← すべての記事

マスクはモデルではありません: プレフィックスの不変性の監査により、Zamba2 と Nemotron-H でのリークが検出されます

ハイブリッド ニューラル ネットワークにおける因果関係の監査

VIDRAFT の韓国のスタートアップ チームは、ハイブリッド言語モデルにおける標準的な因果的注意マスク チェックが安全性に関する幻想にすぎないことを発見しました。つまり、将来からの情報漏洩はスキャン、正規化、集計をすり抜け、注入された 192 件の欠陥のうち 1 つもそのようなチェックでは捕捉されませんでした。

arXiv に関する論文 (2608.22876) は、プレフィックスの不変性、つまり位置におけるトークンの表現の要件を形式化しています。 t 位置の入力に依存してはなりません t + 1 そしてその先へ。純粋なトランスフォーマーでは、因果的注意マスクによってこれが強制されますが、最新のアーキテクチャでは、状態空間モデル (Mamba、Mamba-2)、チャンク スキャン、および畳み込みと注意がますます混合されています。このような各オペレーターには独自の実行パスがあり、アテンション マスクはそれらのオペレーターには影響しません。

提案された監査は、トレーニングや勾配を持たない 2 つの順方向パスで実行されます。最後のトークンのみが異なる 2 つの同一の入力を取得し、それらを独立して実行し、アクティベーションをレイヤーごとに比較します。初期位置の表現が変化すると、因果関係が壊れ、これが最初に発生した層が原因となります。この方法では、漏洩箇所が特定の層に数秒で特定されます。

実験では、異なるアーキテクチャの 8 つのチェックポイントにわたって 192 個の合成フォールトが注入されました。クラシックマスク検査では何も検出されませんでした。新しい監査では 192 件すべてが見つかり、正確な層が特定されました。さらに、トランスフォーマーのチャンク スキャン コードの静的および動的解析により、Zamba2 (Zyphra) と Nemotron-H (NVIDIA) にも同じ欠陥が明らかになりました。これは、リファレンス実装によって修正されたチャンク軸間エラーです。

なぜアテンションマスクでは十分ではなくなったのか

長い間、「因果マ​​スク = 因果モデル」が公理でした。デコーダのみのトランスフォーマでは、マスクは実際にすべてのパスを閉じます。アテンションが唯一のトークン混合メカニズムです。しかし、ハイブリッド モデルでは並列計算領域が導入されました。 SSM 再帰、畳み込みカーネル、およびチャンク スキャン オペレーターは、独自のルールに従ってシーケンスを処理します。そこではアテンション マスクが適用されないだけであり、今後の情報がこれらの経路を通じて漏洩する可能性があります。

著者らはこれを Nemotron-H で実証しています。アテンション ブロック内のチャンク スキャンでは、チャンク全体で状態を蓄積するために間違った軸が使用されています。結果 — 次のチャンクのトークンが現在のチャンクの表現に影響を与えます。リークはアテンションを通過しないため、アテンション マスクは完全に正しいままです。

監査が実際にどのように機能するか

このアルゴリズムは安価で移植可能です。

  1. 入力のペアを準備します。1 つは基本的な入力で、もう 1 つは最後のトークンが変更されたものです。
  2. 推論モードでモデルを介して両方を実行します。
  3. 隠れ状態をレイヤーごとに比較します (L2 距離など)。
  4. 差がゼロでない最初の層は、プレフィックス不変違反ポイントです。

微調整や勾配はなく、中間アクティベーションがアクセス可能なアーキテクチャであれば機能します。著者は、1 ページのコードに収まるリファレンス実装を提供しています。

これがモデル開発者にとって何を意味するか

ハイブリッド アーキテクチャ (アテンションを備えた Zamba、Nemotron-H、Mamba-2、またはアテンション + SSM + 畳み込みミックスなど) をトレーニングまたは使用している場合、アテンション マスクをチェックすると誤った安心感が与えられます。 VIDRAFT の監査には数秒かかり、実際には将来からのリークである奇妙な生成アーティファクトのデバッグに数か月かかる時間を節約できます。

チームはすでに、継続的な因果関係診断のためにこのチェックを AX-RAY フレームワークに統合しています。それ以外の場合は、チェックポイントを解放する前に、CI パイプラインに 2 つの転送パスを追加するだけです。

制限と次のステップ

この方法ではリークは検出されますが、そのタイプは自動的に分類されません。原因となっているレイヤーのアーキテクチャを調べる必要があります。また、内部アクティベーションへのアクセスも必要ですが、これはクローズド API (OpenAI、Anthropic) では利用できません。著者らは、このアプローチを量子化およびスパース化されたモデルに拡張することを計画しています。このモデルでは、数値の不安定性が因果関係の漏れに見せかける可能性があります。

紙: マスクはモデルではない: アテンション、状態空間、およびハイブリッド シーケンス モデルにおけるプレフィックス不変性の監査 (arXiv:2608.22876、2026 年 8 月 24 日)。リファレンス実装と AX-RAY フレームワーク — VIDRAFT リポジトリ内。

プレフィックス不変性監査図: 最後のトークンが異なる 2 つの同一入力、2 つの前方パス、レイヤーごとのアクティベーション比較