← Összes cikk

A maszk nem a modell: Az előtag invarianciájának ellenőrzése elkapja a Zamba2 és a Nemotron-H szivárgását

A maszk nem a modell: Az előtag invarianciájának ellenőrzése elkapja a Zamba2 és a Nemotron-H szivárgását

A VIDRAFT koreai startup csapata felfedezte, hogy a hibrid nyelvi modellekben a standard kauzális figyelemmaszk ellenőrzése nem más, mint biztonsági illúzió: a jövőből származó információk átcsúsznak a szkenneléseken, a normalizáláson és az összesítésen keresztül, és a 192 beinjektált hiba egyikét sem érte el egy ilyen ellenőrzés.

Az arXiv-ről (2608.22876) szóló cikk formalizálja az előtag invarianciáját – azt a követelményt, hogy a token a pozícióban jelenjen megtnem függhet a pozícióban lévő bemenetektőlt + 1és azon túl. A tiszta transzformátorokban az ok-okozati figyelemmaszkok ezt kényszerítik ki, de a modern architektúrák egyre inkább keverik a figyelmet állapottér modellekkel (Mamba, Mamba-2), darabos letapogatásokkal és konvolúciókkal. Minden ilyen operátornak megvan a saját végrehajtási útvonala, és a figyelemmaszk nem érinti őket.

A javasolt audit két előremenetben fut, képzés vagy gradiens nélkül. Vegyünk két azonos bemenetet, amelyek csak az utolsó tokenben különböznek egymástól, futtassuk őket egymástól függetlenül, és rétegenként hasonlítsuk össze az aktiválásokat. Ha a korai pozíció-reprezentációk megváltoznak, az ok-okozati összefüggés megszakad, és az a réteg, ahol ez először előfordul, a tettes. A módszer másodpercek alatt lokalizálja a szivárgást egy adott rétegre.

A kísérlet során 192 szintetikus hibát fecskendeztek be nyolc különböző architektúra ellenőrzőpontjába. A klasszikus maszkellenőrzés nem észlelt. Az új ellenőrzés mind a 192-t megtalálta, és pontosan meghatározta a réteget. Ezen túlmenően a transzformátorokban lévő csonkos letapogatási kód statikus és dinamikus elemzése ugyanazt a hibát tárta fel a Zamba2-ben (Zyphra) és a Nemotron-H-ban (NVIDIA) – egy darabok közötti tengelyhibát, amelyet a referencia implementáció javított ki.

Miért nem elég a figyelem maszk?

Sokáig axióma volt az „oksági maszk = oksági modell”. A csak dekóderrel működő transzformátorokban a maszk valóban lezár minden utat: a figyelem az egyetlen tokenkeverő mechanizmus. A hibrid modellek azonban párhuzamos számítási traktusokat vezettek be. Az SSM-ismétlődés, a konvolúciós kernelek és a chunked-scan operátorok saját szabályaik szerint dolgozzák fel a sorozatot. A figyelemmaszk egyszerűen nincs ott – és a jövőbeli információk ezen utak bármelyikén kiszivároghatnak.

A szerzők ezt demonstrálják a Nemotron-H-n: a figyelemblokk belsejében lévő csonka letapogatás rossz tengelyt használ a darabok közötti állapot felhalmozására. Az eredmény – a következő darabból származó tokenek befolyásolják az aktuális darab reprezentációit. A figyelem maszk tökéletesen megfelelő marad, mert a szivárgás nem megy át a figyelemen.

Hogyan működik az audit a gyakorlatban

Az algoritmus olcsó és hordozható:

  1. Készítsen pár bemenetet: egy alap és egy módosított utolsó tokennel.
  2. Futtassa mindkettőt a modellen következtetés módban.
  3. Hasonlítsa össze a rejtett állapotokat rétegenként (pl. L2 távolság).
  4. Az első nem nulla különbségű réteg az előtag invariancia megsértési pontja.

Nincs finomhangolás, nincsenek színátmenetek, minden olyan architektúrán működik, ahol elérhetők a közbenső aktiválások. A szerzők egy referencia-megvalósítást nyújtanak, amely elfér egy kódoldalon.

Mit jelent ez a modellfejlesztők számára

Ha hibrid architektúrákat oktat vagy használ (mint például a Zamba, Nemotron-H, Mamba-2 figyelmességgel, vagy bármilyen figyelem + SSM + konvolúciós keverék) – a figyelemmaszk ellenőrzése hamis biztonságérzetet kelt. A VIDRAFT audit néhány másodpercet vesz igénybe, és hónapokig spórolhat meg a furcsa generációs műtermékek hibakeresésétől, amelyek valójában a jövőből szivárognak.

A csapat már integrálta ezt az ellenőrzést az AX-RAY keretrendszerébe a folyamatos oksági diagnosztika érdekében. Mindenki más számára – csak adjon hozzá két előrelépést a CI-folyamathoz, mielőtt felszabadít egy ellenőrzőpontot.

Korlátozások és következő lépések

A módszer megtalálja a szivárgásokat, de nem osztályozza automatikusan a típusukat – meg kell nézni a bűnös réteg architektúráját. Hozzá kell férni a belső aktiválásokhoz is, ami zárt API-kban (OpenAI, Anthropic) nem érhető el. A szerzők azt tervezik, hogy kiterjesztik a megközelítést a kvantált és ritkított modellekre, ahol a numerikus instabilitás ok-okozati szivárgásnak álcázható.

Papír:A maszk nem a modell: Az előtag invarianciájának ellenőrzése a figyelem, az állapottér és a hibrid szekvencia modellekben(arXiv:2608.22876, 2026. augusztus 24.). Referencia implementáció és AX-RAY keretrendszer – a VIDRAFT adattárban.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison