Masca nu este modelul: auditarea invarianței prefixului detectează scurgeri în Zamba2 și Nemotron-H
O echipă de startup coreeană de la VIDRAFT a descoperit că verificarea standard a măștii de atenție cauzală în modelele de limbaj hibrid nu este altceva decât o iluzie de siguranță: scurgeri de informații din viitor trece prin scanări, normalizare și agregare și niciunul dintre cele 192 de defecte injectate nu a fost surprins de o astfel de verificare.
Lucrarea despre arXiv (2608.22876) formalizează invarianța prefixului - cerința ca reprezentarea unui jeton în pozițietnu trebuie să depindă de intrările la pozițiet + 1si mai departe. În transformatoarele pure, măștile de atenție cauzală impun acest lucru, dar arhitecturile moderne amestecă din ce în ce mai mult atenția cu modele de spațiu de stat (Mamba, Mamba-2), scanări în bucăți și convoluții. Fiecare astfel de operator are propria cale de execuție, iar masca de atenție nu le atinge.
Auditul propus se desfășoară în două treceri înainte fără antrenament sau gradienți. Luați două intrări identice care diferă doar în ultimul simbol, rulați-le independent și comparați activările strat cu strat. Dacă reprezentările de poziție timpurie se schimbă, cauzalitatea este ruptă, iar stratul în care se întâmplă pentru prima dată este vinovat. Metoda localizează scurgerea într-un anumit strat în câteva secunde.
În experiment, 192 de defecte sintetice au fost injectate în opt puncte de control ale arhitecturii diferite. Inspecția clasică a măștii nu a detectat niciuna. Noul audit a găsit toate cele 192 și a identificat stratul exact. Mai mult decât atât, analiza statică și dinamică a codului de scanare fragmentată din transformatoare a relevat același defect în Zamba2 (Zyphra) și Nemotron-H (NVIDIA) - o eroare între axele între bucăți remediată prin implementarea de referință.
De ce masca de atenție nu mai este suficientă
Multă vreme, „mască cauzală = model cauzal” a fost o axiomă. În transformatoarele numai cu decodor, masca închide cu adevărat toate căile: atenția este singurul mecanism de amestecare a simbolurilor. Dar modelele hibride au introdus tracturi de calcul paralele. Recurența SSM, nucleele convoluționale și operatorii de scanare în bucăți procesează secvența după propriile reguli. Pur și simplu, masca de atenție nu este aplicată acolo - iar informațiile viitoare se pot scurge prin oricare dintre aceste căi.
Autorii demonstrează acest lucru pe Nemotron-H: scanarea în bucăți din interiorul blocului de atenție folosește axa greșită pentru acumularea stării în bucăți. Rezultatul — jetoanele din următoarea bucată influențează reprezentările din cea curentă. Masca de atentie ramane perfect corecta deoarece scurgerea nu trece prin atentie.
Cum funcționează auditul în practică
Algoritmul este ieftin și portabil:
- Pregătiți o pereche de intrări: una de bază și una cu un ultimul token modificat.
- Rulați ambele prin model în modul de inferență.
- Comparați stările ascunse strat cu strat (de exemplu, distanța L2).
- Primul strat cu o diferență diferită de zero este punctul de încălcare a invarianței prefixului.
Fără reglaj fin, fără gradienți, funcționează pe orice arhitectură în care activările intermediare sunt accesibile. Autorii oferă o implementare de referință care se potrivește pe o pagină de cod.
Ce înseamnă asta pentru dezvoltatorii de modele
Dacă antrenați sau utilizați arhitecturi hibride (cum ar fi Zamba, Nemotron-H, Mamba-2 cu atenție sau orice amestec de atenție + SSM + convoluție) - verificarea măștii de atenție dă un fals sentiment de securitate. Auditul VIDRAFT durează câteva secunde și poate economisi luni de depanare a artefactelor ciudate de generație care sunt de fapt scurgeri din viitor.
Echipa a integrat deja această verificare în cadrul lor AX-RAY pentru diagnosticarea continuă a cauzalității. Pentru toți ceilalți — adăugați doar două treceri înainte la conducta CI înainte de a elibera un punct de control.
Limitări și pașii următori
Metoda găsește scurgeri, dar nu clasifică automat tipul lor - trebuie să vă uitați la arhitectura stratului vinovat. De asemenea, necesită acces la activări interne, care nu sunt disponibile în API-urile închise (OpenAI, Anthropic). Autorii plănuiesc să extindă abordarea la modele cuantificate și sparsificate, în care instabilitatea numerică se poate masca ca scurgeri cauzale.
Hârtie:Masca nu este modelul: auditarea invarianței prefixului în modelele de atenție, spațiu-state și secvențe hibride(arXiv:2608.22876, 24 august 2026). Implementarea de referință și cadrul AX-RAY — în depozitul VIDRAFT.
