← Alla artiklar

Masken är inte modellen: Auditing Prefix Invariance fångar läckor i Zamba2 och Nemotron-H

Masken är inte modellen: Auditing Prefix Invariance fångar läckor i Zamba2 och Nemotron-H

Ett koreanskt startteam på VIDRAFT har upptäckt att standardkontroll av kausal uppmärksamhetsmask i hybridspråkmodeller inte är något annat än en säkerhetsillusion: informationsläckor från framtiden glider genom skanningar, normalisering och aggregering, och inte en av 192 injicerade defekter fångades av en sådan kontroll.

Uppsatsen om arXiv (2608.22876) formaliserar prefixinvarians – kravet att en tokens representation vid positiontfår inte vara beroende av ingångar vid positiont + 1och bortom. I rena transformatorer framtvingar kausala uppmärksamhetsmasker detta, men moderna arkitekturer blandar i allt högre grad uppmärksamhet med stat-rymdmodeller (Mamba, Mamba-2), chunked skanningar och veck. Varje sådan operatör har sin egen exekveringsbana, och uppmärksamhetsmasken berör dem inte.

Den föreslagna revisionen går i två framåtpassningar utan träning eller gradienter. Ta två identiska ingångar som bara skiljer sig åt i den sista token, kör dem oberoende och jämför aktiveringar lager för lager. Om tidig positionsrepresentationer ändras, bryts kausaliteten, och det lager där detta först inträffar är boven. Metoden lokaliserar läckan till ett specifikt lager på några sekunder.

I experimentet injicerades 192 syntetiska fel över åtta kontrollpunkter med olika arkitekturer. Klassisk maskinspektion upptäckte ingen. Den nya granskningen fann alla 192 och pekade ut det exakta lagret. Dessutom avslöjade statisk och dynamisk analys av chunk-scan-kod i transformatorer samma defekt i Zamba2 (Zyphra) och Nemotron-H (NVIDIA) - ett inter-chunk-axelfel fixat via referensimplementeringen.

Varför uppmärksamhetsmasken inte längre räcker till

Länge var "kausal mask = kausal modell" ett axiom. I transformatorer med endast dekoder, stänger masken verkligen alla vägar: uppmärksamhet är den enda token-blandningsmekanismen. Men hybridmodeller introducerade parallella beräkningsområden. SSM-upprepning, faltningskärnor och chunk-scan-operatorer bearbetar sekvensen enligt sina egna regler. Uppmärksamhetsmasken appliceras helt enkelt inte där - och framtida information kan läcka genom någon av dessa vägar.

Författarna visar detta på Nemotron-H: den chunked scan inuti uppmärksamhetsblocket använder fel axel för att ackumulera tillstånd över bitar. Resultatet — tokens från nästa bit påverkar representationer i den nuvarande. Uppmärksamhetsmasken förblir helt korrekt eftersom läckan inte går igenom uppmärksamheten.

Hur revisionen fungerar i praktiken

Algoritmen är billig och bärbar:

  1. Förbered ett par ingångar: en bas en och en med en modifierad sista token.
  2. Kör båda genom modellen i inferensläge.
  3. Jämför dolda tillstånd lager för lager (t.ex. L2-avstånd).
  4. Det första lagret med en skillnad som inte är noll är prefixets invariansöverträdelsepunkt.

Ingen finjustering, inga gradienter, fungerar på alla arkitekturer där mellanliggande aktiveringar är tillgängliga. Författarna tillhandahåller en referensimplementering som får plats på en sida med kod.

Vad detta betyder för modellutvecklare

Om du tränar eller använder hybridarkitekturer (som Zamba, Nemotron-H, Mamba-2 med uppmärksamhet, eller någon uppmärksamhet + SSM + faltningsblandningar) — att kontrollera uppmärksamhetsmasken ger en falsk känsla av säkerhet. VIDRAFT-granskningen tar ett par sekunder och kan spara månader av felsökning av konstiga generationsartefakter som faktiskt är läckor från framtiden.

Teamet har redan integrerat denna kontroll i sitt AX-RAY-ramverk för kontinuerlig kausalitetsdiagnostik. För alla andra – lägg bara till två framåtpassningar till din CI-pipeline innan du släpper en kontrollpunkt.

Begränsningar och nästa steg

Metoden hittar läckor men klassificerar inte automatiskt deras typ – du måste titta på den skyldige lagrets arkitektur. Det kräver också tillgång till interna aktiveringar, vilket inte är tillgängligt i slutna API:er (OpenAI, Anthropic). Författarna planerar att utöka tillvägagångssättet till kvantiserade och sparsifierade modeller, där numerisk instabilitet kan maskera sig som orsaksläckor.

Papper:Masken är inte modellen: Auditing Prefix Invariance in Attention, State-Space och Hybrid Sequence Models(arXiv:2608.22876, 24 augusti 2026). Referensimplementering och AX-RAY-ramverk — i VIDRAFT-förvaret.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison