Masken er ikke modellen: Auditing Prefix Invariance fanger lækager i Zamba2 og Nemotron-H
Et koreansk startup-team hos VIDRAFT har opdaget, at standard-causal opmærksomhedsmaske-tjek i hybridsprogmodeller ikke er andet end en sikkerhedsillusion: informationslækager fra fremtiden glider gennem scanninger, normalisering og aggregering, og ikke én af 192 injicerede defekter blev fanget af en sådan kontrol.
Papiret om arXiv (2608.22876) formaliserer præfiksinvarians - kravet om, at et tokens repræsentation ved positiontmå ikke afhænge af input ved positiont + 1og videre. I rene transformatorer håndhæver kausale opmærksomhedsmasker dette, men moderne arkitekturer blander i stigende grad opmærksomhed med stat-rum-modeller (Mamba, Mamba-2), chunked scanninger og foldninger. Hver sådan operatør har sin egen udførelsesvej, og opmærksomhedsmasken rører dem ikke.
Den foreslåede revision kører i to fremadgående gennemløb uden træning eller gradienter. Tag to identiske input, der kun adskiller sig i det sidste token, kør dem uafhængigt, og sammenlign aktiveringer lag for lag. Hvis tidlige positionsrepræsentationer ændres, brydes kausaliteten, og det lag, hvor dette først opstår, er synderen. Metoden lokaliserer lækagen til et specifikt lag på få sekunder.
I eksperimentet blev 192 syntetiske fejl sprøjtet ind på tværs af otte kontrolpunkter med forskellige arkitekturer. Klassisk maskeinspektion fandt ingen. Den nye revision fandt alle 192 og udpegede det nøjagtige lag. Desuden afslørede statisk og dynamisk analyse af chunked-scan-kode i transformere den samme defekt i Zamba2 (Zyphra) og Nemotron-H (NVIDIA) - en inter-chunk-akse-fejl rettet via referenceimplementeringen.
Hvorfor opmærksomhedsmasken ikke længere er nok
I lang tid var "kausal maske = kausal model" et aksiom. I transformatorer, der kun er dekoder, lukker masken virkelig alle veje: opmærksomhed er den eneste token-blandingsmekanisme. Men hybridmodeller introducerede parallelle beregningskanaler. SSM-gentagelse, foldningskerner og chunked-scan-operatorer behandler sekvensen efter deres egne regler. Opmærksomhedsmasken er simpelthen ikke anvendt der - og fremtidig information kan lække gennem nogen af disse stier.
Forfatterne demonstrerer dette på Nemotron-H: den chunked scanning inde i opmærksomhedsblokken bruger den forkerte akse til at akkumulere tilstand på tværs af bidder. Resultatet - tokens fra den næste chunk påvirker repræsentationer i den nuværende. Opmærksomhedsmasken forbliver helt korrekt, fordi lækagen ikke går igennem opmærksomheden.
Hvordan revisionen fungerer i praksis
Algoritmen er billig og bærbar:
- Forbered et par input: en base en og en med en ændret sidste token.
- Kør begge gennem modellen i inferenstilstand.
- Sammenlign skjulte tilstande lag for lag (f.eks. L2-afstand).
- Det første lag med en forskel, der ikke er nul, er præfikset-invariansovertrædelsespunktet.
Ingen finjustering, ingen gradienter, virker på enhver arkitektur, hvor mellemliggende aktiveringer er tilgængelige. Forfatterne leverer en referenceimplementering, der passer på én side med kode.
Hvad det betyder for modeludviklere
Hvis du træner eller bruger hybridarkitekturer (såsom Zamba, Nemotron-H, Mamba-2 med opmærksomhed eller en hvilken som helst opmærksomhed + SSM + foldningsblandinger) - giver tjek af opmærksomhedsmasken en falsk følelse af sikkerhed. VIDRAFT-revisionen tager et par sekunder og kan spare måneders fejlfinding af mærkelige generationsartefakter, der faktisk er lækager fra fremtiden.
Holdet har allerede integreret dette tjek i deres AX-RAY-ramme til kontinuerlig kausalitetsdiagnostik. For alle andre – tilføj blot to fremadgående gennemløb til din CI-pipeline, før du frigiver et kontrolpunkt.
Begrænsninger og næste trin
Metoden finder lækager, men klassificerer ikke automatisk deres type - du skal se på det skyldige lags arkitektur. Det kræver også adgang til interne aktiveringer, hvilket ikke er tilgængeligt i lukkede API'er (OpenAI, Anthropic). Forfatterne planlægger at udvide tilgangen til kvantiserede og sparsificerede modeller, hvor numerisk ustabilitet kan udgive sig som kausale lækager.
Papir:Masken er ikke modellen: Audit-præfiks-invarians i opmærksomheds-, tilstands-rum- og hybridsekvensmodeller(arXiv:2608.22876, 24. august 2026). Referenceimplementering og AX-RAY-ramme — i VIDRAFT-lageret.
