← Все статьи

Maska není model: Auditování prefixové invariance zachycuje úniky v Zamba2 a Nemotron-H

Maska není model: Auditování prefixové invariance zachycuje úniky v Zamba2 a Nemotron-H

Korejský startupový tým ve VIDRAFT zjistil, že standardní kontrola masky kauzální pozornosti v hybridních jazykových modelech není nic jiného než bezpečnostní iluze: informace uniknou z budoucího proklouznutí skenováním, normalizací a agregací a taková kontrola nezachytila ​​ani jeden ze 192 vložených defektů.

Článek o arXiv (2608.22876) formalizuje prefixovou invarianci – požadavek, aby reprezentace tokenu na pozicitnesmí záviset na vstupech na pozicit + 1a dále. U čistých transformátorů to vynucují masky kauzální pozornosti, ale moderní architektury stále více mísí pozornost s modely stavového prostoru (Mamba, Mamba-2), chunked scans a konvolucemi. Každý takový operátor má svou vlastní cestu provádění a maska ​​pozornosti se jich nedotýká.

Navrhovaný audit probíhá ve dvou průjezdech dopředu bez tréninku nebo přechodů. Vezměte dva identické vstupy lišící se pouze posledním tokenem, spusťte je nezávisle a porovnejte aktivace vrstvu po vrstvě. Pokud se změní reprezentace rané pozice, kauzalita je narušena a viníkem je vrstva, kde k tomu dojde poprvé. Metoda lokalizuje únik do určité vrstvy během několika sekund.

V experimentu bylo injektováno 192 syntetických poruch do osmi kontrolních bodů různých architektur. Klasická kontrola masky nic nezjistila. Nový audit našel všech 192 a určil přesnou vrstvu. Navíc statická a dynamická analýza chunked-scan kódu v transformátorech odhalila stejnou závadu v Zamba2 (Zyphra) a Nemotron-H (NVIDIA) – chybu mezi bloky os opravenou referenční implementací.

Proč už maska ​​pro pozornost nestačí

Po dlouhou dobu bylo „kauzální maska ​​= kauzální model“ axiomem. V transformátorech pouze s dekodérem maska ​​skutečně uzavírá všechny cesty: pozornost je jediným mechanismem míchání tokenů. Ale hybridní modely zavedly paralelní výpočetní trakty. Opakování SSM, konvoluční jádra a operátory chunked-scan zpracovávají sekvenci podle svých vlastních pravidel. Maska pozornosti tam prostě není použita – a budoucí informace mohou unikat kteroukoli z těchto cest.

Autoři to demonstrují na Nemotronu-H: segmentovaný sken uvnitř bloku pozornosti používá špatnou osu pro akumulaci stavu napříč bloky. Výsledek — tokeny z dalšího bloku ovlivňují reprezentace v tom aktuálním. Maska pozornosti zůstává dokonale správná, protože únik neprochází pozorností.

Jak audit funguje v praxi

Algoritmus je levný a přenosný:

  1. Připravte si dvojici vstupů: základní a jeden s upraveným posledním žetonem.
  2. Proveďte oba modelem v inferenčním režimu.
  3. Porovnejte skryté stavy vrstvu po vrstvě (např. vzdálenost L2).
  4. První vrstva s nenulovým rozdílem je bod porušení prefixové invariance.

Žádné jemné ladění, žádné přechody, funguje na jakékoli architektuře, kde jsou dostupné přechodné aktivace. Autoři poskytují referenční implementaci, která se vejde na jednu stránku kódu.

Co to znamená pro vývojáře modelů

Pokud trénujete nebo používáte hybridní architektury (jako Zamba, Nemotron-H, Mamba-2 s pozorností nebo jakákoliv pozornost + SSM + konvoluční mixy) — kontrola masky pozornosti dává falešný pocit bezpečí. Audit VIDRAFT trvá několik sekund a může ušetřit měsíce ladění podivných generačních artefaktů, které jsou ve skutečnosti úniky z budoucnosti.

Tým již začlenil tuto kontrolu do svého rámce AX-RAY pro nepřetržitou diagnostiku kauzality. Pro všechny ostatní – stačí přidat dva dopředné průchody do kanálu CI, než uvolníte kontrolní bod.

Omezení a další kroky

Metoda najde úniky, ale neklasifikuje automaticky jejich typ – musíte se podívat na architekturu vrstvy viníka. Vyžaduje také přístup k interním aktivacím, který není dostupný v uzavřených API (OpenAI, Anthropic). Autoři plánují rozšířit přístup ke kvantizovaným a rozptýleným modelům, kde se numerická nestabilita může maskovat jako kauzální úniky.

Papír:Maska není model: Auditování invariance prefixů v modelech pozornosti, stavového prostoru a hybridních sekvencí(arXiv:2608.22876, 24. srpna 2026). Referenční implementace a rámec AX-RAY — v úložišti VIDRAFT.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison