← Все статьи

Маска — не модель: как аудит префиксной инвариантности нашёл утечки в Zamba2 и Nemotron-H

Аудит каузальности в гибридных нейросетях

Команда корейского стартапа VIDRAFT обнаружила, что стандартная проверка каузальной маски внимания в гибридных языковых моделях — это лишь иллюзия безопасности: утечки информации из будущего просачиваются через сканы, нормализацию и агрегацию, и ни один из 192 закладных дефектов такая проверка не нашла.

В статье на arXiv (2608.22876) авторы формализуют понятие префиксной инвариантности — требование, что представление токена на позиции t не должно зависеть от входов в позиции t + 1 и далее. В чистых трансформерах это обеспечивает каузальная маска внимания, но современные архитектуры всё чаще смешивают attention с state-space моделями (Mamba, Mamba-2), чанкированными сканами и свёртками. У каждого такого оператора свой путь выполнения, и маска внимания их не касается.

Предложенный аудит работает за два форвард-прохода без обучения и градиентов. Берут два идентичных входа, которые отличаются только в последнем токене, прогоняют их независимо и сравнивают активации слой за слоем. Если представление ранних позиций изменилось — каузальность нарушена, и слой, где это впервые произошло, — виновник. Метод локализует утечку до конкретного слоя за секунды.

В эксперименте внедрили 192 синтетических ошибки в восемь чекпоинтов разных архитектур. Классическая инспекция маски не обнаружила ни одного. Новый аудит нашёл все 192 и указал точный слой. Более того, статический и динамический анализ чанкированного кода в трансформерах выявил тот же дефект в Zamba2 (Zyphra) и Nemotron-H (NVIDIA) — ошибка по межчанковой оси, исправленная через эталонную реализацию.

Почему маска внимания перестала быть достаточной

Долгое время «каузальная маска = каузальная модель» было аксиомой. В decoder-only трансформерах маска действительно закрывает все пути: attention — единственный механизм смешивания токенов. Но гибридные модели ввели параллельные вычислительные тракты. SSM-рекуррентность, свёрточные ядра и chunked-scan операторы обрабатывают последовательность своими правилами. Маска внимания там просто не применяется — и будущая информация может протечь через любой из этих путей.

Авторы показывают на примере Nemotron-H: чанкированный скан (chunked scan) внутри attention-блока использует неверную ось для накопления состояния между чанками. Результат — токены из следующего чанка влияют на представления в текущем. Маска внимания при этом идеально корректна, потому что утечка идёт не через attention.

Как работает аудит на практике

Алгоритм дешевый и переносимый:

  1. Подготовить пару входов: базовый и с изменённым последним токеном.
  2. Пропустить оба через модель в режиме inference.
  3. Послойно сравнить скрытые состояния (например, L2-расстоянием).
  4. Первый слой с ненулевой разницей — точка нарушения префиксной инвариантности.

Никакого дообучения, никаких градиентов, работает на любой архитектуре, где есть доступ к промежуточным активациям. Авторы предоставляют эталонную реализацию на одной странице кода.

Что это значит для разработчиков моделей

Если вы тренируете или используете гибридные архитектуры (вроде Zamba, Nemotron-H, Mamba-2 с attention, или любые смеси attention + SSM + свертки) — проверка маски внимания даёт ложное чувство безопасности. Аудит VIDRAFT стоит пару секунд и может сэкономить месяцы отладки странных артефактов генерации, которые на самом деле — утечки из будущего.

Команда уже интегрировала этот чек в свой фреймворк AX-RAY для непрерывной диагностики каузальности. Для остальных — достаточно добавить два форвард-прохода в CI-пайплайн перед релизом чекпоинта.

Ограничения и следующие шаги

Метод находит утечки, но не классифицирует их тип автоматически — нужно смотреть на архитектуру слоя-виновника. Также он требует доступа к внутренним активациям, что в закрытых API (OpenAI, Anthropic) недоступно. Авторы планируют расширить подход на квантованные и спарсифицированные модели, где численная неустойчивость может маскироваться под каузальные утечки.

Статья: The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models (arXiv:2608.22876, 24 августа 2026 г.). Референс-реализация и фреймворк AX-RAY — в репозитории VIDRAFT.

Схема аудита префиксной инвариантности: два идентичных входа с разным последним токеном, два форвард-прохода, поэлементное сравнение активаций по слоям