← Tous les articles

Le masque n'est pas le modèle : l'audit de l'invariance des préfixes détecte les fuites dans Zamba2 et Nemotron-H

Le masque n'est pas le modèle : l'audit de l'invariance des préfixes détecte les fuites dans Zamba2 et Nemotron-H

Une équipe de startup coréenne de VIDRAFT a découvert que la vérification standard du masque d'attention causale dans les modèles de langage hybrides n'est rien d'autre qu'une illusion de sécurité : les fuites d'informations du futur passent par les analyses, la normalisation et l'agrégation, et aucun des 192 défauts injectés n'a été détecté par une telle vérification.

L'article sur arXiv (2608.22876) formalise l'invariance du préfixe - l'exigence selon laquelle la représentation d'un jeton à la positiontne doit pas dépendre des entrées en positiont + 1et au-delà. Dans les transformateurs purs, les masques d'attention causale renforcent cela, mais les architectures modernes mélangent de plus en plus l'attention avec des modèles d'espace d'état (Mamba, Mamba-2), des analyses fragmentées et des convolutions. Chacun de ces opérateurs a son propre chemin d'exécution et le masque d'attention ne les touche pas.

L'audit proposé se déroule en deux passes avant sans formation ni gradients. Prenez deux entrées identiques ne différant que par le dernier jeton, exécutez-les indépendamment et comparez les activations couche par couche. Si les représentations en position précoce changent, la causalité est rompue et la couche où cela se produit en premier est la coupable. La méthode localise la fuite sur une couche spécifique en quelques secondes.

Au cours de l’expérience, 192 fautes synthétiques ont été injectées sur huit points de contrôle d’architectures différentes. L’inspection classique des masques n’en a détecté aucun. Le nouvel audit a trouvé les 192 et identifié la couche exacte. De plus, l'analyse statique et dynamique du code de scan fragmenté dans les transformateurs a révélé le même défaut dans Zamba2 (Zyphra) et Nemotron-H (NVIDIA) : une erreur d'axe inter-chunk corrigée via l'implémentation de référence.

Pourquoi le masque d'attention ne suffit plus

Pendant longtemps, « masque causal = modèle causal » était un axiome. Dans les transformateurs à décodeur uniquement, le masque ferme véritablement tous les chemins : l'attention est le seul mécanisme de mélange de jetons. Mais les modèles hybrides ont introduit des voies informatiques parallèles. La récurrence SSM, les noyaux convolutifs et les opérateurs d'analyse fragmentée traitent la séquence selon leurs propres règles. Le masque d’attention n’y est tout simplement pas appliqué – et des informations futures peuvent s’échapper par n’importe lequel de ces chemins.

Les auteurs le démontrent sur Nemotron-H : l'analyse fragmentée à l'intérieur du bloc d'attention utilise le mauvais axe pour accumuler l'état entre les fragments. Le résultat : les jetons du morceau suivant influencent les représentations dans le morceau actuel. Le masque d'attention reste parfaitement correct car la fuite ne passe pas par l'attention.

Comment fonctionne l’audit en pratique

L'algorithme est bon marché et portable :

  1. Préparez une paire d'entrées : une de base et une avec un dernier jeton modifié.
  2. Exécutez les deux dans le modèle en mode inférence.
  3. Comparez les états cachés couche par couche (par exemple, distance L2).
  4. La première couche avec une différence non nulle est le point de violation d'invariance du préfixe.

Pas de réglage fin, pas de dégradés, fonctionne sur n'importe quelle architecture où des activations intermédiaires sont accessibles. Les auteurs fournissent une implémentation de référence qui tient sur une page de code.

Ce que cela signifie pour les développeurs de modèles

Si vous entraînez ou utilisez des architectures hybrides (comme Zamba, Nemotron-H, Mamba-2 avec attention, ou tout autre mélange attention + SSM + convolution) — vérifier le masque d'attention donne un faux sentiment de sécurité. L'audit VIDRAFT prend quelques secondes et peut éviter des mois de débogage d'artefacts de génération étranges qui sont en réalité des fuites du futur.

L'équipe a déjà intégré ce contrôle dans son framework AX-RAY pour le diagnostic continu de causalité. Pour tous les autres : ajoutez simplement deux passes avant à votre pipeline CI avant de libérer un point de contrôle.

Limites et prochaines étapes

La méthode trouve les fuites mais ne classe pas automatiquement leur type : vous devez examiner l'architecture de la couche coupable. Il nécessite également un accès aux activations internes, ce qui n'est pas disponible dans les API fermées (OpenAI, Anthropic). Les auteurs prévoient d’étendre l’approche aux modèles quantifiés et fragmentés, où l’instabilité numérique peut se faire passer pour des fuites causales.

Papier:Le masque n'est pas le modèle : audit de l'invariance des préfixes dans les modèles d'attention, d'espace d'état et de séquence hybride(arXiv :2608.22876, 24 août 2026). Implémentation de référence et framework AX-RAY — dans le référentiel VIDRAFT.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison