La máscara no es el modelo: la auditoría de la invariancia del prefijo detecta fugas en Zamba2 y Nemotron-H
Un equipo de startups coreano de VIDRAFT ha descubierto que la verificación estándar de máscara de atención causal en modelos de lenguaje híbrido no es más que una ilusión de seguridad: las fugas de información del futuro se escapan a través de escaneos, normalización y agregación, y ninguna de los 192 defectos inyectados fue detectada por dicha verificación.
El artículo sobre arXiv (2608.22876) formaliza la invariancia del prefijo: el requisito de que la representación de un token en la posicióntno debe depender de entradas en la posiciónt+1y más allá. En los transformadores puros, las máscaras de atención causal imponen esto, pero las arquitecturas modernas mezclan cada vez más la atención con modelos de espacio de estados (Mamba, Mamba-2), escaneos fragmentados y convoluciones. Cada uno de estos operadores tiene su propia ruta de ejecución y la máscara de atención no los toca.
La auditoría propuesta se ejecuta en dos pases hacia adelante sin entrenamiento ni gradientes. Tome dos entradas idénticas que difieran solo en el último token, ejecútelas de forma independiente y compare las activaciones capa por capa. Si las representaciones de las primeras posiciones cambian, la causalidad se rompe y la capa donde esto ocurre por primera vez es la culpable. El método localiza la fuga en una capa específica en segundos.
En el experimento, se inyectaron 192 fallas sintéticas en ocho puntos de control de diferentes arquitecturas. La inspección clásica de la máscara no detectó ninguno. La nueva auditoría encontró los 192 y identificó la capa exacta. Además, el análisis estático y dinámico del código de escaneo fragmentado en transformadores reveló el mismo defecto en Zamba2 (Zyphra) y Nemotron-H (NVIDIA): un error entre ejes solucionado mediante la implementación de referencia.
Por qué la máscara de atención ya no es suficiente
Durante mucho tiempo, "máscara causal = modelo causal" fue un axioma. En los transformadores que sólo funcionan con decodificador, la máscara realmente cierra todos los caminos: la atención es el único mecanismo de mezcla de tokens. Pero los modelos híbridos introdujeron tractos computacionales paralelos. La recurrencia de SSM, los núcleos convolucionales y los operadores de escaneo fragmentado procesan la secuencia según sus propias reglas. La máscara de atención simplemente no se aplica allí, y la información futura puede filtrarse a través de cualquiera de estos caminos.
Los autores demuestran esto en Nemotron-H: el escaneo fragmentado dentro del bloque de atención utiliza el eje incorrecto para acumular estado entre fragmentos. El resultado: los tokens del siguiente fragmento influyen en las representaciones del actual. La máscara de atención sigue siendo perfectamente correcta porque la fuga no pasa por la atención.
Cómo funciona la auditoría en la práctica
El algoritmo es barato y portátil:
- Prepare un par de entradas: una base y otra con un último token modificado.
- Ejecute ambos a través del modelo en modo de inferencia.
- Compare los estados ocultos capa por capa (por ejemplo, distancia L2).
- La primera capa con una diferencia distinta de cero es el punto de infracción de invariancia del prefijo.
Sin ajustes ni gradientes, funciona en cualquier arquitectura donde se pueda acceder a activaciones intermedias. Los autores proporcionan una implementación de referencia que cabe en una página de código.
Qué significa esto para los desarrolladores de modelos
Si entrena o utiliza arquitecturas híbridas (como Zamba, Nemotron-H, Mamba-2 con atención o cualquier combinación de atención + SSM + convolución), verificar la máscara de atención da una falsa sensación de seguridad. La auditoría VIDRAFT tarda un par de segundos y puede ahorrar meses de depuración de artefactos de generación extraña que en realidad son filtraciones del futuro.
El equipo ya ha integrado esta verificación en su marco AX-RAY para el diagnóstico continuo de causalidad. Para todos los demás, simplemente agregue dos pases directos a su canal de CI antes de liberar un punto de control.
Limitaciones y próximos pasos
El método encuentra fugas pero no clasifica automáticamente su tipo; es necesario observar la arquitectura de la capa culpable. También requiere acceso a activaciones internas, que no están disponibles en API cerradas (OpenAI, Anthropic). Los autores planean ampliar el enfoque a modelos cuantificados y dispersos, donde la inestabilidad numérica puede disfrazarse de fugas causales.
Papel:La máscara no es el modelo: auditoría de la invariancia del prefijo en modelos de atención, espacio de estados y secuencia híbrida(arXiv:2608.22876, 24 de agosto de 2026). Implementación de referencia y marco AX-RAY, en el repositorio VIDRAFT.
