← 모든 글

마스크는 모델이 아닙니다: 접두사 불변성을 감사하여 Zamba2 및 Nemotron-H에서 누출을 포착합니다.

마스크는 모델이 아닙니다: 접두사 불변성을 감사하여 Zamba2 및 Nemotron-H에서 누출을 포착합니다.

VIDRAFT의 한국 스타트업 팀은 하이브리드 언어 모델의 표준 인과 주의 마스크 검사가 안전 환상에 불과하다는 사실을 발견했습니다. 즉, 스캔, 정규화 및 집계를 통해 미래에서 정보가 유출되고, 주입된 192개의 결함 중 하나도 이러한 검사에 의해 포착되지 않았습니다.

arXiv(2608.22876)에 대한 논문은 접두사 불변성을 공식화합니다.t위치의 입력에 의존해서는 안 됩니다.티 + 1그리고 그 이상. 순수 변환기에서는 인과 주의 마스크가 이를 강화하지만 현대 아키텍처에서는 점점 주의를 상태 공간 모델(Mamba, Mamba-2), 청크 스캔 및 컨볼루션과 혼합합니다. 이러한 각 연산자에는 자체 실행 경로가 있으며 주의 마스크는 이를 건드리지 않습니다.

제안된 감사는 훈련이나 경사도 없이 두 번의 정방향 통과로 실행됩니다. 마지막 토큰만 다른 두 개의 동일한 입력을 가져와 독립적으로 실행하고 활성화를 레이어별로 비교합니다. 초기 위치 표현이 변경되면 인과관계가 깨지고 이것이 처음 발생하는 레이어가 원인이 됩니다. 이 방법은 몇 초 만에 특정 레이어에 대한 누출 위치를 파악합니다.

실험에서는 서로 다른 아키텍처의 8개 체크포인트에 192개의 합성 결함이 주입되었습니다. 기존 마스크 검사에서는 아무것도 감지되지 않았습니다. 새로운 감사에서는 192개를 모두 발견하고 정확한 계층을 찾아냈습니다. 또한 변환기의 청크 스캔 코드에 대한 정적 및 동적 분석을 통해 Zamba2(Zyphra) 및 Nemotron-H(NVIDIA)에서 동일한 결함이 발견되었습니다. 이는 참조 구현을 통해 수정된 청크 간 축 오류입니다.

주의 마스크가 더 이상 충분하지 않은 이유

오랫동안 "인과 가면 = 인과 모델"은 공리였습니다. 디코더 전용 변환기에서 마스크는 실제로 모든 경로를 닫습니다. 주의는 유일한 토큰 혼합 메커니즘입니다. 그러나 하이브리드 모델은 병렬 계산 영역을 도입했습니다. SSM 반복, 컨벌루션 커널 및 청크 스캔 연산자는 자체 규칙에 따라 시퀀스를 처리합니다. 거기에는 주의 마스크가 적용되지 않으며 향후 정보가 이러한 경로를 통해 유출될 수 있습니다.

저자는 Nemotron-H에서 이를 시연합니다. Attention 블록 내부의 청크 스캔은 청크 전체에 상태를 축적하는 데 잘못된 축을 사용합니다. 결과 — 다음 청크의 토큰은 현재 청크의 표현에 영향을 미칩니다. 누출이 주의를 거치지 않기 때문에 주의 마스크는 완벽하게 올바른 상태로 유지됩니다.

감사가 실제로 어떻게 진행되는지

알고리즘은 저렴하고 이식성이 뛰어납니다.

  1. 입력 쌍(기본 입력과 수정된 마지막 토큰이 있는 입력)을 준비합니다.
  2. 추론 모드에서 모델을 통해 두 가지를 모두 실행합니다.
  3. 숨겨진 상태를 레이어별로 비교합니다(예: L2 거리).
  4. 0이 아닌 차이가 있는 첫 번째 레이어는 접두사 불변성 위반 지점입니다.

중간 활성화에 액세스할 수 있는 모든 아키텍처에서는 미세 조정이나 그라데이션이 작동하지 않습니다. 작성자는 한 페이지의 코드에 맞는 참조 구현을 제공합니다.

모델 개발자에게 이것이 의미하는 것

하이브리드 아키텍처(예: Zamba, Nemotron-H, Mamba-2 with attention 또는 attention + SSM + convolution mix)를 훈련하거나 사용하는 경우 Attention 마스크를 확인하면 잘못된 보안 감각을 갖게 됩니다. VIDRAFT 감사는 몇 초 정도 걸리며 실제로 미래에 유출되는 이상한 생성 아티팩트를 디버깅하는 데 수개월을 절약할 수 있습니다.

팀은 지속적인 인과관계 진단을 위해 이미 이 검사를 AX-RAY 프레임워크에 통합했습니다. 다른 모든 경우 — 체크포인트를 릴리스하기 전에 CI 파이프라인에 두 개의 전달 패스를 추가하기만 하면 됩니다.

제한 사항 및 다음 단계

이 방법은 누수를 찾아내지만 해당 유형을 자동으로 분류하지는 않습니다. 원인이 되는 레이어의 아키텍처를 살펴봐야 합니다. 또한 폐쇄형 API(OpenAI, Anthropic)에서는 사용할 수 없는 내부 활성화에 대한 액세스도 필요합니다. 저자는 수치적 불안정성이 인과관계 누출로 가장될 수 있는 양자화 및 희소화 모델에 대한 접근 방식을 확장할 계획입니다.

종이:마스크는 모델이 아니다: 어텐션, 상태공간 및 하이브리드 시퀀스 모델의 접두사 불변성 감사(arXiv:2608.22876, 2026년 8월 24일). 참조 구현 및 AX-RAY 프레임워크 — VIDRAFT 저장소에 있습니다.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison