← Все статьи

Topeng Bukanlah Modelnya: Audit Invarian Awalan Menangkap Kebocoran di Zamba2 dan Nemotron-H

Topeng Bukanlah Modelnya: Audit Invarian Awalan Menangkap Kebocoran di Zamba2 dan Nemotron-H

Tim startup Korea di VIDRAFT telah menemukan bahwa pemeriksaan masker perhatian kausal standar dalam model bahasa hibrid hanyalah ilusi keamanan: kebocoran informasi dari masa depan lolos dari pemindaian, normalisasi, dan agregasi, dan tidak satu pun dari 192 cacat yang disuntikkan tertangkap oleh pemeriksaan semacam itu.

Makalah tentang arXiv (2608.22876) memformalkan invariansi awalan — persyaratan bahwa representasi token pada posisittidak boleh bergantung pada masukan pada posisit + 1dan seterusnya. Pada transformator murni, masker perhatian kausal menerapkan hal ini, namun arsitektur modern semakin memadukan perhatian dengan model ruang negara (Mamba, Mamba-2), pemindaian terpotong, dan konvolusi. Setiap operator tersebut memiliki jalur eksekusinya sendiri, dan topeng perhatian tidak menyentuhnya.

Audit yang diusulkan berjalan dalam dua tahap maju tanpa pelatihan atau gradien. Ambil dua input identik yang hanya berbeda pada token terakhir, jalankan secara independen, dan bandingkan aktivasi lapis demi lapis. Jika representasi posisi awal berubah, kausalitas akan rusak, dan lapisan di mana hal ini pertama kali terjadi adalah penyebabnya. Metode ini melokalisasi kebocoran ke lapisan tertentu dalam hitungan detik.

Dalam percobaan tersebut, 192 kesalahan sintetis disuntikkan ke delapan pos pemeriksaan dengan arsitektur berbeda. Pemeriksaan topeng klasik tidak mendeteksi apa pun. Audit baru menemukan 192 lapisan tersebut dan menunjukkan lapisan yang tepat. Selain itu, analisis statis dan dinamis dari kode pemindaian terpotong pada transformator mengungkapkan cacat yang sama pada Zamba2 (Zyphra) dan Nemotron-H (NVIDIA) — kesalahan sumbu antar-bagian yang diperbaiki melalui implementasi referensi.

Mengapa Masker Perhatian Tidak Lagi Cukup

Untuk waktu yang lama, "topeng kausal = model kausal" adalah sebuah aksioma. Dalam transformator khusus dekoder, topeng benar-benar menutup semua jalur: perhatian adalah satu-satunya mekanisme pencampuran token. Namun model hibrida memperkenalkan jalur komputasi paralel. Pengulangan SSM, kernel konvolusional, dan operator pemindaian terpotong memproses urutan berdasarkan aturannya sendiri. Penutup perhatian tidak diterapkan di sana – dan informasi di masa depan dapat bocor melalui salah satu jalur ini.

Penulis mendemonstrasikan hal ini pada Nemotron-H: pemindaian terpotong di dalam blok perhatian menggunakan sumbu yang salah untuk mengumpulkan status di seluruh bongkahan. Hasilnya — token dari potongan berikutnya memengaruhi representasi yang ada di potongan saat ini. Masker perhatian tetap benar karena kebocorannya tidak melalui perhatian.

Bagaimana Audit Bekerja dalam Prakteknya

Algoritmenya murah dan portabel:

  1. Siapkan sepasang masukan: masukan dasar dan masukan dengan token terakhir yang dimodifikasi.
  2. Jalankan keduanya melalui model dalam mode inferensi.
  3. Bandingkan keadaan tersembunyi lapis demi lapis (misalnya, jarak L2).
  4. Lapisan pertama dengan perbedaan bukan nol adalah titik pelanggaran invarian awalan.

Tidak ada penyesuaian, tidak ada gradien, berfungsi pada arsitektur apa pun di mana aktivasi perantara dapat diakses. Penulis memberikan referensi implementasi yang sesuai pada satu halaman kode.

Apa Artinya Bagi Pengembang Model

Jika Anda melatih atau menggunakan arsitektur hibrid (seperti Zamba, Nemotron-H, Mamba-2 dengan perhatian, atau campuran perhatian + SSM + konvolusi) — memeriksa topeng perhatian memberikan rasa aman yang salah. Audit VIDRAFT memerlukan waktu beberapa detik dan dapat menghemat waktu berbulan-bulan dalam men-debug artefak generasi aneh yang sebenarnya merupakan kebocoran dari masa depan.

Tim telah mengintegrasikan pemeriksaan ini ke dalam kerangka AX-RAY mereka untuk diagnostik kausalitas berkelanjutan. Untuk semua orang — cukup tambahkan dua penerusan ke alur CI Anda sebelum melepaskan pos pemeriksaan.

Keterbatasan dan Langkah Selanjutnya

Metode ini menemukan kebocoran tetapi tidak secara otomatis mengklasifikasikan jenisnya — Anda perlu melihat arsitektur lapisan pelakunya. Ini juga memerlukan akses ke aktivasi internal, yang tidak tersedia di API tertutup (OpenAI, Anthropic). Para penulis berencana untuk memperluas pendekatan ke model terkuantisasi dan tersparifikasi, di mana ketidakstabilan numerik dapat menyamar sebagai kebocoran sebab akibat.

Kertas:Topeng Bukanlah Model: Mengaudit Invariansi Awalan dalam Model Perhatian, Ruang-Negara, dan Urutan Hibrid(arXiv:2608.22876, 24 Agustus 2026). Implementasi referensi dan kerangka kerja AX-RAY — di repositori VIDRAFT.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison