← Все статьи

Topeng Bukan Model: Invarian Awalan Pengauditan Menangkap Kebocoran di Zamba2 dan Nemotron-H

Topeng Bukan Model: Invarian Awalan Pengauditan Menangkap Kebocoran di Zamba2 dan Nemotron-H

Pasukan pemula Korea di VIDRAFT telah mendapati bahawa pemeriksaan topeng perhatian sebab-akibat standard dalam model bahasa hibrid hanyalah ilusi keselamatan: maklumat bocor daripada slip masa depan melalui imbasan, normalisasi dan pengagregatan, dan tidak satu pun daripada 192 kecacatan yang disuntik ditangkap oleh pemeriksaan sedemikian.

Kertas mengenai arXiv (2608.22876) memformalkan invarian awalan — keperluan bahawa perwakilan token pada kedudukanttidak boleh bergantung pada input pada kedudukant + 1dan seterusnya. Dalam transformer tulen, topeng perhatian kausal menguatkuasakan ini, tetapi seni bina moden semakin mencampurkan perhatian dengan model ruang keadaan (Mamba, Mamba-2), imbasan ketulan dan konvolusi. Setiap pengendali sedemikian mempunyai laluan pelaksanaannya sendiri, dan topeng perhatian tidak menyentuhnya.

Audit yang dicadangkan berjalan dalam dua pas ke hadapan tanpa latihan atau kecerunan. Ambil dua input yang sama yang berbeza hanya dalam token terakhir, jalankannya secara bebas dan bandingkan pengaktifan lapisan demi lapisan. Jika perwakilan kedudukan awal berubah, sebab musabab dipecahkan, dan lapisan di mana ini pertama kali berlaku adalah penyebabnya. Kaedah menyetempatkan kebocoran ke lapisan tertentu dalam beberapa saat.

Dalam eksperimen, 192 kesalahan sintetik telah disuntik merentasi lapan pusat pemeriksaan seni bina yang berbeza. Pemeriksaan topeng klasik tidak dikesan. Audit baharu menemui kesemua 192 dan menentukan lapisan yang tepat. Selain itu, analisis statik dan dinamik kod imbasan ketulan dalam transformer mendedahkan kecacatan yang sama dalam Zamba2 (Zyphra) dan Nemotron-H (NVIDIA) — ralat paksi antara ketulan yang diperbaiki melalui pelaksanaan rujukan.

Mengapa Topeng Perhatian Tidak Lagi Cukup

Untuk masa yang lama, "topeng sebab = model sebab" ialah aksiom. Dalam transformer penyahkod sahaja, topeng benar-benar menutup semua laluan: perhatian ialah satu-satunya mekanisme pencampuran token. Tetapi model hibrid memperkenalkan saluran pengiraan selari. Pengulangan SSM, kernel konvolusi, dan pengendali imbasan ketulan memproses jujukan mengikut peraturan mereka sendiri. Topeng perhatian semata-mata tidak digunakan di sana — dan maklumat masa depan boleh bocor melalui mana-mana laluan ini.

Pengarang menunjukkan ini pada Nemotron-H: imbasan bongkah di dalam blok perhatian menggunakan paksi yang salah untuk keadaan terkumpul merentas ketulan. Hasilnya — token daripada bahagian seterusnya mempengaruhi perwakilan dalam yang semasa. Topeng perhatian kekal betul dengan sempurna kerana kebocoran tidak melalui perhatian.

Bagaimana Audit Berfungsi dalam Amalan

Algoritma ini murah dan mudah alih:

  1. Sediakan sepasang input: asas satu dan satu dengan token terakhir yang diubah suai.
  2. Jalankan kedua-duanya melalui model dalam mod inferens.
  3. Bandingkan keadaan tersembunyi lapisan demi lapisan (mis., jarak L2).
  4. Lapisan pertama dengan perbezaan bukan sifar ialah titik pelanggaran invarian awalan.

Tiada penalaan halus, tiada kecerunan, berfungsi pada mana-mana seni bina di mana pengaktifan perantaraan boleh diakses. Pengarang menyediakan pelaksanaan rujukan yang sesuai pada satu halaman kod.

Maksud Ini untuk Pembangun Model

Jika anda melatih atau menggunakan seni bina hibrid (seperti Zamba, Nemotron-H, Mamba-2 dengan perhatian, atau sebarang campuran perhatian + SSM + konvolusi) — menyemak topeng perhatian memberikan rasa selamat yang palsu. Audit VIDRAFT mengambil masa beberapa saat dan boleh menjimatkan berbulan-bulan penyahpepijatan artifak generasi pelik yang sebenarnya bocor dari masa hadapan.

Pasukan itu telah menyepadukan pemeriksaan ini ke dalam rangka kerja AX-RAY mereka untuk diagnostik kausaliti berterusan. Untuk orang lain — cuma tambahkan dua pas ke hadapan pada saluran paip CI anda sebelum melepaskan pusat pemeriksaan.

Had dan Langkah Seterusnya

Kaedah ini menemui kebocoran tetapi tidak mengklasifikasikan jenisnya secara automatik — anda perlu melihat seni bina lapisan penyebabnya. Ia juga memerlukan akses kepada pengaktifan dalaman, yang tidak tersedia dalam API tertutup (OpenAI, Anthropic). Penulis merancang untuk melanjutkan pendekatan kepada model terkuantisasi dan jarang, di mana ketidakstabilan berangka boleh menyamar sebagai kebocoran penyebab.

kertas:Topeng Bukan Model: Mengaudit Invarian Awalan dalam Model Perhatian, Ruang Negeri dan Jujukan Hibrid(arXiv:2608.22876, 24 Ogos 2026). Pelaksanaan rujukan dan rangka kerja AX-RAY — dalam repositori VIDRAFT.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison