← جميع المقالات

القناع ليس النموذج: تدقيق ثبات البادئة يكشف التسريبات في Zamba2 و Nemotron-H

تدقيق السببية في الشبكات العصبية الهجينة

اكتشف فريق شركة KVIDRAFT الكورية الناشئة أن الفحص القياسي لقناع الانتباه السببي في نماذج اللغة الهجينة ليس أكثر من وهم للأمان: تسربات المعلومات من المستقبل تتسلل عبر المسح والتطبيع والتجميع، ولم يتم اكتشاف أي من 192 عيبًا مزروعًا بواسطة مثل هذا الفحص.

الورقة على arXiv (2608.22876) تُشكل مفهوم ثبات البادئة (prefix invariance) — المطلب القائل بأن تمثيل الرمز في الموضع t لا يجب أن يعتمد على المدخلات في الموضع t + 1 وما بعده. في المحولات النقية، يضمن قناع الانتباه السببي هذا، لكن المعماريات الحديثة تزداد خلطًا للانتباه مع نماذج فضاء الحالة (Mamba، Mamba-2)، والمسح المقسم (chunked scans)، والالتفافات. لكل من هذه المشغلات مسار تنفيذ خاص، وقناع الانتباه لا يمسها.

التدقيق المقترح يعمل في تمريرين أماميين (forward passes) دون تدريب أو تدرجات. نأخذ مدخلين متطابقين يختلفان فقط في الرمز الأخير، نشغلهما بشكل مستقل، ونقارن التنشيطات طبقة بطبقة. إذا تغيرت تمثيلات المواضع المبكرة — فالسببية مكسورة، والطبقة التي حدث فيها ذلك لأول مرة هي الجاني. الطريقة تحدد التسرب لطبقة محددة في ثوانٍ.

في التجربة، حُقن 192 خطأً اصطناعيًا عبر ثماني نقاط تحقق لمعماريات مختلفة. الفحص التقليدي للقناع لم يكتشف أيًا منها. التدقيق الجديد وجد جميع الـ 192 وحدد الطبقة الدقيقة. علاوة على ذلك، كشف التحليل الساكن والديناميكي لرمز المسح المقسم في المحولات نفس العيب في Zamba2 (Zyphra) و Nemotron-H (NVIDIA) — خطأ في محور ما بين القطع، تم إصلاحه عبر التنفيذ المرجعي.

لماذا لم يعد قناع الانتباه كافيًا

لفترة طويلة، كانت "قناع سببي = نموذج سببي" بديهية. في المحولات من نوع decoder-only، القناع يغلق جميع المسارات حقًا: الانتباه هو آلية خلط الرموز الوحيدة. لكن النماذج الهجينة أدخلت مسارات حسابية متوازية. تكرار SSM، نوى الالتفاف، ومشغلات المسح المقسم تعالج التسلسل بقواعدها الخاصة. قناع الانتباه ببساطة لا يُطبق هناك — ومعلومات المستقبل يمكن أن تتسرب عبر أي من هذه المسارات.

يُظهر المؤلفون هذا على مثال Nemotron-H: المسح المقسم داخل كتلة الانتباه يستخدم محورًا خاطئًا لتجميع الحالة عبر القطع. النتيجة — رموز من القطعة التالية تؤثر على التمثيلات في الحالية. قناع الانتباه يظل صحيحًا تمامًا لأن التسرب لا يمر عبر الانتباه.

كيف يعمل التدقيق عمليًا

الخوارزمية رخيصة وقابلة للنقل:

  1. جهز زوجًا من المدخلات: أساسي وآخر برمز أخير معدل.
  2. مرر كلاهما عبر النموذج في وضع الاستنتاج (inference).
  3. قارن الحالات المخفية طبقة بطبقة (مثلاً بمسافة L2).
  4. أول طبقة مع فرق غير صفري هي نقطة انتهاك ثبات البادئة.

لا ضبط دقيق، لا تدرجات، تعمل على أي معمارية يتوفر فيها الوصول للتنشيطات الوسيطة. المؤلفون يقدمون تنفيذًا مرجعيًا يناسب صفحة كود واحدة.

ماذا يعني هذا لمطوري النماذج

إذا كنت تدرب أو تستخدم معماريات هجينة (مثل Zamba، Nemotron-H، Mamba-2 مع الانتباه، أو أي خلط attention + SSM + الالتفاف) — فحص قناع الانتباه يعطي شعورًا زائفًا بالأمان. تدقيق VIDRAFT يستغرق ثوانٍ ويمكن أن يوفر شهورًا من تصحيح أخطاء جيل غريبة هي في الواقع تسربات من المستقبل.

الفريق دمج هذا الفحص بالفعل في إطار عمل AX-RAY الخاص بهم لتشخيص السببية المستمر. للآخرين — يكفي إضافة تمريرين أماميين إلى خط CI قبل إصدار نقطة تحقق.

القيود والخطوات التالية

الطريقة تجد التسربات لكن لا تصنف نوعها تلقائيًا — يجب النظر لمعمارية الطبقة الجانية. كما أنها تتطلب الوصول للتنشيطات الداخلية، وهو غير متاح في APIs المغلقة (OpenAI، Anthropic). المؤلفون يخططون لتوسيع النهج للنماذج الكمية والمتناثرة، حيث يمكن أن تتنكر عدم الاستقرار العددي ك تسربات سببية.

الورقة: The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models (arXiv:2608.22876، 24 أغسطس 2026). التنفيذ المرجعي وإطار AX-RAY — في مستودع VIDRAFT.

مخطط تدقيق ثبات البادئة: مدخلان متطابقان برمز أخير مختلف، تمريران أماميان، مقارنة تنشيطات طبقة بطبقة