→ כל המאמרים

המסכה היא לא הדגם: Invariance של בקידומת ביקורת תופסת דליפות ב-Zamba2 וב-Nemotron-H

המסכה היא לא הדגם: Invariance של בקידומת ביקורת תופסת דליפות ב-Zamba2 וב-Nemotron-H

צוות סטארט-אפ קוריאני ב-VIDRAFT גילה שבדיקת מסכת הקשב הסיבתית הסטנדרטית במודלים של שפות היברידיות אינה אלא אשליה בטיחותית: דליפות מידע מהעתיד מחליקות דרך סריקות, נורמליזציה והצטברות, ואף אחד מ-192 פגמים שהוזרקו לא נתפס בבדיקה כזו.

המאמר על arXiv (2608.22876) מגבש את חוסר הקידומת - הדרישה לייצוג של אסימון במיקוםtאסור להיות תלוי בכניסות במיקוםt + 1ומעבר לכך. בשנאים טהורים, מסכות קשב סיבתי אוכפות זאת, אך ארכיטקטורות מודרניות מערבבות יותר ויותר תשומת לב עם מודלים של מצב-חלל (Mamba, Mamba-2), סריקות חתיכות ופיתולים. לכל מפעיל כזה יש נתיב ביצוע משלו, ומסיכת הקשב לא נוגעת בהם.

הביקורת המוצעת פועלת בשני מעברים קדימה ללא הכשרה או שיפועים. קח שתי כניסות זהות הנבדלות רק באסימון האחרון, הפעל אותן באופן עצמאי והשווה הפעלה שכבה אחר שכבה. אם ייצוגי מיקום מוקדם משתנים, הסיבתיות נשברת, והרובד שבו זה מתרחש לראשונה הוא האשם. השיטה ממקמת את הדליפה לשכבה ספציפית תוך שניות.

בניסוי הוזרקו 192 תקלות סינתטיות על פני שמונה מחסומים של ארכיטקטורות שונות. בדיקת מסכה קלאסית לא זיהתה אף אחת. הביקורת החדשה מצאה את כל 192 ומצאה את השכבה המדויקת. יתרה מכך, ניתוח סטטי ודינמי של קוד סריקה בחתיכות בשנאים חשף את אותו פגם ב-Zamba2 (Zyphra) וב-Nemotron-H (NVIDIA) - שגיאת ציר בין-צ'אנק שתוקנה באמצעות יישום הייחוס.

למה מסכת הקשב כבר לא מספיקה

במשך זמן רב, "מסכה סיבתית = מודל סיבתי" הייתה אקסיומה. בשנאים מפענח בלבד, המסכה באמת סוגרת את כל הנתיבים: תשומת הלב היא מנגנון ערבוב האסימונים היחיד. אבל מודלים היברידיים הציגו מסלולי חישוב מקבילים. הישנות SSM, גרעינים קונבולוציוניים ואופרטורים של סריקה בחתיכות מעבדים את הרצף לפי הכללים שלהם. מסיכת הקשב פשוט לא מיושמת שם - ומידע עתידי יכול לדלוף בכל אחד מהנתיבים הללו.

המחברים מדגימים זאת ב-Nemotron-H: הסריקה החתוכה בתוך בלוק הקשב משתמשת בציר הלא נכון לצבירת מצב על פני נתחים. התוצאה - אסימונים מהחלק הבא משפיע על ייצוגי הנתח הנוכחי. מסכת הקשב נשארת נכונה לחלוטין מכיוון שהדליפה לא עוברת דרך תשומת הלב.

כיצד פועלת הביקורת בפועל

האלגוריתם זול ונייד:

  1. הכן זוג כניסות: בסיס אחד ואחד עם אסימון אחרון שונה.
  2. הפעל את שניהם דרך המודל במצב מסקנות.
  3. השווה מצבים נסתרים שכבה אחר שכבה (למשל, מרחק L2).
  4. השכבה הראשונה עם הבדל שאינו אפס היא נקודת ההפרה של קידומת חדירות.

ללא כוונון עדין, ללא מעברי צבע, עובד על כל ארכיטקטורה שבה הפעלות ביניים נגישות. המחברים מספקים יישום עזר שמתאים לדף אחד של קוד.

מה זה אומר עבור מפתחי דגמים

אם אתה מתאמן או משתמש בארכיטקטורות היברידיות (כמו Zamba, Nemotron-H, Mamba-2 עם תשומת לב, או כל שילוב של תשומת לב + SSM + קונבולציה) - בדיקת מסכת הקשב נותן תחושת ביטחון מזויפת. ביקורת VIDRAFT נמשכת כמה שניות ויכולה לחסוך חודשים של ניפוי באגים של חפצי דור מוזרים שהם למעשה דליפות מהעתיד.

הצוות כבר שילב את הבדיקה הזו במסגרת ה-AX-RAY שלהם לאבחון סיבתיות מתמשך. לכל השאר - פשוט הוסף שני מעברים קדימה לצינור ה-CI שלך לפני שחרור מחסום.

מגבלות והצעדים הבאים

השיטה מוצאת דליפות אך אינה מסווגת אוטומטית את סוגן - עליך להסתכל על הארכיטקטורה של השכבה האשם. זה גם דורש גישה להפעלות פנימיות, שאינה זמינה בממשקי API סגורים (OpenAI, Anthropic). המחברים מתכננים להרחיב את הגישה למודלים כמותיים ומדלילים, שבהם חוסר יציבות מספרית יכולה להתחזות לדליפות סיבתיות.

נְיָר:המסכה היא לא המודל: חוסר קידומת ביקורת במודלים של קשב, מצב-מרחב ורצף היברידי(arXiv:2608.22876, 24 באוגוסט 2026). יישום הפניות ומסגרת AX-RAY - במאגר VIDRAFT.

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison