← सभी लेख

मास्क मॉडल नहीं है: ऑडिटिंग प्रीफ़िक्स इनवेरिएंस ने ज़ाम्बा2 और नेमोट्रॉन-एच में लीक पकड़ लिया

मास्क मॉडल नहीं है: ऑडिटिंग प्रीफ़िक्स इनवेरिएंस ने ज़ाम्बा2 और नेमोट्रॉन-एच में लीक पकड़ लिया

VIDRAFT की एक कोरियाई स्टार्टअप टीम ने पाया है कि हाइब्रिड भाषा मॉडल में मानक कारण ध्यान मास्क जांच एक सुरक्षा भ्रम के अलावा और कुछ नहीं है: स्कैन, सामान्यीकरण और एकत्रीकरण के माध्यम से भविष्य की पर्ची से जानकारी लीक हो जाती है, और 192 इंजेक्शन दोषों में से एक भी ऐसी जांच द्वारा नहीं पकड़ा गया था।

arXiv (2608.22876) पर पेपर उपसर्ग अपरिवर्तनीयता को औपचारिक बनाता है - आवश्यकता है कि स्थिति पर टोकन का प्रतिनिधित्वtस्थिति में इनपुट पर निर्भर नहीं होना चाहिएटी+1और इसके बाद में। शुद्ध ट्रांसफार्मर में, कारण ध्यान मास्क इसे लागू करते हैं, लेकिन आधुनिक आर्किटेक्चर तेजी से राज्य-अंतरिक्ष मॉडल (माम्बा, माम्बा -2), चंक्ड स्कैन और कनवल्शन के साथ ध्यान मिलाते हैं। ऐसे प्रत्येक ऑपरेटर का अपना निष्पादन पथ होता है, और ध्यान मुखौटा उन्हें नहीं छूता है।

प्रस्तावित ऑडिट बिना किसी प्रशिक्षण या ग्रेडिएंट के दो फॉरवर्ड पास में चलता है। दो समान इनपुट लें जो केवल अंतिम टोकन में भिन्न हों, उन्हें स्वतंत्र रूप से चलाएँ, और परत दर परत सक्रियणों की तुलना करें। यदि प्रारंभिक स्थिति का प्रतिनिधित्व बदलता है, तो कार्य-कारण टूट जाता है, और वह परत जहां यह पहली बार घटित होती है, अपराधी है। यह विधि सेकंडों में रिसाव को एक विशिष्ट परत में स्थानीयकृत कर देती है।

प्रयोग में, विभिन्न आर्किटेक्चर की आठ चौकियों पर 192 सिंथेटिक दोष इंजेक्ट किए गए। क्लासिक मास्क निरीक्षण में कोई नहीं पाया गया। नए ऑडिट में सभी 192 पाए गए और सटीक परत का पता लगाया गया। इसके अलावा, ट्रांसफॉर्मर में चंक्ड-स्कैन कोड के स्थैतिक और गतिशील विश्लेषण से ज़ंबा 2 (ज़िफ़रा) और नेमोट्रॉन-एच (एनवीआईडीआईए) में समान दोष का पता चला - संदर्भ कार्यान्वयन के माध्यम से एक अंतर-चंक अक्ष त्रुटि तय की गई।

ध्यान देने योग्य मुखौटा अब पर्याप्त क्यों नहीं है?

लंबे समय तक, "कारण मुखौटा = कारण मॉडल" एक सिद्धांत था। डिकोडर-केवल ट्रांसफार्मर में, मास्क वास्तव में सभी रास्ते बंद कर देता है: ध्यान ही एकमात्र टोकन-मिश्रण तंत्र है। लेकिन हाइब्रिड मॉडल ने समानांतर कम्प्यूटेशनल ट्रैक्ट पेश किए। एसएसएम पुनरावृत्ति, कनवल्शनल कर्नेल और चंक्ड-स्कैन ऑपरेटर अपने नियमों के अनुसार अनुक्रम को संसाधित करते हैं। ध्यान का मुखौटा बस वहां लागू नहीं होता है - और भविष्य की जानकारी इनमें से किसी भी रास्ते से लीक हो सकती है।

लेखक इसे नेमोट्रॉन-एच पर प्रदर्शित करते हैं: ध्यान ब्लॉक के अंदर खंडित स्कैन टुकड़ों में स्थिति को जमा करने के लिए गलत अक्ष का उपयोग करता है। परिणाम - अगले भाग के टोकन वर्तमान में प्रतिनिधित्व को प्रभावित करते हैं। अटेंशन मास्क बिल्कुल सही रहता है क्योंकि लीक अटेंशन से होकर नहीं गुजरता।

व्यवहार में ऑडिट कैसे काम करता है

एल्गोरिदम सस्ता और पोर्टेबल है:

  1. इनपुट की एक जोड़ी तैयार करें: एक आधार और एक संशोधित अंतिम टोकन के साथ।
  2. दोनों को मॉडल के माध्यम से अनुमान मोड में चलाएँ।
  3. छिपी हुई अवस्थाओं की परत दर परत तुलना करें (जैसे, L2 दूरी)।
  4. गैर-शून्य अंतर वाली पहली परत उपसर्ग अपरिवर्तन उल्लंघन बिंदु है।

कोई फाइन-ट्यूनिंग, कोई ग्रेडिएंट, किसी भी आर्किटेक्चर पर काम नहीं करता है जहां मध्यवर्ती सक्रियण पहुंच योग्य हैं। लेखक एक संदर्भ कार्यान्वयन प्रदान करते हैं जो कोड के एक पृष्ठ पर फिट बैठता है।

मॉडल डेवलपर्स के लिए इसका क्या मतलब है

यदि आप हाइब्रिड आर्किटेक्चर को प्रशिक्षित या उपयोग करते हैं (जैसे ज़ाम्बा, नेमोट्रॉन-एच, ध्यान के साथ माम्बा-2, या कोई ध्यान + एसएसएम + कनवल्शन मिश्रण) - ध्यान मास्क की जाँच करने से सुरक्षा की झूठी भावना आती है। VIDRAFT ऑडिट में कुछ सेकंड लगते हैं और महीनों की अजीब पीढ़ी की कलाकृतियों को डीबग करने से बचाया जा सकता है जो वास्तव में भविष्य से लीक होती हैं।

टीम ने निरंतर कार्य-कारण निदान के लिए इस जांच को पहले ही अपने AX-RAY ढांचे में एकीकृत कर दिया है। बाकी सभी के लिए - चेकपॉइंट जारी करने से पहले बस अपनी सीआई पाइपलाइन में दो फॉरवर्ड पास जोड़ें।

सीमाएँ और अगले चरण

विधि लीक का पता लगाती है लेकिन स्वचालित रूप से उनके प्रकार को वर्गीकृत नहीं करती है - आपको अपराधी परत की वास्तुकला को देखने की आवश्यकता है। इसके लिए आंतरिक सक्रियणों तक पहुंच की भी आवश्यकता होती है, जो बंद एपीआई (ओपनएआई, एंथ्रोपिक) में उपलब्ध नहीं है। लेखक दृष्टिकोण को परिमाणित और विरल मॉडल तक विस्तारित करने की योजना बना रहे हैं, जहां संख्यात्मक अस्थिरता कारण लीक के रूप में सामने आ सकती है।

कागज़:मुखौटा मॉडल नहीं है: ध्यान, राज्य-अंतरिक्ष और हाइब्रिड अनुक्रम मॉडल में उपसर्ग अपरिवर्तनीयता का ऑडिट करना(arXiv:2608.22876, 24 अगस्त, 2026)। संदर्भ कार्यान्वयन और AX-RAY ढांचा - VIDRAFT रिपॉजिटरी में।

Prefix invariance audit diagram: two identical inputs with different last token, two forward passes, layer-wise activation comparison