llms.txt भेद्यता: कैसे AI एजेंट दस्तावेज़ीकरण फ़ाइलों के माध्यम से स्वचालित रूप से दुर्भावनापूर्ण कोड स्थापित करते हैं
गुरुवार, 27 अगस्त को,एर्स टेक्निका ने एक जांच प्रकाशित कीइससे एआई कोडिंग एजेंटों का उपयोग करने वाले किसी भी डेवलपर को अपनी सुरक्षा पर पुनर्विचार करना चाहिए। इज़राइली स्टील्थ स्टार्टअप के शोधकर्ताओं ने फॉर्च्यून 500 कंपनियों, रक्षा ठेकेदारों और बिग टेक से संबंधित 6,214 डोमेन को स्कैन किया - और 120 llms.txt फाइलें पाईं, जो AI एजेंटों को स्वचालित रूप से PyPI और npm से गैर-मौजूद पैकेज इंस्टॉल करने का कारण बनती हैं।
समस्या सरल और भयावह है: llms.txt अनिवार्य रूप से "AI के लिए robots.txt" है - एक मार्कडाउन साइट-मैप फ़ाइल जो एजेंटों को दस्तावेज़ीकरण संरचना को तुरंत समझने में मदद करती है। लेकिन विनिर्देश में कोई प्रमाणीकरण, कोई हस्ताक्षर, कोई अखंडता जांच शामिल नहीं है। यदि ऐसी फ़ाइल में pip install non-existent-package या npm install non-existent-package है, और एजेंट के पास कमांड चलाने की अनुमति है - तो वह वहां जो कुछ भी लिखा है उसे इंस्टॉल कर देगा।
यह काम किस प्रकार करता है
शोधकर्ताओं को 8,265 llms.txt और llms-full.txt फ़ाइलें मिलीं (कई साइटें दोनों को होस्ट करती हैं)। उनमें से 120 में - 120 विभिन्न डोमेन में - ऐसे पैकेज या डोमेन के संदर्भ थे जो रजिस्ट्रियों में मौजूद नहीं हैं। एक हमलावर को केवल ऐसा नाम पंजीकृत करने और दुर्भावनापूर्ण कोड अपलोड करने की आवश्यकता है।
हमले को सत्यापित करने के लिए, शोधकर्ताओं ने स्वयं कई "मुक्त" नाम पंजीकृत किए और हानिरहित पैकेज रखे जो बस उनके सर्वर को "मैंने शुरू किया" के साथ पिंग करते थे। एक घंटे के भीतर, उन्हें फॉर्च्यून 500 कंपनी से प्रतिक्रिया मिली। समय के साथ, दर्जनों और प्रतिक्रियाएँ आईं - अन्य दिग्गजों और स्टार्टअप्स से। प्रक्रिया टेलीमेट्री ने सटीक रूप से दिखाया कि पैकेज किसने स्थापित किए:क्लॉड कोड, ओपनएआई कोडेक्स, और नूस रिसर्च से हर्मीस.

सबसे घृणित मामला - क्लर्क.कॉम
वैध क्लर्क.कॉम साइट पर, llms.txt फ़ाइल में npx clerk-next-fix-auth-protection शामिल है। नियमित npm install के विपरीत, npx एक पैकेज को एनपीएम के कैश में ला सकता है और प्रोजेक्ट की निर्भरता मेनिफेस्ट में जोड़े बिना इसके बाइनरी को निष्पादित कर सकता है। कोई इस मुफ़्त नाम पर दावा करने और वास्तविक मैलवेयर अपलोड करने में कामयाब रहा। क्लर्क ने समस्या का समाधान कर दिया, लेकिन पैटर्न पहले से ही उत्पादन में है।
यह सिर्फ एक "मॉडल बग" क्यों नहीं है
यह कोई मतिभ्रम या सैंडबॉक्स से बच निकलना नहीं है। फ़ाइल कंपनी के आधिकारिक डोमेन पर मौजूद है, जिसे एआई खपत के लिए डिज़ाइन किए गए मानकीकृत प्रारूप में HTTPS पर परोसा जाता है। एजेंट के पास इस पर संदेह करने का कोई कारण नहीं है - फ़ाइलहैअधिकार. समस्या यह है कि llms.txt मानक (सितंबर 2024 में उत्तर.एआई के जेरेमी हॉवर्ड द्वारा प्रस्तावित) में कोई भी सुरक्षा प्रावधान नहीं है: कोई हस्ताक्षर नहीं, कोई मूल सत्यापन नहीं, कोई पैकेज सत्यापन नहीं।
विश्वास श्रृंखला परिवर्तनशील है: llms.txt को फॉर्च्यून 500 की अपनी साइट पर बैठने की ज़रूरत नहीं है - यह एक भागीदार के दस्तावेज़, एक विक्रेता के एसडीके संदर्भ, एक सामुदायिक परियोजना के सेटअप गाइड पर हो सकता है। यदि एजेंट उस तीसरे पक्ष पर भरोसा करता है, और वह तीसरा पक्ष एक अपंजीकृत पैकेज की ओर इशारा करता है - तो श्रृंखला उसी तरह काम करती है।
अभी क्या करें
- अंकेक्षण।अपना
llms.txtऔरllms-full.txtजांचें। सुनिश्चित करें कि प्रत्येक उल्लिखित पैकेज, डोमेन और यूआरएल मौजूद है, आपके नियंत्रण में है, और एक पहचाना हुआ अनुरक्षक है। उन निर्भरताओं के संदर्भ हटा दें जिन्हें आप स्मृति से समझा नहीं सकते। - एजेंटों और रजिस्ट्रियों के बीच प्रॉक्सी।नए पैकेजों को ब्लॉक करें (स्लोपस्क्वैटेड पैकेज परिभाषा के अनुसार नए हैं), किसी भी निर्भरता की पहली रिलीज के बाद 24-72 घंटे का कूलडाउन लागू करें, इंस्टॉलेशन से पहले
provenance(SLSA/Sigstore) को सत्यापित करें। - एजेंटों को
--yolo,--dangerously-skip-permissions,--trust-all-toolsन दें।ये झंडे मौजूद हैं इसलिए डेवलपर जिम्मेदारी लेता है। यदि कोई एजेंट आपकी पुष्टि के बिना पैकेज स्थापित करता है - तो आपने उसे अपने बुनियादी ढांचे की चाबियाँ सौंप दी हैं।
तल - रेखा
एजेंटों के लिए वेबसाइटों को पठनीय बनाने की दौड़ सॉफ्टवेयर आपूर्ति श्रृंखला का फायदा उठाने की दौड़ से टकरा गई। यह किसी एक मॉडल या एक विक्रेता की गलती नहीं है - यह उस मानक में एक डिज़ाइन दोष है जिसके बारे में किसी ने निष्पादन योग्य कोड के रूप में नहीं सोचा था। जब तक उद्योग वेब पर एजेंटों द्वारा पढ़ी गई बातों का सत्यापन लागू नहीं करता, तब तक प्रत्येक ख़राब llms.txt आपके नेटवर्क में एक संभावित प्रवेश बिंदु है।

सुरक्षा के लिए अपने AI वर्कफ़्लो का परीक्षण करना चाहते हैं? न्यूरलस्पेस आपको एक पृथक वातावरण में कोड जनरेशन और परीक्षण एजेंट चलाने की सुविधा देता है -चैट का प्रयास करेंयाकोड मोड.