18 एआई मॉडल ने पूरी तरह से स्वायत्त अनुसंधान दौड़ में प्रवेश किया - ओपन-वेट किमी K3 ने क्लाउड को लगभग पकड़ लिया
प्राइम इंटेलेक्ट ने हाल ही में एक असामान्य प्रयोग किया: 18 शीर्ष भाषा मॉडल - फैबल 5 और जीपीटी-5.6 सोल से लेकर ओपन-वेट किमी के 3 तक - को स्वायत्त अनुसंधान रन पर खुला रखा गया, जहां इंसानों ने कभी कदम नहीं रखा। अंत जोरदार है: सस्ते एजेंट हार्नेस से जुड़ा एक खुला चीनी मॉडल एंथ्रोपिक के सबसे महंगे फ्लैगशिप के करीब आ गया। यहां बताया गया है कि क्या हुआ, और एआई प्रगति पर नज़र रखने वाले किसी भी व्यक्ति के लिए यह क्यों महत्वपूर्ण है।
दौड़: एक मॉडल को यथासंभव कम चरणों में प्रशिक्षित करें
यह कार्य आंद्रेज कारपैथी के सुप्रसिद्ध नैनोजीपीटी स्पीडरन प्रोजेक्ट से आता है। एक छोटे 124 मिलियन-पैरामीटर मॉडल को यथासंभव कम प्रशिक्षण चरणों का उपयोग करके 3.28 की सत्यापन हानि तक पहुंचना होता है। स्टार्टर रेसिपी 3,290 चरणों में वहां पहुंचती है। सर्वोत्तम मानवों ने 2,600 का प्रबंधन किया है।
एजेंट को एक कोड रिपॉजिटरी, एक संक्षिप्त नियम पुस्तिका और एक लक्ष्य प्राप्त होता है। उसके बाद यह अपने आप होता है: ऑप्टिमाइज़र में बदलाव करना, प्रयोग चलाना, यादृच्छिक शोर से वास्तविक सुधार बताना, यह तय करना कि आगे क्या परीक्षण करना है। हार्डवेयर: आठ एच200 जीपीयू, सब कुछ एक ऑफ़लाइन सैंडबॉक्स के अंदर बंद है ताकि मॉडल तैयार उत्तरों को न देख सके। कुल मिलाकर 153 पूर्णतः स्वायत्त रन थे; पिछले आठ दिनों में सबसे लंबा समय लगा।
किसने कहाँ ख़त्म किया
एंथ्रोपिक की कहानी 5 2,726 कदमों पर सबसे आगे चली गई, जिससे बेसलाइन रेसिपी और मानव रिकॉर्ड के बीच का लगभग 82% अंतर कम हो गया। प्रमुख क्लाउड ओपस 5 ने 2,920 की सीमा पार कर ली।
फिर आश्चर्य हुआ. मूनशॉट एआई से ओपन-वेट किमी K3, मल्टी-एजेंट प्राइम एजेंट हार्नेस के माध्यम से चलते हुए, 2,930 कदम पर रुक गया। एक फ्लैगशिप से दस कदम पीछे जिसकी कीमत प्रति टोकन काफी अधिक है। जीपीटी-5.6 सोल खुले मॉडल के पीछे 3,042 पर समाप्त हुआ।

सबसे मजेदार हिस्सा: किसी ने कुछ भी नया आविष्कार नहीं किया
एक भी रन ने वास्तव में एक नवीन पद्धति का निर्माण नहीं किया। वह सब कुछ जो वास्तव में काम करता था - चतुर सामान्यीकरण, सीखने की दर अनुसूची, वजन औसत - वर्षों पहले कागजात में वर्णित किया गया था। प्रत्येक मॉडल लगभग समान विचारों पर सहमत हुआ।
अंतर क्रियान्वयन का था. मजबूत मॉडल एक खराब रोल के बाद किसी परिकल्पना को दफन नहीं करते हैं: वे यादृच्छिक बीज बदलते हैं, माप दोहराते हैं, स्थितियों में बदलाव होने पर पुराने विचारों पर फिर से विचार करते हैं। वे वास्तविक प्रगति को शोर से अधिक सावधानी से अलग करते हैं। और वे अपने स्वयं के उपकरण बनाते हैं: किमी K3 ने हानि वक्रों की तुलना करने के लिए कस्टम फ़ंक्शन लिखे और एक मिनी संख्यात्मक प्रयोगशाला को इकट्ठा किया, इसे वास्तविक प्रशिक्षण में ले जाने से पहले खिलौना मामलों पर न्यूटन-शुल्ज़ पद्धति को मान्य किया।
यह "एआई इम्प्रूविंग एआई" स्क्रिप्ट को नुकसान क्यों पहुंचाता है?
क्लासिक पुनरावर्ती आत्म-सुधार की कहानी इस प्रकार है: सबसे स्मार्ट बंद मॉडल खुद को अपग्रेड करना शुरू कर देता है और अपरिवर्तनीय रूप से दूर चला जाता है जबकि बाकी सभी धूल खाते हैं। यह प्रयोग उस तस्वीर को ख़त्म कर देता है। जब विचार तेजी से खत्म हो जाते हैं, तो विजेता सबसे चतुर खिलाड़ी नहीं होता है, बल्कि वह होता है जिसके "प्रस्ताव - परीक्षण - त्यागें" के चक्र की लागत कम होती है और वह तेजी से घूमता है। अच्छे हार्नेस द्वारा संचालित खुले मॉडल प्रति डॉलर अधिक प्रयास करते हैं - और यह किसी अन्य बेंचमार्क बिंदु से अधिक मायने रखता है।
शिकार
निष्पक्षता से कहें तो: यह एक बहुत ही संकीर्ण कार्य है। एक एकल प्रशिक्षण स्क्रिप्ट, एक स्पष्ट मीट्रिक, एक स्पष्ट सफलता मानदंड - वास्तविक विज्ञान कहीं अधिक गड़बड़ दिखता है। कोई नई विधियाँ भी सामने नहीं आईं, इसलिए यह अभी भी शोधकर्ता को प्रतिस्थापित करने के बजाय एक शोधकर्ता की दिनचर्या को स्वचालित करने के बारे में है। और परिणाम बहुत हद तक हार्नेस पर ही निर्भर करते हैं: एजेंट परत के बिना वही किमी K3 काफी खराब चलता है।
अक्सर पूछे जाने वाले प्रश्न
एजेंट हार्नेस क्या है?
मॉडल के चारों ओर एक परत: उपकरण, एक कोड-निष्पादन वातावरण, पिछले चरणों की स्मृति, एक कार्य अनुसूचक। मॉडल वही रहता है, लेकिन काम करना आसान हो जाता है - जैसे किसी व्यक्ति को उचित उपकरणों के साथ उचित डेस्क मिल जाती है।
क्या नियमित उपयोगकर्ता किमी K3 आज़मा सकते हैं?
हाँ, बाट खुले हैं। आप इसमें चैट कर सकते हैंन्यूरलस्पेस चैटऔर एजेंट-शैली वर्कफ़्लो आज़माएँकोड.
तो क्या एआई जल्द ही अपने दम पर वैज्ञानिक पेपर लिखेगा?
इतनी जल्दी नहीं. स्वायत्त एजेंट वहां अच्छा प्रदर्शन करते हैं जहां स्पष्ट मीट्रिक और त्वरित प्रतिक्रिया होती है। परिकल्पनाएँ, स्वाद और सही प्रश्न पूछना अभी भी मानवीय क्षेत्र हैं। लेकिन मॉडलों के आसपास के बुनियादी ढांचे को अभी किसी भी अन्य चीज़ की तुलना में तेजी से उन्नत किया जा रहा है - जिस पर नज़र रखनी चाहिए।