DeepSeek V4.1 Flash: नया संस्करण चित्र देखता है और V4 Pro को बायपास कर दिया है
DeepSeek जारी V4.1 Flash - एक मॉडल जिसने दो पिछले मॉडल को एक साथ बदल दिया: नियमित V4 Flash और छवि पहचान के साथ एक प्रयोगात्मक संस्करण। अब यह एक मॉडल है जो कोड लिखता है और छवियों को पार्स करता है: एजेंट बेंचमार्क के अनुसार, यह V4 Pro को बायपास करता है, दस लाख टोकन का संदर्भ रखता है और लगभग एक चौथाई कैश खर्च करता है। NeuralSpace V4.1 Flash में यह पहले से ही चैट में, "कोड" अनुभाग में और API के माध्यम से उपलब्ध है - आइए देखें कि V4 Flash की तुलना में क्या बदल गया है।
कौन सा मॉडल
औपचारिक रूप से, यह अब पिछले फ़्लैश का संशोधन नहीं है, बल्कि आर्किटेक्चर के एक नए परिवार का पहला मॉडल है। यू V4.1 Flash 552 बिलियन पैरामीटर बनाम V4 Flash के लिए 284 बिलियन - मॉडल काफ़ी बड़ा है। लेकिन प्रत्येक चरण में कम सक्रिय पैरामीटर हैं: के बारे में इनपुट पढ़ते समय 8 बिलियन और प्रतिक्रिया उत्पन्न करते समय 16 बिलियन।
नई योजना को Causal Encoder-Decoder कहा जाता है: 40 ट्रांसफार्मर परतों को 20 एनकोडर परतों और 20 डिकोडर परतों में विभाजित किया गया है, और कुंजी और मूल्यों का सामान्य कैश एक बार बनाया जाता है - एनकोडर के छिपे हुए राज्यों से, और प्रत्येक परत में दोबारा गणना नहीं की जाती है। यही कारण है कि मॉडल सस्ते में इनपुट प्रोसेस करता है। विषमता को संयोग से नहीं चुना गया था: एजेंट बहुत पढ़ता है - फ़ाइलें, संवाद इतिहास, निर्देश - और अपेक्षाकृत कम लिखता है - संपादन, आदेश, निर्णय। महँगा हिस्सा आसान बना दिया गया, इसलिए एजेंट का काम सस्ता हो गया।
प्रसंग - एक लाख टोकन। तर्क प्रयास लगातार समायोज्य है, 1 से 100 तक: एक साधारण प्रश्न को सस्ते में चलाया जा सकता है, और एक जटिल श्रृंखला को मॉडल को बदले बिना अधिकतम रूप से चलाया जा सकता है।
अब वह तस्वीरें देखता है
पिछले संस्करण से सबसे अधिक ध्यान देने योग्य अंतर. V4 Flash के पास केवल एक टेक्स्ट इनपुट था: वह नहीं जानती थी कि छवियों को कैसे देखना है, और इसके लिए DeepSeek ने अलग से एक प्रयोगात्मक दृष्टि मॉडल जारी किया। V4.1 Flash में दृष्टि मॉडल में ही निर्मित होती है - यह मूल रूप से पाठ और चित्रों को स्वीकार करती है और पाठ के साथ प्रतिक्रिया करती है।
व्यवहार में, इसका मतलब यह है कि इंटरफ़ेस का एक स्क्रीनशॉट, एक ग्राफ़, एक तस्वीर या दस्तावेज़ का एक पृष्ठ मॉडल को वैसे ही दिया जा सकता है। वह छवि का वर्णन करेगी, स्क्रीनशॉट से टेक्स्ट निकालेगी और आरेख का विश्लेषण करेगी। यह एजेंटों के लिए विशेष रूप से सुविधाजनक है: एक मॉडल कोड और इंटरफ़ेस स्क्रीनशॉट दोनों को पढ़ता है, और दो सेवाओं के बीच स्विच करने की कोई आवश्यकता नहीं है।
पुराने मॉडल नाम DeepSeek को हटा दिया गया है: v4-flash और v4-flash-vision-exp के अनुरोधों को अब V4.1 Flash पर पुनर्निर्देशित किया गया है - पुराने एकीकरणों पर कुछ भी ध्यान नहीं दिया जाएगा।

दरकिनार V4 Pro
रिलीज़ का सबसे बड़ा आकर्षण यह था कि एजेंट कार्यों में V4.1 Flash ने बड़े V4 Pro से बेहतर प्रदर्शन किया। यहां आधिकारिक माप से संख्याएँ दी गई हैं DeepSeek:
- Terminal-Bench 2.1 (टर्मिनल में काम) - V4 Pro के लिए 90.6 बनाम 87.9 और पिछले V4 Flash के लिए 82.7;
- CyberGym (साइबर सुरक्षा) - V4 Pro के लिए 88.1 बनाम 83.3;
- DeepSWE v1.1 - V4 Flash के लिए 74.2 बनाम 54.4;
- Terminal-Bench 4.0 - V4 Flash के लिए 31.2 बनाम 7.0।
इसके लिए - GPQA Diamond पर 90.9, Codeforces पर रेटिंग 3471 और MathArena Apex पर 65.6। संख्याएँ स्वतंत्र नहीं हैं, वे स्वयं DeepSeek द्वारा दी गई थीं, इसलिए उन्हें एक बयान के रूप में माना जाना चाहिए, न कि निर्णय के रूप में। लेकिन पिछले फ्लैश में उछाल का पैमाना तीसरे पक्ष के माप के बिना भी दिखाई देता है।
इसके बाद, DeepSeek ने घोषणा की कि वह धीरे-धीरे V4 Pro को समाप्त कर रहा है: 14 सितंबर से, इसका API अनुरोधों को V4 Pro से V4.1 Flash तक पुनर्निर्देशित करता है और उन्हें फ़्लैश दर पर गिनता है। व्यावहारिक निष्कर्ष सरल है: फ्लैश अब "जूनियर" मॉडल नहीं है। अब यह वह है जो मुख्य भार वहन करती है, और नियमित और दृष्टि संस्करण अब अलग-अलग मौजूद नहीं हैं।
कम कैश का अर्थ है सस्ते एजेंट कार्य
एजेंट-आधारित परिदृश्यों के लिए, मुख्य बचत टोकन मूल्य में नहीं, बल्कि कैश में होती है। एजेंट संवाद इतिहास, निर्देशों और प्रोजेक्ट फ़ाइलों को बार-बार पढ़ता है, और यह कैश्ड इनपुट है जो बिल का बड़ा हिस्सा खा जाता है। V4.1 Flash वैश्विक KV कैश लगभग लेता है प्रति टोकन 890 बाइट्स - V4 Flash से लगभग चार गुना कम, और कैश का स्थायी भाग लगभग आठ गुना संपीड़ित होता है।
मॉडल की कीमत भी पिछले फ्लैश की तुलना में कम हो गई है: कैश्ड इनपुट 60% सस्ता है, नियमित इनपुट लगभग एक तिहाई सस्ता है, आउटपुट 11% सस्ता है। लाभ उन कार्यों में विशेष रूप से ध्यान देने योग्य हैं जो बड़े संदर्भों को बार-बार दोहराते हैं; जहां नए उत्तर की लंबाई अधिक महत्वपूर्ण है, बचत अधिक मामूली है।

V4 Flash और V4.1 Flash: क्या बदल गया है
| पैरामीटर | V4 Flash | V4.1 Flash |
|---|---|---|
| विकल्प | 284 अरब | 552 अरब |
| चरण में सक्रिय | 13 अरब | 8 बिलियन इनपुट / 16 बिलियन आउटपुट |
| वास्तुकला | MoE-डिकोडर | Causal Encoder-Decoder |
| चित्रों को समझता है | नहीं, अलग विज़न मॉडल | हाँ, मूलनिवासी |
| प्रसंग | 1 मिलियन टोकन | 1 मिलियन टोकन |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| KV-नकद प्रति टोकन | ~4× अधिक | 890 बाइट्स |
कीमत NeuralSpace और कैसे प्रयास करें
NeuralSpace मॉडल पिछले V4 Flash के समान दर पर काम करता है: $0.14 प्रति मिलियन इनपुट टोकन और $0.28 प्रति मिलियन सप्ताहांत. प्रारंभ - आपके शेष पर 3 टोकन से; डेबिट सामान्य शेष राशि से आता है, बिना किसी अलग सदस्यता और विदेशी कार्ड के। इसे आज़माने के लिए, बस एक कदम ही काफी है:
- बात करना: मॉडल पृष्ठ — आप यहां एक चित्र या स्क्रीनशॉट संलग्न कर सकते हैं, और मॉडल उन्हें सुलझा देगा;
- कोड: "कोड" अनुभाग - मॉडल प्रोजेक्ट से जुड़ता है और रिपॉजिटरी, फाइलों और टर्मिनल के साथ काम करता है;
- API: कुंजी अनुभाग में जारी की गई है API-कुंजियाँ, OpenAI के साथ संगत प्रारूप; दस्तावेज़ीकरण - न्यूरलस्पेस.pro/ru/v1/docs.
अक्सर पूछे जाने वाले प्रश्नों
V4.1 Flash - क्या यह नया मॉडल है या अपडेट? यह आर्किटेक्चर के एक नए परिवार का एक संस्करण है, न कि पिछले फ़्लैश का संशोधन: आर्किटेक्चर बदल गया है, सहायक भाग बड़ा हो गया है, और दृष्टि प्रकट हुई है।
क्या वह तस्वीरें देखती है? हां, मूल रूप से: आप एक फोटो, स्क्रीनशॉट, चार्ट या दस्तावेज़ भेज सकते हैं। आखिरी V4 Flash टेक्स्ट था।
V4 Pro का क्या हुआ? DeepSeek धीरे-धीरे इसे समाप्त कर रहा है और अनुरोधों को V4.1 Flash पर पुनर्निर्देशित कर रहा है, जिसने एजेंट-आधारित बेंचमार्क में V4 Pro से बेहतर प्रदर्शन किया है।
इसे आज़माने में कितना खर्च आता है? $0.14/$0.28 प्रति मिलियन टोकन, शेष राशि पर 3 टोकन से शुरू - पर मॉडल का चैट पेज.
क्या v4-flash के पुराने अनुरोध टूट जायेंगे? नहीं: v4-flash और v4-flash-vision-exp पर कॉल को V4.1 Flash पर पुनर्निर्देशित किया जाता है और इसकी दर पर गिना जाता है।