← सभी लेख

कैश-रीड कैच: वास्तविक एजेंट कार्य में GLM 5.3 की लागत अधिक क्यों है

कैश-रीड कैच: वास्तविक एजेंट कार्य में GLM 5.3 की लागत अधिक क्यों है

हमने एजेंट के काम के वास्तविक बिलों का अध्ययन किया और एक साधारण सी चीज़ देखी। जीएलएम 5.3 के लिए, लागत का बड़ा हिस्सा उत्तर या ताजा इनपुट नहीं है - यह कैश को फिर से पढ़ रहा है: टोकन मॉडल पहले ही उसी कार्य के भीतर देख चुका है। हमारे माप में यह बिल का 80-90% है, और लंबे कार्यों के अंदर यह 98% तक पहुंचता है। यही कारण है कि डीपसीक पर एक ही काम लगातार कई गुना सस्ता मिलता है, भले ही पहली नज़र में जीएलएम की मूल्य सूची मामूली लगती है। यहां बताया गया है कि ऐसा कैसे होता है.

आपके बिल में कैश कहां से आता है

प्रत्येक एपीआई कॉल मेमोरी के बिना होती है: मॉडल पूरी बातचीत को फिर से प्राप्त करता है - सिस्टम निर्देश, चैट इतिहास, फ़ाइल सामग्री। प्रदाता दोहराए गए भाग को कैश करते हैं: यदि अनुरोध की शुरुआत पहले से संसाधित किसी चीज़ से मेल खाती है, तो उन टोकन को कैश से छूट पर पढ़ा जाता है। एपीआई प्रतिक्रिया ब्रेकडाउन दिखाती है: कैश से कितने टोकन आए, कितने नए थे, कितने मॉडल ने उत्पन्न किए।

शुद्ध लाभ जैसा लगता है. लेकिन छूट एक दर है, उपहार नहीं, और प्रत्येक मॉडल अपना स्वयं का मूल्य निर्धारित करता है। मॉडलों के बीच का अंतर प्रतिशत में नहीं बल्कि गुणकों में मापा जाता है। यहीं पर पकड़ छुपी होती है।

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

मूल्य सूची क्या कहती है

अगस्त 2026 के अंत तक सार्वजनिक कीमतें, डॉलर प्रति मिलियन टोकन:

नमूनाइनपुटकैश पढ़ेंउत्पादन
जीएलएम 5.3$1.40$0.26 (इनपुट का 19%)$4.40
जीएलएम 5.3 फ्लैश$0.075$0.015 (इनपुट का 20%)$0.25
डीपसीक वी4 प्रो$0.66$0.022 (इनपुट का 3%)$1.98
डीपसीक वी4 फ्लैश$0.03$0.007 (इनपुट का 23%)$0.10

मध्य स्तम्भ को देखें - जो आमतौर पर सरसरी दृष्टि से आगे बढ़ता है। डीपसीक वी4 प्रो के लिए, कैश रीड की लागत इनपुट मूल्य का तीन प्रतिशत है: दोबारा पढ़ने पर लगभग तीस गुना छूट। जीएलएम 5.3 के लिए यह उन्नीस प्रतिशत है, पाँच गुना छूट। फ्लैश मॉडल सापेक्ष रूप से (लगभग 20% बनाम 23%) करीब हैं, फिर भी पूर्ण संख्या में जीएलएम फ्लैश कैश रीड की लागत अभी भी डीपसीक फ्लैश की तुलना में लगभग दोगुनी है।

वास्तविक कार्य पर मापा गया

हमने अगस्त में दो सप्ताह का वास्तविक एजेंट ट्रैफ़िक लिया: चार मॉडलों में 13,279 एपीआई कॉल - जीएलएम 5.3, जीएलएम 5.3 फ्लैश, डीपसीक वी4 प्रो और डीपसीक वी4 फ्लैश। उनसे हमने लगभग तीन सौ पूर्ण कार्य संवाद इकट्ठे किए, जहां एक मॉडल लंबे समय तक एक कार्य पर काम करता है: कोड पढ़ना, फ़ाइलों को संपादित करना, पूरे इतिहास को संदर्भ में रखना। ऐसे कार्य की विशिष्ट तस्वीर: 97-98% इनपुट टोकन कैश हिट हैं। केवल वास्तविक नए पाठ की एक झलक ही आती है; अधिकांश वही पुनः पढ़ी गई स्मृति है।

और यहां बताया गया है कि बिल कैसे टूटता है:

  • जीएलएम 5.3:कुल का 80-90% कैश रीड में जाता है - 98% एक औसत कार्य संवाद के अंदर। उत्तर और ताज़ा इनपुट बचे हुए हैं।
  • डीपसीक वी4 प्रो:बिल का लगभग दो तिहाई (64%) भी कैश है। भावना में समान हिस्सेदारी, लेकिन पूर्ण मात्रा अतुलनीय है, क्योंकि डीपसीक की पढ़ने की दर बारह गुना कम है।

अब पैसा, प्रति कॉल के बजाय पूरे कार्य के अनुसार। एक औसत कार्य संवाद की लागत जीएलएम 5.3 फ्लैश पर लगभग छह सेंट और डीपसीक वी4 फ्लैश पर लगभग दो सेंट होती है। निष्पक्ष रूप से तुलना करने के लिए, हमने उत्पन्न पाठ की समान मात्रा के साथ कार्यों का मिलान किया: तुलनीय कार्यभार पर डीपसीक 3.6-5 गुना सस्ता आता है। कार्यों की श्रेणी में जहां वे ओवरलैप होते हैं, डीपसीक वी4 प्रो के मुकाबले पूर्ण जीएलएम 5.3, समान मात्रा में किए गए कार्य के लिए 6-7 गुना अधिक महंगा था।

एक कार्यप्रणाली नोट: इन आंकड़ों की पुनर्गणना उपरोक्त तालिका में सार्वजनिक दरों से की जाती है, किसी के वास्तविक चालान से नहीं। विवेक जांच के रूप में हमने पुनर्गणना की तुलना रिकॉर्ड किए गए शुल्कों से की, जहां टैरिफ खुला है - उनमें 2-3% का अंतर है, इसलिए अनुमान सही है।

क्या आप इसे एक ही कॉल पर महसूस करना चाहते हैं? हमारे माप में एक सामान्य एजेंट कॉल लगभग 130 हजार कैश टोकन, तीन हजार नए इनपुट टोकन और कुछ सौ आउटपुट है। GLM 5.3 ऐसी कॉल के लिए लगभग चार सेंट का शुल्क लेता है। डीपसीक वी4 प्रो - लगभग आधा प्रतिशत। समान कार्य मात्रा के लिए सात बार।

तो क्या जीएलएम धोखा दे रहा है?

औपचारिक रूप से, नहीं: सभी दरें प्रकाशित की जाती हैं, और जहां भी टैरिफ खुला होता है, पुनर्गणना वास्तविक शुल्क से मेल खाती है। चाल कहीं और है. नज़र इनपुट और आउटपुट कीमतों को पकड़ती है, जबकि "कैश रीड" लाइन एक तकनीकी फ़ुटनोट की तरह दिखती है। दो-संदेश वाली चैट में यह एक है। लेकिन एजेंट के काम में, जहां मेमोरी को प्रति कार्य सैकड़ों बार दोबारा पढ़ा जाता है, वह लाइन मुख्य लागत वस्तु बन जाती है। जीएलएम ने इसकी कीमत फ्लैगशिप मॉडलों के लिए डीपसीक की तुलना में बारह गुना अधिक रखी - और लंबे सत्रों में यह बाकी सभी चीजों पर भारी पड़ती है। यहां तक ​​कि डीपसीक का कैश भी मुफ़्त नहीं है; इसकी दरें इतनी कम हैं कि पूरी मेमोरी को दोबारा पढ़ने में बहुत पैसा खर्च होता है।

इसके बारे में क्या करना है

एजेंटों के लिए मॉडल चुनने से पहले तीन बातें ध्यान देने योग्य हैं:

  • अपने प्रदाता की मूल्य सूची (कैश रीड / कैश्ड इनपुट) में कैश-रीड दर खोजें। ऐसी कोई लाइन नहीं? सीधे पूछो. लंबे सत्रों के लिए यह इनपुट कीमत से अधिक मायने रखता है।
  • अपनी स्वयं की लोड प्रोफ़ाइल देखें: एपीआई प्रतिक्रिया दिखाती है कि कैश से कितने टोकन आए। 90% से ऊपर कैश हिट होने पर, आप अधिकतर पुनः पढ़ने के लिए भुगतान कर रहे हैं, काम के लिए नहीं।
  • स्मृति को बेरहमी से काटें. पुराने संदेश, विशाल सिस्टम निर्देश और जस्ट-इन-केस फ़ाइलें प्रत्येक कॉल पर आपके खर्च पर दोबारा पढ़ी जाती हैं। कभी-कभी एक नया सत्र तीन दिवसीय इतिहास से सस्ता होता है।

दोनों मॉडल उपलब्ध हैंन्यूरलस्पेस चैट, मेंकोडअनुभाग और के माध्यम सेसार्वजनिक एपीआई- दोनों पर अपना कार्य चलाएं और बिलों की तुलना करें। बस ब्रेकडाउन खोलना याद रखें: दिलचस्प हिस्सा हमेशा कैश्ड-टोकन लाइन में रहता है।