कैश-रीड कैच: वास्तविक एजेंट कार्य में GLM 5.3 की लागत अधिक क्यों है
हमने एजेंट के काम के वास्तविक बिलों का अध्ययन किया और एक साधारण सी चीज़ देखी। जीएलएम 5.3 के लिए, लागत का बड़ा हिस्सा उत्तर या ताजा इनपुट नहीं है - यह कैश को फिर से पढ़ रहा है: टोकन मॉडल पहले ही उसी कार्य के भीतर देख चुका है। हमारे माप में यह बिल का 80-90% है, और लंबे कार्यों के अंदर यह 98% तक पहुंचता है। यही कारण है कि डीपसीक पर एक ही काम लगातार कई गुना सस्ता मिलता है, भले ही पहली नज़र में जीएलएम की मूल्य सूची मामूली लगती है। यहां बताया गया है कि ऐसा कैसे होता है.
आपके बिल में कैश कहां से आता है
प्रत्येक एपीआई कॉल मेमोरी के बिना होती है: मॉडल पूरी बातचीत को फिर से प्राप्त करता है - सिस्टम निर्देश, चैट इतिहास, फ़ाइल सामग्री। प्रदाता दोहराए गए भाग को कैश करते हैं: यदि अनुरोध की शुरुआत पहले से संसाधित किसी चीज़ से मेल खाती है, तो उन टोकन को कैश से छूट पर पढ़ा जाता है। एपीआई प्रतिक्रिया ब्रेकडाउन दिखाती है: कैश से कितने टोकन आए, कितने नए थे, कितने मॉडल ने उत्पन्न किए।
शुद्ध लाभ जैसा लगता है. लेकिन छूट एक दर है, उपहार नहीं, और प्रत्येक मॉडल अपना स्वयं का मूल्य निर्धारित करता है। मॉडलों के बीच का अंतर प्रतिशत में नहीं बल्कि गुणकों में मापा जाता है। यहीं पर पकड़ छुपी होती है।

मूल्य सूची क्या कहती है
अगस्त 2026 के अंत तक सार्वजनिक कीमतें, डॉलर प्रति मिलियन टोकन:
| नमूना | इनपुट | कैश पढ़ें | उत्पादन |
|---|---|---|---|
| जीएलएम 5.3 | $1.40 | $0.26 (इनपुट का 19%) | $4.40 |
| जीएलएम 5.3 फ्लैश | $0.075 | $0.015 (इनपुट का 20%) | $0.25 |
| डीपसीक वी4 प्रो | $0.66 | $0.022 (इनपुट का 3%) | $1.98 |
| डीपसीक वी4 फ्लैश | $0.03 | $0.007 (इनपुट का 23%) | $0.10 |
मध्य स्तम्भ को देखें - जो आमतौर पर सरसरी दृष्टि से आगे बढ़ता है। डीपसीक वी4 प्रो के लिए, कैश रीड की लागत इनपुट मूल्य का तीन प्रतिशत है: दोबारा पढ़ने पर लगभग तीस गुना छूट। जीएलएम 5.3 के लिए यह उन्नीस प्रतिशत है, पाँच गुना छूट। फ्लैश मॉडल सापेक्ष रूप से (लगभग 20% बनाम 23%) करीब हैं, फिर भी पूर्ण संख्या में जीएलएम फ्लैश कैश रीड की लागत अभी भी डीपसीक फ्लैश की तुलना में लगभग दोगुनी है।
वास्तविक कार्य पर मापा गया
हमने अगस्त में दो सप्ताह का वास्तविक एजेंट ट्रैफ़िक लिया: चार मॉडलों में 13,279 एपीआई कॉल - जीएलएम 5.3, जीएलएम 5.3 फ्लैश, डीपसीक वी4 प्रो और डीपसीक वी4 फ्लैश। उनसे हमने लगभग तीन सौ पूर्ण कार्य संवाद इकट्ठे किए, जहां एक मॉडल लंबे समय तक एक कार्य पर काम करता है: कोड पढ़ना, फ़ाइलों को संपादित करना, पूरे इतिहास को संदर्भ में रखना। ऐसे कार्य की विशिष्ट तस्वीर: 97-98% इनपुट टोकन कैश हिट हैं। केवल वास्तविक नए पाठ की एक झलक ही आती है; अधिकांश वही पुनः पढ़ी गई स्मृति है।
और यहां बताया गया है कि बिल कैसे टूटता है:
- जीएलएम 5.3:कुल का 80-90% कैश रीड में जाता है - 98% एक औसत कार्य संवाद के अंदर। उत्तर और ताज़ा इनपुट बचे हुए हैं।
- डीपसीक वी4 प्रो:बिल का लगभग दो तिहाई (64%) भी कैश है। भावना में समान हिस्सेदारी, लेकिन पूर्ण मात्रा अतुलनीय है, क्योंकि डीपसीक की पढ़ने की दर बारह गुना कम है।
अब पैसा, प्रति कॉल के बजाय पूरे कार्य के अनुसार। एक औसत कार्य संवाद की लागत जीएलएम 5.3 फ्लैश पर लगभग छह सेंट और डीपसीक वी4 फ्लैश पर लगभग दो सेंट होती है। निष्पक्ष रूप से तुलना करने के लिए, हमने उत्पन्न पाठ की समान मात्रा के साथ कार्यों का मिलान किया: तुलनीय कार्यभार पर डीपसीक 3.6-5 गुना सस्ता आता है। कार्यों की श्रेणी में जहां वे ओवरलैप होते हैं, डीपसीक वी4 प्रो के मुकाबले पूर्ण जीएलएम 5.3, समान मात्रा में किए गए कार्य के लिए 6-7 गुना अधिक महंगा था।
एक कार्यप्रणाली नोट: इन आंकड़ों की पुनर्गणना उपरोक्त तालिका में सार्वजनिक दरों से की जाती है, किसी के वास्तविक चालान से नहीं। विवेक जांच के रूप में हमने पुनर्गणना की तुलना रिकॉर्ड किए गए शुल्कों से की, जहां टैरिफ खुला है - उनमें 2-3% का अंतर है, इसलिए अनुमान सही है।
क्या आप इसे एक ही कॉल पर महसूस करना चाहते हैं? हमारे माप में एक सामान्य एजेंट कॉल लगभग 130 हजार कैश टोकन, तीन हजार नए इनपुट टोकन और कुछ सौ आउटपुट है। GLM 5.3 ऐसी कॉल के लिए लगभग चार सेंट का शुल्क लेता है। डीपसीक वी4 प्रो - लगभग आधा प्रतिशत। समान कार्य मात्रा के लिए सात बार।
तो क्या जीएलएम धोखा दे रहा है?
औपचारिक रूप से, नहीं: सभी दरें प्रकाशित की जाती हैं, और जहां भी टैरिफ खुला होता है, पुनर्गणना वास्तविक शुल्क से मेल खाती है। चाल कहीं और है. नज़र इनपुट और आउटपुट कीमतों को पकड़ती है, जबकि "कैश रीड" लाइन एक तकनीकी फ़ुटनोट की तरह दिखती है। दो-संदेश वाली चैट में यह एक है। लेकिन एजेंट के काम में, जहां मेमोरी को प्रति कार्य सैकड़ों बार दोबारा पढ़ा जाता है, वह लाइन मुख्य लागत वस्तु बन जाती है। जीएलएम ने इसकी कीमत फ्लैगशिप मॉडलों के लिए डीपसीक की तुलना में बारह गुना अधिक रखी - और लंबे सत्रों में यह बाकी सभी चीजों पर भारी पड़ती है। यहां तक कि डीपसीक का कैश भी मुफ़्त नहीं है; इसकी दरें इतनी कम हैं कि पूरी मेमोरी को दोबारा पढ़ने में बहुत पैसा खर्च होता है।
इसके बारे में क्या करना है
एजेंटों के लिए मॉडल चुनने से पहले तीन बातें ध्यान देने योग्य हैं:
- अपने प्रदाता की मूल्य सूची (कैश रीड / कैश्ड इनपुट) में कैश-रीड दर खोजें। ऐसी कोई लाइन नहीं? सीधे पूछो. लंबे सत्रों के लिए यह इनपुट कीमत से अधिक मायने रखता है।
- अपनी स्वयं की लोड प्रोफ़ाइल देखें: एपीआई प्रतिक्रिया दिखाती है कि कैश से कितने टोकन आए। 90% से ऊपर कैश हिट होने पर, आप अधिकतर पुनः पढ़ने के लिए भुगतान कर रहे हैं, काम के लिए नहीं।
- स्मृति को बेरहमी से काटें. पुराने संदेश, विशाल सिस्टम निर्देश और जस्ट-इन-केस फ़ाइलें प्रत्येक कॉल पर आपके खर्च पर दोबारा पढ़ी जाती हैं। कभी-कभी एक नया सत्र तीन दिवसीय इतिहास से सस्ता होता है।
दोनों मॉडल उपलब्ध हैंन्यूरलस्पेस चैट, मेंकोडअनुभाग और के माध्यम सेसार्वजनिक एपीआई- दोनों पर अपना कार्य चलाएं और बिलों की तुलना करें। बस ब्रेकडाउन खोलना याद रखें: दिलचस्प हिस्सा हमेशा कैश्ड-टोकन लाइन में रहता है।