Kvaka pri čitanju predmemorije: zašto GLM 5.3 košta više u stvarnom radu agenta
Pregledali smo stvarne račune za agentski rad i vidjeli jednostavnu stvar. Za GLM 5.3, lavovski udio u trošku nisu odgovori i ne svježi unos — to je ponovno čitanje predmemorije: tokeni koje je model već vidio unutar istog posla. U našim mjerenjima to je 80–90% računa, a unutar dugih zadataka približava se 98%. Zbog toga isti posao na DeepSeeku stalno izlazi nekoliko puta jeftinije, iako GLM-ov cjenik na prvi pogled izgleda skromno. Evo kako se to događa.
Odakle dolazi predmemorija na vašem računu
Svaki API poziv odvija se bez memorije: model ponovno prima cijeli razgovor — upute sustava, povijest razgovora, sadržaj datoteke. Pružatelji spremaju ponovljeni dio u predmemoriju: ako početak zahtjeva odgovara nečemu što je već obrađeno, ti se tokeni čitaju iz predmemorije uz popust. API odgovor pokazuje raščlambu: koliko je tokena došlo iz predmemorije, koliko je bilo novih, koliko ih je model generirao.
Zvuči kao čisti profit. Ali popust je cijena, a ne poklon, i svaki model postavlja svoje. Jaz između modela se ne mjeri u postocima, već u višekratnicima. Tu se krije kvaka.

Što kaže cjenik
Javne cijene od kraja kolovoza 2026., dolari za milijun tokena:
| Model | Ulazni | Čitanje predmemorije | Izlaz |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% unosa) | $4.40 |
| GLM 5.3 Flash | $0.075 | $0.015 (20% unosa) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3% unosa) | $1.98 |
| DeepSeek V4 Flash | $0.03 | $0.007 (23% unosa) | $0.10 |
Pogledajte srednji stupac — onaj koji se obično provlači. Za DeepSeek V4 Pro, čitanje predmemorije košta tri posto ulazne cijene: gotovo trideseterostruki popust za ponovno čitanje. Za GLM 5.3 je devetnaest posto, peterostruki popust. Flash modeli su bliži u relativnom smislu (oko 20% u odnosu na 23%), ali u apsolutnim brojevima čitanja GLM Flash predmemorije još uvijek koštaju otprilike dvostruko više od DeepSeek Flasha.
Mjereno na stvarnom radu
Uzeli smo dva tjedna stvarnog agentskog prometa u kolovozu: 13.279 API poziva preko četiri modela — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro i DeepSeek V4 Flash. Od njih smo sastavili gotovo tri stotine dijaloga s punim zadacima, gdje model dugo radi na jednom poslu: čitanje koda, uređivanje datoteka, čuvanje cijele povijesti u kontekstu. Tipična slika takvog zadatka: 97–98% ulaznih tokena su pogoci predmemorije. Dolazi samo mrvica istinski novog teksta; glavnina je ta ista ponovno pročitana memorija.
A evo kako se računica lomi:
- GLM 5.3:80–90% ukupnog broja ide na čitanje predmemorije — 98% unutar dijaloškog okvira srednjeg zadatka. Odgovori i novi unos su ostaci.
- DeepSeek V4 Pro:oko dvije trećine računa (64%) također je cache. Sličan udio u duhu, ali apsolutni iznosi su neusporedivi, jer je DeepSeekova stopa čitanja dvanaest puta manja.
Sada novac, po cijelom zadatku, a ne po pozivu. Srednji dijaloški okvir zadatka košta oko šest centi na GLM 5.3 Flashu i oko dva centa na DeepSeek V4 Flashu. Radi poštene usporedbe, uparili smo zadatke s istom količinom generiranog teksta: na usporedivim radnim opterećenjima DeepSeek je 3,6–5 puta jeftiniji. Puni GLM 5.3 protiv DeepSeek V4 Pro, na klasi zadataka gdje se preklapaju, bio je 6-7 puta skuplji — za istu količinu obavljenog posla.
Metodološka napomena: ove brojke ponovno su izračunate iz javnih stopa u gornjoj tablici, a ne iz nečije stvarne fakture. Kao zdravstvenu provjeru usporedili smo ponovni izračun sa zabilježenim naknadama gdje god je tarifa otvorena — odstupale su za 2-3%, tako da je procjena točna.
Želite li to osjetiti u jednom pozivu? Tipičan poziv agenta u našim mjerenjima je oko 130 tisuća tokena predmemorije, tri tisuće novih ulaznih tokena i nekoliko stotina izlaza. GLM 5.3 takav poziv naplaćuje oko četiri centa. DeepSeek V4 Pro — oko pola centa. Sedam puta, za isti obim posla.
Dakle, vara li GLM?
Formalno, ne: sve tarife su objavljene, a preračun odgovara stvarnim cijenama gdje god je tarifa otvorena. Trik je negdje drugdje. U oči upadaju ulazne i izlazne cijene, dok redak "cache read" izgleda kao tehnička fusnota. U chatu s dvije poruke to je jedna. Ali u agentskom radu, gdje se memorija ponovno čita stotine puta po zadatku, ta linija postaje glavna stavka troškova. GLM ga je cijenio dvanaest puta više nego DeepSeek za vodeće modele — a na dugim sesijama nadmašuje sve ostalo. Čak ni DeepSeekova predmemorija nije besplatna; njegove stope su jednostavno tako male da ponovno čitanje cijele memorije košta peni.
Što učiniti u vezi s tim
Tri stvari koje vrijedi učiniti prije nego što odaberete model za agente:
- Pronađite stopu čitanja predmemorije u cjeniku vašeg pružatelja usluga (čitanje predmemorije / ulaz u predmemoriju). Nema takve linije? Pitajte izravno. Za duge sesije to je važnije od ulazne cijene.
- Pogledajte svoj profil učitavanja: API odgovor pokazuje koliko je tokena došlo iz predmemorije. Iznad 90% pogodaka predmemorije, uglavnom plaćate za ponovno čitanje, a ne za rad.
- Sjeći pamćenje nemilosrdno. Stare poruke, ogromne sistemske upute i datoteke za svaki slučaj ponovno se čitaju o vašem trošku pri svakom pozivu. Ponekad je nova sesija jeftinija od trodnevne povijesti.
Oba modela su dostupna uNeuralSpace chat, uKodiratiodjeljak i krozjavni API— pokrenite vlastiti zadatak na oba i usporedite račune. Samo ne zaboravite otvoriti raščlambu: zanimljiv dio uvijek se nalazi u retku predmemoriranih tokena.