← Svi članci

Kvaka pri čitanju predmemorije: zašto GLM 5.3 košta više u stvarnom radu agenta

Kvaka pri čitanju predmemorije: zašto GLM 5.3 košta više u stvarnom radu agenta

Pregledali smo stvarne račune za agentski rad i vidjeli jednostavnu stvar. Za GLM 5.3, lavovski udio u trošku nisu odgovori i ne svježi unos — to je ponovno čitanje predmemorije: tokeni koje je model već vidio unutar istog posla. U našim mjerenjima to je 80–90% računa, a unutar dugih zadataka približava se 98%. Zbog toga isti posao na DeepSeeku stalno izlazi nekoliko puta jeftinije, iako GLM-ov cjenik na prvi pogled izgleda skromno. Evo kako se to događa.

Odakle dolazi predmemorija na vašem računu

Svaki API poziv odvija se bez memorije: model ponovno prima cijeli razgovor — upute sustava, povijest razgovora, sadržaj datoteke. Pružatelji spremaju ponovljeni dio u predmemoriju: ako početak zahtjeva odgovara nečemu što je već obrađeno, ti se tokeni čitaju iz predmemorije uz popust. API odgovor pokazuje raščlambu: koliko je tokena došlo iz predmemorije, koliko je bilo novih, koliko ih je model generirao.

Zvuči kao čisti profit. Ali popust je cijena, a ne poklon, i svaki model postavlja svoje. Jaz između modela se ne mjeri u postocima, već u višekratnicima. Tu se krije kvaka.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Što kaže cjenik

Javne cijene od kraja kolovoza 2026., dolari za milijun tokena:

ModelUlazniČitanje predmemorijeIzlaz
GLM 5.3$1.40$0.26 (19% unosa)$4.40
GLM 5.3 Flash$0.075$0.015 (20% unosa)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% unosa)$1.98
DeepSeek V4 Flash$0.03$0.007 (23% unosa)$0.10

Pogledajte srednji stupac — onaj koji se obično provlači. Za DeepSeek V4 Pro, čitanje predmemorije košta tri posto ulazne cijene: gotovo trideseterostruki popust za ponovno čitanje. Za GLM 5.3 je devetnaest posto, peterostruki popust. Flash modeli su bliži u relativnom smislu (oko 20% u odnosu na 23%), ali u apsolutnim brojevima čitanja GLM Flash predmemorije još uvijek koštaju otprilike dvostruko više od DeepSeek Flasha.

Mjereno na stvarnom radu

Uzeli smo dva tjedna stvarnog agentskog prometa u kolovozu: 13.279 API poziva preko četiri modela — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro i DeepSeek V4 Flash. Od njih smo sastavili gotovo tri stotine dijaloga s punim zadacima, gdje model dugo radi na jednom poslu: čitanje koda, uređivanje datoteka, čuvanje cijele povijesti u kontekstu. Tipična slika takvog zadatka: 97–98% ulaznih tokena su pogoci predmemorije. Dolazi samo mrvica istinski novog teksta; glavnina je ta ista ponovno pročitana memorija.

A evo kako se računica lomi:

  • GLM 5.3:80–90% ukupnog broja ide na čitanje predmemorije — 98% unutar dijaloškog okvira srednjeg zadatka. Odgovori i novi unos su ostaci.
  • DeepSeek V4 Pro:oko dvije trećine računa (64%) također je cache. Sličan udio u duhu, ali apsolutni iznosi su neusporedivi, jer je DeepSeekova stopa čitanja dvanaest puta manja.

Sada novac, po cijelom zadatku, a ne po pozivu. Srednji dijaloški okvir zadatka košta oko šest centi na GLM 5.3 Flashu i oko dva centa na DeepSeek V4 Flashu. Radi poštene usporedbe, uparili smo zadatke s istom količinom generiranog teksta: na usporedivim radnim opterećenjima DeepSeek je 3,6–5 puta jeftiniji. Puni GLM 5.3 protiv DeepSeek V4 Pro, na klasi zadataka gdje se preklapaju, bio je 6-7 puta skuplji — za istu količinu obavljenog posla.

Metodološka napomena: ove brojke ponovno su izračunate iz javnih stopa u gornjoj tablici, a ne iz nečije stvarne fakture. Kao zdravstvenu provjeru usporedili smo ponovni izračun sa zabilježenim naknadama gdje god je tarifa otvorena — odstupale su za 2-3%, tako da je procjena točna.

Želite li to osjetiti u jednom pozivu? Tipičan poziv agenta u našim mjerenjima je oko 130 tisuća tokena predmemorije, tri tisuće novih ulaznih tokena i nekoliko stotina izlaza. GLM 5.3 takav poziv naplaćuje oko četiri centa. DeepSeek V4 Pro — oko pola centa. Sedam puta, za isti obim posla.

Dakle, vara li GLM?

Formalno, ne: sve tarife su objavljene, a preračun odgovara stvarnim cijenama gdje god je tarifa otvorena. Trik je negdje drugdje. U oči upadaju ulazne i izlazne cijene, dok redak "cache read" izgleda kao tehnička fusnota. U chatu s dvije poruke to je jedna. Ali u agentskom radu, gdje se memorija ponovno čita stotine puta po zadatku, ta linija postaje glavna stavka troškova. GLM ga je cijenio dvanaest puta više nego DeepSeek za vodeće modele — a na dugim sesijama nadmašuje sve ostalo. Čak ni DeepSeekova predmemorija nije besplatna; njegove stope su jednostavno tako male da ponovno čitanje cijele memorije košta peni.

Što učiniti u vezi s tim

Tri stvari koje vrijedi učiniti prije nego što odaberete model za agente:

  • Pronađite stopu čitanja predmemorije u cjeniku vašeg pružatelja usluga (čitanje predmemorije / ulaz u predmemoriju). Nema takve linije? Pitajte izravno. Za duge sesije to je važnije od ulazne cijene.
  • Pogledajte svoj profil učitavanja: API odgovor pokazuje koliko je tokena došlo iz predmemorije. Iznad 90% pogodaka predmemorije, uglavnom plaćate za ponovno čitanje, a ne za rad.
  • Sjeći pamćenje nemilosrdno. Stare poruke, ogromne sistemske upute i datoteke za svaki slučaj ponovno se čitaju o vašem trošku pri svakom pozivu. Ponekad je nova sesija jeftinija od trodnevne povijesti.

Oba modela su dostupna uNeuralSpace chat, uKodiratiodjeljak i krozjavni API— pokrenite vlastiti zadatak na oba i usporedite račune. Samo ne zaboravite otvoriti raščlambu: zanimljiv dio uvijek se nalazi u retku predmemoriranih tokena.