← Все статьи

Úlovok čítania z vyrovnávacej pamäte: prečo GLM 5.3 stojí viac pri práci skutočného agenta

Úlovok čítania z vyrovnávacej pamäte: prečo GLM 5.3 stojí viac pri práci skutočného agenta

Prešli sme skutočné účty za prácu agentov a videli sme jednoduchú vec. Pre GLM 5.3 leví podiel nákladov nie sú odpovede a nie nový vstup – ide o opätovné načítanie vyrovnávacej pamäte: tokeny, ktoré model už videl v rámci rovnakej úlohy. V našich meraniach je to 80 – 90 % účtu av rámci dlhých úloh sa blíži 98 %. To je dôvod, prečo rovnaká práca konzistentne vychádza niekoľkonásobne lacnejšie na DeepSeek, aj keď cenník GLM vyzerá na prvý pohľad skromne. Tu je návod, ako sa to stane.

Odkiaľ pochádza vyrovnávacia pamäť vo vašom účte

Každé volanie API prebieha bez pamäte: model znova dostane celú konverzáciu – systémové pokyny, históriu chatu, obsah súboru. Poskytovatelia ukladajú opakovanú časť do vyrovnávacej pamäte: ak sa začiatok požiadavky zhoduje s niečím už spracovaným, tieto tokeny sa načítajú z vyrovnávacej pamäte so zľavou. Odpoveď API zobrazuje rozpis: koľko tokenov prišlo z vyrovnávacej pamäte, koľko bolo nových, koľko vygeneroval model.

Znie to ako čistý zisk. Ale zľava je sadzba, nie darček a každý model si stanoví svoje. Medzera medzi modelmi sa nemeria v percentách, ale v násobkoch. V tom sa skrýva úlovok.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Čo hovorí cenník

Verejné ceny ku koncu augusta 2026, doláre za milión tokenov:

ModelVstupČítanie z vyrovnávacej pamäteVýstup
GLM 5.3$1.40$0.26 (19 % vstupu)$4.40
Flash GLM 5.3$0.075$0.015 (20 % vstupu)$0.25
DeepSeek V4 Pro$0.66$0.022 (3 % zo vstupu)$1.98
Flash DeepSeek V4$0.03$0.007 (23 % vstupu)$0.10

Pozrite sa na stredný stĺpec – ten, ktorý sa zvyčajne prehliada. V prípade DeepSeek V4 Pro stojí čítanie vyrovnávacej pamäte tri percentá vstupnej ceny: takmer tridsaťnásobná zľava za opätovné čítanie. Pre GLM 5,3 je to devätnásť percent, päťnásobná zľava. Flash modely sú v relatívnom vyjadrení bližšie (asi 20 % oproti 23 %), no v absolútnych číslach stojí čítanie GLM Flash cache stále zhruba dvakrát toľko ako DeepSeek Flash.

Merané na skutočnej práci

V auguste sme absolvovali dva týždne skutočnej návštevnosti agentov: 13 279 volaní API v štyroch modeloch – GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro a DeepSeek V4 Flash. Z nich sme zostavili takmer tristo úplných dialógových okien, kde model pracuje na jednej úlohe dlhú dobu: čítanie kódu, úprava súborov, udržiavanie celej histórie v kontexte. Typický obraz takejto úlohy: 97–98 % vstupných tokenov tvoria prístupy do vyrovnávacej pamäte. Prichádza len pramienok skutočne nového textu; väčšina je tá istá pamäť na opätovné čítanie.

A takto sa účet rozpadá:

  • GLM 5.3:80 – 90 % z celkového počtu ide do vyrovnávacej pamäte – 98 % v dialógovom okne strednej úlohy. Odpovede a čerstvé vstupy sú zvyšky.
  • DeepSeek V4 Pro:asi dve tretiny účtu (64%) je tiež cache. V duchu podobný podiel, ale absolútne sumy sú neporovnateľné, pretože čítanosť DeepSeek je dvanásťkrát nižšia.

Teraz peniaze za celú úlohu, nie za hovor. Stredné dialógové okno úlohy stálo asi šesť centov na GLM 5.3 Flash a asi dva centy na DeepSeek V4 Flash. Aby sme to mohli spravodlivo porovnať, priradili sme úlohy s rovnakým objemom generovaného textu: pri porovnateľných pracovných zaťaženiach DeepSeek vychádza 3,6 až 5-krát lacnejšie. Plná verzia GLM 5.3 oproti DeepSeek V4 Pro v triede úloh, kde sa prekrývajú, bola 6 až 7-krát drahšia – za rovnaký objem vykonanej práce.

Poznámka k metodológii: tieto čísla sú prepočítané z verejných sadzieb v tabuľke vyššie, nie zo skutočnej faktúry niekoho iného. Na kontrolu zdravého rozumu sme porovnali prepočet so zaznamenanými poplatkami všade tam, kde je tarifa otvorená – líšili sa o 2–3 %, takže odhad je správny.

Chcete to cítiť pri jedinom hovore? Typický hovor agenta v našich meraniach je okolo 130 000 tokenov vyrovnávacej pamäte, 3 000 nových vstupných tokenov a niekoľko stoviek výstupov. GLM 5.3 si za takýto hovor účtuje približne štyri centy. DeepSeek V4 Pro – asi pol centa. Sedemkrát za rovnaký objem práce.

Je teda GLM podvádzanie?

Formálne nie: všetky sadzby sú zverejnené a prepočet zodpovedá skutočným poplatkom bez ohľadu na to, kde je tarifa otvorená. Trik je inde. Oči upútajú vstupné a výstupné ceny, zatiaľ čo riadok „čítanie z vyrovnávacej pamäte“ vyzerá ako technická poznámka pod čiarou. V chate s dvomi správami je to jedna. Ale v práci agenta, kde sa pamäť opakovane číta stokrát za úlohu, sa tento riadok stáva hlavnou nákladovou položkou. GLM to stanovilo dvanásťkrát vyššie ako DeepSeek pre vlajkové modely – a pri dlhých reláciách preváži všetko ostatné. Dokonca ani vyrovnávacia pamäť DeepSeek nie je zadarmo; jeho sadzby sú jednoducho také malé, že opätovné načítanie celej pamäte stojí centy.

Čo s tým robiť

Pred výberom modelu pre agentov sa oplatí urobiť tri veci:

  • Nájdite rýchlosť čítania z vyrovnávacej pamäte v cenníku vášho poskytovateľa (čítanie z vyrovnávacej pamäte / vstup z vyrovnávacej pamäte). Žiadna taká čiara? Opýtajte sa priamo. Pri dlhých sedeniach záleží viac ako na vstupnej cene.
  • Pozrite sa na svoj vlastný profil zaťaženia: odpoveď API ukazuje, koľko tokenov prišlo z vyrovnávacej pamäte. Nad 90 % prístupov do vyrovnávacej pamäte väčšinou platíte za opätovné čítanie, nie za prácu.
  • Nemilosrdne odrežte pamäť. Pri každom hovore sa na vaše náklady prečítajú staré správy, obrovské systémové pokyny a súbory len pre prípad. Niekedy je nová relácia lacnejšia ako trojdňová história.

Oba modely sú dostupné vNeuralSpace chat, vkódsekcii a cezverejné API— spustite svoju vlastnú úlohu na oboch a porovnajte účty. Len nezabudnite otvoriť rozpis: zaujímavá časť sa vždy nachádza v rade tokenov uložených vo vyrovnávacej pamäti.