A gyorsítótár-olvasási fogás: miért kerül többe a GLM 5.3 valódi ügynöki munkában
Valódi számlákon mentünk keresztül az ügynöki munkáért, és egy egyszerű dolgot láttunk. A GLM 5.3 esetében a költségek oroszlánrészét nem a válaszok és nem a friss input jelenti – ez a gyorsítótár újraolvasása: olyan tokenek, amelyeket a modell már látott ugyanazon a munkán belül. Méréseink szerint ez a számla 80-90%-a, a hosszú feladatokon belül pedig megközelíti a 98%-ot. Éppen ezért ugyanaz a munka folyamatosan többszöröse olcsóbban jön ki a DeepSeeken, pedig a GLM árlistája első ránézésre szerénynek tűnik. Íme, hogyan történik ez.
Honnan származik a számlájában szereplő gyorsítótár
Minden API-hívás memória nélkül történik: a modell újra megkapja a teljes beszélgetést – rendszerutasításokat, csevegési előzményeket, fájltartalmat. A szolgáltatók gyorsítótárazzák az ismétlődő részt: ha egy kérés eleje megegyezik valamivel, ami már feldolgozott, akkor ezek a tokenek kedvezményesen kerülnek kiolvasásra a gyorsítótárból. Az API-válasz a bontást mutatja: hány token érkezett a gyorsítótárból, hány volt új, mennyit generált a modell.
Tiszta haszonnak tűnik. De a kedvezmény mérték, nem ajándék, és minden modell meghatározza a magáét. A modellek közötti különbséget nem százalékban, hanem többszörösben mérik. Ott rejtőzik a fogás.

Amit az árlista ír
Nyilvános árak 2026. augusztus végén, dollár per millió token:
| Modell | Bemenet | Gyorsítótár beolvasása | Kimenet |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (a bemenet 19%-a) | $4.40 |
| GLM 5.3 Flash | $0.075 | $0.015 (a bemenet 20%-a) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (a bemenet 3%-a) | $1.98 |
| DeepSeek V4 Flash | $0.03 | $0.007 (a bemenet 23%-a) | $0.10 |
Nézze meg a középső oszlopot – azt, amelyik általában elhaladt. A DeepSeek V4 Pro esetében a gyorsítótár olvasása a beviteli ár három százalékába kerül: csaknem harmincszoros kedvezmény az újraolvasásért. A GLM 5.3 esetében tizenkilenc százalék, ötszörös kedvezmény. A Flash modellek relatív értelemben közelebb állnak egymáshoz (kb. 20% versus 23%), de abszolút számokban a GLM Flash gyorsítótár olvasása még mindig nagyjából kétszer annyiba kerül, mint a DeepSeek Flashé.
Valós munkához mérve
Augusztusban két hét valódi ügynökforgalmat vettünk igénybe: 13 279 API-hívás négy modellben – GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro és DeepSeek V4 Flash. Ezekből csaknem háromszáz teljes feladat párbeszédablakot állítottunk össze, ahol egy modell hosszú ideig egy munkán dolgozik: kódot olvas, fájlokat szerkeszt, kontextusban tartja a teljes előzményeket. Egy ilyen feladat tipikus képe: a bemeneti tokenek 97–98%-a gyorsítótár találat. Csak egy cseppnyi valóban új szöveg jön be; a nagyrészt ugyanaz az újraolvasási memória.
És a számla így bomlik le:
- GLM 5.3:A teljes mennyiség 80–90%-a a gyorsítótár-olvasásra megy – 98%-a egy átlagos feladat párbeszédpanelen belül. A válaszok és a friss input a maradék.
- DeepSeek V4 Pro:a számla körülbelül kétharmada (64%) szintén gyorsítótár. Lélekben hasonló arány, de az abszolút mennyiségek összehasonlíthatatlanok, mert a DeepSeek olvasási sebessége tizenkétszer alacsonyabb.
Most a pénz az egész feladatonként, nem pedig hívásonként. Egy átlagos feladatpárbeszéd körülbelül hat centbe került GLM 5.3 Flash esetén és körülbelül két cent a DeepSeek V4 Flash esetén. A tisztességes összehasonlítás érdekében a feladatokat azonos mennyiségű generált szöveggel párosítottuk: összehasonlítható terheléseknél a DeepSeek 3,6-5-ször olcsóbb. A Full GLM 5.3 a DeepSeek V4 Pro ellen, azon feladatok osztályában, ahol átfedésben vannak, 6-7-szer drágább volt – ugyanannyi elvégzett munka mellett.
Módszertani megjegyzés: ezeket a számokat a fenti táblázatban szereplő nyilvános díjakból számítjuk át, nem pedig valakinek a tényleges számláját. A józanság ellenőrzése érdekében az újrakalkulációt összehasonlítottuk a rögzített díjakkal, ahol a tarifa nyitva van – ezek 2-3%-kal tértek el, így a becslés megalapozott.
Érezni szeretnéd egyetlen hívásnál? Egy tipikus ügynökhívás méréseink során körülbelül 130 ezer cache token, háromezer új bemeneti token és néhány száz kimenet. A GLM 5.3 körülbelül négy centet kér egy ilyen hívásért. DeepSeek V4 Pro – körülbelül fél cent. Hétszer, ugyanannyi munkáért.
Tehát a GLM csal?
Formálisan nem: minden tarifát közzétesznek, és az újraszámítás megegyezik a tényleges díjakkal, ahol a tarifa nyitva van. A trükk máshol van. A szem megakad az input és output árakon, míg a "cache read" sor úgy néz ki, mint egy technikai lábjegyzet. Egy kétüzenetes chatben ez egy. De az ügynöki munkában, ahol a memóriát feladatonként több százszor újraolvassák, ez a sor lesz a fő költségtétel. A GLM tizenkétszer magasabb árat szabott ki, mint a DeepSeek a zászlóshajó modellek esetében – és hosszú munkamenetek esetén minden mást felülmúl. Még a DeepSeek gyorsítótára sem ingyenes; az arányok egyszerűen olyan kicsik, hogy a teljes memória újraolvasása fillérekbe kerül.
Mit kell tenni ellene
Három dolgot érdemes megtenni, mielőtt modellt választana az ügynökök számára:
- Keresse meg a gyorsítótár olvasási arányát a szolgáltató árlistájában (gyorsítótár olvasása / gyorsítótárazott bemenet). Nincs ilyen vonal? Kérdezzen közvetlenül. Hosszú ülések esetén ez többet számít, mint a bemeneti ár.
- Nézze meg a saját betöltési profilját: az API-válasz megmutatja, hogy hány token érkezett a gyorsítótárból. 90% feletti gyorsítótár találatok esetén többnyire az újraolvasásért kell fizetni, nem a munkáért.
- Kíméletlenül vágja le a memóriát. A régi üzeneteket, az óriási rendszerutasításokat és az esetleges fájlok újraolvasását az Ön költségén minden híváskor. Néha egy friss munkamenet olcsóbb, mint egy háromnapos előzmény.
Mindkét modell elérhető aNeuralSpace chat, aKódszakaszon és anyilvános API— végezze el a saját feladatát mindkettőn, és hasonlítsa össze a számlákat. Ne felejtse el megnyitni a bontást: az érdekes rész mindig a gyorsítótárazott-token sorban található.