Úlovek čtení z mezipaměti: proč GLM 5.3 stojí více při práci skutečných agentů
Prošli jsme skutečné účty za práci agenta a viděli jednoduchou věc. U GLM 5.3 lví podíl na nákladech nepředstavují odpovědi a ne nový vstup – jde o opětovné načtení mezipaměti: tokeny, které model již viděl v rámci stejné zakázky. V našich měřeních je to 80–90 % účtu a v rámci dlouhých úloh se blíží 98 %. To je důvod, proč stejná zakázka vychází na DeepSeek několikrát levněji, i když ceník GLM vypadá na první pohled skromně. Zde je návod, jak se to stane.
Odkud pochází mezipaměť ve vašem účtu
Každé volání API probíhá bez paměti: model znovu obdrží celou konverzaci – systémové instrukce, historii chatu, obsah souboru. Poskytovatelé ukládají opakovanou část do mezipaměti: pokud začátek požadavku odpovídá něčemu již zpracovanému, jsou tyto tokeny načteny z mezipaměti se slevou. Odpověď API ukazuje rozdělení: kolik tokenů přišlo z mezipaměti, kolik bylo nových, kolik model vygeneroval.
Zní to jako čistý zisk. Sleva je ale sazba, ne dárek, a každý model si stanoví své. Mezera mezi modely se neměří v procentech, ale v násobcích. V tom se skrývá úlovek.

Co říká ceník
Veřejné ceny ke konci srpna 2026, dolary za milion tokenů:
| Model | Vstup | Čtení mezipaměti | Výstup |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19 % vstupu) | $4.40 |
| Flash GLM 5.3 | $0.075 | $0.015 (20 % vstupu) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3 % vstupu) | $1.98 |
| Flash DeepSeek V4 | $0.03 | $0.007 (23 % vstupu) | $0.10 |
Podívejte se na prostřední sloupec – ten, který se obvykle míjí kolem. U DeepSeek V4 Pro stojí čtení mezipaměti tři procenta vstupní ceny: téměř třicetinásobná sleva za opětovné čtení. U GLM 5.3 je to devatenáct procent, pětinásobná sleva. Flash modely jsou v relativním vyjádření blíže (asi 20 % oproti 23 %), přesto v absolutních číslech stojí čtení GLM Flash cache stále zhruba dvakrát tolik než DeepSeek Flash.
Měřeno na skutečné práci
V srpnu jsme strávili dva týdny provozu skutečných agentů: 13 279 volání API napříč čtyřmi modely – GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro a DeepSeek V4 Flash. Z těch jsme sestavili téměř tři sta dialogů plných úloh, kde model pracuje na jedné zakázce po dlouhou dobu: čtení kódu, úprava souborů, udržování celé historie v kontextu. Typický obrázek takové úlohy: 97–98 % vstupních tokenů tvoří přístupy do mezipaměti. Přichází jen pramínek skutečně nového textu; hlavní část je stejná paměť pro opětovné čtení.
A takto se účet rozpadá:
- GLM 5.3:80–90 % z celkového počtu jde do mezipaměti čtení – 98 % v dialogovém okně střední úlohy. Odpovědi a nové příspěvky jsou zbytky.
- DeepSeek V4 Pro:asi dvě třetiny účtu (64 %) tvoří také cache. Duchem podobný podíl, ale absolutní částky jsou nesrovnatelné, protože čtenost DeepSeek je dvanáctkrát nižší.
Teď peníze, za celý úkol, spíše než za hovor. Průměrný dialog úlohy stál asi šest centů na GLM 5.3 Flash a asi dva centy na DeepSeek V4 Flash. Abychom to spravedlivě porovnali, porovnali jsme úkoly se stejným objemem generovaného textu: při srovnatelném pracovním zatížení DeepSeek vyjde 3,6–5krát levněji. Plná verze GLM 5.3 proti DeepSeek V4 Pro ve třídě úloh, kde se překrývají, byla 6–7krát dražší — za stejné množství vykonané práce.
Metodická poznámka: tato čísla jsou přepočítána z veřejných sazeb v tabulce výše, nikoli z něčí skutečné faktury. Pro kontrolu zdravého rozumu jsme porovnali přepočet se zaznamenanými poplatky všude tam, kde je tarif otevřený — lišily se o 2–3 %, takže odhad je správný.
Chcete to cítit při jediném hovoru? Typické volání agenta v našich měřeních je kolem 130 tisíc tokenů mezipaměti, tři tisíce nových vstupních tokenů a několik set výstupů. GLM 5.3 si za takový hovor účtuje zhruba čtyři centy. DeepSeek V4 Pro – asi půl centu. Sedmkrát za stejný objem práce.
Je tedy GLM podvádění?
Formálně ne: všechny sazby jsou zveřejněny a přepočet odpovídá skutečným poplatkům, kdekoli je tarif otevřený. Trik je jinde. Oko upoutá vstupní a výstupní ceny, zatímco řádek „čtení z mezipaměti“ vypadá jako technická poznámka pod čarou. V chatu se dvěma zprávami je to jedna. Ale v práci agenta, kde je paměť znovu načtena stokrát za úkol, se tento řádek stává hlavní nákladovou položkou. GLM to stanovilo dvanáctkrát vyšší než DeepSeek u vlajkových modelů – a na dlouhých sezeních převáží všechno ostatní. Ani mezipaměť DeepSeek není zdarma; jeho sazby jsou prostě tak malé, že opětovné načtení celé paměti stojí haléře.
co s tím dělat
Než si vyberete model pro agenty, stojí za to udělat tři věci:
- Najděte rychlost čtení z mezipaměti v ceníku vašeho poskytovatele (čtení z mezipaměti / vstup z mezipaměti). Žádná taková linka? Zeptejte se přímo. U dlouhých sezení záleží více než na vstupní ceně.
- Podívejte se na svůj vlastní profil zatížení: odpověď API ukazuje, kolik tokenů přišlo z mezipaměti. Nad 90 % přístupů do mezipaměti většinou platíte za opětovné čtení, nikoli za práci.
- Nemilosrdně ořízněte paměť. Při každém hovoru jsou na vaše náklady znovu čteny staré zprávy, obří systémové pokyny a soubory pro každý případ. Někdy je nové sezení levnější než třídenní historie.
Oba modely jsou dostupné vNeuralSpace chat, vKódsekce a přesveřejné API— spusťte svůj vlastní úkol na obou a porovnejte účty. Jen nezapomeňte otevřít rozpis: zajímavá část se vždy nachází v řádku tokenů uložených v mezipaměti.