← Все статьи

Cache-læse-fangsten: hvorfor GLM 5.3 koster mere i ægte agentarbejde

Cache-læse-fangsten: hvorfor GLM 5.3 koster mere i ægte agentarbejde

Vi gennemgik rigtige regninger for agentarbejde og så en simpel ting. For GLM 5.3 er broderparten af ​​omkostningerne ikke svarene og ikke det friske input - det er at genlæse cachen: tokens, som modellen allerede har set i det samme job. I vores mål er det 80-90 % af regningen, og inden for lange opgaver nærmer det sig 98 %. Derfor kommer det samme job konsekvent flere gange billigere ud på DeepSeek, selvom GLMs prisliste ved første øjekast ser beskeden ud. Her er hvordan det sker.

Hvor cachen i din regning kommer fra

Hvert API-kald sker uden hukommelse: Modellen modtager hele samtalen igen - systeminstruktioner, chathistorik, filindhold. Udbydere cacherer den gentagne del: Hvis begyndelsen af ​​en anmodning matcher noget, der allerede er behandlet, læses disse tokens fra cachen med rabat. API-svaret viser opdelingen: hvor mange tokens kom fra cachen, hvor mange var nye, hvor mange genererede modellen.

Det lyder som ren profit. Men rabatten er en sats, ikke en gave, og hver model sætter sin egen. Afstanden mellem modellerne måles ikke i procent, men i multipla. Det er der, fangsten gemmer sig.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Hvad står der i prislisten

Offentlige priser i slutningen af ​​august 2026, dollars pr. million tokens:

ModelInputCache læstProduktion
GLM 5.3$1.40$0.26 (19 % af input)$4.40
GLM 5.3 Flash$0.075$0.015 (20 % af input)$0.25
DeepSeek V4 Pro$0.66$0.022 (3 % af input)$1.98
DeepSeek V4 Flash$0.03$0.007 (23 % af input)$0.10

Se på den midterste kolonne - den, der normalt skummede forbi. For DeepSeek V4 Pro koster cachelæsning tre procent af inputprisen: en næsten tredivedobbelt rabat ved genlæsning. For GLM 5.3 er det nitten procent, en femdobbelt rabat. Flash-modellerne er tættere på i relative termer (ca. 20 % mod 23 %), men i absolutte tal koster GLM Flash-cache-læsninger stadig omtrent dobbelt så meget som DeepSeek Flashs.

Målt på reelt arbejde

Vi tog to ugers reel agenttrafik i august: 13.279 API-kald på tværs af fire modeller - GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro og DeepSeek V4 Flash. Fra dem samlede vi næsten tre hundrede fulde opgavedialoger, hvor en model arbejder på ét job i lang tid: læse kode, redigere filer, holde hele historien i sammenhæng. Det typiske billede af en sådan opgave: 97–98 % af inputtokens er cache-hits. Kun et dryp af ægte ny tekst kommer ind; hovedparten er den samme genlæste hukommelse.

Og her er, hvordan regningen fordeler sig:

  • GLM 5.3:80-90 % af det samlede antal går til cache-læsninger - 98 % i en medianopgavedialog. Svar og friske input er resterne.
  • DeepSeek V4 Pro:omkring to tredjedele af regningen (64%) er også cache. En tilsvarende andel i ånden, men de absolutte beløb er uforlignelige, fordi DeepSeeks læsehastighed er tolv gange lavere.

Nu pengene, pr hele opgave i stedet for pr opkald. En medianopgavedialog kostede omkring seks cent på GLM 5.3 Flash og omkring to cent på DeepSeek V4 Flash. For at sammenligne retfærdigt matchede vi opgaver med den samme mængde genereret tekst: på sammenlignelige arbejdsbelastninger kommer DeepSeek 3,6-5 gange billigere. Fuld GLM 5.3 mod DeepSeek V4 Pro, på den klasse af opgaver, hvor de overlapper, var 6-7 gange dyrere - for den samme mængde udført arbejde.

En metodenote: Disse tal er genberegnet ud fra de offentlige takster i tabellen ovenfor, ikke en persons faktiske faktura. Som en fornuftskontrol sammenlignede vi genberegningen med registrerede gebyrer, uanset hvor taksten er åben - de afveg med 2-3 %, så estimatet er fornuftigt.

Vil du mærke det på et enkelt opkald? Et typisk agentkald i vores målinger er omkring 130 tusind cache-tokens, tre tusinde nye input-tokens og et par hundrede output. GLM 5.3 koster omkring fire øre for et sådant opkald. DeepSeek V4 Pro - omkring en halv cent. Syv gange for samme mængde arbejde.

Så snyder GLM?

Formelt nej: alle takster offentliggøres, og genberegningen matcher faktiske gebyrer, uanset hvor taksten er åben. Tricket ligger et andet sted. Øjet fanger input- og outputpriserne, mens "cache read"-linjen ligner en teknisk fodnote. I en chat med to beskeder er det én. Men i agentarbejde, hvor hukommelsen genlæses hundredvis af gange pr. opgave, bliver den linje den vigtigste omkostningspost. GLM prissatte det tolv gange højere end DeepSeek gjorde for flagskibsmodellerne - og på lange sessioner opvejer det alt andet. Selv DeepSeeks cache er ikke gratis; dens priser er simpelthen så små, at genlæsning af hele hukommelsen koster øre.

Hvad skal man gøre ved det

Tre ting, der er værd at gøre, før du vælger en model for agenter:

  • Find cache-læsehastigheden i din udbyders prisliste (cache-læsning / cache-input). Ingen sådan linje? Spørg direkte. For lange sessioner betyder det mere end inputprisen.
  • Se på din egen indlæsningsprofil: API-svaret viser, hvor mange tokens der kom fra cachen. Over 90 % cache-hits betaler du for det meste for genlæsning, ikke for arbejde.
  • Klip hukommelsen hensynsløst. Gamle beskeder, gigantiske systeminstruktioner og just-in-case filer genlæses på din regning ved hvert opkald. Nogle gange er en frisk session billigere end en tre-dages historie.

Begge modeller fås iNeuralSpace chat, iKodeafsnit og gennemoffentlig API— kør din egen opgave på begge og sammenlign regningerne. Bare husk at åbne opdelingen: den interessante del lever altid i cache-tokens-linjen.