← Alle artikler

Den cache-lese fangsten: hvorfor GLM 5.3 koster mer i ekte agentarbeid

Den cache-lese fangsten: hvorfor GLM 5.3 koster mer i ekte agentarbeid

Vi gikk gjennom ekte regninger for agentarbeid og så en enkel ting. For GLM 5.3 er ikke brorparten av kostnadene svarene og ikke de ferske inputene – det er å lese cachen på nytt: tokens modellen allerede har sett i samme jobb. I våre målinger er det 80–90 % av regningen, og innenfor lange oppgaver nærmer det seg 98 %. Derfor kommer den samme jobben konsekvent flere ganger billigere ut på DeepSeek, selv om GLMs prisliste ser beskjeden ut ved første øyekast. Her er hvordan det skjer.

Hvor cachen i regningen din kommer fra

Hvert API-kall skjer uten minne: modellen mottar hele samtalen på nytt - systeminstruksjoner, chattehistorikk, filinnhold. Leverandører cacher den gjentatte delen: Hvis begynnelsen av en forespørsel samsvarer med noe som allerede er behandlet, leses disse tokenene fra hurtigbufferen med rabatt. API-svaret viser sammenbruddet: hvor mange tokens som kom fra cachen, hvor mange var nye, hvor mange modellen genererte.

Høres ut som ren profitt. Men rabatten er en pris, ikke en gave, og hver modell setter sin egen. Gapet mellom modellene måles ikke i prosent, men i multipler. Det er der fangsten skjuler seg.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Hva står det i prislisten

Offentlige priser fra slutten av august 2026, dollar per million tokens:

ModellInndataCache lestProduksjon
GLM 5.3$1.40$0.26 (19 % av input)$4.40
GLM 5.3 Flash$0.075$0.015 (20 % av input)$0.25
DeepSeek V4 Pro$0.66$0.022 (3 % av input)$1.98
DeepSeek V4 Flash$0.03$0.007 (23 % av input)$0.10

Se på den midterste kolonnen - den som vanligvis skummet forbi. For DeepSeek V4 Pro koster cache-lesing tre prosent av inngangsprisen: en nesten tretti ganger rabatt for omlesing. For GLM 5.3 er det nitten prosent, en femdobbel rabatt. Flash-modellene er nærmere i relative termer (omtrent 20 % mot 23 %), men i absolutte tall koster GLM Flash-cache-lesninger fortsatt omtrent dobbelt så mye som DeepSeek Flashs.

Målt på reelt arbeid

Vi tok to uker med ekte agenttrafikk i august: 13 279 API-anrop på fire modeller – GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro og DeepSeek V4 Flash. Fra disse samlet vi nesten tre hundre fulle oppgavedialoger, der en modell jobber på én jobb i lang tid: lese kode, redigere filer, holde hele historien i sammenheng. Det typiske bildet av en slik oppgave: 97–98 % av input-tokens er cache-treff. Bare en drypp av genuint ny tekst kommer inn; hoveddelen er det samme gjenleseminnet.

Og her er hvordan regningen brytes ned:

  • GLM 5.3:80–90 % av totalen går til cache-lesninger – 98 % i en medianoppgavedialog. Svar og ferske innspill er restene.
  • DeepSeek V4 Pro:omtrent to tredjedeler av regningen (64 %) er også cache. En tilsvarende andel i ånden, men de absolutte beløpene er uforlignelige, fordi DeepSeeks lesehastighet er tolv ganger lavere.

Nå pengene, per hele oppgaven i stedet for per samtale. En median oppgavedialog kostet omtrent seks cent på GLM 5.3 Flash og omtrent to cent på DeepSeek V4 Flash. For å sammenligne rettferdig, matchet vi oppgaver med samme volum generert tekst: på sammenlignbare arbeidsbelastninger kommer DeepSeek ut 3,6–5 ganger billigere. Full GLM 5.3 mot DeepSeek V4 Pro, i klassen med oppgaver der de overlapper hverandre, var 6–7 ganger dyrere – for samme mengde arbeid som ble utført.

Et metodologisk notat: disse tallene er beregnet på nytt fra de offentlige prisene i tabellen ovenfor, ikke noens faktiske faktura. Som en fornuftssjekk sammenlignet vi omberegningen med registrerte gebyrer uansett hvor tariffen er åpen – de avviker med 2–3 %, så estimatet er forsvarlig.

Vil du føle det på en enkelt samtale? Et typisk agentanrop i målingene våre er rundt 130 tusen cache-tokens, tre tusen nye input-tokens og et par hundre utdata. GLM 5.3 tar omtrent fire øre for en slik samtale. DeepSeek V4 Pro — omtrent et halvt øre. Syv ganger, for samme arbeidsmengde.

Så er GLM juks?

Formelt sett nei: alle priser er publisert, og omberegningen samsvarer med faktiske kostnader uansett hvor tariffen er åpen. Trikset ligger et annet sted. Blikket fanger input- og output-prisene, mens "cache read"-linjen ser ut som en teknisk fotnote. I en chat med to meldinger er det én. Men i agentarbeid, hvor minnet leses på nytt hundrevis av ganger per oppgave, blir den linjen hovedkostnadsposten. GLM priset det tolv ganger høyere enn DeepSeek gjorde for flaggskipsmodellene - og på lange økter oppveier det alt annet. Selv DeepSeeks cache er ikke gratis; prisene er rett og slett så små at det koster øre å lese hele minnet på nytt.

Hva skal man gjøre med det

Tre ting som er verdt å gjøre før du velger en modell for agenter:

  • Finn cache-lesehastigheten i leverandørens prisliste (cache read / cached input). Ingen slik linje? Spør direkte. For lange økter betyr det mer enn inngangsprisen.
  • Se på din egen lasteprofil: API-svaret viser hvor mange tokens som kom fra cachen. Over 90 % cache-treff betaler du stort sett for omlesing, ikke for arbeid.
  • Kutt hukommelsen hensynsløst. Gamle meldinger, gigantiske systeminstruksjoner og just-in-case-filer leses på nytt på din bekostning ved hver samtale. Noen ganger er en fersk økt billigere enn en tre-dagers historie.

Begge modellene er tilgjengelige iNeuralSpace chat, iKodeseksjon og gjennomoffentlig API— kjør din egen oppgave på begge og sammenlign regningene. Bare husk å åpne sammenbruddet: den interessante delen lever alltid i bufret-tokens-linjen.