← Alla artiklar

Den cachelästa haken: varför GLM 5.3 kostar mer i verkligt agentarbete

Den cachelästa haken: varför GLM 5.3 kostar mer i verkligt agentarbete

Vi gick igenom riktiga räkningar för agentarbete och såg en enkel sak. För GLM 5.3 är lejonparten av kostnaden inte svaren och inte den färska input - det är att läsa cachen igen: tokens som modellen redan har sett inom samma jobb. I våra mått är det 80–90 % av notan, och inom långa arbetsuppgifter närmar det sig 98 %. Det är därför samma jobb konsekvent kommer ut flera gånger billigare på DeepSeek, även om GLM:s prislista vid första anblicken ser blygsam ut. Så här går det till.

Varifrån cachen i din faktura kommer

Varje API-anrop sker utan minne: modellen tar emot hela konversationen igen - systeminstruktioner, chatthistorik, filinnehåll. Leverantörer cachelagrar den upprepade delen: om början av en begäran matchar något som redan har bearbetats läses dessa tokens från cachen med rabatt. API-svaret visar uppdelningen: hur många tokens som kom från cachen, hur många var nya, hur många modellen genererade.

Låter som ren vinst. Men rabatten är en kurs, inte en gåva, och varje modell sätter sin egen. Gapet mellan modellerna mäts inte i procent utan i multiplar. Det är där fångsten gömmer sig.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Vad står det i prislistan

Offentliga priser i slutet av augusti 2026, dollar per miljon tokens:

ModellInputCache lästProduktion
GLM 5.3$1.40$0.26 (19 % av input)$4.40
GLM 5.3 Flash$0.075$0.015 (20 % av input)$0.25
DeepSeek V4 Pro$0.66$0.022 (3 % av input)$1.98
DeepSeek V4 Flash$0.03$0.007 (23 % av input)$0.10

Titta på mittkolumnen - den som vanligtvis skummade förbi. För DeepSeek V4 Pro kostar cacheläsning tre procent av ingångspriset: en nästan trettiofaldig rabatt för omläsning. För GLM 5,3 är det nitton procent, en femfaldig rabatt. Flash-modellerna ligger närmare i relativa termer (cirka 20 % mot 23 %), men i absoluta tal kostar GLM Flash-cacheläsning fortfarande ungefär dubbelt så mycket som DeepSeek Flashs.

Mätt på verkligt arbete

Vi tog två veckor av verklig agenttrafik i augusti: 13 279 API-anrop över fyra modeller — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro och DeepSeek V4 Flash. Av dem har vi sammanställt nästan trehundra fullständiga uppgiftsdialoger, där en modell fungerar på ett jobb under en lång sträcka: läsa kod, redigera filer, hålla hela historien i sitt sammanhang. Den typiska bilden av en sådan uppgift: 97–98 % av indatatoken är cacheträffar. Bara en rännel av genuint ny text kommer in; huvuddelen är samma omläsningsminne.

Och här är hur räkningen fördelar sig:

  • GLM 5.3:80–90 % av det totala antalet går till cacheläsningar – 98 % i en medianuppgiftsdialogruta. Svar och färsk input är resterna.
  • DeepSeek V4 Pro:cirka två tredjedelar av notan (64 %) är också cache. En liknande andel i andan, men de absoluta beloppen är ojämförliga, eftersom DeepSeeks läshastighet är tolv gånger lägre.

Nu pengarna, per hela uppgiften snarare än per samtal. En medianuppgiftsdialogruta kostade cirka sex cent på GLM 5.3 Flash och cirka två cent på DeepSeek V4 Flash. För att jämföra rättvist matchade vi uppgifter med samma volym genererad text: på jämförbara arbetsbelastningar kommer DeepSeek ut 3,6–5 gånger billigare. Full GLM 5.3 mot DeepSeek V4 Pro, i den klass av uppgifter där de överlappar varandra, var 6–7 gånger dyrare – för samma mängd arbete som utförts.

En metodanmärkning: dessa siffror är omräknade från de offentliga priserna i tabellen ovan, inte någons faktiska faktura. Som en förnuftskontroll jämförde vi omräkningen med registrerade avgifter varhelst tariffen är öppen – de avvek med 2–3 %, så uppskattningen är sund.

Vill du känna det på ett enda samtal? Ett typiskt agentanrop i våra mätningar är cirka 130 tusen cache-tokens, tre tusen nya indata-tokens och ett par hundra utdata. GLM 5.3 tar cirka fyra cent för ett sådant samtal. DeepSeek V4 Pro — ungefär en halv cent. Sju gånger, för samma arbetsvolym.

Så är GLM fusk?

Formellt nej: alla priser publiceras och omräkningen matchar faktiska avgifter varhelst tariffen är öppen. Tricket ligger någon annanstans. Ögat fångar input- och outputpriserna, medan "cache read"-raden ser ut som en teknisk fotnot. I en chatt med två meddelanden är det ett. Men i agentarbete, där minnet läses om hundratals gånger per uppgift, blir den raden den huvudsakliga kostnadsposten. GLM prissatte det tolv gånger högre än DeepSeek gjorde för flaggskeppsmodellerna - och på långa sessioner uppväger det allt annat. Även DeepSeeks cache är inte gratis; dess priser är helt enkelt så låga att omläsning av hela minnet kostar slantar.

Vad ska man göra åt det

Tre saker som är värda att göra innan du väljer en modell för agenter:

  • Hitta cache-läshastigheten i din leverantörs prislista (cache-läs/cache-indata). Ingen sådan rad? Fråga direkt. För långa sessioner är det viktigare än insatspriset.
  • Titta på din egen laddningsprofil: API-svaret visar hur många tokens som kom från cachen. Över 90 % cacheträffar betalar du mest för omläsning, inte för arbete.
  • Klipp minnet hänsynslöst. Gamla meddelanden, gigantiska systeminstruktioner och just-in-case-filer läses om på din bekostnad vid varje samtal. Ibland är en ny session billigare än en tredagars historia.

Båda modellerna finns tillgängliga iNeuralSpace-chatt, iKodaavsnitt och genomoffentligt API— kör din egen uppgift på båda och jämför räkningarna. Kom bara ihåg att öppna uppdelningen: den intressanta delen lever alltid i den cachade token-raden.