← Alle artikelen

Het addertje onder het gras bij het lezen: waarom GLM 5.3 meer kost bij echt agentwerk

Het addertje onder het gras bij het lezen: waarom GLM 5.3 meer kost bij echt agentwerk

We hebben echte rekeningen doorgenomen voor het werk van agenten en zagen iets eenvoudigs. Voor GLM 5.3 bestaat het leeuwendeel van de kosten niet uit de antwoorden en niet uit de nieuwe input; het gaat om het herlezen van de cache: tokens die het model al binnen dezelfde taak heeft gezien. In onze metingen is dat 80-90% van de rekening, en bij lange taken benadert dit de 98%. Daarom komt dezelfde klus op DeepSeek consequent meerdere keren goedkoper uit, ook al lijkt de prijslijst van GLM op het eerste gezicht bescheiden. Hier ziet u hoe dat gebeurt.

Waar de cache op uw factuur vandaan komt

Elke API-aanroep gebeurt zonder geheugen: het model ontvangt het hele gesprek opnieuw: systeeminstructies, chatgeschiedenis, bestandsinhoud. Providers cachen het herhaalde deel: als het begin van een verzoek overeenkomt met iets dat al is verwerkt, worden die tokens met korting uit de cache gelezen. Het API-antwoord toont de uitsplitsing: hoeveel tokens kwamen uit de cache, hoeveel waren er nieuw, hoeveel het model er genereerde.

Klinkt als pure winst. Maar de korting is een tarief, geen geschenk, en elk model bepaalt zijn eigen tarief. De kloof tussen modellen wordt niet in procenten gemeten, maar in veelvouden. Dat is waar de vangst zich verbergt.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Wat de prijslijst zegt

Publieke prijzen vanaf eind augustus 2026, dollars per miljoen tokens:

ModelInvoerCache lezenUitvoer
GLM 5.3$1.40$0.26 (19% van de input)$4.40
GLM 5.3 Flitser$0.075$0.015 (20% van de input)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% van de input)$1.98
DeepSeek V4-flitser$0.03$0.007 (23% van de input)$0.10

Kijk naar de middelste kolom – degene die gewoonlijk voorbij scheerde. Voor DeepSeek V4 Pro kost het lezen in de cache drie procent van de invoerprijs: een bijna dertigvoudige korting voor het opnieuw lezen. Voor GLM 5.3 is het negentien procent, een vervijfvoudiging. De Flash-modellen liggen in relatieve termen dichter bij elkaar (ongeveer 20% versus 23%), maar in absolute cijfers kost het lezen van GLM Flash-cache nog steeds ongeveer twee keer zoveel als die van DeepSeek Flash.

Gemeten op echt werk

We hebben in augustus twee weken echt agentverkeer verwerkt: 13.279 API-aanroepen voor vier modellen: GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro en DeepSeek V4 Flash. Daaruit hebben we bijna driehonderd volledige taakdialogen samengesteld, waarin een model langdurig aan één taak werkt: code lezen, bestanden bewerken, de hele geschiedenis in context houden. Het typische beeld van een dergelijke taak: 97-98% van de invoertokens zijn cachehits. Er komt slechts een straaltje echt nieuwe tekst binnen; het grootste deel is datzelfde herleesgeheugen.

En hier is hoe het wetsvoorstel uiteenvalt:

  • GLM 5.3:80-90% van het totaal gaat naar cache-lezingen – 98% binnen een mediaan taakdialoogvenster. Antwoorden en nieuwe input zijn de restjes.
  • DeepSeek V4 Pro:ongeveer tweederde van de rekening (64%) is ook cache. Een vergelijkbaar aandeel in de geest, maar de absolute bedragen zijn onvergelijkbaar, omdat de leessnelheid van DeepSeek twaalf keer lager is.

Nu het geld, per hele taak in plaats van per oproep. Een gemiddelde taakdialoog kost ongeveer zes cent op GLM 5.3 Flash en ongeveer twee cent op DeepSeek V4 Flash. Om eerlijk te kunnen vergelijken, hebben we taken gematcht met hetzelfde volume aan gegenereerde tekst: bij vergelijkbare werklasten komt DeepSeek 3,6 tot 5 keer goedkoper uit. Volledige GLM 5.3 vergeleken met DeepSeek V4 Pro, voor de klasse van taken waar ze elkaar overlappen, was 6 tot 7 keer duurder – voor dezelfde hoeveelheid werk.

Een opmerking over de methodologie: deze cijfers zijn herberekend op basis van de openbare tarieven in de bovenstaande tabel, en niet op basis van iemands daadwerkelijke factuur. Bij wijze van controle hebben we de herberekening vergeleken met de geregistreerde kosten waar het tarief ook geldt: deze liepen 2 à 3% uiteen, dus de schatting klopt.

Wilt u het tijdens één gesprek voelen? Een typische agentoproep in onze metingen bestaat uit ongeveer 130.000 cachetokens, drieduizend nieuwe invoertokens en een paar honderd uitvoer. GLM 5.3 rekent voor zo'n gesprek zo'n vier cent aan. DeepSeek V4 Pro — ongeveer een halve cent. Zeven keer, voor hetzelfde werkvolume.

Is GLM dus valsspelen?

Formeel niet: alle tarieven worden gepubliceerd en de herberekening komt overeen met de werkelijke kosten, waar het tarief ook geldt. De truc ligt ergens anders. Het oog valt op de input- en outputprijzen, terwijl de 'cache read'-regel eruitziet als een technische voetnoot. In een chat met twee berichten is het één. Maar bij agentwerk, waarbij het geheugen honderden keren per taak opnieuw wordt uitgelezen, wordt die regel de belangrijkste kostenpost. GLM heeft hem twaalf keer hoger geprijsd dan DeepSeek deed voor de vlaggenschipmodellen – en bij lange sessies weegt hij zwaarder dan al het andere. Zelfs de cache van DeepSeek is niet gratis; de tarieven zijn simpelweg zo klein dat het opnieuw lezen van het hele geheugen centen kost.

Wat eraan te doen

Drie dingen die de moeite waard zijn om te doen voordat u een model voor agenten kiest:

  • Zoek de cache-leessnelheid in de prijslijst van uw provider (cache lezen / cache-invoer). Bestaat zo'n lijn niet? Vraag het direct. Voor lange sessies maakt het meer uit dan de inputprijs.
  • Kijk naar je eigen laadprofiel: het API-antwoord laat zien hoeveel tokens er uit de cache kwamen. Boven de 90% cachehits betaal je meestal voor het herlezen, niet voor werk.
  • Snijd het geheugen meedogenloos. Oude berichten, gigantische systeeminstructies en voor het geval dat-bestanden worden bij elk gesprek op uw kosten opnieuw gelezen. Soms is een nieuwe sessie goedkoper dan een geschiedenis van drie dagen.

Beide modellen zijn verkrijgbaar in deNeuralSpace-chat, in deCodesectie en via deopenbare API— voer uw eigen taak uit op beide en vergelijk de rekeningen. Vergeet niet om de uitsplitsing te openen: het interessante deel bevindt zich altijd in de regel met tokens in de cache.