← Kaikki artikkelit

Välimuistin lukusaalis: miksi GLM 5.3 maksaa enemmän todellisessa agenttityössä

Välimuistin lukusaalis: miksi GLM 5.3 maksaa enemmän todellisessa agenttityössä

Kävimme läpi todelliset laskut agenttityöstä ja näimme yksinkertaisen asian. GLM 5.3:ssa leijonanosa kustannuksista ei ole vastauksia eikä tuoretta syötettä – se on välimuistin uudelleen lukemista: merkkejä, jotka malli on jo nähnyt samassa työssä. Mittauksissamme se on 80–90 % laskusta ja pitkien tehtävien sisällä 98 %. Siksi sama työ tulee jatkuvasti useita kertoja halvemmalla DeepSeekissä, vaikka GLM:n hinnasto näyttää ensi silmäyksellä vaatimattomalta. Näin se tapahtuu.

Mistä laskusi välimuisti tulee

Jokainen API-puhelu tapahtuu ilman muistia: malli vastaanottaa uudelleen koko keskustelun – järjestelmäohjeet, keskusteluhistorian, tiedostojen sisällön. Palveluntarjoajat tallentavat toistetun osan välimuistiin: jos pyynnön alku vastaa jotain jo käsiteltyä, nuo tunnukset luetaan välimuistista alennuksella. API-vastaus näyttää erittelyn: kuinka monta merkkiä tuli välimuistista, kuinka monta oli uutta, kuinka monta malli luotiin.

Kuulostaa puhtaalta voitolta. Mutta alennus on korko, ei lahja, ja jokainen malli asettaa omanlaisensa. Mallien välistä eroa ei mitata prosentteina vaan kerrannaisina. Siellä saalis piiloutuu.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Mitä hinnasto sanoo

Julkiset hinnat elokuun 2026 lopulla, dollaria miljoonalta tokenilta:

MalliSyöteVälimuistin lukuLähtö
GLM 5.3$1.40$0.26 (19 % syötteestä)$4.40
GLM 5.3 Flash$0.075$0.015 (20 % syötteestä)$0.25
DeepSeek V4 Pro$0.66$0.022 (3 % syötteestä)$1.98
DeepSeek V4 Flash$0.03$0.007 (23 % syötteestä)$0.10

Katso keskimmäistä saraketta – se, joka yleensä ohitti. DeepSeek V4 Prossa välimuistin lukeminen maksaa kolme prosenttia syöttöhinnasta: lähes kolminkertainen alennus uudelleenlukemisesta. GLM 5.3:lle se on 19 prosenttia, viisinkertainen alennus. Flash-mallit ovat suhteellisesti läheisempiä (noin 20 % vs. 23 %), mutta absoluuttisina lukuina GLM Flash -välimuistin lukeminen maksaa silti suunnilleen kaksi kertaa niin paljon kuin DeepSeek Flashin.

Oikealla työllä mitattuna

Kestimme elokuussa kaksi viikkoa todellista agenttiliikennettä: 13 279 API-puhelua neljässä mallissa – GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro ja DeepSeek V4 Flash. Niistä kokosimme lähes kolmesataa täydellistä tehtävädialogiaa, joissa malli toimii yhdessä työssä pitkään: lukee koodia, muokkaa tiedostoja, pitää koko historian kontekstissa. Tyypillinen kuva tällaisesta tehtävästä: 97–98 % syöttötunnisteista on välimuistiosuuksia. Vain hiukkanen aidosti uutta tekstiä tulee sisään; suurin osa on sama uudelleenlukumuisti.

Ja näin lasku hajoaa:

  • GLM 5.3:80–90 % kokonaismäärästä menee välimuistin lukuihin – 98 % mediaanitehtävän valintaikkunassa. Vastaukset ja tuoreet panokset ovat jäämiä.
  • DeepSeek V4 Pro:noin kaksi kolmasosaa laskusta (64 %) on myös välimuistia. Hengellisesti samanlainen osuus, mutta absoluuttiset määrät ovat vertaansa vailla, koska DeepSeekin lukunopeus on kaksitoista kertaa pienempi.

Nyt rahat koko tehtävää kohti puhelun sijaan. Mediaanitehtävävalintaikkuna maksoi noin kuusi senttiä GLM 5.3 Flashissa ja noin kaksi senttiä DeepSeek V4 Flashissa. Oikeudenmukaisen vertailun vuoksi sovitimme tehtäviä, joilla on sama määrä luotua tekstiä: vertailukelpoisilla työkuormilla DeepSeek tulee 3,6–5 kertaa halvemmaksi. Full GLM 5.3 DeepSeek V4 Prota vastaan, siinä tehtäväluokassa, jossa ne menevät päällekkäin, oli 6–7 kertaa kalliimpi – samalla työmäärällä.

Menetelmähuomautus: nämä luvut on laskettu uudelleen yllä olevan taulukon julkisista hinnoista, ei jonkun todellisesta laskusta. Järkevyyden tarkistuksena verrasimme uudelleenlaskentaa kirjattuihin maksuihin siellä, missä tariffi on auki – ne poikkesivat 2–3 %, joten arvio on oikea.

Haluatko tuntea sen yhdellä puhelulla? Tyypillinen agenttikutsu mittauksissamme on noin 130 tuhatta välimuistitunnusta, kolme tuhatta uutta syöttötunnusta ja parisataa ulostuloa. GLM 5.3 veloittaa noin neljä senttiä tällaisesta puhelusta. DeepSeek V4 Pro - noin puoli senttiä. Seitsemän kertaa samalla työmäärällä.

Onko siis GLM huijausta?

Muodollisesti ei: kaikki hinnat julkaistaan, ja uudelleenlaskenta vastaa todellisia maksuja kaikkialla, missä tariffi on avoinna. Temppu on muualla. Silmä kiinnittää panos- ja tuotantohinnat, kun taas "cache read" -rivi näyttää tekniseltä alaviitteeltä. Kahden viestin chatissa se on yksi. Mutta agenttityössä, jossa muisti luetaan uudelleen satoja kertoja tehtävää kohti, tästä rivistä tulee tärkein kustannuserä. GLM maksoi sen kaksitoista kertaa korkeammalle kuin DeepSeek lippulaivamalleille – ja pitkillä istunnoilla se painaa kaiken muun. Jopa DeepSeekin välimuisti ei ole ilmainen; sen hinnat ovat yksinkertaisesti niin pieniä, että koko muistin uudelleen lukeminen maksaa penniä.

Mitä tehdä asialle

Kolme asiaa kannattaa tehdä ennen kuin valitset mallin agenteille:

  • Etsi välimuistin lukunopeus palveluntarjoajasi hinnastosta (välimuistin luku / välimuistin syöttö). Ei sellaista linjaa? Kysy suoraan. Pitkillä istunnoilla sillä on enemmän merkitystä kuin syöttöhinnalla.
  • Katso omaa latausprofiiliasi: API-vastaus näyttää kuinka monta tokenia tuli välimuistista. Yli 90 % välimuistin osumista maksat enimmäkseen uudelleenlukemisesta, et työstä.
  • Leikkaa muistia armottomasti. Vanhat viestit, jättimäiset järjestelmäohjeet ja tiedostot luetaan uudelleen joka puhelun kustannuksella. Joskus uusi istunto on halvempi kuin kolmen päivän historia.

Molemmat mallit ovat saatavillaNeuralSpace-chat, sisälläKoodiosion ja kauttajulkinen API- suorita oma tehtäväsi molemmille ja vertaa laskuja. Muista vain avata erittely: mielenkiintoinen osa asuu aina välimuistissa-tokens-rivillä.