← Все статьи

Captura de citire a memoriei cache: de ce GLM 5.3 costă mai mult în munca unui agent real

Captura de citire a memoriei cache: de ce GLM 5.3 costă mai mult în munca unui agent real

Am trecut prin facturi reale pentru munca de agent și am văzut un lucru simplu. Pentru GLM 5.3, partea leului din cost nu o reprezintă răspunsurile și nu input-ul proaspăt - ci recitește memoria cache: jetoane pe care modelul le-a văzut deja în cadrul aceleiași sarcini. În măsurătorile noastre, aceasta reprezintă 80–90% din factura, iar în cadrul sarcinilor lungi se apropie de 98%. De aceea, același loc de muncă iese în mod constant de câteva ori mai ieftin pe DeepSeek, chiar dacă lista de prețuri a GLM pare modestă la prima vedere. Iată cum se întâmplă asta.

De unde provine memoria cache din factura dvs

Fiecare apel API are loc fără memorie: modelul primește din nou întreaga conversație — instrucțiuni de sistem, istoric chat, conținut fișier. Furnizorii memorează în cache partea repetată: dacă începutul unei cereri se potrivește cu ceva deja procesat, acele token-uri sunt citite din cache cu reducere. Răspunsul API arată defalcarea: câte jetoane au venit din cache, câte au fost noi, câte a generat modelul.

Sună a profit pur. Dar reducerea este o rată, nu un cadou și fiecare model își stabilește propriul. Diferența dintre modele este măsurată nu în procente, ci în multipli. Acolo se ascunde captura.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Ce scrie pe lista de prețuri

Prețuri publice de la sfârșitul lunii august 2026, dolari per milion de jetoane:

ModelIntrareCitirea memoriei cacheIeșire
GLM 5.3$1.40$0.26 (19% din intrare)$4.40
GLM 5.3 Flash$0.075$0.015 (20% din intrare)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% din intrare)$1.98
DeepSeek V4 Flash$0.03$0.007 (23% din intrare)$0.10

Uitați-vă la coloana din mijloc - cea trecută de obicei. Pentru DeepSeek V4 Pro, citirile din cache costă trei procente din prețul de intrare: o reducere de aproape treizeci de ori pentru recitire. Pentru GLM 5.3 este de nouăsprezece procente, o reducere de cinci ori. Modelele Flash sunt mai apropiate în termeni relativi (aproximativ 20% față de 23%), dar, în cifre absolute, citirile GLM Flash cache încă costă aproximativ de două ori mai mult decât cele ale DeepSeek Flash.

Măsurat pe munca reală

Am avut nevoie de două săptămâni de trafic de agenți real în august: 13.279 de apeluri API pe patru modele — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro și DeepSeek V4 Flash. Dintre acestea am asamblat aproape trei sute de dialoguri de sarcini complete, în care un model lucrează pe o singură lucrare pentru o perioadă lungă de timp: citirea codului, editarea fișierelor, păstrarea întregului istoric în context. Imaginea tipică a unei astfel de sarcini: 97–98% din jetoanele de intrare sunt accesări în cache. Intră doar un firicel de text cu adevărat nou; cea mai mare parte este aceeași memorie recitit.

Și iată cum se defalcă factura:

  • GLM 5.3:80–90% din total merge la citirile din memoria cache - 98% într-un dialog de activitate mediană. Răspunsurile și informațiile noi sunt resturile.
  • DeepSeek V4 Pro:aproximativ două treimi din factura (64%) este, de asemenea, cache. O pondere similară în spirit, dar sumele absolute sunt incomparabile, deoarece rata de citire a DeepSeek este de douăsprezece ori mai mică.

Acum banii, mai degrabă pe întreaga sarcină decât pe apel. Un dialog de sarcină mediu costă aproximativ șase cenți pe GLM 5.3 Flash și aproximativ doi cenți pe DeepSeek V4 Flash. Pentru a compara corect, am corelat sarcini cu același volum de text generat: pe sarcini de lucru comparabile, DeepSeek iese de 3,6-5 ori mai ieftin. Completul GLM 5.3 împotriva DeepSeek V4 Pro, pentru clasa de sarcini în care se suprapun, a fost de 6-7 ori mai scump - pentru aceeași cantitate de muncă efectuată.

O notă de metodologie: aceste cifre sunt recalculate din tarifele publice din tabelul de mai sus, nu din factura reală a cuiva. Ca o verificare a logicii, am comparat recalcularea cu taxele înregistrate oriunde este deschis tariful - acestea au divergentat cu 2–3%, deci estimarea este solidă.

Vrei să simți asta la un singur apel? Un apel tipic de agent în măsurătorile noastre este de aproximativ 130 de mii de jetoane cache, trei mii de jetoane de intrare noi și câteva sute de ieșire. GLM 5.3 percepe aproximativ patru cenți pentru un astfel de apel. DeepSeek V4 Pro - aproximativ jumătate de cent. De șapte ori, pentru același volum de muncă.

Deci GLM trișează?

Formal, nu: toate tarifele sunt publicate, iar recalcularea se potrivește cu tarifele reale oriunde este deschis tariful. Trucul se află în altă parte. Ochiul atrage prețurile de intrare și de ieșire, în timp ce linia „citire cache” arată ca o notă de subsol tehnică. Într-un chat cu două mesaje este unul. Dar în munca de agent, în care memoria este recitită de sute de ori per sarcină, acea linie devine elementul principal de cost. GLM l-a prețuit de douăsprezece ori mai mare decât a făcut-o DeepSeek pentru modelele emblematice - și la sesiunile lungi depășește orice altceva. Nici măcar cache-ul DeepSeek nu este gratuit; ratele sale sunt pur și simplu atât de mici încât recitirea întregii memorie costă bănuți.

Ce să faci în privința asta

Trei lucruri care merită făcute înainte de a alege un model pentru agenți:

  • Găsiți rata de citire a cache-ului în lista de prețuri a furnizorului dvs. (citire în cache / intrare în cache). Nu există o astfel de linie? Întrebați direct. Pentru sesiuni lungi contează mai mult decât prețul de intrare.
  • Priviți propriul profil de încărcare: răspunsul API arată câte jetoane au venit din cache. Peste 90% accesări cache, plătiți mai ales pentru recitire, nu pentru muncă.
  • Tăiați memoria fără milă. Mesajele vechi, instrucțiunile de sistem uriașe și fișierele pentru orice eventualitate sunt recitite pe cheltuiala dvs. la fiecare apel. Uneori, o sesiune proaspătă este mai ieftină decât o istorie de trei zile.

Ambele modele sunt disponibile înChat NeuralSpace, înCodsectiune si prinAPI-ul public— rulați-vă propria sarcină pe ambele și comparați facturile. Nu uitați să deschideți defalcarea: partea interesantă trăiește întotdeauna în linia de jetoane în cache.