← Все статьи

Cache-read catch: mengapa GLM 5.3 lebih mahal dalam kerja ejen sebenar

Cache-read catch: mengapa GLM 5.3 lebih mahal dalam kerja ejen sebenar

Kami telah melalui bil sebenar untuk kerja ejen dan melihat satu perkara yang mudah. Untuk GLM 5.3, bahagian terbesar kos bukanlah jawapan dan bukan input baharu — ia sedang membaca semula cache: token yang telah dilihat model dalam kerja yang sama. Dalam ukuran kami iaitu 80–90% daripada bil, dan dalam tugasan yang panjang ia menghampiri 98%. Itulah sebabnya kerja yang sama secara konsisten keluar beberapa kali lebih murah di DeepSeek, walaupun senarai harga GLM kelihatan sederhana pada pandangan pertama. Inilah caranya.

Dari mana cache dalam bil anda berasal

Setiap panggilan API berlaku tanpa memori: model menerima keseluruhan perbualan sekali lagi — arahan sistem, sejarah sembang, kandungan fail. Penyedia cache bahagian yang berulang: jika permulaan permintaan sepadan dengan sesuatu yang telah diproses, token tersebut dibaca daripada cache pada harga diskaun. Respons API menunjukkan pecahan: bilangan token yang datang daripada cache, bilangan yang baharu, bilangan model yang dihasilkan.

Kedengaran seperti keuntungan murni. Tetapi diskaun adalah kadar, bukan hadiah, dan setiap model menetapkannya sendiri. Jurang antara model diukur bukan dalam peratus tetapi dalam gandaan. Di situlah tempat tangkapan bersembunyi.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Apa yang dinyatakan dalam senarai harga

Harga awam pada akhir Ogos 2026, dolar per juta token:

ModelInputCache dibacaKeluaran
GLM 5.3$1.40$0.26 (19% daripada input)$4.40
GLM 5.3 Denyar$0.075$0.015 (20% daripada input)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% daripada input)$1.98
DeepSeek V4 Flash$0.03$0.007 (23% daripada input)$0.10

Lihatlah pada lajur tengah — lajur yang biasanya melintas. Untuk DeepSeek V4 Pro, bacaan cache berharga tiga peratus daripada harga input: diskaun hampir tiga puluh kali ganda untuk bacaan semula. Untuk GLM 5.3 ia adalah sembilan belas peratus, diskaun lima kali ganda. Model Flash adalah lebih dekat dari segi relatif (kira-kira 20% berbanding 23%), namun dalam jumlah mutlak bacaan cache GLM Flash masih berharga kira-kira dua kali lebih banyak daripada DeepSeek Flash.

Diukur pada kerja sebenar

Kami mengambil dua minggu trafik ejen sebenar pada bulan Ogos: 13,279 panggilan API merentas empat model — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro dan DeepSeek V4 Flash. Daripada yang kami kumpulkan hampir tiga ratus dialog tugas penuh, di mana model berfungsi pada satu kerja untuk tempoh yang lama: membaca kod, mengedit fail, mengekalkan keseluruhan sejarah dalam konteks. Gambar biasa tugasan sedemikian: 97–98% daripada token input ialah hit cache. Hanya titisan teks yang benar-benar baru masuk; sebahagian besarnya ialah ingatan baca semula yang sama.

Dan inilah cara rang undang-undang itu dipecahkan:

  • GLM 5.3:80–90% daripada jumlah keseluruhan pergi ke bacaan cache — 98% dalam dialog tugas median. Jawapan dan input segar adalah sisa.
  • DeepSeek V4 Pro:kira-kira dua pertiga daripada bil (64%) juga adalah cache. Bahagian semangat yang sama, tetapi jumlah mutlaknya tidak dapat dibandingkan, kerana kadar bacaan DeepSeek adalah dua belas kali lebih rendah.

Sekarang wang, setiap tugas keseluruhan dan bukannya setiap panggilan. Dialog tugasan median berharga kira-kira enam sen pada GLM 5.3 Flash dan kira-kira dua sen pada DeepSeek V4 Flash. Untuk membandingkan secara saksama, kami memadankan tugasan dengan volum teks terjana yang sama: pada beban kerja yang setanding DeepSeek keluar 3.6–5 kali lebih murah. GLM 5.3 penuh terhadap DeepSeek V4 Pro, pada kelas tugas yang bertindih, adalah 6–7 kali lebih mahal — untuk jumlah kerja yang sama dilakukan.

Nota metodologi: angka ini dikira semula daripada kadar awam dalam jadual di atas, bukan invois sebenar seseorang. Sebagai semakan kewarasan, kami membandingkan pengiraan semula dengan caj yang direkodkan di mana-mana sahaja tarif dibuka — mereka menyimpang sebanyak 2–3%, jadi anggarannya adalah kukuh.

Ingin merasainya dalam satu panggilan? Panggilan ejen biasa dalam pengukuran kami ialah sekitar 130 ribu token cache, tiga ribu token input baharu dan beberapa ratus output. GLM 5.3 mengenakan bayaran kira-kira empat sen untuk panggilan sedemikian. DeepSeek V4 Pro — kira-kira setengah sen. Tujuh kali, untuk jumlah kerja yang sama.

Jadi adakah GLM menipu?

Secara rasmi, tidak: semua kadar diterbitkan, dan pengiraan semula sepadan dengan caj sebenar di mana sahaja tarif dibuka. Caranya terletak di tempat lain. Mata menangkap harga input dan output, manakala baris "baca cache" kelihatan seperti nota kaki teknikal. Dalam sembang dua mesej ia adalah satu. Tetapi dalam kerja ejen, di mana memori dibaca semula ratusan kali setiap tugas, baris itu menjadi item kos utama. GLM harganya dua belas kali lebih tinggi daripada DeepSeek untuk model perdana — dan pada sesi yang panjang ia mengatasi segala-galanya. Malah cache DeepSeek tidak percuma; kadarnya sangat kecil sehingga membaca semula keseluruhan ingatan menelan kos beberapa sen.

Apa yang perlu dilakukan mengenainya

Tiga perkara yang patut dilakukan sebelum anda memilih model untuk ejen:

  • Cari kadar baca cache dalam senarai harga pembekal anda (baca cache / input cache). Tiada baris sedemikian? Tanya terus. Untuk sesi yang panjang, ia lebih penting daripada harga input.
  • Lihat profil muat anda sendiri: respons API menunjukkan bilangan token yang datang daripada cache. Melebihi 90% capaian cache, anda kebanyakannya membayar untuk membaca semula, bukan untuk kerja.
  • Potong ingatan dengan kejam. Mesej lama, arahan sistem gergasi dan fail just-in-case dibaca semula dengan perbelanjaan anda pada setiap panggilan. Kadangkala sesi baru lebih murah daripada sejarah tiga hari.

Kedua-dua model boleh didapati diSembang NeuralSpace, dalamKodbahagian dan melaluiAPI awam— jalankan tugas anda sendiri pada kedua-duanya dan bandingkan bil. Ingatlah untuk membuka pecahan: bahagian yang menarik sentiasa berada dalam baris token cache.