← Все статьи

Tangkapan pembacaan cache: mengapa GLM 5.3 lebih mahal dalam pekerjaan agen sebenarnya

Tangkapan pembacaan cache: mengapa GLM 5.3 lebih mahal dalam pekerjaan agen sebenarnya

Kami memeriksa tagihan sebenarnya untuk pekerjaan agen dan melihat hal yang sederhana. Untuk GLM 5.3, bagian terbesar dari biaya bukanlah jawaban atau masukan baru — melainkan membaca ulang cache: token yang telah dilihat oleh model dalam pekerjaan yang sama. Dalam pengukuran kami, jumlah tersebut mencapai 80–90% dari tagihan, dan dalam tugas yang panjang, jumlahnya mendekati 98%. Itulah sebabnya pekerjaan yang sama secara konsisten menghasilkan harga beberapa kali lebih murah di DeepSeek, meskipun daftar harga GLM terlihat sederhana pada pandangan pertama. Begini caranya.

Dari mana asal cache di tagihan Anda

Setiap panggilan API terjadi tanpa memori: model menerima kembali seluruh percakapan — instruksi sistem, riwayat obrolan, konten file. Penyedia menyimpan bagian yang berulang dalam cache: jika awal permintaan cocok dengan sesuatu yang sudah diproses, token tersebut dibaca dari cache dengan harga diskon. Respons API menunjukkan rinciannya: berapa banyak token yang berasal dari cache, berapa banyak yang baru, berapa banyak model yang dihasilkan.

Kedengarannya seperti keuntungan murni. Namun diskon adalah tarif, bukan hadiah, dan setiap model menetapkan tarifnya sendiri. Kesenjangan antar model diukur bukan dalam persen, melainkan dalam kelipatan. Di situlah tangkapannya bersembunyi.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Apa yang tercantum dalam daftar harga

Harga publik pada akhir Agustus 2026, dolar per juta token:

ModelMasukanBaca cacheKeluaran
GLM 5.3$1.40$0.26 (19% dari masukan)$4.40
GLM 5.3 Lampu Kilat$0.075$0.015 (20% dari masukan)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% dari masukan)$1.98
Flash DeepSeek V4$0.03$0.007 (23% dari masukan)$0.10

Lihatlah kolom tengah - yang biasanya dilewati. Untuk DeepSeek V4 Pro, pembacaan cache dikenakan biaya tiga persen dari harga input: diskon hampir tiga puluh kali lipat untuk pembacaan ulang. Untuk GLM 5.3 sembilan belas persen, diskon lima kali lipat. Model Flash lebih dekat secara relatif (sekitar 20% berbanding 23%), namun dalam jumlah absolut, biaya pembacaan cache GLM Flash masih kira-kira dua kali lipat dibandingkan DeepSeek Flash.

Diukur pada pekerjaan nyata

Kami melakukan trafik agen nyata selama dua minggu pada bulan Agustus: 13.279 panggilan API di empat model — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro, dan DeepSeek V4 Flash. Dari dialog tersebut kami mengumpulkan hampir tiga ratus dialog tugas lengkap, di mana sebuah model bekerja pada satu pekerjaan untuk waktu yang lama: membaca kode, mengedit file, menjaga seluruh riwayat dalam konteks. Gambaran umum dari tugas semacam itu: 97–98% token masukan adalah cache hits. Hanya sedikit teks baru yang masuk; sebagian besar adalah memori baca ulang yang sama.

Dan inilah rincian RUU tersebut:

  • GLM 5.3:80–90% dari total pembacaan cache — 98% di dalam dialog tugas median. Jawaban dan masukan baru adalah sisanya.
  • DeepSeek V4 Pro:sekitar dua pertiga dari tagihan (64%) juga merupakan cache. Semangatnya serupa, tetapi jumlah absolutnya tidak ada bandingannya, karena kecepatan membaca DeepSeek dua belas kali lebih rendah.

Sekarang uangnya, per seluruh tugas, bukan per panggilan. Dialog tugas rata-rata berharga sekitar enam sen pada GLM 5.3 Flash dan sekitar dua sen pada DeepSeek V4 Flash. Untuk membandingkan secara adil, kami mencocokkan tugas dengan volume teks yang dihasilkan sama: pada beban kerja yang sebanding, DeepSeek menghasilkan 3,6–5 kali lebih murah. GLM 5.3 penuh dibandingkan DeepSeek V4 Pro, pada kelas tugas yang tumpang tindih, harganya 6–7 kali lebih mahal — untuk jumlah pekerjaan yang sama.

Catatan metodologi: angka-angka ini dihitung ulang dari tarif publik pada tabel di atas, bukan dari tagihan aktual seseorang. Sebagai pemeriksaan kewarasan, kami membandingkan penghitungan ulang dengan biaya yang tercatat di mana pun tarif diberlakukan — selisihnya sebesar 2–3%, sehingga perkiraan tersebut masuk akal.

Ingin merasakannya dalam satu panggilan? Panggilan agen yang umum dalam pengukuran kami adalah sekitar 130 ribu token cache, tiga ribu token masukan baru, dan beberapa ratus keluaran. GLM 5.3 mengenakan biaya sekitar empat sen untuk panggilan semacam itu. DeepSeek V4 Pro — sekitar setengah sen. Tujuh kali, untuk volume pekerjaan yang sama.

Jadi apakah GLM curang?

Secara formal, tidak: semua tarif dipublikasikan, dan perhitungan ulangnya sesuai dengan biaya sebenarnya di mana pun tarif dibuka. Triknya terletak di tempat lain. Mata menangkap harga input dan output, sedangkan baris "cache read" tampak seperti catatan kaki teknis. Dalam obrolan dua pesan itu adalah satu. Namun dalam pekerjaan agen, di mana memori dibaca ulang ratusan kali per tugas, baris tersebut menjadi item biaya utama. GLM memberi harga dua belas kali lebih tinggi daripada DeepSeek untuk model andalan — dan pada sesi yang panjang, harganya melebihi yang lainnya. Bahkan cache DeepSeek tidak gratis; tarifnya sangat kecil sehingga membaca ulang seluruh memori memerlukan biaya yang tidak sedikit.

Apa yang harus dilakukan mengenai hal itu

Tiga hal yang perlu dilakukan sebelum Anda memilih model untuk agen:

  • Temukan tingkat pembacaan cache di daftar harga penyedia Anda (pembacaan cache/input cache). Tidak ada garis seperti itu? Tanyakan langsung. Untuk sesi yang panjang, hal ini lebih penting daripada harga input.
  • Lihat profil beban Anda sendiri: respons API menunjukkan berapa banyak token yang berasal dari cache. Di atas 90% cache hits, Anda sebagian besar membayar untuk membaca ulang, bukan untuk bekerja.
  • Potong ingatan dengan kejam. Pesan lama, instruksi sistem raksasa, dan file untuk berjaga-jaga dibaca ulang atas biaya Anda pada setiap panggilan. Terkadang sesi baru lebih murah daripada sesi sejarah tiga hari.

Kedua model tersedia diObrolan NeuralSpace, diKodebagian dan melaluiAPI publik— jalankan tugas Anda sendiri pada keduanya dan bandingkan tagihannya. Ingatlah untuk membuka rinciannya: bagian yang menarik selalu ada di baris token yang di-cache.