cache 読み取りの落とし穴: 実際のエージェント作業ではなぜ GLM 5.3 のコストが高くなるのか
私たちはエージェント業務の実際の請求書を調べたところ、簡単なことが分かりました。 GLM 5.3 の場合、コストの大部分は答えや新しい入力ではありません。cache: モデルが同じジョブ内ですでに確認したトークンを再読み取りすることです。私たちの測定では、これは請求額の 80 ~ 90% であり、長時間のタスクでは 98% に近づきます。 GLM の価格表が一見すると控えめに見えても、同じ仕事が一貫して DeepSeek では数倍安くなるのはそのためです。それがどのように起こるかは次のとおりです。
請求書の cache はどこから来たのか
すべての API 呼び出しはメモリなしで行われます。モデルは、システム命令、チャット履歴、ファイルの内容など、会話全体を再度受信します。プロバイダー cache 繰り返される部分: リクエストの先頭が既に処理されたものと一致する場合、それらのトークンは割引価格で cache から読み取られます。 API 応答には、cache から来たトークンの数、新しいトークンの数、モデルが生成したトークンの数などの内訳が表示されます。
純粋な利益のように聞こえます。ただし、割引は料金であり、贈り物ではなく、モデルごとに独自に設定されています。モデル間のギャップはパーセントではなく倍数で測定されます。そこに落とし穴が隠れているのです。

価格表に記載されている内容
2026 年 8 月下旬時点の公開価格、100 万トークンあたりのドル:
| モデル | 入力 | キャッシュ読み取り | 出力 |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (投入量の19%) | $4.40 |
| GLM 5.3 フラッシュ | $0.075 | $0.015 (入力の20%) | $0.25 |
| DeepSeek V4 プロ | $0.66 | $0.022 (投入量の3%) | $1.98 |
| DeepSeek V4 フラッシュ | $0.03 | $0.007 (入力の 23%) | $0.10 |
真ん中の列を見てください。通常は流し読みしてしまうものです。 DeepSeek V4 Pro の場合、cache の読み取りコストは入力価格の 3% であり、再読み取りの場合はほぼ 30 倍の割引になります。 GLM 5.3 の場合は 19%、5 倍の割引になります。相対的には Flash モデルのほうが近いですが (約 20% 対 23%)、絶対数では、GLM Flash cache の読み取りコストは依然として DeepSeek Flash のおよそ 2 倍です。
実際の作業で測定
8 月に 2 週間の実際のエージェント トラフィックを測定しました。4 つのモデル (GLM 5.3、GLM 5.3 Flash、DeepSeek V4 Pro、DeepSeek V4 Flash) で 13,279 件の API 呼び出しがありました。これらから、約 300 の完全なタスク ダイアログを組み立てました。モデルは、コードの読み取り、ファイルの編集、コンテキスト内での履歴全体の保持など、1 つのジョブを長期間にわたって実行します。このようなタスクの典型的な図: 入力トークンの 97 ~ 98% が cache ヒットします。本当に新しいテキストはほんの少ししか入ってきません。大部分は同じ再読み取りメモリです。
そして、法案の内訳は次のとおりです。
- GLM 5.3: 全体の 80 ~ 90% が cache 読み取りに使用され、98% は中央値のタスク ダイアログ内で行われます。答えと新鮮なインプットが残ります。
- DeepSeek V4 プロ: 請求額の約 3 分の 2 (64%) も cache です。精神的には似たようなシェアですが、DeepSeek の読み取り率は 12 倍低いため、絶対量は比較できません。
今では、通話ごとではなくタスク全体ごとにお金がかかります。タスク ダイアログのコストの中央値は、GLM 5.3 Flash では約 6 セント、DeepSeek V4 Flash では約 2 セントです。公平に比較するために、生成されるテキストの量が同じであるタスクを照合しました。同等のワークロードでは、DeepSeek は 3.6 ~ 5 倍安くなります。完全な GLM 5.3 と DeepSeek V4 Pro は、重複するタスクのクラスにおいて、同じ作業量の場合でも 6 ~ 7 倍高価でした。
方法論に関するメモ: これらの数値は、誰かの実際の請求書ではなく、上の表の公的料金から再計算されています。健全性チェックとして、料金表が公開されている場合はどこでも記録された料金と再計算を比較しました。両者の乖離は 2 ~ 3% であったため、見積もりは妥当です。
たった一度の電話でそれを感じてみませんか?私たちの測定による典型的なエージェント コールは、約 130,000 cache トークン、3,000 の新しい入力トークン、および数百の出力です。 GLM 5.3 では、そのような通話に対して約 4 セントの料金がかかります。 DeepSeek V4 Pro — 約0.5セント。同じ量の作業で 7 回。
では、GLMは浮気をしているのでしょうか?
形式的には「いいえ」です。すべての料金は公開されており、料金表が公開されている場合はどこでも、再計算は実際の料金と一致します。トリックは別のところにあります。目に入るのはインプット価格とアウトプット価格ですが、「cache read」行は技術的な脚注のように見えます。 2 メッセージ チャットでは 1 つです。しかし、エージェントの作業では、タスクごとにメモリが何百回も再読み取りされるため、この行が主なコスト項目になります。 GLM の価格は、主力モデルの DeepSeek の 12 倍であり、長時間のセッションでは他のすべてを上回ります。 DeepSeek の cache でも無料ではありません。そのレートは単に非常に小さいため、メモリ全体を再読み取りするには数ペニーの費用がかかります。
それについて何をすべきか
エージェントのモデルを選択する前に行う価値のある 3 つのこと:
- プロバイダーの価格表で cache 読み取りレート (cache 読み取り / cached 入力) を見つけます。そのようなラインはありませんか?直接聞いてください。長時間のセッションでは、入力価格よりも重要です。
- 独自の負荷プロファイルを確認してください。API 応答には、cache から送信されたトークンの数が表示されます。 90% cache ヒットを超えると、ほとんどの場合、仕事の対価ではなく、再読の対価としてお金を払っていることになります。
- 容赦なく記憶をカットする。古いメッセージ、巨大なシステム命令、および万が一の場合に備えたファイルは、通話のたびにお客様の負担で再読み取りされます。場合によっては、3 日間の履歴よりも新しいセッションの方が安い場合があります。
どちらのモデルも、 NeuralSpace チャット、で コード セクションと パブリックAPI — 両方で独自のタスクを実行し、請求額を比較します。忘れずに内訳を開いてください。興味深い部分は常に cached-tokens 行にあります。