cache-阅读要点:为什么 GLM 5.3 在实际代理工作中花费更多
我们查看了代理工作的真实账单,发现了一件简单的事情。对于GLM 5.3,成本的最大部分不是答案,也不是新的输入——它是重新读取cache:模型在同一作业中已经看到的标记。根据我们的测量,该比例占账单的 80-90%,而在长任务中,该比例接近 98%。这就是为什么同样的工作在 DeepSeek 上总是便宜几倍,尽管 GLM 的价目表乍一看似乎很温和。这是如何发生的。
您帐单中的cache来自哪里
每个 API 调用都是在没有记忆的情况下发生的:模型再次接收整个对话 - 系统指令、聊天历史记录、文件内容。提供者cache重复部分:如果请求的开头与已处理的内容匹配,则以折扣价从cache读取这些令牌。 API 响应显示了细分:有多少代币来自 cache,有多少是新的,有多少是模型生成的。
听起来像是纯利润。但折扣是一个价格,而不是礼物,每个型号都有自己的折扣。模型之间的差距不是以百分比而是以倍数来衡量的。这就是隐藏的地方。

价目表怎么说
截至 2026 年 8 月下旬的公开价格,每百万代币美元:
| 模型 | 输入 | 缓存读取 | 输出 |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (输入的 19%) | $4.40 |
| GLM 5.3 闪光 | $0.075 | $0.015 (输入的 20%) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (输入的 3%) | $1.98 |
| DeepSeek V4 闪存 | $0.03 | $0.007 (输入的 23%) | $0.10 |
看看中间的那一栏——通常是一闪而过的那一栏。对于 DeepSeek V4 Pro,cache 阅读费用为输入价格的百分之三:重读几乎有三十倍的折扣。 GLM 5.3 是百分之十九,五倍折扣。 Flash 模型相对而言更接近(大约 20% 比 23%),但从绝对数量来看,GLM Flash cache 读取成本仍然大约是 DeepSeek Flash 的两倍。
根据实际工作测量
我们收集了 8 月份两周的真实代理流量:四个模型的 13,279 个 API 调用 - GLM 5.3、GLM 5.3 Flash、DeepSeek V4 Pro 和 DeepSeek V4 Flash。从这些对话框中,我们组装了近三百个完整的任务对话框,其中模型长时间处理一项工作:读取代码、编辑文件、将整个历史记录保存在上下文中。此类任务的典型情况是:97-98% 的输入标记是 cache 命中。只有少量真正的新文本进来;大部分是相同的重读存储器。
以下是该法案的详细内容:
- GLM 5.3: 总数的 80–90% 用于 cache 阅读 — 98% 在中间任务对话框中。答案和新的输入是剩下的。
- DeepSeek V4 Pro: 大约三分之二的账单 (64%) 也是 cache。精神上的份额相似,但绝对数量无法比较,因为DeepSeek的阅读率低十二倍。
现在,钱是按整个任务而不是每次通话来支付的。在 GLM 5.3 Flash 上,任务对话框的中值成本约为 6 美分,在 DeepSeek V4 Flash 上约为 2 美分。为了公平比较,我们将任务与相同数量的生成文本进行匹配:在可比较的工作负载上,DeepSeek 的成本要便宜 3.6-5 倍。在完成相同工作量的情况下,在重叠的任务类别上,完整的 GLM 5.3 与 DeepSeek V4 Pro 的成本要高出 6-7 倍。
方法说明:这些数字是根据上表中的公开费率重新计算的,而不是某人的实际发票。作为一项健全性检查,我们将重新计算结果与关税开放时记录的费用进行了比较——两者相差 2-3%,因此估计是合理的。
想通过一次通话来感受一下吗?在我们的测量中,典型的代理调用大约有 13 万个 cache 令牌、三千个新输入令牌和几百个输出。 GLM 5.3这样的通话费用约为四美分。 DeepSeek V4 Pro — 大约半美分。对于相同的工作量,七次。
那么GLM是作弊吗?
从形式上来说,不会:所有费率均已公布,并且重新计算的费用与开放费率的实际费用相匹配。诀窍在于其他地方。引人注目的是投入和产出价格,而“cache阅读”行看起来像一个技术脚注。在两条消息聊天中,它是一条。但在代理工作中,每个任务都会重新读取内存数百次,该行成为主要成本项目。 GLM 的价格比旗舰机型 DeepSeek 的价格高出 12 倍,而且在长时间使用时它比其他一切都重要。就连DeepSeek的cache也不是免费的;它的速率是如此之小,以至于重新读取整个内存只需花费几美分。
该怎么办
在为代理选择模型之前值得做三件事:
- 在提供商的价目表中查找 cache 读取率(cache 读取/cached 输入)。没有这样的线吗?直接询问。对于长时间的会话来说,它比输入价格更重要。
- 查看您自己的负载配置文件:API 响应显示有多少令牌来自 cache。超过 90% cache 点击率,你主要是在为重读付费,而不是为工作付费。
- 无情地切断记忆。每次通话时,旧消息、庞大的系统指令和以防万一文件都会重新读取,费用由您承担。有时,新的会话比三天的历史记录便宜。
两种型号均可在 NeuralSpace聊天,在 代码 部分并通过 公共API — 在两者上运行您自己的任务并比较账单。请记住打开细分:有趣的部分始终位于 cached-tokens 行中。