缓存读取陷阱:为什么 GLM 5.3 在实际智能体任务中成本更高
我们翻看了智能体任务的真实账单,发现一个简单的事实。对于 GLM 5.3 来说,成本的大头不是生成的回答,也不是新输入的内容——而是重新读取缓存:模型在同一个任务中已经见过的 token。在我们的测试中,这部分占账单的 80–90%,在长任务中接近 98%。这就是为什么同样的工作在 DeepSeek 上始终便宜好几倍,尽管 GLM 的价格表乍一看还挺实惠。事情是这样的。
账单中的缓存从哪来
每次 API 调用都是无记忆的:模型会重新接收整个对话——系统指令、聊天历史、文件内容。服务商会缓存重复的部分:如果请求的开头与已处理过的内容匹配,这些 token 就从缓存中读取,享受折扣价。API 响应会显示明细:多少 token 来自缓存,多少是新的,模型生成了多少。
听起来是纯赚。但折扣是一个费率,不是免费,每个模型都自己定价。模型之间的差距不是按百分比算的,而是按倍数算的。陷阱就藏在这里。

价格表怎么说
2026 年 8 月底的公开价格,单位为美元/百万 token:
| 模型 | 输入 | 缓存读取 | 输出 |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (输入价的 19%) | $4.40 |
| GLM 5.3 Flash | $0.075 | $0.015 (输入价的 20%) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (输入价的 3%) | $1.98 |
| DeepSeek V4 Flash | $0.03 | $0.007 (输入价的 23%) | $0.10 |
看中间那一列——通常被一扫而过的那列。对于 DeepSeek V4 Pro,缓存读取成本是输入价格的 3%:重新读取有近 30 倍的折扣。对于 GLM 5.3 是 19%,只有 5 倍折扣。Flash 模型在相对比例上更接近(约 20% 对 23%),但在绝对数字上,GLM Flash 的缓存读取成本仍然大约是 DeepSeek Flash 的两倍。
实际工作的实测
我们统计了 8 月份两周的真实智能体流量:13,279 次 API 调用,涵盖四个模型——GLM 5.3、GLM 5.3 Flash、DeepSeek V4 Pro 和 DeepSeek V4 Flash。从中我们整理出近三百个完整的任务对话,模型在一个任务上长时间工作:读代码、编辑文件、把整个历史保持在上下文中。这种任务的典型画面是:97–98% 的输入 token 是缓存命中。只有涓涓细流的真正新文本进来;大头都是重新读取的那些记忆。
账单是这样分解的:
- GLM 5.3: 总费用的 80–90% 用于缓存读取——在中位数任务对话中是 98%。回答和新输入只是零头。
- DeepSeek V4 Pro: 约三分之二的账单(64%)也是缓存。比例精神上类似,但绝对金额没法比,因为 DeepSeek 的读取费率低了 12 倍。
现在看钱,按整个任务而不是按单次调用算。一个中位数任务对话在 GLM 5.3 Flash 上花费约 6 美分,在 DeepSeek V4 Flash 上约 2 美分。为了公平比较,我们匹配了生成文本量相同的任务:在可比工作量下,DeepSeek 便宜 3.6–5 倍。完整版 GLM 5.3 对比 DeepSeek V4 Pro,在它们重叠的任务类别上,贵了 6–7 倍——做同样的工作。
方法论说明:这些数字是根据上表中的公开费率重新计算的,不是某人的实际发票。作为合理性检查,我们在费率公开的地方对比了重新计算与实际记录的费用——差异在 2–3%,所以估算是靠谱的。
想在单次调用上感受一下?我们测试中一次典型的智能体调用大约是 13 万个缓存 token、3000 个新输入 token 和几百个输出。GLM 5.3 对这样一次调用收费约 4 美分。DeepSeek V4 Pro——约半美分。7 倍,做同样的工作量。
所以 GLM 在耍赖吗?
形式上没有:所有费率都是公开的,重新计算在费率透明的地方与实际收费吻合。诀窍在别处。眼睛会注意到输入和输出价格,而「缓存读取」那一行看起来像技术脚注。在两条消息的聊天中确实是。但在智能体工作中,记忆每个任务被重新读取几百次,那一行就成了主要成本项。GLM 把它定价成 DeepSeek 旗舰模型的 12 倍——在长会话中它压倒一切。即使 DeepSeek 的缓存也不免费;它的费率只是太小了,重新读取整个记忆只花几美分。
怎么应对
在为智能体选模型之前值得做三件事:
- 在服务商的价格表中找缓存读取费率(缓存读取 / 缓存输入)。没有这一行?直接问。对于长会话,这比输入价格重要得多。
- 看看自己的负载情况:API 响应显示了多少 token 来自缓存。缓存命中率超过 90%,你主要是在为重新读取付费,而不是为工作付费。
- 无情地削减记忆。旧消息、巨大的系统指令和以防万一的文件,每次调用都要重新读取,费用由你承担。有时候开个新会话比保留三天历史更便宜。
两个模型都可以在 NeuralSpace 聊天、Code 部分以及通过公共 API 使用——在两个模型上跑自己的任务,比较账单。只是记得打开明细:有趣的部分总是藏在缓存 token 那一行。