Хитрое чтение кэша: почему GLM 5.3 в реальной работе дороже, чем кажется
Посчитали реальные счета за агентные задачи — и увидели простую вещь. У GLM 5.3 львиная доля расходов приходится не на ответы и не на новые запросы, а на повторное чтение кэша: токены, которые модель уже и так видела в этой же работе. В нашем замере это 80–90% суммы, а внутри длинных задач — под 98%. Из-за этого одна и та же работа у DeepSeek стабильно выходит в несколько раз дешевле, хотя строчки прайса у GLM на первый взгляд вполне скромные. Разбираемся, как так получается.
Откуда в счёте берётся кэш
Каждый вызов API происходит без памяти: модель заново получает всю переписку — системную инструкцию, историю разговора, содержимое файлов. Провайдеры это понимают и кэшируют повторяющуюся часть: если начало запроса совпало с тем, что уже обрабатывалось, эти токены читаются из кэша со скидкой. В ответе API видно разбивку: сколько токенов пришло из кэша, сколько было новыми, сколько модель сгенерировала.
Звучит как чистая выгода. Но скидка — это не подарок, а тариф, у каждой модели свой. И разница между моделями бывает не в проценты, а в разы. Тут и прячется подвох.

Что написано в прайсе
Публичные цены на конец августа 2026 года, доллары за миллион токенов:
| Модель | Вход | Чтение кэша | Выход |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% от входа) | $4.40 |
| GLM 5.3 Flash | $0.075 | $0.015 (20% от входа) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3% от входа) | $1.98 |
| DeepSeek V4 Flash | $0.03 | $0.007 (23% от входа) | $0.10 |
Смотрите на среднюю колонку — ту, которую в прайсах обычно пролистывают. У DeepSeek V4 Pro чтение кэша стоит три процента от цены входа: скидка за повторное чтение почти тридцатикратная. У GLM 5.3 — девятнадцать процентов, скидка всего пятикратная. У Flash-версий относительная разница скромнее (примерно 20% против 23%), но в абсолюте кэш GLM Flash всё равно примерно вдвое дороже кэша DeepSeek Flash.
Замер на живой нагрузке
Мы взяли статистику реальной агентной работы за две недели августа: 13 279 обращений к API четырёх моделей — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro и DeepSeek V4 Flash. Из них собрали почти триста полноценных задач-диалогов, где модель подолгу работает над одним делом: читает код, правит файлы, держит в памяти всю историю. Типичная картина такой задачи: 97–98% входных токенов — кэш-хиты. Нового текста поступает мизер, основная масса — та самая перечитываемая память.
И вот как раскладывается счёт:
- GLM 5.3: 80–90% суммы уходит на чтение кэша, а внутри медианной задачи-диалога — все 98%. Ответы и новые запросы — остатки.
- DeepSeek V4 Pro: на кэш уходит около двух третей счёта (64%). Доля похожая по смыслу, но абсолютные суммы несопоставимы: ставка за чтение у DeepSeek в двенадцать раз ниже.
Теперь деньгами, по целым задачам, а не по отдельным вызовам. Медианная задача-диалог обошлась в шесть центов на GLM 5.3 Flash и в два цента на DeepSeek V4 Flash. Чтобы сравнивать честно, мы брали задачи с одинаковым объёмом сгенерированного текста: на сопоставимой нагрузке DeepSeek выходит дешевле в 3,6–5 раз. Полная GLM 5.3 против DeepSeek V4 Pro на пересекающемся классе задач — в 6–7 раз дороже. Объём проделанной работы при этом одинаковый.
Нюанс методики: это пересчёт по публичным ставкам из таблицы выше, а не распечатка чужого счёта. Для контроля мы сверили пересчёт с фактическими списаниями там, где тариф открытый, — они разошлись на 2–3%, так что оценка аккуратная.
Хотите почувствовать разницу на одном вызове? Типовой вызов агента в наших замерах — порядка 130 тысяч кэш-токенов, трёх тысяч новых входных и пары сотен на выходе. GLM 5.3 берёт за такой вызов около четырёх центов. DeepSeek V4 Pro — около полцента. Семь раз. При том что объём работы один и тот же.
Так хитрит ли GLM?
Формально — нет: все ставки опубликованы, и пересчёт по ним сходится с фактическими списаниями там, где тариф открытый. Хитрость в другом. Взгляд цепляется за цену входа и выхода, а строка «чтение кэша» выглядит технической мелочью. Для короткого разговора из двух реплик она и есть мелочь. Но в агентной работе, где память перечитывается сотни раз за задачу, именно эта строка становится главной статьёй расходов. GLM назначила за неё цену, которая у старших моделей в 12 раз выше дипсиковской, — и на длинных сессиях это перевешивает всё остальное. Даже у DeepSeek кэш не бесплатный: просто его ставки настолько малы, что «прочитать заново всю память» стоит копейки.
Что с этим делать
Три вещи, которые стоит сделать до того, как выберете модель для агентов:
- Найдите в прайсе провайдера ставку за чтение кэша (cache read / cached input). Нет такой строки — спросите напрямую. Для длинных сессий она важнее цены входа.
- Посмотрите свой профиль нагрузки: в ответе API видно, сколько токенов пришло из кэша. Если кэш-хитов больше 90%, вы платите в основном за перечитывание, а не за работу.
- Режьте память без жалости. Старые сообщения, гигантские системные инструкции и файлы «на всякий случай» перечитываются за ваши деньги каждым вызовом. Иногда дешевле начать новую сессию, чем тащить за собой трёхдневную историю.
Обе модели доступны в чате NeuralSpace, в разделе «Код» и через публичный API — прогоните свою задачу на обеих и сравните счета сами. Только не забудьте открыть разбивку: самое интересное всегда в строке cached tokens.