← Все статьи

Хитрое чтение кэша: почему GLM 5.3 в реальной работе дороже, чем кажется

Стеклянные весы: светящийся кристалл против стопки золотых монет — метафора скрытой цены нейросети

Посчитали реальные счета за агентные задачи — и увидели простую вещь. У GLM 5.3 львиная доля расходов приходится не на ответы и не на новые запросы, а на повторное чтение кэша: токены, которые модель уже и так видела в этой же работе. В нашем замере это 80–90% суммы, а внутри длинных задач — под 98%. Из-за этого одна и та же работа у DeepSeek стабильно выходит в несколько раз дешевле, хотя строчки прайса у GLM на первый взгляд вполне скромные. Разбираемся, как так получается.

Откуда в счёте берётся кэш

Каждый вызов API происходит без памяти: модель заново получает всю переписку — системную инструкцию, историю разговора, содержимое файлов. Провайдеры это понимают и кэшируют повторяющуюся часть: если начало запроса совпало с тем, что уже обрабатывалось, эти токены читаются из кэша со скидкой. В ответе API видно разбивку: сколько токенов пришло из кэша, сколько было новыми, сколько модель сгенерировала.

Звучит как чистая выгода. Но скидка — это не подарок, а тариф, у каждой модели свой. И разница между моделями бывает не в проценты, а в разы. Тут и прячется подвох.

Светящаяся катушка с лентой, которую читает луч света, — метафора повторного чтения кэша моделью

Что написано в прайсе

Публичные цены на конец августа 2026 года, доллары за миллион токенов:

МодельВходЧтение кэшаВыход
GLM 5.3$1.40$0.26 (19% от входа)$4.40
GLM 5.3 Flash$0.075$0.015 (20% от входа)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% от входа)$1.98
DeepSeek V4 Flash$0.03$0.007 (23% от входа)$0.10

Смотрите на среднюю колонку — ту, которую в прайсах обычно пролистывают. У DeepSeek V4 Pro чтение кэша стоит три процента от цены входа: скидка за повторное чтение почти тридцатикратная. У GLM 5.3 — девятнадцать процентов, скидка всего пятикратная. У Flash-версий относительная разница скромнее (примерно 20% против 23%), но в абсолюте кэш GLM Flash всё равно примерно вдвое дороже кэша DeepSeek Flash.

Замер на живой нагрузке

Мы взяли статистику реальной агентной работы за две недели августа: 13 279 обращений к API четырёх моделей — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro и DeepSeek V4 Flash. Из них собрали почти триста полноценных задач-диалогов, где модель подолгу работает над одним делом: читает код, правит файлы, держит в памяти всю историю. Типичная картина такой задачи: 97–98% входных токенов — кэш-хиты. Нового текста поступает мизер, основная масса — та самая перечитываемая память.

И вот как раскладывается счёт:

  • GLM 5.3: 80–90% суммы уходит на чтение кэша, а внутри медианной задачи-диалога — все 98%. Ответы и новые запросы — остатки.
  • DeepSeek V4 Pro: на кэш уходит около двух третей счёта (64%). Доля похожая по смыслу, но абсолютные суммы несопоставимы: ставка за чтение у DeepSeek в двенадцать раз ниже.

Теперь деньгами, по целым задачам, а не по отдельным вызовам. Медианная задача-диалог обошлась в шесть центов на GLM 5.3 Flash и в два цента на DeepSeek V4 Flash. Чтобы сравнивать честно, мы брали задачи с одинаковым объёмом сгенерированного текста: на сопоставимой нагрузке DeepSeek выходит дешевле в 3,6–5 раз. Полная GLM 5.3 против DeepSeek V4 Pro на пересекающемся классе задач — в 6–7 раз дороже. Объём проделанной работы при этом одинаковый.

Нюанс методики: это пересчёт по публичным ставкам из таблицы выше, а не распечатка чужого счёта. Для контроля мы сверили пересчёт с фактическими списаниями там, где тариф открытый, — они разошлись на 2–3%, так что оценка аккуратная.

Хотите почувствовать разницу на одном вызове? Типовой вызов агента в наших замерах — порядка 130 тысяч кэш-токенов, трёх тысяч новых входных и пары сотен на выходе. GLM 5.3 берёт за такой вызов около четырёх центов. DeepSeek V4 Pro — около полцента. Семь раз. При том что объём работы один и тот же.

Так хитрит ли GLM?

Формально — нет: все ставки опубликованы, и пересчёт по ним сходится с фактическими списаниями там, где тариф открытый. Хитрость в другом. Взгляд цепляется за цену входа и выхода, а строка «чтение кэша» выглядит технической мелочью. Для короткого разговора из двух реплик она и есть мелочь. Но в агентной работе, где память перечитывается сотни раз за задачу, именно эта строка становится главной статьёй расходов. GLM назначила за неё цену, которая у старших моделей в 12 раз выше дипсиковской, — и на длинных сессиях это перевешивает всё остальное. Даже у DeepSeek кэш не бесплатный: просто его ставки настолько малы, что «прочитать заново всю память» стоит копейки.

Что с этим делать

Три вещи, которые стоит сделать до того, как выберете модель для агентов:

  • Найдите в прайсе провайдера ставку за чтение кэша (cache read / cached input). Нет такой строки — спросите напрямую. Для длинных сессий она важнее цены входа.
  • Посмотрите свой профиль нагрузки: в ответе API видно, сколько токенов пришло из кэша. Если кэш-хитов больше 90%, вы платите в основном за перечитывание, а не за работу.
  • Режьте память без жалости. Старые сообщения, гигантские системные инструкции и файлы «на всякий случай» перечитываются за ваши деньги каждым вызовом. Иногда дешевле начать новую сессию, чем тащить за собой трёхдневную историю.

Обе модели доступны в чате NeuralSpace, в разделе «Код» и через публичный API — прогоните свою задачу на обеих и сравните счета сами. Только не забудьте открыть разбивку: самое интересное всегда в строке cached tokens.