O problema da leitura cache: por que GLM 5.3 custa mais no trabalho de um agente real
Analisamos contas reais de trabalho de agente e vimos uma coisa simples. Para GLM 5.3, a maior parte do custo não são as respostas e nem as novas informações - é a releitura dos cache: tokens que o modelo já viu no mesmo trabalho. Em nossas medições isso representa 80–90% da conta, e em tarefas longas chega perto de 98%. É por isso que o mesmo trabalho sai consistentemente várias vezes mais barato em DeepSeek, embora a lista de preços de GLM pareça modesta à primeira vista. Veja como isso acontece.
De onde vem o cache da sua fatura
Cada chamada de API acontece sem memória: o modelo recebe toda a conversa novamente – instruções do sistema, histórico de chat, conteúdo do arquivo. Provedores cache a parte repetida: se o início de uma solicitação corresponder a algo já processado, esses tokens são lidos a partir do cache com desconto. A resposta da API mostra o detalhamento: quantos tokens vieram do cache, quantos eram novos, quantos o modelo gerou.
Parece puro lucro. Mas o desconto é uma taxa, não um presente, e cada modelo define o seu. A diferença entre os modelos não é medida em percentagem, mas em múltiplos. É aí que o problema se esconde.

O que diz a lista de preços
Preços públicos no final de agosto de 2026, dólares por milhão de tokens:
| Modelo | Entrada | Leitura de cache | Saída |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% da entrada) | $4.40 |
| GLM 5.3 Flash | $0.075 | $0.015 (20% da entrada) | $0.25 |
| DeepSeek V4 Pró | $0.66 | $0.022 (3% da entrada) | $1.98 |
| DeepSeek Flash V4 | $0.03 | $0.007 (23% da entrada) | $0.10 |
Olhe para a coluna do meio – aquela que geralmente passa rapidamente. Para DeepSeek V4 Pro, cache as leituras custam três por cento do preço de entrada: um desconto de quase trinta vezes para releitura. Para GLM 5.3 é dezenove por cento, um desconto cinco vezes maior. Os modelos Flash estão mais próximos em termos relativos (cerca de 20% versus 23%), mas em números absolutos as leituras de GLM Flash cache ainda custam aproximadamente o dobro das leituras de DeepSeek Flash.
Medido em trabalho real
Tivemos duas semanas de tráfego real de agentes em agosto: 13.279 chamadas de API em quatro modelos — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro e DeepSeek V4 Flash. Desses, reunimos quase trezentos diálogos completos de tarefas, onde um modelo trabalha em um trabalho por um longo período: lendo código, editando arquivos, mantendo todo o histórico em contexto. A imagem típica de tal tarefa: 97–98% dos tokens de entrada são cache acertos. Apenas chega uma pequena quantidade de texto genuinamente novo; a maior parte é a mesma memória de releitura.
E aqui está como a conta se divide:
- GLM 5.3: 80–90% do total vai para cache leituras – 98% dentro de uma caixa de diálogo de tarefa mediana. Respostas e novas contribuições são as sobras.
- DeepSeek V4 Pró: cerca de dois terços da conta (64%) também é cache. Uma participação semelhante em espírito, mas os valores absolutos são incomparáveis, porque a taxa de leitura de DeepSeek é doze vezes menor.
Agora, o dinheiro, por tarefa completa e não por chamada. Uma caixa de diálogo de tarefa média custa cerca de seis centavos no GLM 5.3 Flash e cerca de dois centavos no DeepSeek V4 Flash. Para comparar de forma justa, combinamos tarefas com o mesmo volume de texto gerado: em cargas de trabalho comparáveis, DeepSeek sai 3,6–5 vezes mais barato. Full GLM 5.3 contra DeepSeek V4 Pro, na classe de tarefas em que se sobrepõem, era 6–7 vezes mais caro - para a mesma quantidade de trabalho realizado.
Uma nota metodológica: esses números são recalculados a partir das taxas públicas da tabela acima, e não da fatura real de alguém. Como uma verificação de sanidade, comparámos o recálculo com os encargos registados onde quer que a tarifa esteja aberta – eles divergiram entre 2–3%, pelo que a estimativa é sólida.
Quer sentir isso em uma única ligação? Uma chamada típica de agente em nossas medições gira em torno de 130 mil cache tokens, três mil novos tokens de entrada e algumas centenas de tokens de saída. GLM 5.3 cobra cerca de quatro centavos por essa ligação. DeepSeek V4 Pro — cerca de meio centavo. Sete vezes, para o mesmo volume de trabalho.
Então GLM está trapaceando?
Formalmente, não: todas as tarifas são publicadas e o recálculo corresponde aos encargos reais onde quer que a tarifa esteja aberta. O truque está em outro lugar. O olhar capta os preços de insumos e produtos, enquanto a linha “cache lida” parece uma nota de rodapé técnica. Em um bate-papo de duas mensagens, é uma só. Mas no trabalho do agente, onde a memória é relida centenas de vezes por tarefa, essa linha se torna o principal item de custo. O preço do GLM é doze vezes maior do que o do DeepSeek para os modelos principais – e em sessões longas ele supera todo o resto. Mesmo o cache de DeepSeek não é gratuito; suas taxas são tão pequenas que reler toda a memória custa alguns centavos.
O que fazer sobre isso
Três coisas que vale a pena fazer antes de escolher um modelo para agentes:
- Encontre a taxa de leitura cache na lista de preços do seu provedor (entrada cache leitura / cached). Não existe essa linha? Pergunte diretamente. Para sessões longas, isso importa mais do que o preço de entrada.
- Observe seu próprio perfil de carregamento: a resposta da API mostra quantos tokens vieram do cache. Acima de 90% cache acertos, você está pagando principalmente pela releitura, não pelo trabalho.
- Corte a memória impiedosamente. Mensagens antigas, instruções gigantes do sistema e arquivos para o caso de serem relidos às suas custas em cada chamada. Às vezes, uma nova sessão é mais barata que um histórico de três dias.
Ambos os modelos estão disponíveis no NeuralSpace bate-papo, no Código seção e através do API pública – execute sua própria tarefa em ambos e compare as contas. Apenas lembre-se de abrir o detalhamento: a parte interessante sempre fica na linha cached-tokens.