← Todos os artigos

O problema da leitura cache: por que GLM 5.3 custa mais no trabalho de um agente real

Balanças de vidro: um cristal brilhante contra uma pilha de moedas de ouro — uma metáfora para o preço oculto de um modelo de IA

Analisamos contas reais de trabalho de agente e vimos uma coisa simples. Para GLM 5.3, a maior parte do custo não são as respostas e nem as novas informações - é a releitura dos cache: tokens que o modelo já viu no mesmo trabalho. Em nossas medições isso representa 80–90% da conta, e em tarefas longas chega perto de 98%. É por isso que o mesmo trabalho sai consistentemente várias vezes mais barato em DeepSeek, embora a lista de preços de GLM pareça modesta à primeira vista. Veja como isso acontece.

De onde vem o cache da sua fatura

Cada chamada de API acontece sem memória: o modelo recebe toda a conversa novamente – instruções do sistema, histórico de chat, conteúdo do arquivo. Provedores cache a parte repetida: se o início de uma solicitação corresponder a algo já processado, esses tokens são lidos a partir do cache com desconto. A resposta da API mostra o detalhamento: quantos tokens vieram do cache, quantos eram novos, quantos o modelo gerou.

Parece puro lucro. Mas o desconto é uma taxa, não um presente, e cada modelo define o seu. A diferença entre os modelos não é medida em percentagem, mas em múltiplos. É aí que o problema se esconde.

Um carretel de fita brilhante lido por um feixe de luz - uma metáfora para uma modelo relendo seu cache

O que diz a lista de preços

Preços públicos no final de agosto de 2026, dólares por milhão de tokens:

ModeloEntradaLeitura de cacheSaída
GLM 5.3$1.40$0.26 (19% da entrada)$4.40
GLM 5.3 Flash$0.075$0.015 (20% da entrada)$0.25
DeepSeek V4 Pró$0.66$0.022 (3% da entrada)$1.98
DeepSeek Flash V4$0.03$0.007 (23% da entrada)$0.10

Olhe para a coluna do meio – aquela que geralmente passa rapidamente. Para DeepSeek V4 Pro, cache as leituras custam três por cento do preço de entrada: um desconto de quase trinta vezes para releitura. Para GLM 5.3 é dezenove por cento, um desconto cinco vezes maior. Os modelos Flash estão mais próximos em termos relativos (cerca de 20% versus 23%), mas em números absolutos as leituras de GLM Flash cache ainda custam aproximadamente o dobro das leituras de DeepSeek Flash.

Medido em trabalho real

Tivemos duas semanas de tráfego real de agentes em agosto: 13.279 chamadas de API em quatro modelos — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro e DeepSeek V4 Flash. Desses, reunimos quase trezentos diálogos completos de tarefas, onde um modelo trabalha em um trabalho por um longo período: lendo código, editando arquivos, mantendo todo o histórico em contexto. A imagem típica de tal tarefa: 97–98% dos tokens de entrada são cache acertos. Apenas chega uma pequena quantidade de texto genuinamente novo; a maior parte é a mesma memória de releitura.

E aqui está como a conta se divide:

  • GLM 5.3: 80–90% do total vai para cache leituras – 98% dentro de uma caixa de diálogo de tarefa mediana. Respostas e novas contribuições são as sobras.
  • DeepSeek V4 Pró: cerca de dois terços da conta (64%) também é cache. Uma participação semelhante em espírito, mas os valores absolutos são incomparáveis, porque a taxa de leitura de DeepSeek é doze vezes menor.

Agora, o dinheiro, por tarefa completa e não por chamada. Uma caixa de diálogo de tarefa média custa cerca de seis centavos no GLM 5.3 Flash e cerca de dois centavos no DeepSeek V4 Flash. Para comparar de forma justa, combinamos tarefas com o mesmo volume de texto gerado: em cargas de trabalho comparáveis, DeepSeek sai 3,6–5 vezes mais barato. Full GLM 5.3 contra DeepSeek V4 Pro, na classe de tarefas em que se sobrepõem, era 6–7 vezes mais caro - para a mesma quantidade de trabalho realizado.

Uma nota metodológica: esses números são recalculados a partir das taxas públicas da tabela acima, e não da fatura real de alguém. Como uma verificação de sanidade, comparámos o recálculo com os encargos registados onde quer que a tarifa esteja aberta – eles divergiram entre 2–3%, pelo que a estimativa é sólida.

Quer sentir isso em uma única ligação? Uma chamada típica de agente em nossas medições gira em torno de 130 mil cache tokens, três mil novos tokens de entrada e algumas centenas de tokens de saída. GLM 5.3 cobra cerca de quatro centavos por essa ligação. DeepSeek V4 Pro — cerca de meio centavo. Sete vezes, para o mesmo volume de trabalho.

Então GLM está trapaceando?

Formalmente, não: todas as tarifas são publicadas e o recálculo corresponde aos encargos reais onde quer que a tarifa esteja aberta. O truque está em outro lugar. O olhar capta os preços de insumos e produtos, enquanto a linha “cache lida” parece uma nota de rodapé técnica. Em um bate-papo de duas mensagens, é uma só. Mas no trabalho do agente, onde a memória é relida centenas de vezes por tarefa, essa linha se torna o principal item de custo. O preço do GLM é doze vezes maior do que o do DeepSeek para os modelos principais – e em sessões longas ele supera todo o resto. Mesmo o cache de DeepSeek não é gratuito; suas taxas são tão pequenas que reler toda a memória custa alguns centavos.

O que fazer sobre isso

Três coisas que vale a pena fazer antes de escolher um modelo para agentes:

  • Encontre a taxa de leitura cache na lista de preços do seu provedor (entrada cache leitura / cached). Não existe essa linha? Pergunte diretamente. Para sessões longas, isso importa mais do que o preço de entrada.
  • Observe seu próprio perfil de carregamento: a resposta da API mostra quantos tokens vieram do cache. Acima de 90% cache acertos, você está pagando principalmente pela releitura, não pelo trabalho.
  • Corte a memória impiedosamente. Mensagens antigas, instruções gigantes do sistema e arquivos para o caso de serem relidos às suas custas em cada chamada. Às vezes, uma nova sessão é mais barata que um histórico de três dias.

Ambos os modelos estão disponíveis no NeuralSpace bate-papo, no Código seção e através do API pública – execute sua própria tarefa em ambos e compare as contas. Apenas lembre-se de abrir o detalhamento: a parte interessante sempre fica na linha cached-tokens.