El problema de la lectura de caché: por qué GLM 5.3 cuesta más en el trabajo real del agente
Revisamos facturas reales de trabajo de agente y vimos algo simple. Para GLM 5.3, la mayor parte del costo no son las respuestas ni las nuevas entradas, sino la relectura del caché: tokens que el modelo ya ha visto en el mismo trabajo. Según nuestras mediciones, esto representa entre el 80% y el 90% de la factura, y en tareas largas se acerca al 98%. Por eso el mismo trabajo siempre sale varias veces más barato en DeepSeek, aunque la lista de precios de GLM parezca modesta a primera vista. Así es como sucede eso.
De dónde proviene el caché de tu factura
Cada llamada a la API se realiza sin memoria: el modelo vuelve a recibir toda la conversación: instrucciones del sistema, historial de chat, contenido del archivo. Los proveedores almacenan en caché la parte repetida: si el comienzo de una solicitud coincide con algo ya procesado, esos tokens se leen del caché con un descuento. La respuesta de la API muestra el desglose: cuántos tokens provienen del caché, cuántos son nuevos y cuántos generó el modelo.
Suena a pura ganancia. Pero el descuento es una tarifa, no un regalo, y cada modelo marca la suya. La brecha entre modelos no se mide en porcentaje sino en múltiplos. Ahí es donde se esconde la trampa.

Lo que dice la lista de precios
Precios públicos a finales de agosto de 2026, dólares por millón de tokens:
| Modelo | Aporte | lectura de caché | Producción |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% de la entrada) | $4.40 |
| Flash GLM 5.3 | $0.075 | $0.015 (20% de la entrada) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3% de la entrada) | $1.98 |
| Flash DeepSeek V4 | $0.03 | $0.007 (23% de la entrada) | $0.10 |
Mire la columna del medio, la que normalmente se pasa por alto. Para DeepSeek V4 Pro, las lecturas de caché cuestan el tres por ciento del precio de entrada: un descuento de casi treinta veces por la relectura. Para GLM 5.3 es diecinueve por ciento, un descuento cinco veces mayor. Los modelos Flash están más cerca en términos relativos (alrededor del 20% frente al 23%), sin embargo, en números absolutos, las lecturas de caché de GLM Flash todavía cuestan aproximadamente el doble que las de DeepSeek Flash.
Medido en trabajo real
En agosto, tuvimos dos semanas de tráfico real de agentes: 13 279 llamadas API en cuatro modelos: GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro y DeepSeek V4 Flash. De ellos reunimos casi trescientos cuadros de diálogo de tareas completas, donde un modelo trabaja en un trabajo durante un largo período: leer código, editar archivos, mantener todo el historial en contexto. La imagen típica de una tarea de este tipo: entre el 97% y el 98% de los tokens de entrada son aciertos de caché. Sólo llega un hilo de texto genuinamente nuevo; la mayor parte es esa misma memoria releída.
Y así es como se desglosa el proyecto de ley:
- GLM 5.3:Entre el 80% y el 90% del total se destina a lecturas de caché; el 98% dentro de un cuadro de diálogo de tarea mediana. Las respuestas y los nuevos aportes son lo que sobra.
- DeepSeek V4 Pro:Alrededor de dos tercios de la factura (64%) también son caché. Una proporción similar en espíritu, pero las cantidades absolutas son incomparables, porque la tasa de lectura de DeepSeek es doce veces menor.
Ahora el dinero, por tarea completa y no por llamada. Un diálogo de tarea promedio cuesta alrededor de seis centavos en GLM 5.3 Flash y alrededor de dos centavos en DeepSeek V4 Flash. Para comparar de manera justa, comparamos tareas con el mismo volumen de texto generado: en cargas de trabajo comparables, DeepSeek resulta entre 3,6 y 5 veces más barato. Full GLM 5.3 frente a DeepSeek V4 Pro, en la clase de tareas en las que se superponen, era entre 6 y 7 veces más caro, por la misma cantidad de trabajo realizado.
Una nota metodológica: estas cifras se recalculan a partir de las tarifas públicas de la tabla anterior, no de la factura real de alguien. Como prueba de cordura, comparamos el recálculo con los cargos registrados dondequiera que la tarifa esté abierta: divergieron entre un 2% y un 3%, por lo que la estimación es sólida.
¿Quieres sentirlo en una sola llamada? Una llamada de agente típica en nuestras mediciones es de alrededor de 130 mil tokens de caché, tres mil tokens de entrada nuevos y un par de cientos de salida. GLM 5.3 cobra unos cuatro céntimos por una llamada de este tipo. DeepSeek V4 Pro: alrededor de medio centavo. Siete veces, por el mismo volumen de trabajo.
Entonces, ¿GLM está haciendo trampa?
Formalmente, no: todas las tarifas se publican y el nuevo cálculo coincide con los cargos reales dondequiera que la tarifa esté abierta. El truco está en otra parte. Llama la atención los precios de insumos y productos, mientras que la línea de "lectura de caché" parece una nota técnica a pie de página. En un chat de dos mensajes es uno. Pero en el trabajo de agente, donde la memoria se relee cientos de veces por tarea, esa línea se convierte en el principal costo. GLM le puso un precio doce veces mayor que el de DeepSeek para los modelos insignia, y en sesiones largas supera a todo lo demás. Incluso el caché de DeepSeek no es gratuito; sus tarifas son simplemente tan pequeñas que releer toda la memoria cuesta unos centavos.
¿Qué hacer al respecto?
Tres cosas que vale la pena hacer antes de elegir un modelo para agentes:
- Encuentre la tasa de lectura de caché en la lista de precios de su proveedor (lectura de caché/entrada en caché). ¿No existe tal línea? Pregunta directamente. Para sesiones largas importa más que el precio de entrada.
- Mire su propio perfil de carga: la respuesta de la API muestra cuántos tokens provienen del caché. Por encima del 90% de aciertos de caché, se paga principalmente por volver a leer, no por trabajar.
- Corta la memoria sin piedad. Los mensajes antiguos, las gigantescas instrucciones del sistema y los archivos por si acaso se vuelven a leer por su cuenta en cada llamada. A veces, una nueva sesión es más barata que un historial de tres días.
Ambos modelos están disponibles en elChat de espacio neuronal, en elCódigosección y a través de laAPI pública— ejecute su propia tarea en ambos y compare las facturas. Sólo recuerda abrir el desglose: la parte interesante siempre se encuentra en la línea de tokens en caché.