Le problème de la lecture du cache : pourquoi GLM 5.3 coûte plus cher en travail d'agent réel
Nous avons examiné de vraies factures pour le travail d'agent et avons vu une chose simple. Pour GLM 5.3, la part du lion du coût ne vient pas des réponses ni de la nouvelle entrée — il s'agit de la relecture du cache : des jetons que le modèle a déjà vus dans le même travail. Dans nos mesures, cela représente 80 à 90 % de la facture, et pour les tâches longues, cela approche 98 %. C'est pourquoi le même travail revient systématiquement plusieurs fois moins cher sur DeepSeek, même si la liste de prix de GLM semble modeste à première vue. Voici comment cela se passe.
D'où vient le cache de votre facture
Chaque appel d'API s'effectue sans mémoire : le modèle reçoit à nouveau l'intégralité de la conversation : instructions système, historique des discussions, contenu des fichiers. Les fournisseurs mettent en cache la partie répétée : si le début d'une requête correspond à quelque chose déjà traité, ces jetons sont lus à partir du cache avec une réduction. La réponse de l'API montre la répartition : combien de jetons proviennent du cache, combien étaient nouveaux, combien le modèle a généré.
Cela ressemble à du pur profit. Mais la remise est un tarif, pas un cadeau, et chaque modèle définit le sien. L’écart entre les modèles ne se mesure pas en pourcentage mais en multiples. C’est là que se cache le piège.

Ce que dit la liste de prix
Prix publics à fin août 2026, en dollars par million de jetons :
| Modèle | Saisir | Lecture du cache | Sortir |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% des apports) | $4.40 |
| GLM 5.3 Flash | $0.075 | $0.015 (20% de l'entrée) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3% de l'entrée) | $1.98 |
| Flash DeepSeek V4 | $0.03 | $0.007 (23% des entrées) | $0.10 |
Regardez la colonne du milieu – celle habituellement survolée. Pour DeepSeek V4 Pro, les lectures de cache coûtent trois pour cent du prix d’entrée : une remise presque trente fois supérieure pour la relecture. Pour GLM 5.3, c'est dix-neuf pour cent, soit une remise quintuplée. Les modèles Flash sont plus proches en termes relatifs (environ 20 % contre 23 %), mais en chiffres absolus, les lectures du cache GLM Flash coûtent toujours environ deux fois plus que celles de DeepSeek Flash.
Mesuré sur du travail réel
Nous avons enregistré deux semaines de trafic d'agents réels en août : 13 279 appels API sur quatre modèles : GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro et DeepSeek V4 Flash. À partir de ceux-ci, nous avons assemblé près de trois cents boîtes de dialogue de tâches complètes, dans lesquelles un modèle travaille sur une tâche pendant une longue période : lire du code, éditer des fichiers, conserver tout l'historique dans son contexte. L'image typique d'une telle tâche : 97 à 98 % des jetons d'entrée sont des accès au cache. Seul un filet de texte véritablement nouveau arrive ; l'essentiel est cette même mémoire relue.
Et voici comment se décompose la facture :
- GLM 5.3 :80 à 90 % du total est destiné aux lectures du cache – 98 % dans une boîte de dialogue de tâche médiane. Les réponses et les nouvelles contributions sont les restes.
- DeepSeek V4 Pro :environ les deux tiers de la facture (64 %) sont également du cache. Une part similaire dans l'esprit, mais les montants absolus sont incomparables, car le taux de lecture de DeepSeek est douze fois inférieur.
Maintenant, l'argent, par tâche entière plutôt que par appel. Une boîte de dialogue de tâche médiane coûte environ six cents sur GLM 5.3 Flash et environ deux cents sur DeepSeek V4 Flash. Pour comparer équitablement, nous avons comparé les tâches avec le même volume de texte généré : sur des charges de travail comparables, DeepSeek s'avère 3,6 à 5 fois moins cher. Le GLM 5.3 complet par rapport à DeepSeek V4 Pro, pour la classe de tâches où elles se chevauchent, était 6 à 7 fois plus cher — pour la même quantité de travail effectué.
Une note méthodologique : ces chiffres sont recalculés à partir des tarifs publics du tableau ci-dessus, et non de la facture réelle de quelqu'un. Pour vérifier la cohérence, nous avons comparé le nouveau calcul avec les frais enregistrés partout où le tarif est ouvert : ils ont divergé de 2 à 3 %, l'estimation est donc solide.
Voulez-vous le ressentir lors d'un seul appel ? Un appel d'agent typique dans nos mesures est d'environ 130 000 jetons de cache, trois mille nouveaux jetons d'entrée et quelques centaines de sorties. GLM 5.3 facture environ quatre centimes pour un tel appel. DeepSeek V4 Pro – environ un demi-cent. Sept fois, pour le même volume de travail.
Alors, GLM triche-t-il ?
Formellement, non : tous les tarifs sont publiés et le recalcul correspond aux tarifs réels partout où le tarif est ouvert. L’astuce est ailleurs. L'œil attire l'attention sur les prix des intrants et des extrants, tandis que la ligne « lecture du cache » ressemble à une note technique de bas de page. Dans une conversation à deux messages, il n'en reste qu'un. Mais dans le travail des agents, où la mémoire est relue des centaines de fois par tâche, cette ligne devient le principal poste de coût. GLM l'a proposé douze fois plus cher que DeepSeek pour les modèles phares – et sur les longues sessions, il l'emporte sur tout le reste. Même le cache de DeepSeek n'est pas gratuit ; ses tarifs sont tout simplement si faibles que la relecture de la mémoire entière coûte quelques centimes.
Que faire à ce sujet
Trois choses à faire avant de choisir un modèle pour les agents :
- Recherchez le tarif de lecture du cache dans la liste de prix de votre fournisseur (lecture du cache / entrée en cache). Il n'y a pas une telle ligne ? Demandez directement. Pour les longues sessions, cela compte plus que le prix des intrants.
- Regardez votre propre profil de chargement : la réponse de l'API indique combien de jetons proviennent du cache. Au-dessus de 90 % d’accès au cache, vous payez principalement pour la relecture, pas pour le travail.
- Coupez la mémoire sans pitié. Les anciens messages, les instructions système géantes et les fichiers au cas où sont relus à vos frais à chaque appel. Parfois, une nouvelle séance coûte moins cher qu’un historique de trois jours.
Les deux modèles sont disponibles dans leChat NeuralSpace, dans leCodesection et à travers laAPI publique- exécutez votre propre tâche sur les deux et comparez les factures. N'oubliez pas d'ouvrir la répartition : la partie intéressante réside toujours dans la ligne des jetons en cache.