← Все статьи

Το cache-read catch: γιατί το GLM 5.3 κοστίζει περισσότερο σε πραγματική εργασία αντιπροσώπου

Το cache-read catch: γιατί το GLM 5.3 κοστίζει περισσότερο σε πραγματική εργασία αντιπροσώπου

Περάσαμε πραγματικούς λογαριασμούς για εργασία αντιπροσώπου και είδαμε ένα απλό πράγμα. Για το GLM 5.3, η μερίδα του λέοντος στο κόστος δεν είναι οι απαντήσεις και όχι η νέα εισαγωγή — είναι η εκ νέου ανάγνωση της κρυφής μνήμης: διακριτικά που έχει ήδη δει το μοντέλο στην ίδια εργασία. Στις μετρήσεις μας αυτό είναι το 80–90% του λογαριασμού και στις μεγάλες εργασίες πλησιάζει το 98%. Αυτός είναι ο λόγος για τον οποίο η ίδια δουλειά βγαίνει σταθερά πολλές φορές φθηνότερη στο DeepSeek, παρόλο που ο τιμοκατάλογος της GLM φαίνεται μέτριος με την πρώτη ματιά. Να πώς συμβαίνει αυτό.

Από πού προέρχεται η κρυφή μνήμη στον λογαριασμό σας

Κάθε κλήση API πραγματοποιείται χωρίς μνήμη: το μοντέλο λαμβάνει ξανά ολόκληρη τη συνομιλία — οδηγίες συστήματος, ιστορικό συνομιλιών, περιεχόμενα αρχείων. Οι πάροχοι αποθηκεύουν προσωρινά το επαναλαμβανόμενο μέρος: εάν η αρχή ενός αιτήματος ταιριάζει με κάτι που έχει ήδη υποβληθεί σε επεξεργασία, αυτά τα διακριτικά διαβάζονται από την κρυφή μνήμη με έκπτωση. Η απόκριση API δείχνει την ανάλυση: πόσα διακριτικά προήλθαν από τη μνήμη cache, πόσα ήταν νέα, πόσα δημιούργησε το μοντέλο.

Ακούγεται καθαρό κέρδος. Αλλά η έκπτωση είναι τιμή, όχι δώρο, και κάθε μοντέλο ορίζει τη δική του. Το χάσμα μεταξύ των μοντέλων μετριέται όχι σε ποσοστά αλλά σε πολλαπλάσια. Εκεί κρύβονται τα αλιεύματα.

A glowing spool of tape read by a beam of light — a metaphor for a model re-reading its cache

Τι λέει ο τιμοκατάλογος

Δημόσιες τιμές από τα τέλη Αυγούστου 2026, δολάρια ανά εκατομμύριο μάρκες:

ΜοντέλοΕισαγωγήΑνάγνωση κρυφής μνήμηςΠαραγωγή
GLM 5.3$1.40$0.26 (19% των εισροών)$4.40
GLM 5.3 Flash$0.075$0.015 (20% των εισροών)$0.25
DeepSeek V4 Pro$0.66$0.022 (3% των εισροών)$1.98
Flash DeepSeek V4$0.03$0.007 (23% της εισροής)$0.10

Κοιτάξτε τη μεσαία στήλη - αυτή που συνήθως ξεπερνιέται. Για το DeepSeek V4 Pro, οι αναγνώσεις προσωρινής μνήμης κοστίζουν το τρία τοις εκατό της τιμής εισόδου: σχεδόν τριάντα φορές έκπτωση για εκ νέου ανάγνωση. Για το GLM 5.3 είναι δεκαεννέα τοις εκατό, πενταπλάσια έκπτωση. Τα μοντέλα Flash είναι πιο κοντά σε σχετικούς όρους (περίπου 20% έναντι 23%), ωστόσο σε απόλυτους αριθμούς οι αναγνώσεις cache του GLM Flash εξακολουθούν να κοστίζουν περίπου το διπλάσιο από το DeepSeek Flash.

Μετρημένο σε πραγματική εργασία

Πήραμε δύο εβδομάδες πραγματικής επισκεψιμότητας αντιπροσώπων τον Αύγουστο: 13.279 κλήσεις API σε τέσσερα μοντέλα — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro και DeepSeek V4 Flash. Από αυτά συγκεντρώσαμε σχεδόν τριακόσιους πλήρεις διαλόγους εργασιών, όπου ένα μοντέλο λειτουργεί σε μία εργασία για μεγάλο χρονικό διάστημα: ανάγνωση κώδικα, επεξεργασία αρχείων, διατήρηση ολόκληρης της ιστορίας στο πλαίσιο. Η τυπική εικόνα μιας τέτοιας εργασίας: 97–98% των διακριτικών εισόδου είναι επισκέψεις προσωρινής μνήμης. Μόνο μια στάλα γνήσιου νέου κειμένου μπαίνει. ο κύριος όγκος είναι η ίδια μνήμη επανάληψης.

Και ιδού πώς αναλύεται ο λογαριασμός:

  • GLM 5.3:Το 80–90% του συνόλου πηγαίνει σε αναγνώσεις κρυφής μνήμης — 98% μέσα σε ένα διάλογο διάμεσων εργασιών. Οι απαντήσεις και η νέα εισαγωγή είναι τα υπολείμματα.
  • DeepSeek V4 Pro:περίπου τα δύο τρίτα του λογαριασμού (64%) είναι επίσης προσωρινή μνήμη. Παρόμοιο μερίδιο σε πνεύμα, αλλά τα απόλυτα ποσά είναι ασύγκριτα, επειδή το ποσοστό ανάγνωσης του DeepSeek είναι δώδεκα φορές χαμηλότερο.

Τώρα τα χρήματα, ανά ολόκληρη εργασία και όχι ανά κλήση. Ένας διάλογος εργασίας διάμεσου κόστους κοστίζει περίπου έξι σεντς στο GLM 5.3 Flash και περίπου δύο σεντ στο DeepSeek V4 Flash. Για δίκαιη σύγκριση, ταιριάξαμε εργασίες με τον ίδιο όγκο κειμένου που δημιουργήθηκε: σε συγκρίσιμους φόρτους εργασίας, το DeepSeek βγαίνει 3,6–5 φορές φθηνότερο. Το Full GLM 5.3 έναντι του DeepSeek V4 Pro, στην κατηγορία εργασιών όπου επικαλύπτονται, ήταν 6-7 φορές πιο ακριβό — για τον ίδιο όγκο εργασίας.

Σημείωση μεθοδολογίας: αυτά τα στοιχεία υπολογίζονται εκ νέου από τις δημόσιες τιμές στον παραπάνω πίνακα και όχι από το πραγματικό τιμολόγιο κάποιου. Ως έλεγχος λογικής, συγκρίναμε τον επανυπολογισμό με τις καταγεγραμμένες χρεώσεις οπουδήποτε είναι ανοιχτό το τιμολόγιο — απέκλιναν κατά 2–3%, επομένως η εκτίμηση είναι σωστή.

Θέλετε να το νιώσετε με μια μόνο κλήση; Μια τυπική κλήση πράκτορα στις μετρήσεις μας είναι περίπου 130 χιλιάδες διακριτικά κρυφής μνήμης, τρεις χιλιάδες νέα διακριτικά εισόδου και μερικές εκατοντάδες έξοδοι. Το GLM 5.3 χρεώνει περίπου τέσσερα σεντς για μια τέτοια κλήση. DeepSeek V4 Pro — περίπου μισό σεντ. Επτά φορές, για τον ίδιο όγκο εργασίας.

Είναι λοιπόν το GLM απάτη;

Επισήμως, όχι: όλες οι τιμές δημοσιεύονται και ο επανυπολογισμός αντιστοιχεί στις πραγματικές χρεώσεις όπου κι αν είναι ανοιχτό το τιμολόγιο. Το κόλπο βρίσκεται αλλού. Το μάτι πιάνει τις τιμές εισόδου και εξόδου, ενώ η γραμμή "cache read" μοιάζει με τεχνική υποσημείωση. Σε μια συνομιλία δύο μηνυμάτων είναι ένα. Αλλά στην εργασία με πράκτορες, όπου η μνήμη διαβάζεται ξανά εκατοντάδες φορές ανά εργασία, αυτή η γραμμή γίνεται το κύριο στοιχείο κόστους. Η GLM το κόμισε δώδεκα φορές υψηλότερα από ό,τι το DeepSeek για τα κορυφαία μοντέλα — και σε μεγάλες περιόδους λειτουργίας υπερτερεί όλων των άλλων. Ακόμη και η κρυφή μνήμη του DeepSeek δεν είναι δωρεάν. Τα ποσοστά του είναι απλά τόσο μικρά που η εκ νέου ανάγνωση ολόκληρης της μνήμης κοστίζει δεκάρες.

Τι να κάνετε για αυτό

Τρία πράγματα που αξίζει να κάνετε πριν επιλέξετε ένα μοντέλο για πράκτορες:

  • Βρείτε το ποσοστό ανάγνωσης προσωρινής μνήμης στον τιμοκατάλογο του παρόχου σας (ανάγνωση προσωρινής μνήμης / είσοδος προσωρινής αποθήκευσης). Δεν υπάρχει τέτοια γραμμή; Ρωτήστε απευθείας. Για μεγάλες συνεδρίες έχει μεγαλύτερη σημασία από την τιμή εισόδου.
  • Δείτε το δικό σας προφίλ φόρτωσης: η απόκριση API δείχνει πόσα διακριτικά προήλθαν από την κρυφή μνήμη. Πάνω από το 90% των επισκέψεων στην προσωρινή μνήμη, πληρώνετε κυρίως για επανάγνωση, όχι για εργασία.
  • Κόψτε τη μνήμη αδίστακτα. Παλιά μηνύματα, γιγάντιες οδηγίες συστήματος και αρχεία για κάθε περίπτωση διαβάζονται ξανά με δικά σας έξοδα σε κάθε κλήση. Μερικές φορές μια νέα συνεδρία είναι φθηνότερη από ένα ιστορικό τριών ημερών.

Και τα δύο μοντέλα είναι διαθέσιμα στοΣυνομιλία NeuralSpace, στοΚώδικαςτμήματος και μέσω τουδημόσιο API— εκτελέστε τη δική σας εργασία και στα δύο και συγκρίνετε τους λογαριασμούς. Απλώς θυμηθείτε να ανοίξετε την ανάλυση: το ενδιαφέρον μέρος μένει πάντα στη γραμμή cache-tokens.