Problem z odczytem pamięci podręcznej: dlaczego GLM 5.3 kosztuje więcej w pracy prawdziwego agenta
Przejrzeliśmy prawdziwe rachunki za pracę agenta i zobaczyliśmy prostą rzecz. W przypadku GLM 5.3 lwią część kosztów nie stanowią odpowiedzi ani nowe dane wejściowe — polega na ponownym odczytaniu pamięci podręcznej: tokenów, które model widział już w ramach tego samego zadania. W naszych pomiarach stanowi to 80–90% rachunku, a przy długich zadaniach zbliża się do 98%. Dlatego ta sama praca konsekwentnie wychodzi na DeepSeek kilkukrotnie taniej, mimo że cennik GLM na pierwszy rzut oka wygląda skromnie. Oto jak to się dzieje.
Skąd pochodzi pamięć podręczna na rachunku
Każde wywołanie API odbywa się bez pamięci: model ponownie odbiera całą rozmowę — instrukcje systemowe, historię rozmów, zawartość pliku. Dostawcy buforują powtarzaną część: jeśli początek żądania pasuje do czegoś już przetworzonego, tokeny te są odczytywane z pamięci podręcznej ze zniżką. Odpowiedź API pokazuje podział: ile tokenów pochodziło z pamięci podręcznej, ile było nowych, ile wygenerował model.
Brzmi jak czysty zysk. Ale zniżka jest stawką, a nie prezentem, a każdy model ustala własną. Różnica między modelami jest mierzona nie w procentach, ale w wielokrotnościach. To właśnie tam kryje się haczyk.

Co mówi cennik
Ceny publiczne na koniec sierpnia 2026 r., dolary za milion tokenów:
| Model | Wejście | Pamięć podręczna odczytana | Wyjście |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% danych wejściowych) | $4.40 |
| Flash w GLM 5.3 | $0.075 | $0.015 (20% wkładu) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3% wejścia) | $1.98 |
| Flash DeepSeek V4 | $0.03 | $0.007 (23% wkładu) | $0.10 |
Spójrz na środkową kolumnę – tę, którą zwykle omijałeś. W przypadku DeepSeek V4 Pro odczyty pamięci podręcznej kosztują trzy procent ceny wejściowej: prawie trzydziestokrotna zniżka za ponowne odczytanie. W przypadku GLM 5.3 jest to dziewiętnaście procent, czyli pięciokrotna zniżka. Modele Flash są do siebie zbliżone w ujęciu względnym (około 20% w porównaniu do 23%), jednak w liczbach bezwzględnych odczyty pamięci podręcznej GLM Flash nadal kosztują mniej więcej dwa razy więcej niż modele DeepSeek Flash.
Mierzone na podstawie rzeczywistej pracy
W sierpniu przeprowadziliśmy dwa tygodnie rzeczywistego ruchu agentów: 13 279 wywołań API w czterech modelach — GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro i DeepSeek V4 Flash. Z nich zebraliśmy prawie trzysta pełnych okien dialogowych zadań, w których model pracuje nad jednym zadaniem przez dłuższy czas: czytanie kodu, edytowanie plików, utrzymywanie całej historii w kontekście. Typowy obraz takiego zadania: 97–98% tokenów wejściowych to trafienia w pamięci podręcznej. Pojawia się jedynie strużka naprawdę nowego tekstu; większość to ta sama pamięć ponownego odczytu.
A oto jak rozkłada się projekt ustawy:
- GLM 5.3:80–90% całości trafia do odczytów z pamięci podręcznej — 98% w środkowym oknie dialogowym zadania. Odpowiedzi i świeże uwagi to pozostałość.
- DeepSeek V4 Pro:około dwie trzecie rachunku (64%) to także pamięć podręczna. Podobny udział duchowy, ale kwoty bezwzględne są nieporównywalne, bo współczynnik odczytu DeepSeek jest dwunastokrotnie niższy.
Teraz pieniądze za całe zadanie, a nie za rozmowę. Średni koszt okna dialogowego zadania wynosi około sześciu centów w przypadku GLM 5.3 Flash i około dwóch centów w przypadku DeepSeek V4 Flash. Aby dokonać uczciwego porównania, dopasowaliśmy zadania o tej samej objętości wygenerowanego tekstu: przy porównywalnych obciążeniach DeepSeek wychodzi 3,6–5 razy taniej. Pełny GLM 5.3 w porównaniu z DeepSeek V4 Pro w klasie zadań, w których się one pokrywają, był 6–7 razy droższy — przy tej samej ilości wykonanej pracy.
Uwaga metodologiczna: liczby te zostały przeliczone na podstawie stawek publicznych podanych w powyższej tabeli, a nie czyjejś faktycznej faktury. Dla pewności porównaliśmy przeliczenie z opłatami zarejestrowanymi wszędzie tam, gdzie taryfa jest otwarta – różniły się one o 2–3%, więc szacunki są rozsądne.
Chcesz to poczuć podczas jednej rozmowy? Typowe wywołanie agenta w naszych pomiarach to około 130 tysięcy tokenów pamięci podręcznej, trzy tysiące nowych tokenów wejściowych i kilkaset wyników. GLM 5.3 pobiera opłatę w wysokości około czterech centów za takie połączenie. DeepSeek V4 Pro — około pół centa. Siedem razy, za tę samą ilość pracy.
Czy zatem GLM oszukuje?
Formalnie nie: wszystkie stawki są publikowane, a przeliczenie uwzględnia rzeczywiste opłaty wszędzie tam, gdzie taryfa jest otwarta. Sztuka leży gdzie indziej. Oko przyciąga ceny wejściowe i wyjściowe, natomiast linia „odczyt pamięci podręcznej” wygląda jak przypis techniczny. W czacie składającym się z dwóch wiadomości jest to jedna. Jednak w pracy agenta, gdzie pamięć jest ponownie odczytywana setki razy w ramach każdego zadania, ten wiersz staje się główną pozycją kosztową. GLM wycenił go dwanaście razy wyżej niż DeepSeek w przypadku flagowych modeli – a przy długich sesjach przewyższa wszystko inne. Nawet pamięć podręczna DeepSeek nie jest darmowa; jego stawki są po prostu tak małe, że ponowne odczytanie całej pamięci kosztuje grosze.
Co z tym zrobić
Trzy rzeczy, które warto zrobić zanim wybierzesz model dla agentów:
- Znajdź współczynnik odczytu pamięci podręcznej w cenniku swojego dostawcy (odczyt pamięci podręcznej / dane wejściowe z pamięci podręcznej). Nie ma takiej linii? Zapytaj bezpośrednio. W przypadku długich sesji ma to większe znaczenie niż cena wejściowa.
- Spójrz na swój własny profil obciążenia: odpowiedź API pokazuje, ile tokenów pochodzi z pamięci podręcznej. Powyżej 90% trafień w pamięci podręcznej płacisz głównie za ponowne przeczytanie, a nie za pracę.
- Tnij pamięć bezlitośnie. Stare wiadomości, ogromne instrukcje systemowe i pliki na wszelki wypadek są ponownie odczytywane na Twój koszt podczas każdej rozmowy. Czasami świeża sesja jest tańsza niż trzydniowa historia.
Obydwa modele dostępne są w wersjiCzat NeuralSpace, wKodsekcję i przezpubliczne API— uruchom własne zadanie na obu i porównaj rachunki. Pamiętaj tylko, aby otworzyć podział: interesująca część zawsze znajduje się w wierszu buforowanych tokenów.