המלכוד לקריאת המטמון: מדוע GLM 5.3 עולה יותר בעבודת סוכן אמיתית
עברנו על חשבונות אמיתיים לעבודת סוכנים וראינו דבר פשוט. עבור GLM 5.3, חלק הארי בעלות הוא לא התשובות ולא הקלט הטרי - הוא קריאה מחדש של המטמון: אסימונים שהדגם כבר ראה באותה עבודה. במידות שלנו זה 80–90% מהחשבון, ובתוך משימות ארוכות זה מתקרב ל-98%. לכן אותה עבודה יוצאת בעקביות זולה פי כמה ב-DeepSeek, למרות שהמחירון של GLM נראה צנוע במבט ראשון. הנה איך זה קורה.
מאיפה מגיע המטמון בחשבון שלך
כל קריאת API מתרחשת ללא זיכרון: הדגם מקבל שוב את כל השיחה - הוראות מערכת, היסטוריית צ'אט, תוכן הקובץ. ספקים מאחסנים את החלק החוזר: אם תחילתה של בקשה תואמת למשהו שכבר מעובד, האסימונים האלה נקראים מהמטמון בהנחה. תגובת ה-API מציגה את הפירוט: כמה אסימונים הגיעו מהמטמון, כמה היו חדשים, כמה המודל יצר.
נשמע כמו רווח טהור. אבל ההנחה היא תעריף, לא מתנה, וכל דגם קובע את שלו. הפער בין המודלים נמדד לא באחוזים אלא בכפולות. שם מסתתר המלכוד.

מה אומר המחירון
מחירים ציבוריים נכון לסוף אוגוסט 2026, דולר למיליון אסימונים:
| דֶגֶם | קֶלֶט | קריאת מטמון | תְפוּקָה |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (19% מהקלט) | $4.40 |
| GLM 5.3 פלאש | $0.075 | $0.015 (20% מהקלט) | $0.25 |
| DeepSeek V4 Pro | $0.66 | $0.022 (3% מהקלט) | $1.98 |
| DeepSeek V4 Flash | $0.03 | $0.007 (23% מהקלט) | $0.10 |
תסתכל על העמודה האמצעית - זו שבדרך כלל חלפה על פניה. עבור DeepSeek V4 Pro, קריאות מטמון עולות שלושה אחוזים ממחיר הקלט: הנחה כמעט פי שלושים לקריאה חוזרת. עבור GLM 5.3 זה תשעה עשר אחוז, הנחה של פי חמישה. דגמי הפלאש קרובים יותר במונחים יחסיים (כ-20% לעומת 23%), אך במספרים מוחלטים קריאת מטמון GLM Flash עדיין עולה בערך פי שניים מזו של DeepSeek Flash.
נמדד על עבודה אמיתית
לקחנו שבועיים של תעבורת סוכנים אמיתית באוגוסט: 13,279 קריאות API על פני ארבעה דגמים - GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro ו-DeepSeek V4 Flash. מאלה הרכבנו כמעט שלוש מאות דיאלוגים של משימות מלאות, שבהן מודל עובד על עבודה אחת לאורך זמן: קריאת קוד, עריכת קבצים, שמירה על כל ההיסטוריה בהקשר. התמונה האופיינית למשימה כזו: 97-98% מאסימוני הקלט הם כניסות למטמון. רק טפטוף של טקסט חדש באמת נכנס; הרוב הוא אותו זיכרון קריאה חוזרת.
והנה החשבון מתפרק:
- GLM 5.3:80-90% מהסך הכל עובר לקריאות מטמון - 98% בתוך תיבת דו-שיח חציונית של משימות. תשובות וקלט טרי הם השאריות.
- DeepSeek V4 Pro:כשני שלישים מהחשבון (64%) הוא גם מטמון. נתח דומה ברוחו, אבל הסכומים האבסולוטיים אינם ניתנים להשוואה, מכיוון שקצב הקריאה של DeepSeek נמוך פי 12.
עכשיו הכסף, לכל משימה ולא לכל שיחה. תיבת דו-שיח חציונית של משימות עלתה כשישה סנט ב-GLM 5.3 Flash וכשני סנט ב-DeepSeek V4 Flash. כדי להשוות בצורה הוגנת, התאמנו משימות עם אותו נפח של טקסט שנוצר: בעומסי עבודה דומים DeepSeek יוצא זול פי 3.6-5. GLM 5.3 המלא מול DeepSeek V4 Pro, במחלקת המשימות שבהן הן חופפות, היה יקר פי 6-7 - עבור אותה כמות עבודה שנעשתה.
הערה מתודולוגית: נתונים אלה מחושבים מחדש מהתעריפים הציבוריים בטבלה למעלה, ולא מהחשבונית בפועל של מישהו. כבדיקת שפיות השווינו את החישוב מחדש עם חיובים רשומים בכל מקום שבו התעריף פתוח - הם התפצלו ב-2-3%, כך שההערכה נכונה.
רוצה להרגיש את זה בשיחה אחת? קריאת סוכן טיפוסית במדידות שלנו היא בסביבות 130 אלף אסימוני מטמון, שלושת אלפים אסימוני קלט חדשים וכמה מאות פלט. GLM 5.3 גובה כארבעה סנטים עבור שיחה כזו. DeepSeek V4 Pro - כחצי סנט. שבע פעמים, עבור אותו נפח עבודה.
אז האם GLM בוגדת?
פורמלית, לא: כל התעריפים מתפרסמים, והחישוב מחדש תואם את החיובים בפועל בכל מקום שבו התעריף פתוח. הטריק טמון במקום אחר. העין קולטת את מחירי הקלט והפלט, בעוד שורת "קריאה במטמון" נראית כמו הערת שוליים טכנית. בצ'אט של שתי הודעות זה אחד. אבל בעבודת סוכן, שבה הזיכרון נקרא מחדש מאות פעמים בכל משימה, השורה הזו הופכת לפריט העלות העיקרי. GLM תמחרה אותו פי 12 ממה שמחיר DeepSeek עבור דגמי הדגל - ובמפגשים ארוכים היא עולה על כל השאר. אפילו המטמון של DeepSeek אינו פנוי; התעריפים שלו פשוט כל כך קטנים עד שקריאה חוזרת של כל הזיכרון עולה גרושים.
מה לעשות בנידון
שלושה דברים ששווה לעשות לפני שאתה בוחר דגם לסוכנים:
- מצא את קצב קריאת המטמון במחירון הספק שלך (קריאת מטמון / קלט במטמון). אין שורה כזו? שאל ישירות. למפגשים ארוכים זה משנה יותר ממחיר הקלט.
- תסתכל על פרופיל הטעינה שלך: תגובת ה-API מראה כמה אסימונים הגיעו מהמטמון. מעל 90% כניסות למטמון, אתה משלם בעיקר על קריאה חוזרת, לא על עבודה.
- חותכים את הזיכרון ללא רחמים. הודעות ישנות, הוראות מערכת ענקיות וקבצים לכל מקרה, נקראים מחדש על חשבונך בכל שיחה. לפעמים מפגש חדש זול יותר מהיסטוריה של שלושה ימים.
שני הדגמים זמינים ב-צ'אט NeuralSpace, בקודסעיף ודרך הAPI ציבורי- הפעל את המשימה שלך על שניהם והשווה את החשבונות. רק זכרו לפתוח את הפירוט: החלק המעניין תמיד חי בשורת האסימונים המאוחסנים במטמון.