캐시 읽기 캐치: 실제 에이전트 작업에서 GLM 5.3의 비용이 더 많이 드는 이유
우리는 에이전트 업무에 대한 실제 청구서를 살펴보고 간단한 것을 보았습니다. GLM 5.3의 경우 비용의 가장 큰 부분은 답변이나 새로운 입력이 아닙니다. 캐시를 다시 읽는 것입니다. 모델이 동일한 작업 내에서 이미 본 토큰입니다. 우리 측정에서는 청구서의 80~90%이고 장기 작업에서는 98%에 가깝습니다. 이것이 바로 GLM의 가격표가 언뜻 보기에 적당해 보이지만 DeepSeek에서 동일한 작업이 지속적으로 몇 배 더 저렴하게 나오는 이유입니다. 그 일이 일어나는 방법은 다음과 같습니다.
청구서의 캐시 출처
모든 API 호출은 메모리 없이 발생합니다. 모델은 시스템 지침, 채팅 기록, 파일 콘텐츠 등 전체 대화를 다시 수신합니다. 공급자는 반복되는 부분을 캐시합니다. 요청의 시작 부분이 이미 처리된 항목과 일치하는 경우 할인된 가격으로 캐시에서 해당 토큰을 읽습니다. API 응답은 캐시에서 나온 토큰 수, 새로운 토큰 수, 모델이 생성한 토큰 수 등의 분석을 보여줍니다.
순수 이익 같네요. 그러나 할인은 선물이 아닌 요율이며, 모든 모델은 자체적으로 설정됩니다. 모델 간의 차이는 퍼센트가 아닌 배수로 측정됩니다. 캐치가 숨어있는 곳입니다.

가격표에 나와 있는 내용
2026년 8월 말 기준 공개 가격, 백만 토큰당 달러:
| 모델 | 입력 | 캐시 읽기 | 산출 |
|---|---|---|---|
| GLM 5.3 | $1.40 | $0.26 (입력의 19%) | $4.40 |
| GLM 5.3 플래시 | $0.075 | $0.015 (입력의 20%) | $0.25 |
| DeepSeek V4 프로 | $0.66 | $0.022 (입력의 3%) | $1.98 |
| DeepSeek V4 플래시 | $0.03 | $0.007 (입력의 23%) | $0.10 |
중간 열을 보십시오. 일반적으로 훑어보는 열입니다. DeepSeek V4 Pro의 경우 캐시 읽기 비용은 입력 가격의 3%입니다. 다시 읽기 비용은 거의 30배 할인됩니다. GLM 5.3의 경우 19%로 5배 할인됩니다. Flash 모델은 상대적인 측면에서 더 유사하지만(약 20% 대 23%), 절대 수치에서는 GLM 플래시 캐시 읽기 비용이 여전히 DeepSeek 플래시보다 약 2배 더 높습니다.
실제 작업에서 측정됨
8월에 2주간의 실제 에이전트 트래픽이 사용되었습니다. GLM 5.3, GLM 5.3 Flash, DeepSeek V4 Pro 및 DeepSeek V4 Flash의 4가지 모델에 걸쳐 13,279건의 API 호출이 있었습니다. 우리는 모델이 코드 읽기, 파일 편집, 전체 기록 유지 등 오랜 기간 동안 하나의 작업을 수행하는 약 300개의 전체 작업 대화 상자를 모았습니다. 이러한 작업의 일반적인 그림은 입력 토큰의 97~98%가 캐시 적중입니다. 아주 약간의 새로운 텍스트만 들어옵니다. 대부분은 동일한 다시 읽기 메모리입니다.
그리고 청구서가 어떻게 분류되는지는 다음과 같습니다.
- GLM 5.3:전체의 80~90%가 캐시 읽기에 사용됩니다. 98%는 중간 작업 대화 상자 내부에 있습니다. 답변과 새로운 입력은 남은 부분입니다.
- DeepSeek V4 프로:청구서의 약 2/3(64%)도 캐시입니다. 정신적으로는 비슷한 점유율이지만 DeepSeek의 읽기 속도가 12배나 낮기 때문에 절대적인 양은 비교할 수 없습니다.
이제 통화당 비용이 아닌 전체 작업당 비용이 청구됩니다. 중간 작업 대화 상자 비용은 GLM 5.3 Flash에서 약 6센트, DeepSeek V4 Flash에서 약 2센트입니다. 공정하게 비교하기 위해 동일한 양의 생성된 텍스트로 작업을 일치시켰습니다. 비슷한 작업 부하에서 DeepSeek은 3.6~5배 더 저렴했습니다. DeepSeek V4 Pro에 대한 전체 GLM 5.3은 중복되는 작업 클래스에서 동일한 작업량에 대해 6~7배 더 비쌌습니다.
방법론 참고 사항: 이 수치는 실제 청구서가 아닌 위 표의 공개 요율을 기준으로 다시 계산됩니다. 온전한 점검을 위해 재계산을 관세가 적용되는 곳마다 기록된 요금과 비교했습니다. 두 요금은 2~3% 차이가 나므로 추정치는 타당합니다.
통화 한 번으로 느끼고 싶으신가요? 우리 측정에서 일반적인 에이전트 호출은 약 130,000개의 캐시 토큰, 3,000개의 새로운 입력 토큰 및 수백 개의 출력입니다. GLM 5.3은 그러한 통화에 대해 약 4센트를 청구합니다. DeepSeek V4 Pro — 약 0.5센트. 같은 양의 작업에 대해 일곱 번.
그렇다면 GLM이 부정행위를 하고 있는 걸까요?
공식적으로는 아니요. 모든 요율이 게시되고 관세가 공개되는 곳마다 재계산이 실제 요금과 일치합니다. 비결은 다른 곳에 있다. 눈길을 끄는 것은 입력 및 출력 가격이며, "캐시 읽기" 라인은 기술적인 각주처럼 보입니다. 두 개의 메시지 채팅에서는 하나입니다. 그러나 작업당 메모리를 수백 번 다시 읽는 에이전트 작업에서는 해당 라인이 주요 비용 항목이 됩니다. GLM은 DeepSeek의 플래그십 모델 가격보다 12배 더 높은 가격을 책정했으며 장시간 세션에서는 다른 모든 제품보다 가격이 더 높습니다. DeepSeek의 캐시도 무료가 아닙니다. 그 속도는 너무 작아서 전체 메모리를 다시 읽는 데에는 몇 푼도 들지 않습니다.
그것에 대해 무엇을 해야할지
상담원 모델을 선택하기 전에 수행할 가치가 있는 세 가지 작업은 다음과 같습니다.
- 공급자의 가격표(캐시 읽기/캐시된 입력)에서 캐시 읽기 속도를 찾으세요. 그런 라인은 없나요? 직접 물어보세요. 긴 세션의 경우 입력 가격보다 더 중요합니다.
- 자신의 로드 프로필을 살펴보세요. API 응답은 캐시에서 가져온 토큰 수를 보여줍니다. 캐시 적중률이 90%를 넘으면 작업 비용이 아닌 다시 읽기 비용을 대부분 지불하게 됩니다.
- 무자비하게 기억을 자르세요. 오래된 메시지, 거대한 시스템 지침 및 만일의 경우에 대비한 파일은 통화할 때마다 귀하의 비용으로 다시 읽혀집니다. 때로는 새로운 세션이 3일 기록보다 저렴할 때도 있습니다.
두 모델 모두에서 사용 가능합니다.NeuralSpace 채팅, 에서암호섹션을 통해공개 API— 두 가지 모두에 대해 자신의 작업을 실행하고 청구서를 비교하십시오. 분석 내용을 여는 것을 잊지 마십시오. 흥미로운 부분은 항상 캐시된 토큰 라인에 있습니다.