DeepSeek V4.1 Flash: 새 버전에서는 사진을 보고 우회했습니다. V4 Pro
DeepSeek 출시 V4.1 Flash - 두 가지 이전 모델을 한 번에 대체한 모델: 일반 V4 Flash 버전과 이미지 인식 기능이 있는 실험 버전입니다. 이제 이것은 코드를 작성하고 이미지를 구문 분석하는 하나의 모델입니다. 에이전트 벤치마크에 따르면 V4 Pro를 우회하고 백만 개의 토큰 컨텍스트를 보유하며 약 4분의 1의 캐시를 소비합니다. NeuralSpace V4.1 Flash에서는 이미 채팅, "코드" 섹션 및 API를 통해 사용할 수 있습니다. V4 Flash와 비교하여 변경된 사항을 살펴보겠습니다.
어떤 모델
공식적으로 이것은 더 이상 이전 Flash의 개정판이 아니라 새로운 아키텍처 제품군의 첫 번째 모델입니다. 으 V4.1 Flash 5,520억 개의 매개변수 V4 Flash의 경우 2,840억에 비해 모델이 눈에 띄게 더 큽니다. 그러나 각 단계에는 활성 매개변수 수가 더 적습니다. 입력을 읽을 때 80억 응답을 생성할 때는 160억입니다.
새로운 방식은 Causal Encoder-Decoder라고 합니다. 40개의 변환기 레이어는 20개의 인코더 레이어와 20개의 디코더 레이어로 나뉘며 키와 값의 일반 캐시는 인코더의 숨겨진 상태에서 한 번 구축되며 각 레이어에서 다시 계산되지 않습니다. 이것이 모델이 입력을 저렴하게 처리하는 이유입니다. 비대칭성은 우연히 선택되지 않았습니다. 에이전트는 파일, 대화 기록, 지침 등 많이 읽고 편집, 명령, 결정 등 상대적으로 적게 씁니다. 비용이 많이 드는 부분이 쉬워져서 상담원 업무가 더 저렴해졌습니다.
컨텍스트 - 백만 개의 토큰. 추론 노력은 1에서 100까지 지속적으로 조정 가능합니다. 간단한 질문은 저렴하게 실행할 수 있으며, 복잡한 체인은 모델을 변경하지 않고도 최대로 실행할 수 있습니다.
이제 그는 사진을 본다
이전 버전과 가장 눈에 띄는 차이점은. V4 Flash에는 텍스트 입력만 있었습니다. 그녀는 이미지를 보는 방법을 몰랐고 이를 위해 DeepSeek에는 실험적인 비전 모델을 별도로 출시했습니다. V4.1 Flash에서는 비전이 모델 자체에 내장되어 있습니다. 즉, 기본적으로 텍스트와 그림을 받아들이고 텍스트로 응답합니다.
실제로 이는 인터페이스의 스크린샷, 그래프, 사진 또는 문서 페이지를 있는 그대로 모델에 제공할 수 있음을 의미합니다. 그녀는 이미지를 설명하고, 스크린샷에서 텍스트를 추출하고, 다이어그램을 분석합니다. 이는 상담원에게 특히 편리합니다. 하나의 모델이 코드와 인터페이스 스크린샷을 모두 읽으므로 두 서비스 간에 전환할 필요가 없습니다.
이전 모델 이름 DeepSeek은 폐기되었습니다. v4-flash 및 v4-flash-vision-exp에 대한 요청은 이제 V4.1 Flash로 리디렉션됩니다. 이전 통합에서는 아무 것도 알 수 없습니다.

우회됨 V4 Pro
이번 릴리스의 가장 큰 특징은 에이전트 작업에서 V4.1 Flash가 더 큰 V4 Pro보다 성능이 뛰어났다는 것입니다. 공식 측정 수치는 다음과 같습니다 DeepSeek:
- Terminal-Bench 2.1 (터미널에서 작업) - V4 Pro의 경우 90.6 대 87.9, 이전 V4 Flash의 경우 82.7입니다.
- CyberGym (사이버 보안) - V4 Pro의 경우 88.1 대 83.3입니다.
- DeepSWE v1.1 — V4 Flash의 경우 74.2 대 54.4;
- Terminal-Bench 4.0 — V4 Flash의 경우 31.2 대 7.0입니다.
이에 대한 평가는 GPQA Diamond에서 90.9, Codeforces에서 3471, MathArena Apex에서 65.6입니다. 숫자는 독립적이지 않으며 DeepSeek 자신이 제공한 것이므로 평결이 아닌 진술로 취급되어야 합니다. 그러나 이전 플래시의 점프 규모는 타사 측정 없이도 볼 수 있습니다.
다음으로 DeepSeek는 V4 Pro를 단계적으로 폐지한다고 발표했습니다. 9월 14일부터 API는 요청을 V4 Pro에서 V4.1 Flash로 리디렉션하고 플래시 속도로 계산합니다. 실질적인 결론은 간단합니다. Flash는 더 이상 "주니어" 모델이 아닙니다. 이제 주요 부하를 담당하는 것은 그녀이며 일반 버전과 비전 버전은 더 이상 별도로 존재하지 않습니다.
캐시가 적다는 것은 에이전트 작업 비용이 저렴하다는 것을 의미합니다.
에이전트 기반 시나리오의 경우 주요 절감 효과는 토큰 가격이 아니라 캐시에 있습니다. 에이전트는 대화 기록, 지침 및 프로젝트 파일을 계속해서 다시 읽으며, 청구서의 대부분을 차지하는 것은 캐시된 입력입니다. V4.1 Flash 전역 KV 캐시는 약 토큰당 890바이트 - V4 Flash보다 약 4배 적으며, 캐시의 영구 부분은 약 8배 압축됩니다.
모델 자체의 가격도 이전 Flash에 비해 낮아졌습니다. 캐시된 입력은 60% 저렴하고 일반 입력은 약 1/3 저렴하며 출력은 11% 저렴합니다. 대규모 컨텍스트를 계속해서 재활용하는 작업에서 특히 눈에 띄는 이점이 있습니다. 새로운 답변의 길이가 더 중요한 경우 절감 효과는 더 적습니다.

V4 Flash 및 V4.1 Flash: 변경된 사항
| 매개변수 | V4 Flash | V4.1 Flash |
|---|---|---|
| 옵션 | 2,840억 | 5,520억 |
| 단계에서 활성 | 130억 | 80억 입력 / 160억 출력 |
| 건축학 | MoE-디코더 | Causal Encoder-Decoder |
| 그림을 이해한다 | 아니요, 별도의 비전 모델 | 응, 원주민이야 |
| 문맥 | 100만 토큰 | 100만 토큰 |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| KV-토큰당 현금 | ~4배 이상 | 890바이트 |
가격 NeuralSpace 및 체험 방법
NeuralSpace 모델은 이전 V4 Flash와 동일한 속도로 작동합니다. 입력 토큰 백만 개당 $0.14 그리고 주말 100만 개당 0.28달러. 시작 - 잔고에 있는 토큰 3개부터 시작하세요. 차변은 별도의 가입 및 해외 카드 없이 일반 잔액에서 발생합니다. 시도해 보려면 다음 한 단계만 수행하면 충분합니다.
- 채팅: 모델 페이지 — 여기에 사진이나 스크린샷을 첨부하면 모델이 이를 분류합니다.
- 암호: "코드" 섹션 — 모델이 프로젝트에 연결되고 저장소, 파일 및 터미널과 함께 작동합니다.
- API: 키는 섹션에서 발급됩니다. API-키, OpenAI와 호환되는 형식; 문서 - 신경 공간.pro/ru/v1/docs.
자주 묻는 질문
V4.1 Flash - 이것은 새로운 모델인가요 아니면 업데이트인가요? 이는 이전 Flash의 개정판이 아닌 새로운 아키텍처 제품군의 버전입니다. 아키텍처가 변경되고 지원 부분이 성장했으며 비전이 나타났습니다.
그녀는 사진을 보나요? 예, 기본적으로 사진, 스크린샷, 차트 또는 문서를 보낼 수 있습니다. 마지막 V4 Flash는 텍스트였습니다.
V4 Pro에게 무슨 일이 일어났나요? DeepSeek는 점차적으로 이를 단계적으로 폐지하고 요청을 V4.1 Flash로 리디렉션하고 있으며, 이는 에이전트 기반 벤치마크에서 V4 Pro보다 성능이 뛰어납니다.
시도하는 데 비용이 얼마나 드나요? 백만 토큰당 $0.14/$0.28, 잔액 3개 토큰부터 시작 - 모델의 채팅 페이지.
v4-flash에 대한 이전 요청이 중단되나요? 아니요: v4-flash 및 v4-flash-vision-exp에 대한 통화는 V4.1 Flash로 리디렉션되고 해당 속도로 계산됩니다.