DeepSeek V4.1 Flash: nowa wersja widzi obrazy i pomija V4 Pro
DeepSeek wypuścił V4.1 Flash - model, który zastąpił od razu dwa poprzednie: zwykły V4 Flash i wersję eksperymentalną z rozpoznawaniem obrazu. Jest to jeden z modeli, który zarówno pisze kod, jak i analizuje obrazy: według testów porównawczych agentów ominął V4 Pro, przechowuje kontekst miliona tokenów i zużywa około jedną czwartą mniej pamięci podręcznej. W NeuralSpace V4.1 Flash jest już dostępny na czacie, w sekcji „Kod” i przez API - spójrzmy, co się zmieniło w porównaniu do V4 Flash.
Jakiego modelu
Formalnie nie jest to już rewizja poprzedniego Flasha, ale pierwszy model nowej rodziny architektur. U V4.1 Flash 552 miliardy parametrów w porównaniu do 284 miliardów dla V4 Flash – model jest zauważalnie większy. Ale na każdym kroku jest mniej aktywnych parametrów: about 8 miliardów przy czytaniu danych wejściowych i 16 miliardów podczas generowania odpowiedzi.
Nowy schemat nazywa się Causal Encoder-Decoder: 40 warstw transformatora dzieli się na 20 warstw kodera i 20 warstw dekodera, a ogólna pamięć podręczna kluczy i wartości budowana jest jednorazowo – z ukrytych stanów kodera i nie jest przeliczana ponownie w każdej warstwie. Dlatego model przetwarza dane wejściowe tanio. Asymetria nie została wybrana przypadkowo: agent dużo czyta – pliki, historię dialogów, instrukcje – a stosunkowo mało pisze – edytuje, polecenia, decyzje. Kosztowna część została uproszczona, więc zadania agenta stały się tańsze.
Kontekst – milion tokenów. Nakład rozumowania można płynnie regulować w zakresie od 1 do 100: proste pytanie można przeprowadzić tanio, a złożony łańcuch można przeprowadzić maksymalnie bez zmiany modelu.
Teraz widzi zdjęcia
Najbardziej zauważalna różnica w stosunku do poprzedniej wersji. V4 Flash wprowadzała jedynie tekst: nie wiedziała, jak patrzeć na obrazy, i w tym celu DeepSeek oddzielnie opublikowała eksperymentalny model widzenia. W V4.1 Flash wizja jest wbudowana w sam model - natywnie akceptuje tekst i obrazy oraz odpowiada tekstem.
W praktyce oznacza to, że zrzut ekranu interfejsu, wykres, zdjęcie czy strona dokumentu można przekazać modelowi w niezmienionej postaci. Opisze obraz, wyodrębni tekst ze zrzutu ekranu i przeanalizuje diagram. Jest to szczególnie wygodne dla agentów: jeden model odczytuje zarówno kod, jak i zrzut ekranu interfejsu i nie ma konieczności przełączania się między dwiema usługami.
Stare nazwy modeli DeepSeek zostały wycofane: żądania do v4-flash i v4-flash-vision-exp są teraz przekierowywane do V4.1 Flash - stare integracje nic nie zauważą.

Pominięty V4 Pro
Największą atrakcją tej wersji było to, że V4.1 Flash przewyższało większego V4 Pro w zadaniach agenta. Oto liczby z oficjalnych pomiarów DeepSeek:
- Terminal-Bench 2.1 (praca w terminalu) – 90,6 wobec 87,9 za V4 Pro i 82,7 za poprzednie V4 Flash;
- CyberGym (cyberbezpieczeństwo) – 88,1 wobec 83,3 dla V4 Pro;
- DeepSWE v1.1 — 74,2 w porównaniu z 54,4 dla V4 Flash;
- Terminal-Bench 4.0 — 31,2 w porównaniu do 7,0 dla V4 Flash.
Do tego - 90,9 przy GPQA Diamond, ocena 3471 przy Codeforces i 65,6 przy MathArena Apex. Liczby nie są niezależne, podała je sama DeepSeek, dlatego należy je traktować jako stwierdzenie, a nie werdykt. Ale skala skoku w poprzednim Flashu jest widoczna nawet bez zewnętrznych pomiarów.
Następnie DeepSeek ogłosił, że stopniowo wycofuje V4 Pro: od 14 września jego API przekierowuje żądania z V4 Pro do V4.1 Flash i zlicza je z szybkością Flash. Praktyczny wniosek jest prosty: Flash nie jest już modelem „młodszym”. Teraz to ona dźwiga główny ciężar, a wersja zwykła i wizyjna nie istnieją już osobno.
Mniejsza pamięć podręczna oznacza tańsze zadania agenta
W przypadku scenariuszy opartych na agentach główne oszczędności nie dotyczą ceny tokena, ale pamięci podręcznej. Agent wielokrotnie ponownie czyta historię dialogów, instrukcje i pliki projektu i to właśnie dane wejściowe zapisane w pamięci podręcznej pochłaniają większość rachunku. Globalna pamięć podręczna V4.1 Flash KV zajmuje około 890 bajtów na token - około czterokrotnie mniej niż V4 Flash, a stała część pamięci podręcznej jest skompresowana około ośmiokrotnie.
Cena samego modelu również spadła w porównaniu z poprzednim Flashem: dane wejściowe z pamięci podręcznej są o 60% tańsze, zwykłe dane wejściowe są o około jedną trzecią tańsze, dane wyjściowe są o 11% tańsze. Korzyści są szczególnie zauważalne w przypadku zadań, które wymagają ciągłego odtwarzania dużych kontekstów; tam, gdzie ważniejsza jest długość nowej odpowiedzi, oszczędności są skromniejsze.

V4 Flash i V4.1 Flash: co się zmieniło
| Parametr | V4 Flash | V4.1 Flash |
|---|---|---|
| Opcje | 284 miliardy | 552 miliardy |
| Aktywny w kroku | 13 miliardów | 8 miliardów wejść / 16 miliardów wyjść |
| Architektura | MoE-dekoder | Causal Encoder-Decoder |
| Rozumie obrazy | Nie, oddzielny model widzenia | Tak, rodzimy |
| Kontekst | 1 milion tokenów | 1 milion tokenów |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| KV-gotówka za token | ~4× więcej | 890 bajtów |
Cena NeuralSpace i sposób wypróbowania
Model NeuralSpace działa w tym samym tempie, co poprzedni V4 Flash: 0,14 USD za milion tokenów wejściowych I W weekendy 0,28 dolara za milion. Start - od 3 żetonów na saldzie; debet pochodzi z salda ogólnego, bez osobnego abonamentu i karty zagranicznej. Aby spróbować, wystarczy jeden krok:
- Pogawędzić: strona modelowa — możesz tutaj załączyć zdjęcie lub zrzut ekranu, a model je uporządkuje;
- Kod: Sekcja „Kod”. — model łączy się z projektem i współpracuje z repozytorium, plikami i terminalem;
- API: klucz jest wydawany w sekcji API-klawisze, format zgodny z OpenAI; dokumentacja - neuralspace.pro/pl/v1/docs.
Często zadawane pytania
V4.1 Flash - czy to nowy model czy aktualizacja? Jest to wersja nowej rodziny architektur, a nie rewizja poprzedniego Flasha: zmieniła się architektura, powiększyła się część wspierająca i pojawiła się wizja.
Czy ona widzi zdjęcia? Tak, natywnie: możesz wysłać zdjęcie, zrzut ekranu, wykres lub dokument. Ostatnim V4 Flash był SMS.
Co się stało z V4 Pro? DeepSeek stopniowo wycofuje to rozwiązanie i przekierowuje żądania do V4.1 Flash, które w testach porównawczych opartych na agentach uzyskało lepsze wyniki niż V4 Pro.
Ile kosztuje próba? 0,14 USD/0,28 USD za milion tokenów, zaczynając od 3 tokenów na koncie – przy strona czatu modelki.
Czy stare prośby o v4-flash przestaną działać? Nie: połączenia z numerami v4-flash i v4-flash-vision-exp są przekierowywane na numer V4.1 Flash i liczone według jego stawki.