← Все статьи

DeepSeek V4.1 Flash: nowa wersja widzi obrazy i pomija V4 Pro

Świecący cyfrowy wieloryb rozpadający się na szybko jasne cząsteczki to metafora nowej, lekkiej wersji DeepSeek

DeepSeek wypuścił V4.1 Flash - model, który zastąpił od razu dwa poprzednie: zwykły V4 Flash i wersję eksperymentalną z rozpoznawaniem obrazu. Jest to jeden z modeli, który zarówno pisze kod, jak i analizuje obrazy: według testów porównawczych agentów ominął V4 Pro, przechowuje kontekst miliona tokenów i zużywa około jedną czwartą mniej pamięci podręcznej. W NeuralSpace V4.1 Flash jest już dostępny na czacie, w sekcji „Kod” i przez API - spójrzmy, co się zmieniło w porównaniu do V4 Flash.

Jakiego modelu

Formalnie nie jest to już rewizja poprzedniego Flasha, ale pierwszy model nowej rodziny architektur. U V4.1 Flash 552 miliardy parametrów w porównaniu do 284 miliardów dla V4 Flash – model jest zauważalnie większy. Ale na każdym kroku jest mniej aktywnych parametrów: about 8 miliardów przy czytaniu danych wejściowych i 16 miliardów podczas generowania odpowiedzi.

Nowy schemat nazywa się Causal Encoder-Decoder: 40 warstw transformatora dzieli się na 20 warstw kodera i 20 warstw dekodera, a ogólna pamięć podręczna kluczy i wartości budowana jest jednorazowo – z ukrytych stanów kodera i nie jest przeliczana ponownie w każdej warstwie. Dlatego model przetwarza dane wejściowe tanio. Asymetria nie została wybrana przypadkowo: agent dużo czyta – pliki, historię dialogów, instrukcje – a stosunkowo mało pisze – edytuje, polecenia, decyzje. Kosztowna część została uproszczona, więc zadania agenta stały się tańsze.

Kontekst – milion tokenów. Nakład rozumowania można płynnie regulować w zakresie od 1 do 100: proste pytanie można przeprowadzić tanio, a złożony łańcuch można przeprowadzić maksymalnie bez zmiany modelu.

Teraz widzi zdjęcia

Najbardziej zauważalna różnica w stosunku do poprzedniej wersji. V4 Flash wprowadzała jedynie tekst: nie wiedziała, jak patrzeć na obrazy, i w tym celu DeepSeek oddzielnie opublikowała eksperymentalny model widzenia. W V4.1 Flash wizja jest wbudowana w sam model - natywnie akceptuje tekst i obrazy oraz odpowiada tekstem.

W praktyce oznacza to, że zrzut ekranu interfejsu, wykres, zdjęcie czy strona dokumentu można przekazać modelowi w niezmienionej postaci. Opisze obraz, wyodrębni tekst ze zrzutu ekranu i przeanalizuje diagram. Jest to szczególnie wygodne dla agentów: jeden model odczytuje zarówno kod, jak i zrzut ekranu interfejsu i nie ma konieczności przełączania się między dwiema usługami.

Stare nazwy modeli DeepSeek zostały wycofane: żądania do v4-flash i v4-flash-vision-exp są teraz przekierowywane do V4.1 Flash - stare integracje nic nie zauważą.

Soczewka, przez którą przepływają linie tekstu i ramki obrazu i wyłaniają się jako pojedynczy strumień światła.

Pominięty V4 Pro

Największą atrakcją tej wersji było to, że V4.1 Flash przewyższało większego V4 Pro w zadaniach agenta. Oto liczby z oficjalnych pomiarów DeepSeek:

  • Terminal-Bench 2.1 (praca w terminalu) – 90,6 wobec 87,9 za V4 Pro i 82,7 za poprzednie V4 Flash;
  • CyberGym (cyberbezpieczeństwo) – 88,1 wobec 83,3 dla V4 Pro;
  • DeepSWE v1.1 — 74,2 w porównaniu z 54,4 dla V4 Flash;
  • Terminal-Bench 4.0 — 31,2 w porównaniu do 7,0 dla V4 Flash.

Do tego - 90,9 przy GPQA Diamond, ocena 3471 przy Codeforces i 65,6 przy MathArena Apex. Liczby nie są niezależne, podała je sama DeepSeek, dlatego należy je traktować jako stwierdzenie, a nie werdykt. Ale skala skoku w poprzednim Flashu jest widoczna nawet bez zewnętrznych pomiarów.

Następnie DeepSeek ogłosił, że stopniowo wycofuje V4 Pro: od 14 września jego API przekierowuje żądania z V4 Pro do V4.1 Flash i zlicza je z szybkością Flash. Praktyczny wniosek jest prosty: Flash nie jest już modelem „młodszym”. Teraz to ona dźwiga główny ciężar, a wersja zwykła i wizyjna nie istnieją już osobno.

Mniejsza pamięć podręczna oznacza tańsze zadania agenta

W przypadku scenariuszy opartych na agentach główne oszczędności nie dotyczą ceny tokena, ale pamięci podręcznej. Agent wielokrotnie ponownie czyta historię dialogów, instrukcje i pliki projektu i to właśnie dane wejściowe zapisane w pamięci podręcznej pochłaniają większość rachunku. Globalna pamięć podręczna V4.1 Flash KV zajmuje około 890 bajtów na token - około czterokrotnie mniej niż V4 Flash, a stała część pamięci podręcznej jest skompresowana około ośmiokrotnie.

Cena samego modelu również spadła w porównaniu z poprzednim Flashem: dane wejściowe z pamięci podręcznej są o 60% tańsze, zwykłe dane wejściowe są o około jedną trzecią tańsze, dane wyjściowe są o 11% tańsze. Korzyści są szczególnie zauważalne w przypadku zadań, które wymagają ciągłego odtwarzania dużych kontekstów; tam, gdzie ważniejsza jest długość nowej odpowiedzi, oszczędności są skromniejsze.

Strumień danych jest kompresowany w wąski, jasny pasek podczas przechodzenia przez sieć krystaliczną.

V4 Flash i V4.1 Flash: co się zmieniło

ParametrV4 FlashV4.1 Flash
Opcje284 miliardy552 miliardy
Aktywny w kroku13 miliardów8 miliardów wejść / 16 miliardów wyjść
ArchitekturaMoE-dekoderCausal Encoder-Decoder
Rozumie obrazyNie, oddzielny model widzeniaTak, rodzimy
Kontekst1 milion tokenów1 milion tokenów
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-gotówka za token~4× więcej890 bajtów

Cena NeuralSpace i sposób wypróbowania

Model NeuralSpace działa w tym samym tempie, co poprzedni V4 Flash: 0,14 USD za milion tokenów wejściowych I W weekendy 0,28 dolara za milion. Start - od 3 żetonów na saldzie; debet pochodzi z salda ogólnego, bez osobnego abonamentu i karty zagranicznej. Aby spróbować, wystarczy jeden krok:

Często zadawane pytania

V4.1 Flash - czy to nowy model czy aktualizacja? Jest to wersja nowej rodziny architektur, a nie rewizja poprzedniego Flasha: zmieniła się architektura, powiększyła się część wspierająca i pojawiła się wizja.

Czy ona widzi zdjęcia? Tak, natywnie: możesz wysłać zdjęcie, zrzut ekranu, wykres lub dokument. Ostatnim V4 Flash był SMS.

Co się stało z V4 Pro? DeepSeek stopniowo wycofuje to rozwiązanie i przekierowuje żądania do V4.1 Flash, które w testach porównawczych opartych na agentach uzyskało lepsze wyniki niż V4 Pro.

Ile kosztuje próba? 0,14 USD/0,28 USD za milion tokenów, zaczynając od 3 tokenów na koncie – przy strona czatu modelki.

Czy stare prośby o v4-flash przestaną działać? Nie: połączenia z numerami v4-flash i v4-flash-vision-exp są przekierowywane na numer V4.1 Flash i liczone według jego stawki.