← Alla artiklar

DeepSeek V4.1 Flash: den nya versionen ser bilder och har förbigått V4 Pro

En glödande digital val som smular till snabba ljusa partiklar är en metafor för den nya lätta versionen av DeepSeek

DeepSeek släppt V4.1 Flash - en modell som ersatte två tidigare på en gång: den vanliga V4 Flash och en experimentell version med bildigenkänning. Nu är det här en modell som både skriver kod och analyserar bilder: enligt agentens riktmärken förbigick den V4 Pro, har ett sammanhang på en miljon tokens och spenderar ungefär en fjärdedel så mycket cache. I NeuralSpace V4.1 Flash är den redan tillgänglig i chatten, i avsnittet "Kod" och genom API - låt oss titta på vad som har förändrats jämfört med V4 Flash.

Vilken modell

Formellt är detta inte längre en revidering av den tidigare Flash, utan den första modellen av en ny familj av arkitekturer. U V4.1 Flash 552 miljarder parametrar mot 284 miljarder för V4 Flash - modellen är märkbart större. Men det finns färre aktiva parametrar vid varje steg: ca 8 miljarder vid läsning av input och 16 miljarder när man genererar ett svar.

Det nya schemat kallas Causal Encoder-Decoder: 40 transformatorlager är uppdelade i 20 kodarlager och 20 avkodarlager, och den allmänna cachen med nycklar och värden byggs en gång - från kodarens dolda tillstånd och räknas inte om i varje lager igen. Det är därför modellen bearbetar input billigt. Asymmetrin valdes inte av en slump: agenten läser mycket - filer, dialoghistorik, instruktioner - och skriver relativt lite - redigeringar, kommandon, beslut. Den dyra delen gjordes enkel, så agentuppgifterna blev billigare.

Sammanhang - en miljon tokens. Resonemangsinsatsen är kontinuerligt justerbar, från 1 till 100: en enkel fråga kan köras billigt, och en komplex kedja kan köras maximalt utan att ändra modellen.

Nu ser han bilder

Den mest märkbara skillnaden från den tidigare versionen. V4 Flash hade bara en textinmatning: hon visste inte hur hon skulle titta på bilder, och för detta släppte DeepSeek separat en experimentell synmodell. I V4.1 Flash är vision inbyggd i själva modellen - den accepterar text och bilder och svarar med text.

I praktiken innebär detta att en skärmdump av gränssnittet, en graf, ett fotografi eller en sida av ett dokument kan ges till modellen som den är. Hon kommer att beskriva bilden, extrahera text från skärmdumpen och analysera diagrammet. Detta är särskilt praktiskt för agenter: en modell läser både koden och gränssnittets skärmdump, och det finns inget behov av att växla mellan två tjänster.

Gamla modellnamn DeepSeek har tagits ur drift: förfrågningar till v4-flash och v4-flash-vision-exp omdirigeras nu till V4.1 Flash - gamla integrationer kommer inte att märka någonting.

En lins i vilken textlinjer och bildramar flödar in och framträder som en enda ström av ljus.

Förbigått V4 Pro

Den största höjdpunkten med releasen var att V4.1 Flash överträffade de större V4 Pro i agentuppgifter. Här är siffrorna från officiella mätningar DeepSeek:

  • Terminal-Bench 2.1 (fungerar i terminalen) - 90,6 mot 87,9 för V4 Pro och 82,7 för föregående V4 Flash;
  • CyberGym (cybersäkerhet) - 88.1 mot 83.3 för V4 Pro;
  • DeepSWE v1.1 — 74,2 mot 54,4 för V4 Flash;
  • Terminal-Bench 4.0 — 31,2 mot 7,0 för V4 Flash.

Till detta - 90,9 vid GPQA Diamond, betyg 3471 vid Codeforces och 65,6 vid MathArena Apex. Siffrorna är inte oberoende, de gavs av DeepSeek själv, så de bör behandlas som ett uttalande och inte som en dom. Men omfattningen av hoppet i föregående Flash är synlig även utan mätningar från tredje part.

Därefter tillkännagav DeepSeek att det gradvis fasas ut V4 Pro: från och med den 14 september omdirigerar dess API förfrågningar till V4 Pro till V4.1 Flash och räknar dem med flashhastigheten. Den praktiska slutsatsen är enkel: Flash är inte längre en "junior" modell. Nu är det hon som bär huvudbördan, och den vanliga versionen och visionversionen finns inte längre separat.

Mindre cache innebär billigare agentuppgifter

För agentbaserade scenarier finns de huvudsakliga besparingarna inte i tokenpriset, utan i cachen. Agenten läser om dialoghistoriken, instruktionerna och projektfilerna om och om igen, och det är den cachade ingången som äter upp huvuddelen av notan. Den V4.1 Flash globala KV cachen tar ungefär 890 byte per token - ungefär fyra gånger mindre än V4 Flash, och den permanenta delen av cachen komprimeras ungefär åtta gånger.

Priset på själva modellen har också minskat i förhållande till tidigare Flash: cachad ingång är 60 % billigare, vanlig ingång är ungefär en tredjedel billigare, utdata är 11 % billigare. Vinsterna märks särskilt i uppgifter som återvinner stora sammanhang om och om igen; där längden på det nya svaret är viktigare är besparingarna mer blygsamma.

Dataströmmen komprimeras till en smal ljus remsa när den passerar genom kristallgittret.

V4 Flash och V4.1 Flash: vad har förändrats

ParameterV4 FlashV4.1 Flash
Alternativ284 miljarder552 miljarder
Aktiv i steg13 miljarder8 miljarder insats / 16 miljarder produktion
ArkitekturMoE-dekoderCausal Encoder-Decoder
Förstår bilderNej, separat visionmodellJa, infödd
Sammanhang1 miljon tokens1 miljon tokens
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-kontanter per token~4× mer890 byte

Pris NeuralSpace och hur man provar

NeuralSpace-modellen fungerar i samma takt som den tidigare V4 Flash: $0,14 per miljon inmatade tokens Och $0,28 per miljon helger. Börja - från 3 tokens på ditt saldo; debiteringen kommer från det allmänna saldot, utan ett separat abonnemang och ett utländskt kort. För att prova räcker det med bara ett steg:

  • Chatta: modellsida — du kan bifoga en bild eller skärmdump här, så kommer modellen att reda ut dem;
  • Koda: avsnittet "Kod". — Modellen ansluter till projektet och fungerar med arkivet, filerna och terminalen.
  • API: nyckeln utfärdas i avsnittet API-nycklar, format kompatibelt med OpenAI; dokumentation - neuralspace.pro/sv/v1/docs.

Vanliga frågor

V4.1 Flash - är detta en ny modell eller en uppdatering? Det här är en version av en ny arkitekturfamilj och inte en revidering av den tidigare Flash: arkitekturen har förändrats, den stödjande delen har vuxit och visionen har dykt upp.

Ser hon bilderna? Ja, naturligt: ​​du kan skicka ett foto, skärmdump, diagram eller dokument. Den sista V4 Flash var text.

Vad hände med V4 Pro? DeepSeek fasar gradvis ut det och omdirigerar förfrågningar till V4.1 Flash, som överträffade V4 Pro i agentbaserade benchmarks.

Hur mycket kostar det att prova? $0,14/$0,28 per miljon tokens, från 3 tokens på saldot - kl. modellens chattsida.

Kommer gamla förfrågningar om v4-flash att bryta? Nej: samtal till v4-flash och v4-flash-vision-exp omdirigeras till V4.1 Flash och räknas i takt.