← Все статьи

DeepSeek V4.1 Flash: den nye version ser billeder og slår V4 Pro

DeepSeek V4.1 Flash: den nye version ser billeder og slår V4 Pro

DeepSeek har udgivet V4.1 Flash - en model, der erstattede to tidligere på én gang: den almindelige V4 Flash og en eksperimentel version med billedgenkendelse. Nu er det en enkelt model, der både skriver kode og læser billeder: den slår V4 Pro på agentiske benchmarks, har en en million token-kontekst og bruger cirka fire gange mindre KV-cache. På NeuralSpace er V4.1 Flash allerede tilgængelig i chatten, i "Kode"-sektionen og via API'et - her er, hvad der er ændret sammenlignet med V4 Flash.

Hvad er denne model

Strengt taget er dette ikke en revision af den tidligere Flash, men den første model af en ny arkitekturfamilie. V4.1 Flash har552 milliarder parametremod 284 milliarder i V4 Flash, så modellen er mærkbart større. Alligevel aktiverer den færre parametre pr. trin: ca8 milliarder, mens du læser inputog 16 milliarder, mens svaret genereres.

Det nye skema kaldes Causal Encoder-Decoder: de 40 transformerlag opdeles i 20 koderlag og 20 dekoderlag, og den delte nøgleværdi-cache bygges én gang - fra koderens skjulte tilstande - i stedet for at blive genberegnet i hvert lag. Derfor er inputbehandling billig. Asymmetrien er bevidst: en agent læser meget - filer, samtalehistorik, instruktioner - og skriver forholdsvis lidt - redigeringer, kommandoer, beslutninger. Den dyre halvdel blev gjort let, så agenturarbejdet blev også billigere.

Konteksten er en million tokens. Begrundelsesindsatsen kan løbende justeres fra 1 til 100: Et simpelt spørgsmål kan køre billigt, mens en hård kæde maksimalt kan køre uden at skifte model.

Den ser billeder nu

Dette er den mest synlige forskel fra den tidligere version. V4 Flash havde en tekst-kun input: den kunne ikke se på billeder, og DeepSeek sendte en separat eksperimentel vision-model til det. I V4.1 Flash er vision indbygget i selve modellen - den accepterer naturligt tekst og billeder og svarer med tekst.

I praksis kan du give modellen et UI-skærmbillede, et diagram, et foto eller en dokumentside, som den er. Det vil beskrive billedet, udtrække tekst fra et skærmbillede eller læse et diagram. Det er især praktisk for agenter: én model læser både koden og UI-skærmbilledet uden at skulle skifte mellem to tjenester.

DeepSeek trak de gamle modelnavne tilbage: anmodninger til v4-flash og v4-flash-vision-exp er nu dirigeret til V4.1 Flash, så eksisterende integrationer vil intet bemærke.

A lens with text lines and image frames flowing in and a single stream of light coming out

Det slår V4 Pro

Den mest højlydte del af udgivelsen: V4.1 Flash overgik den større V4 Pro på agentopgaver. Her er tallene fra DeepSeeks officielle evalueringer:

  • Terminal-Bench 2.1(arbejder i en terminal) — 90,6 mod 87,9 for V4 Pro og 82,7 for den tidligere V4 Flash;
  • CyberGym(cybersikkerhed) — 88,1 mod 83,3 for V4 Pro;
  • DeepSWE v1.1— 74,2 mod 54,4 for V4 Flash;
  • Terminal-Bench 4.0— 31,2 mod 7,0 for V4 Flash.

Oven i det: 90,9 på GPQA Diamond, en Codeforces-rating på 3471 og 65,6 på MathArena Apex. Tallene er ikke uafhængige - DeepSeek rapporterede dem selv, så behandl dem som en påstand snarere end en dom. Men omfanget af springet over den tidligere Flash er synligt uden tredjepartskørsler.

DeepSeek annoncerede også en velordnet udfasning af V4 Pro: fra den 14. september sender dens API anmodninger om V4 Pro til V4.1 Flash og fakturerer dem til Flash-priser. Den praktiske takeaway er enkel: Flash er ikke længere "junior"-modellen. Den bærer nu hovedbelastningen, og den almindelige og vision-versionen eksisterer ikke længere separat.

Mindre cache, billigere agentopgaver

For agentscenarier er den største besparelse ikke i tokenprisen, men i cachen. En agent genlæser samtalehistorikken, instruktionerne og projektfilerne igen og igen, og det er det cachelagrede input, der spiser det meste af regningen. V4.1 Flashs globale KV-cache tager ca890 bytes pr. token- cirka fire gange mindre end V4 Flash - og dens vedvarende cache er komprimeret omkring otte gange.

Modelprisen faldt også i forhold til den tidligere Flash: cachelagret input er 60 % billigere, uncached input omkring en tredjedel billigere og output 11 % billigere. Gevinsten er mest synlig i arbejdsbelastninger, der gentagne gange behandler en stor kontekst; hvor længden af ​​ny produktion betyder mere, er besparelsen mere beskeden.

A data stream compressing into a narrow bright band as it passes through a crystal lattice

V4 Flash versus V4.1 Flash: hvad ændrede sig

ParameterV4 FlashV4.1 Flash
Parametre284B552B
Aktiveret pr. trin13B8B input / 16B output
ArkitekturMoE dekoderCausal Encoder-Decoder
Forstår billederNej, separat visionsmodelJa, indfødt
Sammenhæng1M tokens1M tokens
Terminal-Bench 2.182.790.6
DeepSWE v1.154.474.2
KV-cache pr. token~4× større890 bytes

Pris på NeuralSpace og hvordan man prøver det

På NeuralSpace kører modellen med samme hastighed som den tidligere V4 Flash:$0,14 pr. million input-tokensog$0,28 pr. million output-tokens. Du kan starte med så få som 3 tokens på din saldo; forbrug opkræves fra den delte saldo, uden separat abonnement og uden udenlandsk kort. For at prøve det er et trin nok:

Ofte stillede spørgsmål

Er V4.1 Flash en ny model eller en opdatering?Det er en model af en ny arkitekturfamilie snarere end en revision af den tidligere Flash: arkitekturen ændrede sig, rygraden voksede, og vision blev tilføjet.

Kan den se billeder?Ja, indbygget: Send et billede, et skærmbillede, et diagram eller et dokument. Den tidligere V4 Flash var kun tekst.

Hvad skete der med V4 Pro?DeepSeek udfaser det og dirigerer anmodninger til V4.1 Flash, som slog V4 Pro på agentiske benchmarks.

Hvor meget koster det at prøve?$0,14/$0,28 pr. million tokens, startende fra 3 tokens på din saldo — påchat model side.

Vil gamle v4-flash-anmodninger bryde?Nej: opkald til v4-flash og v4-flash-vision-exp omdirigeres til V4.1 Flash og faktureres efter dens sats.