DeepSeek V4.1 Flash: den nye version ser billeder og slår V4 Pro
DeepSeek har udgivet V4.1 Flash - en model, der erstattede to tidligere på én gang: den almindelige V4 Flash og en eksperimentel version med billedgenkendelse. Nu er det en enkelt model, der både skriver kode og læser billeder: den slår V4 Pro på agentiske benchmarks, har en en million token-kontekst og bruger cirka fire gange mindre KV-cache. På NeuralSpace er V4.1 Flash allerede tilgængelig i chatten, i "Kode"-sektionen og via API'et - her er, hvad der er ændret sammenlignet med V4 Flash.
Hvad er denne model
Strengt taget er dette ikke en revision af den tidligere Flash, men den første model af en ny arkitekturfamilie. V4.1 Flash har552 milliarder parametremod 284 milliarder i V4 Flash, så modellen er mærkbart større. Alligevel aktiverer den færre parametre pr. trin: ca8 milliarder, mens du læser inputog 16 milliarder, mens svaret genereres.
Det nye skema kaldes Causal Encoder-Decoder: de 40 transformerlag opdeles i 20 koderlag og 20 dekoderlag, og den delte nøgleværdi-cache bygges én gang - fra koderens skjulte tilstande - i stedet for at blive genberegnet i hvert lag. Derfor er inputbehandling billig. Asymmetrien er bevidst: en agent læser meget - filer, samtalehistorik, instruktioner - og skriver forholdsvis lidt - redigeringer, kommandoer, beslutninger. Den dyre halvdel blev gjort let, så agenturarbejdet blev også billigere.
Konteksten er en million tokens. Begrundelsesindsatsen kan løbende justeres fra 1 til 100: Et simpelt spørgsmål kan køre billigt, mens en hård kæde maksimalt kan køre uden at skifte model.
Den ser billeder nu
Dette er den mest synlige forskel fra den tidligere version. V4 Flash havde en tekst-kun input: den kunne ikke se på billeder, og DeepSeek sendte en separat eksperimentel vision-model til det. I V4.1 Flash er vision indbygget i selve modellen - den accepterer naturligt tekst og billeder og svarer med tekst.
I praksis kan du give modellen et UI-skærmbillede, et diagram, et foto eller en dokumentside, som den er. Det vil beskrive billedet, udtrække tekst fra et skærmbillede eller læse et diagram. Det er især praktisk for agenter: én model læser både koden og UI-skærmbilledet uden at skulle skifte mellem to tjenester.
DeepSeek trak de gamle modelnavne tilbage: anmodninger til v4-flash og v4-flash-vision-exp er nu dirigeret til V4.1 Flash, så eksisterende integrationer vil intet bemærke.

Det slår V4 Pro
Den mest højlydte del af udgivelsen: V4.1 Flash overgik den større V4 Pro på agentopgaver. Her er tallene fra DeepSeeks officielle evalueringer:
- Terminal-Bench 2.1(arbejder i en terminal) — 90,6 mod 87,9 for V4 Pro og 82,7 for den tidligere V4 Flash;
- CyberGym(cybersikkerhed) — 88,1 mod 83,3 for V4 Pro;
- DeepSWE v1.1— 74,2 mod 54,4 for V4 Flash;
- Terminal-Bench 4.0— 31,2 mod 7,0 for V4 Flash.
Oven i det: 90,9 på GPQA Diamond, en Codeforces-rating på 3471 og 65,6 på MathArena Apex. Tallene er ikke uafhængige - DeepSeek rapporterede dem selv, så behandl dem som en påstand snarere end en dom. Men omfanget af springet over den tidligere Flash er synligt uden tredjepartskørsler.
DeepSeek annoncerede også en velordnet udfasning af V4 Pro: fra den 14. september sender dens API anmodninger om V4 Pro til V4.1 Flash og fakturerer dem til Flash-priser. Den praktiske takeaway er enkel: Flash er ikke længere "junior"-modellen. Den bærer nu hovedbelastningen, og den almindelige og vision-versionen eksisterer ikke længere separat.
Mindre cache, billigere agentopgaver
For agentscenarier er den største besparelse ikke i tokenprisen, men i cachen. En agent genlæser samtalehistorikken, instruktionerne og projektfilerne igen og igen, og det er det cachelagrede input, der spiser det meste af regningen. V4.1 Flashs globale KV-cache tager ca890 bytes pr. token- cirka fire gange mindre end V4 Flash - og dens vedvarende cache er komprimeret omkring otte gange.
Modelprisen faldt også i forhold til den tidligere Flash: cachelagret input er 60 % billigere, uncached input omkring en tredjedel billigere og output 11 % billigere. Gevinsten er mest synlig i arbejdsbelastninger, der gentagne gange behandler en stor kontekst; hvor længden af ny produktion betyder mere, er besparelsen mere beskeden.

V4 Flash versus V4.1 Flash: hvad ændrede sig
| Parameter | V4 Flash | V4.1 Flash |
|---|---|---|
| Parametre | 284B | 552B |
| Aktiveret pr. trin | 13B | 8B input / 16B output |
| Arkitektur | MoE dekoder | Causal Encoder-Decoder |
| Forstår billeder | Nej, separat visionsmodel | Ja, indfødt |
| Sammenhæng | 1M tokens | 1M tokens |
| Terminal-Bench 2.1 | 82.7 | 90.6 |
| DeepSWE v1.1 | 54.4 | 74.2 |
| KV-cache pr. token | ~4× større | 890 bytes |
Pris på NeuralSpace og hvordan man prøver det
På NeuralSpace kører modellen med samme hastighed som den tidligere V4 Flash:$0,14 pr. million input-tokensog$0,28 pr. million output-tokens. Du kan starte med så få som 3 tokens på din saldo; forbrug opkræves fra den delte saldo, uden separat abonnement og uden udenlandsk kort. For at prøve det er et trin nok:
- Snak:demodel side— vedhæft et billede eller skærmbillede, og modellen vil læse det;
- Kode:de"Kode" sektion— modellen forbinder til dit projekt og arbejder med lageret, filerne og terminalen;
- API:få en nøgle påSiden med API-nøgler; formatet er OpenAI-kompatibelt, og dokumenterne lever klneuralspace.pro/en/v1/docs.
Ofte stillede spørgsmål
Er V4.1 Flash en ny model eller en opdatering?Det er en model af en ny arkitekturfamilie snarere end en revision af den tidligere Flash: arkitekturen ændrede sig, rygraden voksede, og vision blev tilføjet.
Kan den se billeder?Ja, indbygget: Send et billede, et skærmbillede, et diagram eller et dokument. Den tidligere V4 Flash var kun tekst.
Hvad skete der med V4 Pro?DeepSeek udfaser det og dirigerer anmodninger til V4.1 Flash, som slog V4 Pro på agentiske benchmarks.
Hvor meget koster det at prøve?$0,14/$0,28 pr. million tokens, startende fra 3 tokens på din saldo — påchat model side.
Vil gamle v4-flash-anmodninger bryde?Nej: opkald til v4-flash og v4-flash-vision-exp omdirigeres til V4.1 Flash og faktureres efter dens sats.