DeepSeek V4.1 Flash: den nye versjonen ser bilder og slår V4 Pro
DeepSeek har gitt ut V4.1 Flash - en modell som erstattet to tidligere på en gang: den vanlige V4 Flash og en eksperimentell versjon med bildegjenkjenning. Nå er det en enkelt modell som både skriver kode og leser bilder: den slår V4 Pro på agentiske benchmarks, har en én million token-kontekst og bruker omtrent fire ganger mindre KV-cache. På NeuralSpace er V4.1 Flash allerede tilgjengelig i chatten, i "Kode"-delen og via API - her er hva som endret seg sammenlignet med V4 Flash.
Hva er denne modellen
Dette er strengt tatt ikke en revisjon av forrige Flash, men den første modellen av en ny arkitekturfamilie. V4.1 Flash har552 milliarder parameteremot 284 milliarder i V4 Flash, så modellen er merkbart større. Likevel aktiverer den færre parametere per trinn: ca8 milliarder mens du leser innspilletog 16 milliarder mens du genererer svaret.
Den nye ordningen kalles Causal Encoder-Decoder: de 40 transformatorlagene er delt inn i 20 koderlag og 20 dekoderlag, og den delte nøkkelverdibufferen bygges én gang - fra koderens skjulte tilstander - i stedet for å bli beregnet på nytt i hvert lag. Derfor er inndatabehandling billig. Asymmetrien er bevisst: en agent leser mye - filer, samtalehistorikk, instruksjoner - og skriver relativt lite - redigeringer, kommandoer, avgjørelser. Den dyre halvdelen ble gjort lett, så agentarbeid ble også billigere.
Konteksten er én million tokens. Resonneringsinnsats er kontinuerlig justerbar fra 1 til 100: et enkelt spørsmål kan kjøres billig, mens en hard kjede kan kjøre maksimalt uten å bytte modell.
Den ser bilder nå
Dette er den mest synlige forskjellen fra forrige versjon. V4 Flash hadde kun tekstinngang: den kunne ikke se på bilder, og DeepSeek sendte en egen eksperimentell visjonsmodell for det. I V4.1 Flash er visjon innebygd i selve modellen – den godtar tekst og bilder og svarer med tekst.
I praksis kan du gi modellen et skjermbilde, et diagram, et bilde eller en dokumentside som den er. Den vil beskrive bildet, trekke ut tekst fra et skjermbilde eller lese et diagram. Det er spesielt nyttig for agenter: én modell leser både koden og skjermbildet for brukergrensesnittet, uten behov for å bytte mellom to tjenester.
DeepSeek trakk tilbake de gamle modellnavnene: forespørsler til v4-flash og v4-flash-vision-exp blir nå rutet til V4.1 Flash, så eksisterende integrasjoner vil ikke merke noe.

Den slår V4 Pro
Den mest høylytte delen av utgivelsen: V4.1 Flash overgikk den større V4 Pro på agentoppgaver. Her er tallene fra DeepSeeks offisielle evalueringer:
- Terminal-benk 2.1(arbeider i en terminal) — 90,6 mot 87,9 for V4 Pro og 82,7 for forrige V4 Flash;
- CyberGym(cybersikkerhet) — 88,1 mot 83,3 for V4 Pro;
- DeepSWE v1.1— 74,2 mot 54,4 for V4 Flash;
- Terminal-benk 4.0— 31,2 mot 7,0 for V4 Flash.
På toppen av det: 90,9 på GPQA Diamond, en Codeforces-rating på 3471, og 65,6 på MathArena Apex. Tallene er ikke uavhengige - DeepSeek rapporterte dem selv, så behandle dem som et krav i stedet for en dom. Men omfanget av hoppet over forrige Flash er synlig uten tredjepartskjøringer.
DeepSeek annonserte også en ryddig utfasing av V4 Pro: fra 14. september sender API-en forespørsler om V4 Pro til V4.1 Flash og fakturerer dem til Flash-priser. Den praktiske takeawayen er enkel: Flash er ikke lenger "junior"-modellen. Den bærer nå hovedbelastningen, og de vanlige og visjonsversjonene eksisterer ikke lenger separat.
Mindre cache, billigere agentoppgaver
For agentscenarier er hovedbesparelsen ikke i symbolprisen, men i cachen. En agent leser samtalehistorikken, instruksjonene og prosjektfilene igjen og igjen, og det er den bufrede inngangen som spiser mesteparten av regningen. V4.1 Flashs globale KV-cache tar ca890 byte per token— omtrent fire ganger mindre enn V4 Flash — og den vedvarende cachen er komprimert omtrent åtte ganger.
Modellprisen falt også mot forrige Flash: Bufret input er 60 % billigere, ubufret input omtrent en tredjedel billigere, og utgang 11 % billigere. Gevinsten er mest synlig i arbeidsbelastninger som gjentatte ganger behandler en stor kontekst; hvor lengden på ny produksjon betyr mer, er besparelsen mer beskjeden.

V4 Flash versus V4.1 Flash: hva endret seg
| Parameter | V4 Flash | V4.1 Flash |
|---|---|---|
| Parametere | 284B | 552B |
| Aktivert per trinn | 13B | 8B inngang / 16B utgang |
| Arkitektur | MoE-dekoder | Årsakskoder-dekoder |
| Forstår bilder | Nei, egen visjonsmodell | Ja, innfødt |
| Kontekst | 1M tokens | 1M tokens |
| Terminal-benk 2.1 | 82.7 | 90.6 |
| DeepSWE v1.1 | 54.4 | 74.2 |
| KV-cache per token | ~4× større | 890 byte |
Pris på NeuralSpace og hvordan du prøver det
På NeuralSpace kjører modellen med samme hastighet som forrige V4 Flash:$0,14 per million input tokensog$0,28 per million utdata-tokens. Du kan starte med så få som 3 tokens på saldoen din; bruk belastes fra den delte saldoen, uten eget abonnement og uten utenlandsk kort. For å prøve det, er ett trinn nok:
- Chat:demodellside— legg ved et bilde eller skjermbilde og modellen vil lese det;
- Kode:de"Kode"-delen— modellen kobles til prosjektet ditt og fungerer med depotet, filene og terminalen;
- API:få en nøkkel påSiden for API-nøkler; formatet er OpenAI-kompatibelt, og dokumentene lever påneuralspace.pro/en/v1/docs.
Ofte stilte spørsmål
Er V4.1 Flash en ny modell eller en oppdatering?Det er en modell av en ny arkitekturfamilie snarere enn en revisjon av den forrige Flash: arkitekturen endret seg, ryggraden vokste og visjon ble lagt til.
Ser den bilder?Ja, naturlig: send et bilde, skjermbilde, diagram eller dokument. Den forrige V4 Flash var kun tekst.
Hva skjedde med V4 Pro?DeepSeek faser det ut og dirigerer forespørsler til V4.1 Flash, som slo V4 Pro på agenter.
Hvor mye koster det å prøve?$0,14/$0,28 per million tokens, fra 3 tokens på saldoen din - påchat-modellsiden.
Vil gamle v4-flash-forespørsler bryte?Nei: anrop til v4-flash og v4-flash-vision-exp blir rutet til V4.1 Flash og fakturert til sin pris.