DeepSeek V4.1 Flash: de nieuwe versie ziet afbeeldingen en heeft V4 Pro omzeild
DeepSeek vrijgegeven V4.1 Flash - een model dat twee voorgaande tegelijk verving: de reguliere V4 Flash en een experimentele versie met beeldherkenning. Dit is een model dat zowel code schrijft als afbeeldingen parseert: volgens agentbenchmarks omzeilde het V4 Pro, bevat het een context van een miljoen tokens en besteedt het ongeveer een kwart zoveel cache. In NeuralSpace V4.1 Flash is het al beschikbaar in de chat, in de sectie “Code” en via API - laten we eens kijken wat er is veranderd vergeleken met V4 Flash.
Welk model
Formeel is dit niet langer een herziening van de vorige Flash, maar het eerste model van een nieuwe familie van architecturen. U V4.1 Flash 552 miljard parameters versus 284 miljard voor V4 Flash – het model is merkbaar groter. Maar er zijn bij elke stap minder actieve parameters: ongeveer 8 miljard bij het lezen van input en 16 miljard bij het genereren van een reactie.
Het nieuwe schema heet Causal Encoder-Decoder: 40 transformatorlagen zijn verdeeld in 20 encoderlagen en 20 decoderlagen, en de algemene cache van sleutels en waarden wordt één keer opgebouwd - vanuit de verborgen toestanden van de encoder, en wordt niet in elke laag opnieuw berekend. Daarom verwerkt het model input goedkoop. De asymmetrie is niet toevallig gekozen: de agent leest veel - bestanden, dialooggeschiedenis, instructies - en schrijft relatief weinig - bewerkingen, opdrachten, beslissingen. Het dure deel werd gemakkelijk gemaakt, waardoor de taken van de agenten goedkoper werden.
Context - een miljoen tokens. De redeneerinspanning is continu instelbaar, van 1 tot 100: een eenvoudige vraag kan goedkoop worden uitgevoerd, en een complexe keten kan maximaal worden uitgevoerd zonder het model te veranderen.
Nu ziet hij foto's
Het meest opvallende verschil met de vorige versie. V4 Flash had alleen tekstinvoer: ze wist niet hoe ze naar afbeeldingen moest kijken, en hiervoor bracht DeepSeek afzonderlijk een experimenteel visiemodel uit. In V4.1 Flash is vision ingebouwd in het model zelf: het accepteert standaard tekst en afbeeldingen en reageert met tekst.
In de praktijk betekent dit dat een screenshot van de interface, een grafiek, een foto of een pagina van een document ongewijzigd aan het model kan worden gegeven. Ze zal de afbeelding beschrijven, tekst uit de schermafbeelding halen en het diagram analyseren. Dit is vooral handig voor agenten: één model leest zowel de code als de interface-screenshot, en het is niet nodig om tussen twee services te schakelen.
Oude modelnamen DeepSeek zijn buiten gebruik gesteld: verzoeken aan v4-flash en v4-flash-vision-exp worden nu doorgestuurd naar V4.1 Flash - oude integraties zullen er niets van merken.

Omzeild V4 Pro
Het grootste hoogtepunt van de release was dat V4.1 Flash beter presteerde dan de grotere V4 Pro bij agenttaken. Hier zijn de cijfers van officiële metingen DeepSeek:
- Terminal-Bench 2.1 (werk in de terminal) - 90,6 versus 87,9 voor V4 Pro en 82,7 voor de vorige V4 Flash;
- CyberGym (cyberbeveiliging) - 88,1 versus 83,3 voor V4 Pro;
- DeepSWE v1.1 — 74,2 versus 54,4 voor V4 Flash;
- Terminal-Bench 4.0 — 31,2 versus 7,0 voor V4 Flash.
Hierop - 90,9 op GPQA Diamond, beoordeling 3471 op Codeforces en 65,6 op MathArena Apex. De cijfers zijn niet onafhankelijk, ze zijn door DeepSeek zelf gegeven, dus ze moeten worden behandeld als een verklaring en niet als een oordeel. Maar de omvang van de sprong in de vorige Flash is zelfs zonder metingen van derden zichtbaar.
Vervolgens kondigde DeepSeek aan dat het V4 Pro geleidelijk afbouwt: vanaf 14 september stuurt API verzoeken om naar V4 Pro naar V4.1 Flash en telt deze met de Flash-snelheid. De praktische conclusie is simpel: Flash is niet langer een ‘junior’-model. Nu is zij het die de hoofdlast draagt, en de reguliere en vision-versies bestaan niet langer afzonderlijk.
Minder cache betekent goedkopere agenttaken
Voor op agenten gebaseerde scenario's zitten de belangrijkste besparingen niet in de tokenprijs, maar in de cache. De agent herleest de dialooggeschiedenis, instructies en projectbestanden keer op keer, en het is de in de cache opgeslagen invoer die het grootste deel van de rekening opslokt. De V4.1 Flash globale KV cache duurt ongeveer 890 bytes per token - ongeveer vier keer minder dan V4 Flash, en het permanente deel van de cache wordt ongeveer acht keer gecomprimeerd.
De prijs van het model zelf is ook gedaald ten opzichte van de vorige Flash: gecachte invoer is 60% goedkoper, reguliere invoer is ongeveer een derde goedkoper, uitvoer is 11% goedkoper. De winst is vooral merkbaar bij taken waarbij grote contexten keer op keer worden hergebruikt; waar de lengte van het nieuwe antwoord belangrijker is, zijn de besparingen bescheidener.

V4 Flash en V4.1 Flash: wat is er veranderd
| Parameter | V4 Flash | V4.1 Flash |
|---|---|---|
| Opties | 284 miljard | 552 miljard |
| Actief in stap | 13 miljard | 8 miljard input / 16 miljard output |
| Architectuur | MoE-decoder | Causal Encoder-Decoder |
| Begrijpt afbeeldingen | Nee, apart visiemodel | Ja, inheems |
| Context | 1 miljoen tokens | 1 miljoen tokens |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| KV-contant per token | ~4× meer | 890 bytes |
Prijs NeuralSpace en hoe te proberen
Het NeuralSpace-model werkt in hetzelfde tempo als het vorige V4 Flash: $0,14 per miljoen invoertokens En $ 0,28 per miljoen weekenden. Start - vanaf 3 tokens op je saldo; de afschrijving komt uit het algemene saldo, zonder apart abonnement en buitenlandse kaart. Om het te proberen, is slechts één stap voldoende:
- Chatten: modelpagina — je kunt hier een foto of screenshot bijvoegen, en het model zal ze uitzoeken;
- Code: Sectie "Code". — het model sluit aan op het project en werkt met de repository, bestanden en terminal;
- API: de sleutel wordt uitgegeven in de sectie API-toetsen, formaat compatibel met OpenAI; documentatie - neuralspace.pro/nl/v1/docs.
Veelgestelde vragen
V4.1 Flash - is dit een nieuw model of een update? Dit is een versie van een nieuwe familie van architecturen, en geen herziening van de vorige Flash: de architectuur is veranderd, het ondersteunende deel is gegroeid en de visie is verschenen.
Ziet ze de foto's? Ja, standaard: u kunt een foto, screenshot, diagram of document verzenden. De laatste V4 Flash was tekst.
Wat is er gebeurd met V4 Pro? DeepSeek voert dit geleidelijk uit en stuurt verzoeken door naar V4.1 Flash, dat beter presteerde dan V4 Pro in agent-gebaseerde benchmarks.
Hoeveel kost het om te proberen? $0,14/$0,28 per miljoen tokens, vanaf 3 tokens per saldo - at chatpagina van het model.
Zullen oude verzoeken om v4-flash te breken? Nee: oproepen naar v4-flash en v4-flash-vision-exp worden doorgestuurd naar V4.1 Flash en worden tegen het tarief geteld.