← Alle Artikel

DeepSeek V4.1 Flash: Die neue Version sieht Bilder und hat V4 Pro umgangen

Ein leuchtender digitaler Wal, der in schnelle helle Partikel zerfällt, ist eine Metapher für die neue Lichtversion von DeepSeek

DeepSeek veröffentlichte V4.1 Flash – ein Modell, das gleich zwei Vorgänger ersetzte: das reguläre V4 Flash und eine experimentelle Version mit Bilderkennung. Dies ist nun ein Modell, das sowohl Code schreibt als auch Bilder analysiert: Laut Agenten-Benchmarks umgeht es V4 Pro, enthält einen Kontext von einer Million Token und verbraucht etwa ein Viertel so viel Cache. In NeuralSpace V4.1 Flash ist es bereits im Chat, im Abschnitt „Code“ und bis API verfügbar – schauen wir uns an, was sich im Vergleich zu V4 Flash geändert hat.

Welches Modell

Formal handelt es sich hierbei nicht mehr um eine Überarbeitung des bisherigen Flash, sondern um das erste Modell einer neuen Architekturfamilie. U V4.1 Flash 552 Milliarden Parameter gegenüber 284 Milliarden für V4 Flash – das Modell ist deutlich größer. Bei jedem Schritt gibt es jedoch weniger aktive Parameter: ungefähr 8 Milliarden beim Lesen der Eingabe und 16 Milliarden beim Generieren einer Antwort.

Das neue Schema heißt Causal Encoder-Decoder: 40 Transformatorschichten werden in 20 Encoderschichten und 20 Decoderschichten unterteilt, und der allgemeine Cache von Schlüsseln und Werten wird einmal erstellt – aus den verborgenen Zuständen des Encoders und wird nicht in jeder Schicht erneut neu berechnet. Aus diesem Grund verarbeitet das Modell Eingaben kostengünstig. Die Asymmetrie wurde nicht zufällig gewählt: Der Agent liest viel – Dateien, Dialogverlauf, Anweisungen – und schreibt relativ wenig – Bearbeitungen, Befehle, Entscheidungen. Der teure Teil wurde vereinfacht, sodass die Agentenaufgaben billiger wurden.

Kontext – eine Million Token. Der Argumentationsaufwand ist stufenlos einstellbar, von 1 bis 100: Eine einfache Frage kann kostengünstig ausgeführt werden, eine komplexe Kette kann maximal ausgeführt werden, ohne das Modell zu ändern.

Jetzt sieht er Bilder

Der auffälligste Unterschied zur Vorgängerversion. V4 Flash hatte nur eine Texteingabe: Sie wusste nicht, wie man Bilder betrachtet, und dafür veröffentlichte DeepSeek separat ein experimentelles Sehmodell. In V4.1 Flash ist Vision in das Modell selbst integriert – es akzeptiert nativ Text und Bilder und antwortet mit Text.

In der Praxis bedeutet dies, dass dem Modell ein Screenshot der Benutzeroberfläche, ein Diagramm, ein Foto oder eine Seite eines Dokuments unverändert übergeben werden kann. Sie wird das Bild beschreiben, Text aus dem Screenshot extrahieren und das Diagramm analysieren. Dies ist besonders praktisch für Agenten: Ein Modell liest sowohl den Code als auch den Schnittstellen-Screenshot und es ist nicht erforderlich, zwischen zwei Diensten zu wechseln.

Alte Modellnamen DeepSeek wurden außer Betrieb genommen: Anfragen an v4-flash und v4-flash-vision-exp werden jetzt an V4.1 Flash umgeleitet – alte Integrationen werden nichts bemerken.

Eine Linse, in die Textzeilen und Bildrahmen einfließen und als einziger Lichtstrom wieder zum Vorschein kommen.

Umgangen V4 Pro

Das größte Highlight der Veröffentlichung war, dass V4.1 Flash das größere V4 Pro bei Agentenaufgaben übertraf. Hier sind die Zahlen der offiziellen Messungen DeepSeek:

  • Terminal-Bench 2.1 (Arbeit im Terminal) – 90,6 gegenüber 87,9 für V4 Pro und 82,7 für das vorherige V4 Flash;
  • CyberGym (Cybersicherheit) – 88,1 gegenüber 83,3 für V4 Pro;
  • DeepSWE v1.1 — 74,2 gegenüber 54,4 für V4 Flash;
  • Terminal-Bench 4.0 — 31,2 gegenüber 7,0 für V4 Flash.

Dazu - 90,9 bei GPQA Diamond, Bewertung 3471 bei Codeforces und 65,6 bei MathArena Apex. Die Zahlen sind nicht unabhängig, sie wurden von DeepSeek selbst angegeben und sollten daher als Aussage und nicht als Urteil betrachtet werden. Aber das Ausmaß des Sprungs im vorherigen Flash ist auch ohne Messungen Dritter sichtbar.

Als nächstes gab DeepSeek bekannt, dass es V4 Pro schrittweise auslaufen lässt: Ab dem 14. September leitet API Anfragen an V4 Pro bis V4.1 Flash um und zählt sie mit der Flash-Rate. Die praktische Schlussfolgerung ist einfach: Flash ist kein „Junior“-Modell mehr. Jetzt trägt sie die Hauptlast, und die reguläre und die Vision-Version existieren nicht mehr getrennt voneinander.

Weniger Cache bedeutet günstigere Agentenaufgaben

Bei agentenbasierten Szenarien liegen die wesentlichen Einsparungen nicht im Token-Preis, sondern im Cache. Der Agent liest den Dialogverlauf, die Anweisungen und die Projektdateien immer wieder neu, und es sind die zwischengespeicherten Eingaben, die den Großteil der Rechnung verschlingen. Der V4.1 Flash globale KV-Cache benötigt ca 890 Byte pro Token - etwa viermal weniger als V4 Flash, und der permanente Teil des Caches wird etwa achtmal komprimiert.

Auch der Preis des Modells selbst ist im Vergleich zum vorherigen Flash gesunken: Die zwischengespeicherte Eingabe ist 60 % günstiger, die reguläre Eingabe ist etwa ein Drittel günstiger, die Ausgabe ist 11 % günstiger. Die Vorteile machen sich besonders bei Aufgaben bemerkbar, bei denen große Kontexte immer wieder recycelt werden. Wo die Länge der neuen Antwort wichtiger ist, sind die Einsparungen geringer.

Der Datenstrom wird beim Durchgang durch das Kristallgitter zu einem schmalen hellen Streifen komprimiert.

V4 Flash und V4.1 Flash: was sich geändert hat

ParameterV4 FlashV4.1 Flash
Optionen284 Milliarden552 Milliarden
Aktiv im Schritt13 Milliarden8 Milliarden Input / 16 Milliarden Output
ArchitekturMoE-DecoderCausal Encoder-Decoder
Versteht BilderNein, separates Vision-ModellJa, einheimisch
Kontext1 Million Token1 Million Token
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-Bargeld pro Token~4× mehr890 Byte

Preis NeuralSpace und wie man es ausprobiert

Das NeuralSpace-Modell arbeitet mit der gleichen Geschwindigkeit wie das vorherige V4 Flash: 0,14 $ pro Million Input-Token Und 0,28 $ pro Million Wochenenden. Start – ab 3 Token auf Ihrem Guthaben; Die Abbuchung erfolgt vom Gesamtsaldo, ohne separates Abonnement und ohne ausländische Karte. Um es auszuprobieren, genügt ein Schritt:

  • Chat: Modellseite — Sie können hier ein Bild oder einen Screenshot anhängen, und das Modell wird sie sortieren;
  • Code: Abschnitt „Code“. — Das Modell stellt eine Verbindung zum Projekt her und arbeitet mit dem Repository, den Dateien und dem Terminal.
  • API: Der Schlüssel wird im Abschnitt ausgegeben API-Tasten, Format kompatibel mit OpenAI; Dokumentation - neuralspace.pro/de/v1/docs.

Häufig gestellte Fragen

V4.1 Flash – ist das ein neues Modell oder ein Update? Dies ist eine Version einer neuen Architekturfamilie und keine Überarbeitung des vorherigen Flash: Die Architektur hat sich geändert, der unterstützende Teil ist gewachsen und es ist eine Vision entstanden.

Sieht sie die Bilder? Ja, nativ: Sie können ein Foto, einen Screenshot, ein Diagramm oder ein Dokument senden. Das letzte V4 Flash war Text.

Was ist mit V4 Pro passiert? DeepSeek lässt es schrittweise auslaufen und leitet Anfragen an V4.1 Flash um, das V4 Pro in agentenbasierten Benchmarks übertraf.

Wie viel kostet es, es auszuprobieren? 0,14 $/0,28 $ pro Million Token, beginnend mit 3 Token im Saldo – bei Chat-Seite des Models.

Werden alte Anfragen zu v4-flash kaputt gehen? Nein: Anrufe zu v4-flash und v4-flash-vision-exp werden zu V4.1 Flash umgeleitet und zu deren Tarif gezählt.