← Tous les articles

DeepSeek V4.1 Flash : la nouvelle version voit les images et a contourné V4 Pro

Une baleine numérique brillante s'effondrant en particules lumineuses rapides est une métaphore de la nouvelle version légère de DeepSeek

DeepSeek a sorti V4.1 Flash - un modèle qui a remplacé deux précédents à la fois : le V4 Flash régulier et une version expérimentale avec reconnaissance d'image. Il s'agit désormais d'un modèle qui à la fois écrit du code et analyse les images : selon les tests d'agent, il a contourné V4 Pro, contient un contexte d'un million de jetons et dépense environ un quart de cache. Dans NeuralSpace V4.1 Flash, il est déjà disponible dans le chat, dans la section « Code » et via API - regardons ce qui a changé par rapport à V4 Flash.

Quel modèle

Formellement, il ne s'agit plus d'une révision du précédent Flash, mais du premier modèle d'une nouvelle famille d'architectures. U V4.1 Flash 552 milliards de paramètres contre 284 milliards pour V4 Flash - le modèle est sensiblement plus grand. Mais il y a moins de paramètres actifs à chaque étape : environ 8 milliards lors de la lecture de l'entrée et 16 milliards en générant une réponse.

Le nouveau schéma s'appelle Causal Encoder-Decoder : 40 couches de transformateur sont divisées en 20 couches d'encodeur et 20 couches de décodeur, et le cache général des clés et des valeurs est construit une seule fois - à partir des états cachés de l'encodeur, et n'est pas recalculé dans chaque couche. C'est pourquoi le modèle traite les entrées à moindre coût. L'asymétrie n'a pas été choisie par hasard : l'agent lit beaucoup - fichiers, historique des dialogues, instructions - et écrit relativement peu - éditions, commandes, décisions. La partie coûteuse a été facilitée, de sorte que les tâches des agents sont devenues moins chères.

Contexte - un million de jetons. L'effort de raisonnement est réglable en continu, de 1 à 100 : une question simple peut être exécutée à moindre coût, et une chaîne complexe peut être exécutée au maximum sans changer de modèle.

Maintenant il voit des photos

La différence la plus notable par rapport à la version précédente. V4 Flash n'avait qu'une saisie de texte : elle ne savait pas comment regarder les images, et pour cela DeepSeek a publié séparément un modèle de vision expérimental. Dans V4.1 Flash, la vision est intégrée au modèle lui-même : elle accepte nativement le texte et les images et répond par du texte.

En pratique, cela signifie qu'une capture d'écran de l'interface, un graphique, une photographie ou une page d'un document peut être remis tel quel au modèle. Elle décrira l'image, extraira le texte de la capture d'écran et analysera le diagramme. Ceci est particulièrement pratique pour les agents : un modèle lit à la fois le code et la capture d'écran de l'interface, et il n'est pas nécessaire de basculer entre deux services.

Les anciens noms de modèles DeepSeek ont été mis hors service : les requêtes vers v4-flash et v4-flash-vision-exp sont désormais redirigées vers V4.1 Flash - les anciennes intégrations ne remarqueront rien.

Une lentille dans laquelle les lignes de texte et les cadres d'images coulent et émergent comme un seul flux de lumière.

Contourné V4 Pro

Le plus grand point fort de la version était que V4.1 Flash surpassait le plus grand V4 Pro dans les tâches d'agent. Voici les chiffres des mesures officielles DeepSeek :

  • Terminal-Bench 2.1 (travail dans le terminal) - 90,6 contre 87,9 pour le V4 Pro et 82,7 pour le précédent V4 Flash ;
  • CyberGym (cybersécurité) - 88,1 contre 83,3 pour V4 Pro ;
  • DeepSWE v1.1 — 74,2 contre 54,4 pour V4 Flash ;
  • Terminal-Bench 4.0 — 31,2 contre 7,0 pour V4 Flash.

À cela - 90,9 à GPQA Diamond, note 3471 à Codeforces et 65,6 à MathArena Apex. Les chiffres ne sont pas indépendants, ils ont été donnés par DeepSeek elle-même, ils doivent donc être traités comme une déclaration et non comme un verdict. Mais l'ampleur du saut dans le Flash précédent est visible même sans mesures tierces.

Ensuite, DeepSeek a annoncé qu'il supprimait progressivement V4 Pro : à partir du 14 septembre, son API redirige les requêtes vers V4 Pro vers V4.1 Flash et les compte au rythme Flash. La conclusion pratique est simple : Flash n’est plus un modèle « junior ». Désormais, c'est elle qui supporte la charge principale, et les versions régulière et vision n'existent plus séparément.

Moins de cache signifie des tâches d'agent moins chères

Pour les scénarios basés sur des agents, les principales économies ne résident pas dans le prix du jeton, mais dans le cache. L'agent relit encore et encore l'historique des dialogues, les instructions et les fichiers du projet, et ce sont les entrées mises en cache qui engloutissent l'essentiel de la facture. Le cache global V4.1 Flash KV prend environ 890 octets par jeton - environ quatre fois moins que V4 Flash, et la partie permanente du cache est compressée environ huit fois.

Le prix du modèle lui-même a également diminué par rapport au Flash précédent : l'entrée en cache est 60 % moins chère, l'entrée régulière est environ un tiers moins chère, la sortie est 11 % moins chère. Les gains sont particulièrement visibles dans les tâches qui recyclent encore et encore de vastes contextes ; là où la longueur de la nouvelle réponse est plus importante, les économies sont plus modestes.

Le flux de données est compressé en une étroite bande brillante lorsqu’il traverse le réseau cristallin.

V4 Flash et V4.1 Flash : ce qui a changé

ParamètreV4 FlashV4.1 Flash
Possibilités284 milliards552 milliards
Actif en étape13 milliards8 milliards d'entrées / 16 milliards de sorties
ArchitectureMoE-décodeurCausal Encoder-Decoder
Comprend les imagesNon, modèle de vision séparéOui, natif
Contexte1 million de jetons1 million de jetons
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-cash par jeton~4× plus890 octets

Prix ​​NeuralSpace et comment essayer

Le modèle NeuralSpace fonctionne au même rythme que le précédent V4 Flash : 0,14 $ par million de jetons d'entrée Et 0,28 $ par million de week-ends. Commencez - à partir de 3 jetons sur votre solde ; le débit provient du solde général, sans abonnement séparé et sans carte étrangère. Pour l’essayer, une seule étape suffit :

  • Chat: page modèle — vous pouvez joindre une photo ou une capture d'écran ici, et le modèle les triera ;
  • Code: Rubrique "Codes" — le modèle se connecte au projet et fonctionne avec le référentiel, les fichiers et le terminal ;
  • API : la clé est délivrée dans la section API-clés, format compatible avec OpenAI ; documentation - neuralspace.pro/fr/v1/docs.

Questions fréquemment posées

V4.1 Flash - s'agit-il d'un nouveau modèle ou d'une mise à jour ? Il s'agit d'une version d'une nouvelle famille d'architectures, et non d'une révision du Flash précédent : l'architecture a changé, la partie support s'est agrandie et la vision est apparue.

Voit-elle les photos ? Oui, de manière native : vous pouvez envoyer une photo, une capture d'écran, un graphique ou un document. Le dernier V4 Flash était du texte.

Qu'est-il arrivé au V4 Pro ? DeepSeek le supprime progressivement et redirige les demandes vers V4.1 Flash, qui a surpassé V4 Pro dans les benchmarks basés sur des agents.

Combien ça coûte d'essayer ? 0,14 $/0,28 $ par million de jetons, à partir de 3 jetons en solde - à page de discussion du modèle.

Les anciennes requêtes v4-flash seront-elles interrompues ? Non : les appels vers le v4-flash et le v4-flash-vision-exp sont redirigés vers le V4.1 Flash et comptés à son tarif.