DeepSeek V4.1 Flash: la nuova versione vede le immagini e ha bypassato V4 Pro
DeepSeek ha rilasciato V4.1 Flash - un modello che ha sostituito due precedenti contemporaneamente: il normale V4 Flash e una versione sperimentale con riconoscimento delle immagini. Ora, questo è un modello che scrive codice e analizza immagini: secondo i benchmark dell'agente, ha bypassato V4 Pro, contiene un contesto di un milione di token e spende circa un quarto della cache. In NeuralSpace V4.1 Flash è già disponibile nella chat, nella sezione “Codice” e tramite API - vediamo cosa è cambiato rispetto a V4 Flash.
Che modello
Formalmente non si tratta più di una revisione della precedente Flash, ma del primo modello di una nuova famiglia di architetture. U V4.1 Flash 552 miliardi di parametri contro 284 miliardi per V4 Flash - il modello è notevolmente più grande. Ma ci sono meno parametri attivi ad ogni passaggio: circa 8 miliardi durante la lettura dell'input e 16 miliardi quando si genera una risposta.
Il nuovo schema si chiama Causal Encoder-Decoder: 40 strati del trasformatore sono divisi in 20 strati del codificatore e 20 strati del decodificatore, e la cache generale di chiavi e valori viene creata una volta - dagli stati nascosti del codificatore, e non viene ricalcolata nuovamente in ogni strato. Questo è il motivo per cui il modello elabora gli input in modo economico. L'asimmetria non è stata scelta a caso: l'agente legge molto - file, cronologia dei dialoghi, istruzioni - e scrive relativamente poco - modifiche, comandi, decisioni. La parte costosa è stata semplificata, quindi i compiti dell'agente sono diventati più economici.
Contesto: un milione di token. Lo sforzo di ragionamento è regolabile in continuo, da 1 a 100: una domanda semplice può essere eseguita in modo economico, e una catena complessa può essere eseguita al massimo senza modificare il modello.
Adesso vede le foto
La differenza più evidente rispetto alla versione precedente. V4 Flash aveva solo un input testuale: non sapeva come guardare le immagini, e per questo DeepSeek ha rilasciato separatamente un modello di visione sperimentale. In V4.1 Flash la visione è integrata nel modello stesso: accetta nativamente testo e immagini e risponde con il testo.
In pratica ciò significa che uno screenshot dell'interfaccia, un grafico, una fotografia o una pagina di un documento possono essere forniti al modello così come sono. Descriverà l'immagine, estrarrà il testo dallo screenshot e analizzerà il diagramma. Ciò è particolarmente conveniente per gli agenti: un modello legge sia il codice che lo screenshot dell'interfaccia e non è necessario passare da un servizio all'altro.
I vecchi nomi dei modelli DeepSeek sono stati disattivati: le richieste a v4-flash e v4-flash-vision-exp vengono ora reindirizzate a V4.1 Flash - le vecchie integrazioni non noteranno nulla.

Bypassato V4 Pro
Il punto più importante del rilascio è stato che V4.1 Flash ha sovraperformato il più grande V4 Pro nelle attività degli agenti. Ecco i numeri delle misurazioni ufficiali DeepSeek:
- Terminal-Bench 2.1 (lavoro nel terminal) - 90,6 contro 87,9 per V4 Pro e 82,7 per il precedente V4 Flash;
- CyberGym (sicurezza informatica) - 88,1 contro 83,3 per V4 Pro;
- DeepSWE v1.1 — 74,2 contro 54,4 per V4 Flash;
- Terminal-Bench 4.0 — 31,2 contro 7,0 per V4 Flash.
A questo - 90,9 a GPQA Diamond, valutazione 3471 a Codeforces e 65,6 a MathArena Apex. I numeri non sono indipendenti, sono stati forniti dalla stessa DeepSeek, quindi dovrebbero essere trattati come una dichiarazione e non come un verdetto. Ma la portata del salto nel Flash precedente è visibile anche senza misurazioni di terze parti.
Successivamente, DeepSeek ha annunciato che sta gradualmente eliminando V4 Pro: dal 14 settembre, il suo API reindirizza le richieste da V4 Pro a V4.1 Flash e le conta alla velocità Flash. La conclusione pratica è semplice: Flash non è più un modello “junior”. Ora è lei a sostenere il carico principale e le versioni normale e visionaria non esistono più separatamente.
Meno cache significa attività dell'agente più economiche
Per gli scenari basati su agenti, il risparmio principale non risiede nel prezzo del token, ma nella cache. L'agente rilegge più e più volte la cronologia dei dialoghi, le istruzioni e i file di progetto, ed è l'input memorizzato nella cache che assorbe la maggior parte del conto. La cache globale V4.1 Flash KV richiede circa 890 byte per token - circa quattro volte meno di V4 Flash e la parte permanente della cache viene compressa di circa otto volte.
Anche il prezzo del modello stesso è diminuito rispetto al Flash precedente: l'input memorizzato nella cache è più economico del 60%, l'input normale costa circa un terzo in meno, l'output è più economico dell'11%. I vantaggi sono particolarmente evidenti nelle attività che riciclano più e più volte contesti di grandi dimensioni; dove la lunghezza della nuova risposta è più importante, il risparmio è più modesto.

V4 Flash e V4.1 Flash: cosa è cambiato
| Parametro | V4 Flash | V4.1 Flash |
|---|---|---|
| Opzioni | 284 miliardi | 552 miliardi |
| Attivo al passo | 13 miliardi | 8 miliardi di input / 16 miliardi di output |
| Architettura | MoE-decodificatore | Causal Encoder-Decoder |
| Comprende le immagini | No, modello di visione separato | Sì, nativo |
| Contesto | 1 milione di gettoni | 1 milione di gettoni |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| KV contanti per gettone | ~4× in più | 890 byte |
Prezzo NeuralSpace e come provarlo
Il modello NeuralSpace funziona alla stessa velocità del precedente V4 Flash: $ 0,14 per milione di token di input E $ 0,28 per milione di fine settimana. Inizia: da 3 gettoni sul tuo saldo; l'addebito avviene dal saldo generale, senza sottoscrizione separata e carta estera. Per provarlo basta un solo passaggio:
- Chiacchierata: pagina del modello — puoi allegare un'immagine o uno screenshot qui e il modello li risolverà;
- Codice: Sezione "Codice". — il modello si connette al progetto e funziona con il repository, i file e il terminale;
- API: la chiave viene rilasciata nella sezione API-tasti, formato compatibile con OpenAI; documentazione - neuralspace.pro/it/v1/docs.
Domande frequenti
V4.1 Flash - è un nuovo modello o un aggiornamento? Questa è una versione di una nuova famiglia di architetture, e non una revisione del precedente Flash: l'architettura è cambiata, la parte portante è cresciuta ed è apparsa la visione.
Vede le foto? Sì, in modo nativo: puoi inviare una foto, uno screenshot, un grafico o un documento. L'ultimo V4 Flash era testo.
Cos'è successo a V4 Pro? DeepSeek lo sta gradualmente eliminando e reindirizzando le richieste a V4.1 Flash, che ha sovraperformato V4 Pro nei benchmark basati su agenti.
Quanto costa provare? $ 0,14/$ 0,28 per milione di token, a partire da 3 token in totale - a la pagina di chat della modella.
Le vecchie richieste a v4-flash si interromperanno? No: le chiamate al v4-flash e al v4-flash-vision-exp vengono reindirizzate al V4.1 Flash e conteggiate secondo la sua tariffa.