← Tutti gli articoli

DeepSeek V4.1 Flash: la nuova versione vede le immagini e ha bypassato V4 Pro

Una balena digitale luminosa che si sbriciola in particelle veloci e luminose è una metafora per la nuova versione leggera di DeepSeek

DeepSeek ha rilasciato V4.1 Flash - un modello che ha sostituito due precedenti contemporaneamente: il normale V4 Flash e una versione sperimentale con riconoscimento delle immagini. Ora, questo è un modello che scrive codice e analizza immagini: secondo i benchmark dell'agente, ha bypassato V4 Pro, contiene un contesto di un milione di token e spende circa un quarto della cache. In NeuralSpace V4.1 Flash è già disponibile nella chat, nella sezione “Codice” e tramite API - vediamo cosa è cambiato rispetto a V4 Flash.

Che modello

Formalmente non si tratta più di una revisione della precedente Flash, ma del primo modello di una nuova famiglia di architetture. U V4.1 Flash 552 miliardi di parametri contro 284 miliardi per V4 Flash - il modello è notevolmente più grande. Ma ci sono meno parametri attivi ad ogni passaggio: circa 8 miliardi durante la lettura dell'input e 16 miliardi quando si genera una risposta.

Il nuovo schema si chiama Causal Encoder-Decoder: 40 strati del trasformatore sono divisi in 20 strati del codificatore e 20 strati del decodificatore, e la cache generale di chiavi e valori viene creata una volta - dagli stati nascosti del codificatore, e non viene ricalcolata nuovamente in ogni strato. Questo è il motivo per cui il modello elabora gli input in modo economico. L'asimmetria non è stata scelta a caso: l'agente legge molto - file, cronologia dei dialoghi, istruzioni - e scrive relativamente poco - modifiche, comandi, decisioni. La parte costosa è stata semplificata, quindi i compiti dell'agente sono diventati più economici.

Contesto: un milione di token. Lo sforzo di ragionamento è regolabile in continuo, da 1 a 100: una domanda semplice può essere eseguita in modo economico, e una catena complessa può essere eseguita al massimo senza modificare il modello.

Adesso vede le foto

La differenza più evidente rispetto alla versione precedente. V4 Flash aveva solo un input testuale: non sapeva come guardare le immagini, e per questo DeepSeek ha rilasciato separatamente un modello di visione sperimentale. In V4.1 Flash la visione è integrata nel modello stesso: accetta nativamente testo e immagini e risponde con il testo.

In pratica ciò significa che uno screenshot dell'interfaccia, un grafico, una fotografia o una pagina di un documento possono essere forniti al modello così come sono. Descriverà l'immagine, estrarrà il testo dallo screenshot e analizzerà il diagramma. Ciò è particolarmente conveniente per gli agenti: un modello legge sia il codice che lo screenshot dell'interfaccia e non è necessario passare da un servizio all'altro.

I vecchi nomi dei modelli DeepSeek sono stati disattivati: le richieste a v4-flash e v4-flash-vision-exp vengono ora reindirizzate a V4.1 Flash - le vecchie integrazioni non noteranno nulla.

Una lente nella quale confluiscono linee di testo e cornici di immagini che emergono come un unico flusso di luce.

Bypassato V4 Pro

Il punto più importante del rilascio è stato che V4.1 Flash ha sovraperformato il più grande V4 Pro nelle attività degli agenti. Ecco i numeri delle misurazioni ufficiali DeepSeek:

  • Terminal-Bench 2.1 (lavoro nel terminal) - 90,6 contro 87,9 per V4 Pro e 82,7 per il precedente V4 Flash;
  • CyberGym (sicurezza informatica) - 88,1 contro 83,3 per V4 Pro;
  • DeepSWE v1.1 — 74,2 contro 54,4 per V4 Flash;
  • Terminal-Bench 4.0 — 31,2 contro 7,0 per V4 Flash.

A questo - 90,9 a GPQA Diamond, valutazione 3471 a Codeforces e 65,6 a MathArena Apex. I numeri non sono indipendenti, sono stati forniti dalla stessa DeepSeek, quindi dovrebbero essere trattati come una dichiarazione e non come un verdetto. Ma la portata del salto nel Flash precedente è visibile anche senza misurazioni di terze parti.

Successivamente, DeepSeek ha annunciato che sta gradualmente eliminando V4 Pro: dal 14 settembre, il suo API reindirizza le richieste da V4 Pro a V4.1 Flash e le conta alla velocità Flash. La conclusione pratica è semplice: Flash non è più un modello “junior”. Ora è lei a sostenere il carico principale e le versioni normale e visionaria non esistono più separatamente.

Meno cache significa attività dell'agente più economiche

Per gli scenari basati su agenti, il risparmio principale non risiede nel prezzo del token, ma nella cache. L'agente rilegge più e più volte la cronologia dei dialoghi, le istruzioni e i file di progetto, ed è l'input memorizzato nella cache che assorbe la maggior parte del conto. La cache globale V4.1 Flash KV richiede circa 890 byte per token - circa quattro volte meno di V4 Flash e la parte permanente della cache viene compressa di circa otto volte.

Anche il prezzo del modello stesso è diminuito rispetto al Flash precedente: l'input memorizzato nella cache è più economico del 60%, l'input normale costa circa un terzo in meno, l'output è più economico dell'11%. I vantaggi sono particolarmente evidenti nelle attività che riciclano più e più volte contesti di grandi dimensioni; dove la lunghezza della nuova risposta è più importante, il risparmio è più modesto.

Il flusso di dati viene compresso in una stretta striscia luminosa mentre passa attraverso il reticolo cristallino.

V4 Flash e V4.1 Flash: cosa è cambiato

ParametroV4 FlashV4.1 Flash
Opzioni284 miliardi552 miliardi
Attivo al passo13 miliardi8 miliardi di input / 16 miliardi di output
ArchitetturaMoE-decodificatoreCausal Encoder-Decoder
Comprende le immaginiNo, modello di visione separatoSì, nativo
Contesto1 milione di gettoni1 milione di gettoni
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV contanti per gettone~4× in più890 byte

Prezzo NeuralSpace e come provarlo

Il modello NeuralSpace funziona alla stessa velocità del precedente V4 Flash: $ 0,14 per milione di token di input E $ 0,28 per milione di fine settimana. Inizia: da 3 gettoni sul tuo saldo; l'addebito avviene dal saldo generale, senza sottoscrizione separata e carta estera. Per provarlo basta un solo passaggio:

  • Chiacchierata: pagina del modello — puoi allegare un'immagine o uno screenshot qui e il modello li risolverà;
  • Codice: Sezione "Codice". — il modello si connette al progetto e funziona con il repository, i file e il terminale;
  • API: la chiave viene rilasciata nella sezione API-tasti, formato compatibile con OpenAI; documentazione - neuralspace.pro/it/v1/docs.

Domande frequenti

V4.1 Flash - è un nuovo modello o un aggiornamento? Questa è una versione di una nuova famiglia di architetture, e non una revisione del precedente Flash: l'architettura è cambiata, la parte portante è cresciuta ed è apparsa la visione.

Vede le foto? Sì, in modo nativo: puoi inviare una foto, uno screenshot, un grafico o un documento. L'ultimo V4 Flash era testo.

Cos'è successo a V4 Pro? DeepSeek lo sta gradualmente eliminando e reindirizzando le richieste a V4.1 Flash, che ha sovraperformato V4 Pro nei benchmark basati su agenti.

Quanto costa provare? $ 0,14/$ 0,28 per milione di token, a partire da 3 token in totale - a la pagina di chat della modella.

Le vecchie richieste a v4-flash si interromperanno? No: le chiamate al v4-flash e al v4-flash-vision-exp vengono reindirizzate al V4.1 Flash e conteggiate secondo la sua tariffa.