DeepSeek V4.1 Flash: a nova versão vê fotos e contornou V4 Pro
DeepSeek lançou V4.1 Flash - modelo que substituiu os dois anteriores ao mesmo tempo: o V4 Flash normal e uma versão experimental com reconhecimento de imagem. Agora, este é um modelo que escreve código e analisa imagens: de acordo com benchmarks de agentes, ele contornou V4 Pro, mantém um contexto de um milhão de tokens e gasta cerca de um quarto do cache. Em NeuralSpace V4.1 Flash já está disponível no chat, na seção “Código” e através de API - vamos ver o que mudou em relação a V4 Flash.
Qual modelo
Formalmente, esta não é mais uma revisão do Flash anterior, mas o primeiro modelo de uma nova família de arquiteturas. Você V4.1 Flash 552 bilhões de parâmetros contra 284 bilhões para V4 Flash - o modelo é visivelmente maior. Mas há menos parâmetros ativos em cada etapa: cerca de 8 bilhões ao ler a entrada e 16 bilhões ao gerar uma resposta.
O novo esquema é chamado Causal Encoder-Decoder: 40 camadas do transformador são divididas em 20 camadas do codificador e 20 camadas do decodificador, e o cache geral de chaves e valores é construído uma vez - a partir dos estados ocultos do codificador, e não é recalculado em cada camada novamente. É por isso que o modelo processa os insumos de maneira barata. A assimetria não foi escolhida por acaso: o agente lê muito – arquivos, histórico de diálogos, instruções – e escreve relativamente pouco – edições, comandos, decisões. A parte cara foi facilitada, então as tarefas do agente ficaram mais baratas.
Contexto - um milhão de tokens. O esforço de raciocínio é continuamente ajustável, de 1 a 100: uma pergunta simples pode ser executada de forma barata e uma cadeia complexa pode ser executada no máximo sem alterar o modelo.
Agora ele vê fotos
A diferença mais notável em relação à versão anterior. V4 Flash tinha apenas entrada de texto: ela não sabia olhar imagens, e para isso DeepSeek lançou separadamente um modelo experimental de visão. Em V4.1 Flash a visão é incorporada ao próprio modelo - ela aceita texto e imagens nativamente e responde com texto.
Na prática, isso significa que uma captura de tela da interface, um gráfico, uma fotografia ou uma página de um documento podem ser fornecidos ao modelo como está. Ela descreverá a imagem, extrairá o texto da captura de tela e analisará o diagrama. Isso é especialmente conveniente para agentes: um modelo lê o código e a captura de tela da interface e não há necessidade de alternar entre dois serviços.
Os nomes dos modelos antigos DeepSeek foram desativados: as solicitações para v4-flash e v4-flash-vision-exp agora são redirecionadas para V4.1 Flash - as integrações antigas não notarão nada.

Ignorado V4 Pro
O maior destaque do lançamento foi que V4.1 Flash superou o maior V4 Pro em tarefas de agente. Aqui estão os números das medições oficiais DeepSeek:
- Terminal-Bench 2.1 (trabalho no terminal) - 90,6 versus 87,9 para V4 Pro e 82,7 para o anterior V4 Flash;
- CyberGym (cibersegurança) - 88,1 versus 83,3 para V4 Pro;
- DeepSWE v1.1 — 74,2 versus 54,4 para V4 Flash;
- Terminal-Bench 4.0 — 31,2 versus 7,0 para V4 Flash.
Para isso - 90,9 em GPQA Diamond, classificação 3471 em Codeforces e 65,6 em MathArena Apex. Os números não são independentes, foram fornecidos pela própria DeepSeek, portanto devem ser tratados como uma declaração e não como um veredicto. Mas a escala do salto no Flash anterior é visível mesmo sem medições de terceiros.
Em seguida, DeepSeek anunciou que está descontinuando gradualmente V4 Pro: a partir de 14 de setembro, seu API redireciona solicitações de V4 Pro para V4.1 Flash e as conta na taxa de Flash. A conclusão prática é simples: o Flash não é mais um modelo “júnior”. Agora é ela quem carrega o fardo principal, e as versões regular e vision não existem mais separadamente.
Menos cache significa tarefas de agente mais baratas
Para cenários baseados em agentes, a principal economia não está no preço do token, mas no cache. O agente relê o histórico de diálogos, as instruções e os arquivos do projeto repetidas vezes, e é a entrada armazenada em cache que consome a maior parte da conta. O cache global V4.1 Flash KV leva cerca de 890 bytes por token - cerca de quatro vezes menos que V4 Flash, e a parte permanente do cache é comprimida cerca de oito vezes.
O preço do modelo em si também diminuiu em relação ao Flash anterior: a entrada em cache é 60% mais barata, a entrada normal é cerca de um terço mais barata, a saída é 11% mais barata. Os ganhos são especialmente perceptíveis em tarefas que reciclam grandes contextos continuamente; onde a extensão da nova resposta é mais importante, as poupanças são mais modestas.

V4 Flash e V4.1 Flash: o que mudou
| Parâmetro | V4 Flash | V4.1 Flash |
|---|---|---|
| Opções | 284 bilhões | 552 bilhões |
| Ativo na etapa | 13 bilhões | 8 bilhões de entradas / 16 bilhões de saídas |
| Arquitetura | MoE-decodificador | Causal Encoder-Decoder |
| Compreende fotos | Não, modelo de visão separado | Sim, nativo |
| Contexto | 1 milhão de fichas | 1 milhão de fichas |
| Terminal-Bench 2.1 | 82,7 | 90,6 |
| DeepSWE v1.1 | 54,4 | 74,2 |
| KV-dinheiro por token | ~4× mais | 890 bytes |
Preço NeuralSpace e como experimentar
O modelo NeuralSpace funciona na mesma taxa que o V4 Flash anterior: US$ 0,14 por milhão de tokens de entrada E US$ 0,28 por milhão de fins de semana. Iniciar - a partir de 3 tokens no seu saldo; o débito vem do saldo geral, sem assinatura separada e cartão estrangeiro. Para experimentar, basta um passo:
- Bater papo: página do modelo - você pode anexar uma foto ou captura de tela aqui, e a modelo irá resolvê-las;
- Código: Seção "Código" — o modelo se conecta ao projeto e funciona com o repositório, arquivos e terminal;
- API: a chave é emitida na seção API teclas, formato compatível com OpenAI; documentação - neuralspace.pro/pt/v1/docs.
Perguntas frequentes
V4.1 Flash - este é um modelo novo ou uma atualização? Esta é uma versão de uma nova família de arquiteturas, e não uma revisão do Flash anterior: a arquitetura mudou, a parte de suporte cresceu e a visão apareceu.
Ela vê as fotos? Sim, nativamente: você pode enviar foto, screenshot, gráfico ou documento. O último V4 Flash foi texto.
O que aconteceu com V4 Pro? DeepSeek está gradualmente eliminando-o e redirecionando as solicitações para V4.1 Flash, que superou V4 Pro em benchmarks baseados em agentes.
Quanto custa tentar? US$ 0,14/US$ 0,28 por milhão de tokens, começando com 3 tokens no saldo - em página de bate-papo da modelo.
As solicitações antigas para v4-flash serão interrompidas? Não: as chamadas para v4-flash e v4-flash-vision-exp são redirecionadas para V4.1 Flash e contadas de acordo com sua taxa.