← Todos los artículos

DeepSeek V4.1 Flash: la nueva versión ve imágenes y ha omitido V4 Pro

Una ballena digital brillante que se desmorona en partículas rápidas y brillantes es una metáfora de la nueva versión luminosa de DeepSeek

DeepSeek lanzó V4.1 Flash: un modelo que reemplazó a dos anteriores a la vez: el V4 Flash normal y una versión experimental con reconocimiento de imágenes. Ahora bien, este es un modelo que escribe código y analiza imágenes: según los puntos de referencia de los agentes, omitió V4 Pro, contiene un contexto de un millón de tokens y gasta aproximadamente una cuarta parte de la cantidad de caché. En NeuralSpace V4.1 Flash ya está disponible en el chat, en la sección "Código" y hasta API; veamos qué ha cambiado en comparación con V4 Flash.

que modelo

Formalmente, esto ya no es una revisión del Flash anterior, sino el primer modelo de una nueva familia de arquitecturas. UV4.1 Flash 552 mil millones de parámetros versus 284 mil millones para V4 Flash: el modelo es notablemente más grande. Pero hay menos parámetros activos en cada paso: aproximadamente 8 mil millones al leer la entrada y 16 mil millones al generar una respuesta.

El nuevo esquema se llama Causal Encoder-Decoder: 40 capas de transformador se dividen en 20 capas de codificador y 20 capas de decodificador, y el caché general de claves y valores se construye una vez, a partir de los estados ocultos del codificador, y no se vuelve a calcular en cada capa. Esta es la razón por la que el modelo procesa los insumos de forma económica. La asimetría no fue elegida por casualidad: el agente lee mucho (archivos, historial de diálogos, instrucciones) y escribe relativamente poco (ediciones, comandos, decisiones). La parte costosa se simplificó, por lo que las tareas de los agentes se volvieron más baratas.

Contexto: un millón de tokens. El esfuerzo de razonamiento se puede ajustar continuamente, de 1 a 100: una pregunta sencilla se puede ejecutar de forma económica y una cadena compleja se puede ejecutar al máximo sin cambiar el modelo.

Ahora ve fotos

La diferencia más notable con respecto a la versión anterior. V4 Flash solo tenía entrada de texto: no sabía mirar imágenes, y para ello DeepSeek lanzó por separado un modelo de visión experimental. En V4.1 Flash, la visión está integrada en el propio modelo: acepta texto e imágenes de forma nativa y responde con texto.

En la práctica, esto significa que se puede dar al modelo tal cual una captura de pantalla de la interfaz, un gráfico, una fotografía o una página de un documento. Ella describirá la imagen, extraerá texto de la captura de pantalla y analizará el diagrama. Esto es especialmente conveniente para los agentes: un modelo lee tanto el código como la captura de pantalla de la interfaz, y no es necesario cambiar entre dos servicios.

Los nombres de modelos antiguos DeepSeek han sido retirados de servicio: las solicitudes a v4-flash y v4-flash-vision-exp ahora se redirigen a V4.1 Flash; las integraciones antiguas no notarán nada.

Una lente en la que fluyen líneas de texto y marcos de imágenes y emerge como un único flujo de luz.

Omitido V4 Pro

Lo más destacado del lanzamiento fue que V4.1 Flash superó al V4 Pro más grande en tareas de agente. Aquí están los números de las medidas oficiales DeepSeek:

  • Terminal-Bench 2.1 (trabajar en la terminal) - 90,6 frente a 87,9 para el V4 Pro y 82,7 para el V4 Flash anterior;
  • CyberGym (ciberseguridad): 88,1 frente a 83,3 para V4 Pro;
  • DeepSWE v1.1 — 74,2 frente a 54,4 para V4 Flash;
  • Terminal-Bench 4.0 – 31,2 frente a 7,0 para V4 Flash.

A esto: 90,9 en GPQA Diamond, calificación 3471 en Codeforces y 65,6 en MathArena Apex. Los números no son independientes, fueron dados por la propia DeepSeek, por lo que deben tratarse como una declaración y no como un veredicto. Pero la magnitud del salto en el Flash anterior es visible incluso sin mediciones de terceros.

A continuación, DeepSeek anunció que se eliminará gradualmente V4 Pro: a partir del 14 de septiembre, su API redirige las solicitudes de V4 Pro a V4.1 Flash y las cuenta según la velocidad Flash. La conclusión práctica es simple: Flash ya no es un modelo "junior". Ahora es ella quien soporta la carga principal, y las versiones normal y visual ya no existen por separado.

Menos caché significa tareas de agente más baratas

Para escenarios basados ​​en agentes, los principales ahorros no están en el precio del token, sino en el caché. El agente relee el historial de diálogo, las instrucciones y los archivos del proyecto una y otra vez, y es la entrada almacenada en caché la que consume la mayor parte de la factura. La caché V4.1 Flash global KV tarda aproximadamente 890 bytes por token - aproximadamente cuatro veces menos que V4 Flash, y la parte permanente del caché se comprime aproximadamente ocho veces.

El precio del modelo en sí también ha disminuido en relación con el Flash anterior: la entrada en caché es un 60% más barata, la entrada normal es aproximadamente un tercio más barata y la salida es un 11% más barata. Las ganancias son especialmente notables en tareas que reciclan contextos grandes una y otra vez; donde la longitud de la nueva respuesta es más importante, los ahorros son más modestos.

El flujo de datos se comprime en una franja estrecha y brillante a medida que pasa a través de la red cristalina.

V4 Flash y V4.1 Flash: lo que ha cambiado

ParámetroV4 FlashV4.1 Flash
Opciones284 mil millones552 mil millones
Activo en paso13 mil millones8 mil millones de insumos / 16 mil millones de productos
ArquitecturaMoE-decodificadorCausal Encoder-Decoder
Entiende imágenesNo, modelo de visión independientesi, nativo
Contexto1 millón de fichas1 millón de fichas
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-efectivo por token~4 veces más890 bytes

Precio NeuralSpace y como probar

El modelo NeuralSpace funciona al mismo ritmo que el anterior V4 Flash: 0,14 dólares por millón de tokens de entrada Y 0,28 dólares por millón los fines de semana. Empezar: desde 3 tokens en su saldo; el débito proviene del saldo general, sin suscripción separada y tarjeta extranjera. Para probarlo basta con un solo paso:

  • Charlar: página modelo — puedes adjuntar una imagen o captura de pantalla aquí y el modelo las clasificará;
  • Código: Sección "Código" — el modelo se conecta al proyecto y funciona con el repositorio, los archivos y la terminal;
  • API: la clave se emite en la sección API-teclas, formato compatible con OpenAI; documentación - neuralspace.pro/es/v1/docs.

Preguntas frecuentes

V4.1 Flash - ¿Es este un modelo nuevo o una actualización? Esta es una versión de una nueva familia de arquitecturas, y no una revisión del Flash anterior: la arquitectura cambió, la parte de soporte creció y apareció la visión.

¿Ve las fotos? Sí, de forma nativa: puedes enviar una foto, una captura de pantalla, un gráfico o un documento. El último V4 Flash fue un mensaje de texto.

¿Qué pasó con V4 Pro? DeepSeek lo está eliminando gradualmente y redirigiendo las solicitudes a V4.1 Flash, que superó a V4 Pro en los puntos de referencia basados ​​en agentes.

¿Cuánto cuesta intentarlo? $0,14/$0,28 por millón de tokens, a partir de 3 tokens en saldo - en página de chat del modelo.

¿Se romperán las antiguas solicitudes de v4-flash? No: las llamadas al v4-flash y al v4-flash-vision-exp se redirigen al V4.1 Flash y se cuentan según su tarifa.