← Все статьи

DeepSeek V4.1 Flash: новая версия видит картинки и обошла V4 Pro

Светящийся цифровой кит, рассыпающийся на быстрые яркие частицы — метафора новой лёгкой версии DeepSeek

DeepSeek выпустила V4.1 Flash — модель, которая заменила сразу две прошлые: обычную V4 Flash и экспериментальную версию с распознаванием картинок. Теперь это одна модель, которая и пишет код, и разбирает изображения: по агентным бенчмаркам она обошла V4 Pro, держит контекст в миллион токенов и тратит примерно вчетверо меньше кэша. В NeuralSpace V4.1 Flash уже доступна в чате, в разделе «Код» и через API — разбираем, что изменилось по сравнению с V4 Flash.

Что за модель

Формально это уже не ревизия прошлой Flash, а первая модель нового семейства архитектур. У V4.1 Flash 552 млрд параметров против 284 млрд у V4 Flash — модель заметно крупнее. Но активных параметров на каждом шаге меньше: около 8 млрд при чтении входа и 16 млрд при генерации ответа.

Новая схема называется Causal Encoder-Decoder: 40 слоёв трансформера делятся на 20 слоёв кодера и 20 слоёв декодера, а общий кэш ключей и значений строится один раз — из скрытых состояний кодера, а не пересчитывается в каждом слое заново. Именно поэтому вход модель обрабатывает дёшево. Асимметрия выбрана не случайно: агент много читает — файлы, историю диалога, инструкции — и сравнительно мало пишет — правки, команды, решения. Дорогую часть сделали лёгкой, поэтому и агентные задачи подешевели.

Контекст — миллион токенов. Усилие рассуждений настраивается непрерывно, от 1 до 100: простой вопрос можно прогнать дёшево, а сложную цепочку — на максимуме, не меняя модель.

Теперь видит картинки

Самое заметное отличие от прошлой версии. У V4 Flash вход был только текстовым: смотреть на изображения она не умела, и для этого DeepSeek отдельно выпускала экспериментальную vision-модель. В V4.1 Flash зрение встроено в саму модель — она нативно принимает текст и картинки и отвечает текстом.

На практике это значит, что скриншот интерфейса, график, фотографию или страницу документа можно отдать модели как есть. Она опишет изображение, вытащит текст со скриншота, разберёт диаграмму. Для агентов это особенно удобно: одна модель читает и код, и скриншот интерфейса, и не нужно переключаться между двумя сервисами.

Старые имена моделей DeepSeek вывела из эксплуатации: запросы к v4-flash и v4-flash-vision-exp теперь перенаправляются на V4.1 Flash — старые интеграции ничего не заметят.

Линза, в которую вливаются текстовые строки и кадры изображений, а выходит единый поток света

Обошла V4 Pro

Самое громкое в релизе — V4.1 Flash обошла более крупную V4 Pro в агентных задачах. Вот цифры из официальных замеров DeepSeek:

  • Terminal-Bench 2.1 (работа в терминале) — 90,6 против 87,9 у V4 Pro и 82,7 у прошлой V4 Flash;
  • CyberGym (кибербезопасность) — 88,1 против 83,3 у V4 Pro;
  • DeepSWE v1.1 — 74,2 против 54,4 у V4 Flash;
  • Terminal-Bench 4.0 — 31,2 против 7,0 у V4 Flash.

К этому — 90,9 на GPQA Diamond, рейтинг 3471 на Codeforces и 65,6 на MathArena Apex. Цифры не независимые, их дала сама DeepSeek, так что к ним стоит относиться как к заявке, а не к приговору. Но масштаб скачка по прошлой Flash виден и без сторонних замеров.

Дальше DeepSeek объявила, что постепенно сворачивает V4 Pro: с 14 сентября её API перенаправляет запросы к V4 Pro на V4.1 Flash и считает их по тарифу Flash. Практический вывод простой: Flash перестала быть «младшей» моделью. Теперь именно она несёт основную нагрузку, а обычная и vision-версии больше не существуют отдельно.

Меньше кэш — дешевле агентные задачи

Для агентных сценариев главная экономия — не в цене токена, а в кэше. Агент раз за разом перечитывает историю диалога, инструкции и файлы проекта, и именно кэшированный вход съедает основную часть счёта. У V4.1 Flash глобальный KV-кэш занимает около 890 байт на токен — примерно вчетверо меньше, чем у V4 Flash, а постоянная часть кэша сжата примерно в восемь раз.

Цена самой модели тоже снизилась относительно прошлой Flash: кэшированный вход — на 60% дешевле, обычный вход — примерно на треть, выход — на 11%. Выигрыш особенно заметен в задачах, которые снова и снова перерабатывают большой контекст; там, где важнее длина нового ответа, экономия скромнее.

Поток данных сжимается в узкую яркую полосу, проходя через кристаллическую решётку

V4 Flash и V4.1 Flash: что изменилось

ПараметрV4 FlashV4.1 Flash
Параметры284 млрд552 млрд
Активных на шаге13 млрд8 млрд вход / 16 млрд выход
АрхитектураMoE-декодерCausal Encoder-Decoder
Понимает картинкиНет, отдельная vision-модельДа, нативно
Контекст1 млн токенов1 млн токенов
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-кэш на токен~4× больше890 байт

Цена на NeuralSpace и как попробовать

В NeuralSpace модель работает по тому же тарифу, что и прошлая V4 Flash: $0,14 за миллион входных токенов и $0,28 за миллион выходных. Старт — от 3 токенов на балансе; списание идёт из общего баланса, без отдельной подписки и зарубежной карты. Чтобы попробовать, хватит одного шага:

  • Чат: страница модели — сюда можно приложить картинку или скриншот, и модель их разберёт;
  • Код: раздел «Код» — модель подключается к проекту и работает с репозиторием, файлами и терминалом;
  • API: ключ выдаётся в разделе API-ключи, формат совместим с OpenAI; документация — neuralspace.pro/ru/v1/docs.

Частые вопросы

V4.1 Flash — это новая модель или обновление? Это версия нового семейства архитектур, а не ревизия прошлой Flash: сменилась архитектура, выросла опорная часть, появилось зрение.

Она видит картинки? Да, нативно: можно прислать фото, скриншот, график или документ. Прошлая V4 Flash была текстовой.

Что стало с V4 Pro? DeepSeek постепенно сворачивает её и перенаправляет запросы на V4.1 Flash, которая обошла V4 Pro в агентных бенчмарках.

Сколько стоит попробовать? $0,14/$0,28 за миллион токенов, старт от 3 токенов на балансе — на странице модели в чате.

Старые запросы к v4-flash сломаются? Нет: обращения к v4-flash и v4-flash-vision-exp перенаправляются на V4.1 Flash и считаются по её тарифу.