← 所有文章

DeepSeek V4.1 Flash:新版本看图,已经绕过了V4 Pro

发光的数字鲸鱼碎裂成快速明亮的粒子是新光版本DeepSeek的隐喻

DeepSeek 释放 V4.1 Flash - 一个模型同时取代了之前的两个模型:通常的模型 V4 Flash 以及具有图像识别功能的实验版本。现在,这是一种既可以编写代码又可以解析图像的模型:根据基于代理的基准测试,它的性能优于 V4 Pro,拥有一百万个令牌的上下文,并且花费的缓存大约是原来的四倍。在 NeuralSpace V4.1 Flash 已经可以在聊天中、“代码”部分以及通过 API — 我们分析相比之下发生了什么变化 V4 Flash.

什么型号

从形式上来说,这不再是之前 Flash 的修订版,而是新架构系列的第一个模型。 U V4.1 Flash 5520 亿个参数 反对2840亿 V4 Flash - 模型明显更大。但每一步的活跃参数较少:大约 读取输入时为 80 亿 生成响应时为 160 亿。

新方案称为 Causal Encoder-Decoder:40个transformer层分为20个编码器层和20个解码器层,键和值的整体缓存从编码器的隐藏状态构建一次,并且不会在每个层中重新计算。这就是模型处理输入成本低廉的原因。这种不对称性并非偶然选择的:代理读取大量文件、对话历史记录、指令,而写入相对较少的编辑、命令、决策。昂贵的部分变得简单,因此代理任务变得更便宜。

上下文 - 一百万个代币。推理工作量是连续可调的,从 1 到 100:一个简单的问题可以便宜地运行,而一个复杂的链可以在不改变模型的情况下最大程度地运行。

现在他看到了照片

与之前版本最明显的区别。 U V4 Flash 输入只是文本:她不知道如何查看图像,为此 DeepSeek 单独发布了实验视觉模型。在 V4.1 Flash 视觉内置于模型本身中 - 它本身接受文本和图片并以文本响应。

实际上,这意味着可以将界面的屏幕截图、图表、照片或文档页面按原样提供给模型。她将描述图像、从屏幕截图中提取文本并分析图表。这对于代理来说尤其方便:一个模型既读取代码又读取界面截图,无需在两个服务之间切换。

旧型号名称 DeepSeek 退役:查询 v4-flash 和 v4-flash-vision-exp 现在被重定向到 V4.1 Flash - 旧的集成不会注意到任何事情。

文本行和图像帧流入的镜头,并以单一光束的形式出现。

绕过 V4 Pro

发布中最响亮的事情—— V4.1 Flash 超过了较大的一个 V4 Pro 在代理问题中。以下是官方测量的数字 DeepSeek:

  • Terminal-Bench 2.1 (在终端中工作)- 90.6 与 87.9 V4 Pro 上一篇为 82.7 V4 Flash;
  • CyberGym (网络安全)- 88.1 与 83.3 V4 Pro;
  • DeepSWE v1.1 — 74.2 对比 54.4 V4 Flash;
  • Terminal-Bench 4.0 — 31.2 与 7.0 V4 Flash.

为此 - 90.9 每 GPQA Diamond,评分 3471 Codeforces 和 65.6 MathArena Apex。这些数字不是独立的,它们是我自己给的 DeepSeek,所以它们应该被视为一个陈述,而不是一个句子。但即使没有第三方测量,之前的 Flash 的跳跃规模也是可见的。

更远 DeepSeek 宣布逐步淘汰 V4 Pro:9月14日起 API 将请求重定向到 V4 Pro 在 V4.1 Flash 并以 Flash 速率对它们进行计数。实际结论很简单:Flash 不再是“初级”模型。现在是她承担了主要的负担,普通版和视觉版不再单独存在。

更少的缓存意味着更便宜的代理任务

对于基于代理的场景,主要节省的不是代币价格,而是缓存。代理一遍又一遍地重新读取对话历史记录、指令和项目文件,而缓存的输入消耗了大部分费用。 U V4.1 Flash 全球的 KV-缓存大约需要 每个令牌 890 字节 - 大约小于四倍 V4 Flash,并且缓存的持久部分被压缩了大约八倍。

模型本身的价格相对于之前的 Flash 也有所下降:缓存输入便宜 60%,常规输入便宜约三分之一,输出便宜 11%。在一遍又一遍地回收大型上下文的任务中,效果尤其明显;如果新答案的长度更重要,则节省的费用就更小。

数据流在穿过晶格时被压缩成一条狭窄的明亮条带。

V4 Flash 和 V4.1 Flash: 改变了什么

范围V4 FlashV4.1 Flash
选项2840亿5520亿
积极主动的步伐130亿80 亿输入/160 亿输出
建筑学MoE-解码器Causal Encoder-Decoder
看懂图片否,单独的视觉模型是的,本土的
语境100万个代币100万个代币
Terminal-Bench 2.182,790,6
DeepSWE v1.154,474,2
KV-每个令牌缓存~4× 更多890字节

价格为 NeuralSpace 以及如何尝试

在 NeuralSpace 该模型的运行费率与前一个模型相同 V4 Flash: 每百万输入代币 0.14 美元每百万个周末 0.28 美元。开始 - 从您余额上的 3 个代币开始;借方来自一般余额,无需单独订阅和外国卡。要尝试它,只需一个步骤就足够了:

  • 聊天: 模型页 — 您可以在此处附上图片或屏幕截图,模型将对其进行整理;
  • 代码: “代码”部分 — 模型连接到项目并与存储库、文件和终端配合使用;
  • API: 密钥在该部分发布 API-键, 格式兼容 OpenAI;文档 - Neurospace.pro/ru/v1/docs.

常见问题

V4.1 Flash 这是新型号还是更新? 这是新架构系列的一个版本,而不是之前 Flash 的修订版:架构发生了变化,支撑部分增长了,愿景也出现了。

她看到这些照片了吗? 是的,本质上:您可以发送照片、屏幕截图、图表或文档。过去的 V4 Flash 是文本。

发生了什么事 V4 Pro? DeepSeek 逐渐折叠它并将请求重定向到 V4.1 Flash,绕过了 V4 Pro 在代理基准中。

尝试一下要花多少钱? 每百万代币 0.14 美元/0.28 美元,从 3 个代币开始 - 为 模特的聊天页面.

旧请求 v4-flash 他们会打破吗? 否:呼吁 v4-flash 和 v4-flash-vision-exp 重定向到 V4.1 Flash 并按其资费计算。