← 所有文章

DeepSeek V4 Pro 0813——这是一个历史性转折点

一头闪耀的数字鲸鱼——正式版 DeepSeek V4 Pro

先说结论(BLUF)

DeepSeek 已发布 V4 Pro 的最终版本——0813 修订版。没有发布会,所有现有 deepseek-v4-pro 用户都已通过 API 自动升级。目前价格暂时不变,但基准成绩已经更接近 Claude 和 GPT。下文会具体说明它改进了什么、与竞品相比真实差距有多大,以及可以在哪里体验。

今天,DeepSeek 发布了 V4 Pro 的最终版本——0813 修订版。没有发布会,也没有倒计时,API 只是直接完成了更新。已经在使用 deepseek-v4-pro 的用户无需修改任何代码,就自动获得了新模型。4 月的版本是预览版,这次才是 GA 正式版。两者的差异,在需要模型持续执行任务、而不是简单回复一条聊天消息时最为明显。

一头闪耀的数字鲸鱼——正式版 DeepSeek V4 Pro

从今天起,Opus 级别的编程能力真正变得人人都用得起。如果早上说这句话,还像是营销宣传;到了晚上,它已经成为有基准数据支撑的事实。

该模型已在 NeuralSpace 上线:可用于聊天代码专区API。无需“等待分批开放”,打开即可使用。

这是一款什么模型

从技术规格来看,它仍然是 4 月那头“巨兽”:采用混合专家架构,总参数量达 1.6 万亿,每一步激活 490 亿参数。上下文窗口为 100 万 token,单次回答最多可输出 38.4 万 token。作为对比,这大约是相邻标签页中大多数模型的二十倍。

模型支持两种模式——思考和非思考——reasoning_effort 现在分为三个级别:max、high、low。实际使用时,简单问题可以低成本处理;遇到复杂推理链,则可直接启用最高推理强度,无需切换模型。

基准测试:究竟提升了什么

DeepSeek V4 Pro 正式版发布后的基准成绩提升

Artificial Analysis 对最终版本进行了重新测试。Intelligence Index 从 43.7 升至 45.3,Coding Index 从 58.7 升至 59.4,而提升最大的是 Agentic Index:从 35.3 跃升至 37.8。这并非巧合——0813 修订版专门针对智能体场景进行了优化。在这类场景中,模型不是一次性给出答案,而是反复执行一整套流程:读取文件、调用工具、检查结果,再自行修正。

速度与上一版本基本相同:输出约为每秒 76 个 token,首个 token 大约在 1.5 至 2 秒内出现。对于这种体量的模型来说,这已经很快。它也有一个必须如实说明的缺点:话很多。根据 AA 的测量,其输出 token 数量是市场平均水平的 1.5 至 2 倍。模型进行长时间推理时,需要把额外的 token 费用和等待时间都算进去。

对比 Claude 和 GPT:把账算清楚

最新表格中最抢眼的一行,是 Anthropic 的上一代旗舰 Claude Opus 4.8。DeepSeek V4 Pro 0813 在两项编程基准中都超过了它:Terminal-Bench 2.1 为 87.9 比 85.0,DeepSWE 为 62.7 比 58.0。而 Opus 4.8 每百万输入 token 收费 $5,每百万输出 token 收费 $25,分别贵 11 倍和 29 倍。具体数据如下:

编程基准对比:DeepSeek V4 Pro 0813 在 Terminal-Bench 2.1 和 DeepSWE 中超过 Claude Opus 4.8

最终版本最接近 Claude Fable 5:Terminal-Bench 得分为 87.9 比 88.0,只差 0.1 分。在 DeepSWE 中,Fable 的领先幅度更大:70.0 比 62.7。将 DeepSeek 表格中的十项智能体基准取平均,Fable 平均领先 5.3%;但 DeepSeek 在其中两项胜出。如果去掉唯一明显偏离的项目(不使用工具的 Humanity's Last Exam:42.7 比 53.3),平均差距会缩小到 2.8%。

价格差异则不是几个百分点,而是数量级上的差距。Fable 5 每百万输入 token 收费 $10,输出 token 收费 $50;V4 Pro 则是 $0.435 和 $0.87。按输入输出混合计算,大约是 $30 对 $0.65。也就是说,为了在测试中获得几个百分点的优势,Anthropic 要价高出约 46 倍。这里也必须说明几个限制:DeepSeek 的对比表是在其未公开的自有基础设施上测得的,十项测试中有两项是内部测试,而且目前尚无针对 0813 的独立测量结果——毕竟模型今天才刚发布。

为了更直观地理解这个差距,可以回想一下 Kimi K3。一个月前,它成为首个击败 Claude Opus 的中国模型,当时引起了轰动。但 Kimi K3 是一款万亿参数模型,需要昂贵服务器才能运行,因此其零售价格仅比 Claude Fable 便宜三倍,比 Claude Opus 也只便宜 40%。确实很强,但还谈不上真正的普及。

DeepSeek V4 Pro 则是一个真正具有历史意义的节点。它的编程能力确实在逼近 Opus,价格却比 Opus 低 30 倍、比 Fable 低 60 倍。氛围编程从此真正向所有人开放——不是广告文案中的“人人可用”,而是普通人确实负担得起。

与 GPT 相比,情况要更复杂一些。GPT-5.5 在 Artificial Analysis 指数中得分 56.3,DeepSeek 为 45.3,差距确实明显。但两者费率几乎没有可比性:每百万 token 为 $5/$30 对 $0.435/$0.87。不过,更便宜的 GPT-5.6 Luna 收费为 $0.10/$0.60,比 DeepSeek 还低,得分却达到 52.3。因此,“大型模型中最便宜的选择”已不再是 V4 Pro 的独有优势:价格上它与 Luna 竞争,得分则落后于 Terra 和 Sol。

再补充一条来自外部的冷静评价:美国 NIST(CAISI)近期评估认为,V4 Pro 大约落后市场领先模型八个月。不过,他们测试的是预览版。0813 是否缩小了这一差距,还需要等待独立基准测试验证——目前尚无相关结果。

价格暂时没有变化

每百万输入 token 收费 $0.435,输出 token 收费 $0.87。缓存命中依然近乎免费:每百万 token 仅 $0.003625,比普通输入便宜 120 倍。对于智能体任务链来说,这一点最为关键:项目上下文会被反复读取,而缓存成本决定了智能体连续工作一小时究竟要花多少钱。

需要注意的是,DeepSeek 已在文档中警告,计划整体上调 API 价格。具体时间和涨幅尚未公布。目前仍沿用 4 月费率,而且明显低于同级别的西方模型。

现在可以在哪里体验

平台使用卢布从统一余额中扣费,无需订阅、无需 VPN,也无需境外银行卡。费用按实际用量结算,不必预购“整月套餐”。

这款模型无法查看图片,输入仅支持文本。如果需要分析截图或照片,应选择其他模型。但在文本、代码和长流程智能体任务中,最终版 V4 Pro 是目前能力与价格匹配度最高的选择之一。你可以在聊天中体验,也可以前往 API 密钥页面获取密钥,将它集成到自己的产品中。

常见问题(FAQ)

问:如何开始使用?
答:在平台注册,即可获得用于测试的免费 token。

问:生成的内容可以用于商业用途吗?
答:可以,你对自己创建的所有内容拥有完整的商业使用权。