← 所有文章

DeepSeek V4 Pro 0813是一个历史转折点

发光的数字鲸鱼 - 最终版本中的DeepSeek V4 Pro

简单说一下主要的事情(BLUF)

DeepSeek 发布了最终版本 V4 Pro - 修订版 0813:更新通过 API 自动到达,无需演示或参考。我们使用基准来查看到底增加了什么,诚实地计算与 Claude 和 GPT 的差异,并解释为什么价格还没有改变。

今天DeepSeek推出了最终版本V4 Pro - 修订版0813。没有会议或倒计时计数器:只是更新了API。那些已经使用过“deepseek-v4-pro”的人会自动收到一个新模型,而无需更改代码中的任何内容。 4 月份的版本是预览版,这个版本是 GA,差异很明显,主要是模型预计不会在聊天中做出响应,而是能够连贯地工作。

发光的数字鲸鱼 - 最终版本中的DeepSeek V4 Pro

今天是 Opus 级编码真正变得触手可及的日子。 这个提议在早上可能是营销人员的梦想,到了晚上就会成为一个有基准的事实。

在 NeuralSpace 中,模型已经站立: 在聊天中,V “代码”部分 并在 应用程序编程接口。无需“等待它推出”——您可以打开它并使用它。

什么型号

从技术上讲,这与 4 月份的情况相同:具有 1.6 万亿个参数的混合专家,其中每一步都有 490 亿个参数处于活跃状态。上下文是一百万个令牌,该模型能够在一次响应中生成多达 384,000 个令牌。作为比较:这大约是相邻选项卡中大多数模型的二十倍。

该模型可以以两种模式思考——思考和非思考,reasoning_effort 现在有三个级别:max、high、low。在实践中,这意味着一个小问题可以廉价地解决,一个复杂的链条可以通过最大限度的思考来解决,而无需改变模型。

基准:到底增长了什么

最终版本发布后基准测试的增长DeepSeek V4 Pro

人工分析重新测量了最终版本。智力指数从43.7增加到45.3。编码指数 - 从 58.7 到 59.4。但 Agentic 指数涨幅最大:从 35.3 升至 37.8。这并非偶然 - 修订版 0813 专门针对基于代理的场景进行了更正,其中模型不会一次性响应,而是来回移动:读取文件、调用工具、查看结果并自行纠正。

在速度方面,一切都处于之前版本的水平:每秒输出大约 76 个令牌,第一个令牌在大约一秒半到两秒内到达。对于这种尺寸的模型来说,速度很快。诚实的缺点:模型很健谈。在 AA 测量中,它花费的代币比市场平均水平多一倍半到两倍 - 考虑到详细的推理,您要支付额外的代币和额外的等待时间。

反对 Claude 和 GPT:公平算术

最新表格中最引人注目的是与 Anthropic 前旗舰产品 Claude Opus 4.8 的系列。 DeepSeek V4 Pro 0813 在双方的编码基准测试中都击败了它:Terminal-Bench 2.1 - 87.9 与 85.0,DeepSWE - 62.7 与 58.0。与此同时,Opus 4.8 每百万个输入代币的成本为 5 美元,每百万个输出代币的成本为 25 美元,分别贵了 11 倍和 29 倍。这是表格:

编码基准表:DeepSeek V4 Pro 0813 在 Terminal-Bench 2.1 和 DeepSWE 中击败 Claude Opus 4.8

最终版本最接近克劳德寓言 5:终端工作台中的 87.9 与 88.0,相差十分之一。根据 DeepSWE 的数据,《神鬼寓言》的领先程度更为明显:70.0 对 62.7。如果你计算表DeepSeek中所有十个基于代理的基准,《神鬼寓言》平均领先 5.3% - 但十个DeepSeek中有两个获胜,并且如果没有唯一的异常值(没有工具的人类最后考试:42.7 vs 53.3),平均领先优势缩小到 2.8%。

价格的差别不是百分比,而是数倍。 《神鬼寓言 5》每百万输入代币的成本为 10 美元,每百万输出代币的成本为 50 美元; V4 Pro 有 0.435 美元和 0.87 美元。按混合费率计算,其价格约为 30 美元与 0.65 美元。也就是说,对于测试中几个百分点的差异,Anthropic 要求支付大约 46 倍的费用。诚实警告:我自己在自己未发布的基础设施上测量了比较表DeepSeek,十分之二的测试是内部的,而且还没有 0813 的独立测量 - 该模型今天才发布。

要了解其规模,请考虑 Kimi K3。一个月前,她成为第一个超越克劳德·奥普斯(Claude Opus)的中国模特——引起了轰动。但Kimi K3是一个拥有数万亿参数的模型,它需要昂贵的服务器来运行,因此零售价只比Claude Fable便宜三倍,比Claude Opus只便宜40%。令人印象深刻,但其中没有民主化。

但DeepSeek V4 Pro是一个真正的历史时刻。在编码方面真正赶上Opus,成本比Opus低30倍,比Fable低60倍。如今,vibecoding 已经变得人人皆可使用——不是广告意义上的“可用”,而是进入它的价格。

对于 GPT,情况更加复杂。 GPT-5.5 在人工分析指数中得分为 56.3,而 DeepSeek 的得分为 45.3 - 差距确实很明显。但关税不具有可比性:每百万美元 5 美元/30 美元与每百万美元 0.435 美元/0.87 美元。但更便宜的 GPT-5.6 Luna 已经售价 0.10 美元/0.60 美元——也就是说,比 DeepSeek 便宜——得分为 52.3。事实证明,“最便宜的大”不再是唯一的:它以 V4 Pro 的价格与 Luna 竞争,而在积分方面它输给了 Terra 和 Sol。

我想补充一句来自外界的冷静言论:美国国家标准技术研究所(CAISI)最近的一项评估称,V4 Pro落后于市场领先者约八个月。确实,他们测量了预览版本。 0813 是否缩小了这一差距将由独立基准测试来证明,但目前还不存在。

价格没有改变。再见

进入 – 每百万代币 0.435 美元,退出 – 0.87 美元。现金击球仍然几乎免费:每百万 0.003625 美元,比常规参赛便宜 120 倍。对于代理链来说,这是要点:项目上下文被一遍又一遍地读取,而缓存决定了代理一小时的工作成本。

需要注意的是:DeepSeek 已经在文档中警告称,它将提高整个 API 的价格。何时以及持续多久没有说。四月份的关税仍然有效,而且明显低于西方同类产品的关税。

现在可以去哪里尝试

  • 聊天: 打开 模型页 — 最终的 0813 已经是默认值。
  • 代码: V “代码”部分 该模型连接到项目并使用存储库、文件和终端。
  • 应用程序编程接口: 密钥在该部分发布 API 密钥NeuralSpace,格式与 OpenAI 兼容。

付款 - 从一般余额中以卢布支付,无需订阅、VPN 或外国卡。实际使用量被注销,而不是“提前一个月”的套餐。

模型不能做的是看图片:输入只是文本。如果您需要分析屏幕截图或照片,这适用于其他型号。但对于文本、代码和长代理任务,最终的 V4 Pro 现在是在功能和价格方面最诚实的提案之一。 你可以在聊天中查看,如果您需要将其构建到您的产品中 - 密钥取自 API 密钥页面.

常见问题 (FAQ)

问题:如何开始? 答:在平台上注册并获得免费代币进行测试。

问:生成的素材适合商业用途吗? 回答:是的,您获得所有创建内容的完整商业权利。