GEO资讯

DeepSeek V4 Pro正式版上线,编程能力大幅提升

发布于 2026/8/16 59 次阅读
DeepSeek V4 Pro正式版上线,编程能力大幅提升

DeepSeek V4 Pro正式版上线,编程能力大幅提升

8 月 13 日凌晨,DeepSeek 没有开发布会,直接把 V4 Pro 正式版同步更新到网页、App 和 API。这次更新的重点是编程与智能体能力:对比 4 月发布的预览版,多个编程类评测分数大幅跳升,关注度一度盖过同期发布的几款闭源新品。

这次更新了什么

根据官方 API 更新日志和第一财经的报道,V4 Pro 正式版的参数架构、API 调用名称都没有变,现有集成不用改代码就能用上新版本。变化集中在能力上:DeepSWE(AI 编程智能体评测)得分从 12.8 分跳到 62.7 分,Terminal Bench 从 72.1 分提升到 87.9 分,DSBench-FullStack 从 41.8 分提升到 71.1 分。这些分数是厂商自报口径,但提升幅度在开源阵营里不多见。

价格怎么变

正式版上线时价格没有立即调整,但 DeepSeek 已宣布 V4 Pro 的 API 新价格从 8 月 17 日起生效。第一财经的报道把它放在"开源围剿闭源、全球大模型重新定价"的背景下解读:OpenAI 7 月底刚下调 GPT-5.6 系列价格,Meta、阿里也在同一窗口开放或宣布开放模型权重,头部厂商的定价逻辑正在被重新定义。

对企业来说,这类模型的选择成本在下降。编程辅助、客服、内部知识库等场景如果预算敏感,可以先小规模试用再决定是否迁移。但要提醒的是,评测分数不等于生产环境表现,自报数据与实际业务效果的差距可能不小,选型前用自己的真实任务跑一遍更可靠。

开源与闭源的差距正在收窄

把 DeepSeek 这次更新放进更大的格局里看,更有意思的是差距的变化。据 Fulitimes 整理的对比数据,V4 Pro-0813 在 Terminal Bench 上跑出 87.9 分,与顶级闭源模型 Fable 5 的 88.0 分几乎打平;月之暗面 Kimi K3 在 Artificial Analysis 的 Intelligence Index 上拿到 57 分,超过该榜此前版本中 Claude Opus 4.8 所在的约 55 分区间。伯克利大学教授 Ion Stoica 此前接受中国媒体采访时判断,中国开源模型与全球前沿闭源模型的差距,已从 6 到 9 个月缩小到 2 到 3 个月。

这不代表开源已经全面追平闭源——在综合推理、长尾任务泛化上,头部闭源模型仍有优势。但"开源只能打性价比"这个判断,在 2026 年 8 月已经不完全成立,尤其是在编程这类垂直场景。

对企业经营的三点提醒

  1. 关注"静默更新"节奏。大模型现在可以不开发布会直接上线新版本,集成方要盯官方更新日志,而不是等新闻。
  2. 别只看榜单分数。厂商自报的 benchmark 与实际场景差异可能很大,尤其长尾任务要多验证。
  3. 把迁移成本纳入评估。API 名称不变、兼容性好的更新,切换成本低,是明确的加分项。

河北极欧智推科技有限公司 GEO 的建议是:模型越多,你的信息在 AI 答案里被引用和转述的方式越多样,官网作为一手信息源的作用就越重要。趁着模型价格下行窗口,把内容和模型适配一起做,比单点追新更划算。

对内容侧还有个直接影响:模型换版速度加快,意味着同样的提问在不同时间可能得到不同答案。企业做 AI 可见度自查时,要把"版本波动"考虑进去,按固定周期重复测,而不是做完一次就放心。

信息来源

  • 第一财经(今日头条转载)《开源"围剿"闭源,中国大模型掀翻硅谷定价逻辑》,2026-08-13,访问链接
  • 腾讯新闻《AI应用催化不断,软件板块布局窗口或已打开》(DeepSeek V4 Pro 正式版及 8 月 17 日调价),2026-08-14,访问链接
  • Fulitimes《Grok 4.6 和 DeepSeek V4 Pro-0813 接连发布:2026年8月的大模型格局速览》,2026-08-14,访问链接
  • DeepSeek 官方 API 更新日志(一手来源),2026-08,访问链接