前沿热点
前沿热点

DeepSeek-V4-Flash 正式版 API 公测上线:Agent 跑分远超 V4-Pro-Preview

2026-07-31 DeepSeek-V4-Flash 正式版 API 上线公测,model 名仍是 deepseek-v4-flash、结构与 Preview 一致仅重做后训练。Agent 能力大幅增强、官方基准远超 V4-Pro-Preview(Terminal Bench 2.1 82.7、Cybergym 76.7、DeepSWE 54.4 等)。原生支持 Responses API 并适配 Codex;V4-Pro 正式版随后发布。

发布于 2026年7月31日6 分钟阅读
<!-- deepseek-v4-flash-hotspot | hotspot | DeepSeek-V4-Flash 正式版 API 公测上线:Agent 跑分远超 V4-Pro-Preview -->

2026 年 7 月 31 日,DeepSeek 把 DeepSeek-V4-Flash 的正式版 API 推上了公测。调用方式不变,model 名仍是 deepseek-v4-flash,指向的就是最新的 0731 正式版。这次真正的头条不是"又上线一个 API",而是 Agent 能力大幅增强--官方基准里它远超 V4-Pro-Preview。结构、尺寸和 4 月的 Preview 一致(284B 总参 / 13B 激活 MoE),只重做了后训练。V4-Pro 正式版没跟上来,官方说"尽快发布"。

一、正式版公测上线:改了什么、没改什么

先说清这次升级的边界。第一,只升了 V4-Flash 的 API 接口,V4-Pro 的 API 以及 App/Web 端的模型本轮都没动;V4-Pro 正式版官方说会尽快发布。第二,正式版 model 名仍是 deepseek-v4-flash,API 调用方式不变,接上就用最新版,不用改 SDK。第三,DeepSeek-V4-Flash-0731 的模型结构和尺寸与 4 月的 Preview 完全一致,只重新做了后训练(post-training)--也就是说,这次不是换了个更大的模型,而是用同样的架构把 agent 能力训上去了。第四,正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。

二、Agent 能力大幅增强:跑分远超 V4-Pro-Preview

这是这次的核心。官方基准里,正式版 V4-Flash 的 Agent 跑分远超 V4-Pro-Preview,逐项数字如下:

  • Terminal Bench 2.1:82.7
  • NL2Repo:54.2
  • Cybergym:76.7
  • DeepSWE:54.4
  • Toolathlon verified:70.3
  • Agent Last Exam:25.2
  • Automation Bench(Public):25.1
  • DSBench-FullStack:68.7
  • DSBench-Hard:59.6

两个口径必须说清。其一,对于公开基准测试集里的 Code Agent 任务,正式版 V4-Flash 是用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试的,档位 max、topp=0.95、temperature=1.0--也就是说这些分是在特定框架和参数下跑出来的,不是裸模型直接零样本。其二,DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 内部使用的测试集(前者全栈开发、后者 Coding Agent 难题),不像 Terminal Bench / Cybergym 那种公开榜可以独立复现。看这些分的时候把"公开榜"和"内部榜"分开看,别把内部榜当公开成绩直接对比。

三、为什么"结构没变、只重做后训练"值得注意

模型结构和尺寸没变、只重做后训练,意味着这次提升不是靠堆参数,而是靠后训练(强化学习、工具使用对齐等)把同一副"骨架"的 agent 能力榨出来。这对普通人是个信号:在 agent 任务上,后训练的收益可能比换更大模型更显著。也正因为结构没变,自部署用户的硬件门槛和 Preview 时期一样(13B 激活参数对消费级显卡相对友好),不用担心"正式版变重了跑不动"。

四、对开发者与普通人的实际影响

对开发者,最直接的动作是把 deepseek-v4-flash 指向的版本当作正式版来用(model 名不变),在 agent 任务上值得切上去重新测一遍。如果你的工作流里 V4-Flash 跑的是 Code Agent、长工具调用链,这次提升最相关;跑简单分类/抽取的,提升感知不大。要接 Codex 的,正式版有针对性适配,按官方文档配置即可。注意 V4-Pro 这轮没升,硬推理任务暂时还是 V4-Pro-Preview。对普通人,V4-Flash 没有消费端入口,仍是 API + 开源权重(MIT,可自部署)的主战场。自部署用户硬件门槛不变;用 API 的话,agent 任务开 thinking + max 并把缓存打满(缓存命中 $0.0028)依旧是最省钱的打法。

一个"正式版上线"听着是常规新闻,但这次真正的信号是:同一副架构、只重做后训练,就能让 agent 跑分远超上一代更强的 V4-Pro-Preview。落地只看一件事--你手里那个最费 agent 来回的任务,正式版 Flash 能不能比 Preview 少出几次错、少来回几次。能,这次升级就值。V4-Pro 正式版还在路上,硬推理党可以再等等。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-31

相关文章