2026 年 7 月 31 日,DeepSeek 在 API 更新日志里悄悄上线了 V4 Flash 正式版(deepseek-v4-flash-0731),没有发布会,当晚就上了知乎热搜。官方放出的 9 项基准里,代码 Agent 基准 DeepSWE 从预览版的 7.3 跳到 54.4(约 7.5 倍),Terminal Bench 2.1 拿到 82.7 分,逼近 Claude Opus 4.8 的 85.0。消息很猛,但跑分是官方给的,能不能信?
本文不转述官方跑分。我用 Codex 搭了一套纯标准库的测评框架(harness.py),于 2026-08-02 10:51(北京时间)真实调用官方 API,跑了 30 道自建题(编程 10 题 / 数学 10 题 / 中文 10 题),全程本地执行评分、原始数据留档、可复现可审计。结果:30/30 全对,编程 59 个单元测试用例全过,30 题 API 成本不足 5 分钱。
这是一份小样本、单轮次的实测快照,用来印证"正式版"的成色,不代表全面结论。下面把方法、数据、拆解、对照和价格横评一次讲清楚。
一、测评方法:怎么保证数据真实
本文不使用任何"云评测"或二手数据,全部结果来自我本人于 2026-08-02 10:51(北京时间)通过官方 API 真实调用 deepseek-v4-flash 得到的输出,原始数据保存在工作区,可复现、可审计。
评测设置
| 项目 | 取值 |
|---|---|
| API | https://api.deepseek.com/chat/completions(OpenAI 兼容格式) |
| 模型 | deepseek-v4-flash(0731 正式版) |
| 采样参数 | temperature=0.3,reasoning_effort=high,max_tokens=16384(编程)/8192(数学、中文) |
| 并发 | 3 路并行 |
| 测评时间 | 2026-08-02 10:51–10:52(北京时间,处于高峰计费时段) |
| 评分方式 | 编程:本地执行模型代码跑单元测试;数学:答案程序化比对(整数/最简分数);中文:单选题答案比对 |
| 工具 | harness.py(纯标准库无第三方依赖,Codex 搭建) |
三道测试均为自建、答案先经程序化校验的题目:
- 编程能力:10 道经典算法题(两数之和、括号匹配、合并区间、最长递增子序列、最大子数组和、多数元素、轮转数组、第一个唯一字符、打家劫舍、爬楼梯),共 59 个单元测试用例。模型只输出函数代码,本地独立进程执行评分。
- 数学推理:10 道精确答案题(整除求和、含 7 计数、模运算、概率、位数、韦达定理、组合数、排列数、平方和、钟表角度),答案在评测前已用程序逐题验证。
- 中文综合:10 道单选题(文学、历史、科学、三段论逻辑、古诗、成语、地理、天文、阅读理解、传递推理),答案固定。
复现方式:python harness.py --selftest 可本地校验题目答案(不消耗 API 额度);python harness.py --tests coding,math,chinese --workers 3 可复现完整测评。
局限性(先说清楚):样本量小(每类 10 题)、单轮次运行、题目难度以中档为主,100% 的正确率不等于模型"没有短板";要得到统计意义上的结论需要更大样本和多次采样。这份实测的价值在于:用可复现的真实数据印证官方基准的方向,而非替代全面评测。
二、测试一:编程能力(10/10 题,59/59 用例全过)
每道题由模型生成 solve 函数,交由本地 Python 独立进程执行全部测试用例,禁止模型接触测试数据。
| 题号 | 题目 | 用例 | 结果 | 耗时 |
|---|---|---|---|---|
| C01 | 两数之和 | 6/6 | 通过 | 1.90s |
| C02 | 有效的括号 | 7/7 | 通过 | 2.35s |
| C03 | 合并区间 | 6/6 | 通过 | 2.66s |
| C04 | 最长递增子序列 | 6/6 | 通过 | 2.08s |
| C05 | 最大子数组和 | 6/6 | 通过 | 1.80s |
| C06 | 多数元素 | 5/5 | 通过 | 1.68s |
| C07 | 轮转数组 | 6/6 | 通过 | 7.00s |
| C08 | 第一个唯一字符 | 5/5 | 通过 | 2.06s |
| C09 | 打家劫舍 | 6/6 | 通过 | 1.63s |
| C10 | 爬楼梯 | 6/6 | 通过 | 1.94s |
| 合计 | 59/59 | 100% | 平均 2.51s |
抽查 C07 轮转数组的实际生成代码(未做任何修改):
# C07 轮转数组(7.0s 完成,含思考)
def solve(nums: list[int], k: int) -> list[int]:
if not nums:
return []
k %= len(nums)
return nums[-k:] + nums[:-k]代码简洁、边界处理到位(空数组判断、k 取模),10 题全部一次通过,未出现语法错误或运行时异常。C07 多花了几秒,是因为模型在思考里枚举了 k 与数组长度的取模关系——输出本身很短,思考占了大头。
三、测试二:数学推理(10/10 全对)
要求模型给出推导并严格以「答案:xxx」结尾,程序自动解析比对(整数或最简分数)。
| 题号 | 题目 | 参考答案 | 模型答案 | 耗时 |
|---|---|---|---|---|
| M01 | 1–100 中 3 或 5 的倍数之和 | 2418 | 2418 | 3.11s |
| M02 | 1–2026 中含数字 7 的整数个数 | 544 | 544 | 25.43s |
| M03 | 7^2026 的末三位 | 649 | 649 | 8.67s |
| M04 | 两骰子点数和为 7 的概率 | 1/6 | 1/6 | 2.61s |
| M05 | 2^100 的十进制位数 | 31 | 31 | 2.68s |
| M06 | x²−5x+6=0 两根之和 | 5 | 5 | 1.81s |
| M07 | C(10,4) | 210 | 210 | 1.52s |
| M08 | 5 选 3 排列数 | 60 | 60 | 2.32s |
| M09 | 1²+…+10² | 385 | 385 | 1.95s |
| M10 | 3 点整时针分针夹角 | 90° | 90 | 1.46s |
| 合计 | 10/10 | 平均 5.16s |
两道有含金量的题,模型给出的推导(节选):
M03(7^2026 末三位):因为 7²⁰ ≡ 1 (mod 1000),且 2026 = 20×101 + 6,所以 7²⁰²⁶ ≡ 7⁶ = 117649 ≡ 649 (mod 1000)。答案:649
M02(含 7 计数):不含 7 的数:0000
2026 中,千位为 0 或 1 时有 2×9³=1458 个;千位为 2 时……共 25 个。所以 12026 中不含 7 的有 1458+25−1=1482 个,含 7 的有 2026−1482=544 个。答案:544
M02 耗时 25.4 秒、输出 3318 token,说明模型对"枚举型"计数题选择了先构造再枚举的稳妥路线——慢,但稳。这也直接拉高了数学组的平均耗时(5.16s),其余 9 题均在 4 秒内完成。
四、测试三:中文综合(10/10 全对)
覆盖文学、历史、科学、逻辑、古诗、成语、地理、天文、阅读理解和传递推理,答案固定。
| 题号 | 考点 | 模型答案 | 耗时 |
|---|---|---|---|
| Z01 | 《红楼梦》作者 | A(曹雪芹) | 1.29s |
| Z02 | 改进造纸术 | B(蔡伦) | 1.24s |
| Z03 | 水的化学式 | B(H₂O) | 1.24s |
| Z04 | 三段论:向日葵需要光合作用 | A | 1.10s |
| Z05 | 会当凌绝顶出自 | D(杜甫) | 1.14s |
| Z06 | 水滴石穿近义 | B(持之以恒) | 1.47s |
| Z07 | 中国首都 | C(北京) | 1.14s |
| Z08 | 最大行星 | A(木星) | 1.62s |
| Z09 | 短文主旨(坚持) | B | 1.71s |
| Z10 | 传递推理:小明比小李高 | D | 1.20s |
| 合计 | 10/10 | 平均 1.31s |
中文问答是三道测试里响应最快的(平均 1.3 秒),且能给出正确的解题理由。例如 Z04:"由'所有植物都需要光合作用'和'向日葵是植物',根据三段论可必然推出向日葵需要光合作用。答案:A"。这类常识题对前沿模型来说不算难,但全部秒答且理由正确,说明基础认知没有掉链子。
五、汇总:成绩、速度与成本
| 测试 | 题数 | 通过 | 正确率 | 平均耗时 | 输入 token | 输出 token | 估算成本 |
|---|---|---|---|---|---|---|---|
| 编程能力 | 10 | 10 | 100%(59/59 用例) | 2.51s | 2190 | 1808 | ≈0.006 元 |
| 数学推理 | 10 | 10 | 100% | 5.16s | 1807 | 5739 | ≈0.013 元 |
| 中文综合 | 10 | 10 | 100% | 1.31s | 1895 | 618 | ≈0.003 元 |
| 合计 | 30 | 30 | 100% | 平均 ≈3.0s | 5892 | 8165 | ≈0.022–0.044 元 |
三点值得注意的"真实"细节:
- 思考占比极高:30 题共输出 8165 token,其中思考 token(reasoning)6884 个,占 84%。数学题里思考占比更是达到 93%——模型"想得多、说得少",推理 token 占了输出的大头。
- 成本可忽略:按平时价(输入 1 元/输出 2 元每百万 token)约 0.022 元;本次运行恰逢高峰时段(10:51 北京时间),按高峰翻倍价约 0.044 元,仍不足 5 分钱。
- 速度:从发请求到收到完整回答,30 题 API 墙钟总耗时约 40 秒(并行 3 路),单题中位数约 1.8 秒;从 M02 的单请求可粗估生成速度约 130 token/s(含思考)。
六、对照官方与第三方数据
我自己的 30 题与官方口径方向一致,没有出现"分数打架":
| 来源 | 关键数字 |
|---|---|
| 本文实测 | 编程 10/10、数学 10/10、中文 10/10,总计 30/30 |
| 官方(Agent 基准) | DeepSWE 54.4、Terminal Bench 2.1 82.7、Cybergym 76.7 |
| Artificial Analysis | 智能指数 50,与 Gemini 3.6 Flash 持平,距 GPT-5.6 Luna(51 分)仅 1 分 |
| 媒体报道 | 正式版 Agent 测试 25.2 分,接近 Opus-4.8 的 25.7 分 |
| 美标准机构评估 | V4 实际性能接近 8 个月前的 GPT-5,7 项基准中 5 项成本更低 |
官方公布的 9 项基准里,几个关键跳变(V4-Flash-0731 vs 预览版):DeepSWE 从 7.3 跳到 54.4(约 7.5 倍),Cybergym 从 38.7 到 76.7,Terminal Bench 2.1 从 61.8 到 82.7——后训练的效果肉眼可见。注意这些是官方口径,非本文实测。
架构上(官方口径):MoE,总参 2840 亿、激活仅 130 亿,100 万 token 上下文,可切换思考/非思考模式(含 speculative decoding 投机解码);与 4 月预览版骨架一致,只重做了后训练。这意味着这次提升主要来自训练方法而非模型变大——"小模型、强后训练"路线的直接验证。
七、价格横评:V4-Flash 到底便宜多少
| 模型 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| V4-Flash 平时 / 高峰 | 0.02 / 0.04 元 | 1 / 2 元 | 2 / 4 元 |
| V4-Pro 预览版 平时 / 高峰 | 0.025 / 0.05 元 | 3 / 6 元 | 6 / 12 元 |
| GPT-5.5(API 标准) | 0.5 美元 | 5 美元 | 30 美元 |
| Claude Opus 4.8 | - | 5 美元 | 25 美元 |
| Gemini 3.1 Pro | - | - | 12 美元 |
按输出价折算,V4-Flash(约 0.28 美元)约为 Opus 4.8 的 1/90、Gemini 3.1 Pro 的 1/43。即使按高峰翻倍价(4 元/百万 token ≈ 0.56 美元),仍然是 Opus 4.8 的 1/45。DeepSeek 还引入了峰谷计费:北京时间 9:00–12:00、14:00–18:00 为高峰时段价格翻倍,其余时段为平时价。如果你的任务对延迟不敏感,避开高峰可以省一半。
八、优点、已知短板与适用场景
优点
- 三个维度的实测全绿:代码能跑通全部用例,数学推导正确,中文问答快而稳;
- 速度与成本优势明显:单题秒级返回,30 题成本不足 5 分钱,缓存命中价低至 0.02 元/百万 token;
- "小模型、强后训练"路线得到验证:130 亿激活参数打出了接近顶级模型的 Agent 分数。
已知短板(转引自公开报道,本次样本未覆盖)
- 世界知识维度仍落后前沿闭源约 3–6 个月(官方口径);
- 指令遵循偶发翻车、输出偏"话痨"——Artificial Analysis 跑分烧掉 2.1 亿输出 token,是同级中位数的 3 倍多;
- 超长文本(~900K)检索能力一般;Agent 模式下推理语言锁英文。
适合谁用:重度代码/Agent 日常任务、批量生成、对成本敏感的团队——性价比目前没有对手。不适合谁用:需要精准百科知识、严格短输出或超长文档检索的场景,建议实测后再上。
一句话总结:V4 Flash 正式版是 2026 年年中"能干活 + 便宜到离谱"的典型代表,我这份 30 题实测没有找到它掉链子的地方——但小样本全对不等于无短板,样本量越大,结论才越稳。
FAQ
Q:30 题全对能说明什么? A:说明在这 30 道中档难度的编程/数学/中文题上,模型没有出错。但样本量小(每类 10 题)、单轮次运行、题目以中档为主,100% 正确率不能推导出"模型没有短板"。要得到统计意义上的结论需要更大样本和多次采样。这份实测的价值在于:用可复现的真实数据印证了官方基准的方向,而非替代全面评测。
Q:和 Claude Opus 4.8 怎么选? A:看场景和预算。V4-Flash 输出价约为 Opus 4.8 的 1/90,日常代码和 Agent 任务性价比碾压。但 Opus 4.8 在 Terminal Bench(85.0 vs 82.7)、Agents' Last Exam(25.7 vs 25.2)等高难基准上仍领先,复杂推理和长链 Agent 场景建议用 Opus 4.8。典型组合:Opus 4.8 做难活、V4-Flash 做量产,按任务难度分流。
Q:成本怎么算的?0.022 元和 0.044 元差在哪? A:DeepSeek 对 V4 系列引入了峰谷计费:北京时间 9:00–12:00、14:00–18:00 为高峰时段,价格翻倍。本次测评在 10:51 北京时间运行,恰逢高峰,所以按高峰价算约 0.044 元;若在平时时段跑同样 30 题,约 0.022 元。两次都不到 5 分钱。
Q:怎么复现这次测评?
A:三步。第一步设置 API Key:$env:DEEPSEEK_API_KEY = "sk-..."。第二步本地校验:python harness.py --selftest(不消耗 API 额度,验证题目答案与解析器)。第三步完整复现:python harness.py --tests coding,math,chinese --workers 3。harness.py 纯标准库无第三方依赖,原始结果保存在 results/ 目录的 JSONL 文件中,含每题完整输出、token 用量、耗时,可逐条核对。
Q:高峰计费是什么?平时和高峰怎么区分? A:DeepSeek 对 V4 系列引入了峰谷定价:北京时间 9:00–12:00 和 14:00–18:00 为高峰时段,输入和输出价格翻倍;其余时段(含夜间和周末)为平时价。缓存命中价在高峰也翻倍(0.02 元→0.04 元),但仍极低。如果你的任务是批量跑、对延迟不敏感,避开高峰时段可以省一半成本。
参考来源
- DeepSeek 官方模型卡 DeepSeek-V4-Flash-0731(ModelScope / HuggingFace):规格与 9 项基准
- DeepSeek API 文档「模型 & 价格」(api-docs.deepseek.com):模型名、峰谷定价
- Artificial Analysis 大模型智能指数与公开评测
- IT之家《DeepSeek-V4-Flash 正式版跑分报告》(2026-07-31)
- 科技日报《美标准机构评估认为……》(2026-05-05)
- 本文实测原始数据:harness.py + results/summary.json + raw_{coding,math,chinese}.jsonl(2026-08-02 10:51 北京时间真实调用)