硬核横评
硬核横评

用 Codex 实测 DeepSeek-V4-Flash 正式版:30 题硬核压测与竞品横评

用 Codex 搭纯标准库测评框架 harness.py,2026-08-02 10:51 真实调用 DeepSeek-V4-Flash(0731 正式版)API 跑 30 道自建题。结果:30/30 全对、编程 59/59 用例全过、30 题成本不足 5 分钱、平均 3 秒返回、思考 token 占 84%。附官方 9 基准对照表与价格横评(V4-Flash 输出价约为 Opus 4.8 的 1/90)。亲自压测非代表性对比,原始数据可复现可审计,含局限性与已知短板。

发布于 2026年8月2日7 分钟阅读
<!-- deepseek-v4-flash-codex-benchmark-review | review | 用 Codex 实测 DeepSeek-V4-Flash 正式版:30 题硬核压测与竞品横评 -->

2026 年 7 月 31 日,DeepSeek 在 API 更新日志里悄悄上线了 V4 Flash 正式版(deepseek-v4-flash-0731),没有发布会,当晚就上了知乎热搜。官方放出的 9 项基准里,代码 Agent 基准 DeepSWE 从预览版的 7.3 跳到 54.4(约 7.5 倍),Terminal Bench 2.1 拿到 82.7 分,逼近 Claude Opus 4.8 的 85.0。消息很猛,但跑分是官方给的,能不能信?

本文不转述官方跑分。我用 Codex 搭了一套纯标准库的测评框架(harness.py),于 2026-08-02 10:51(北京时间)真实调用官方 API,跑了 30 道自建题(编程 10 题 / 数学 10 题 / 中文 10 题),全程本地执行评分、原始数据留档、可复现可审计。结果:30/30 全对,编程 59 个单元测试用例全过,30 题 API 成本不足 5 分钱。

这是一份小样本、单轮次的实测快照,用来印证"正式版"的成色,不代表全面结论。下面把方法、数据、拆解、对照和价格横评一次讲清楚。

一、测评方法:怎么保证数据真实

本文不使用任何"云评测"或二手数据,全部结果来自我本人于 2026-08-02 10:51(北京时间)通过官方 API 真实调用 deepseek-v4-flash 得到的输出,原始数据保存在工作区,可复现、可审计。

评测设置

项目取值
APIhttps://api.deepseek.com/chat/completions(OpenAI 兼容格式)
模型deepseek-v4-flash(0731 正式版)
采样参数temperature=0.3,reasoning_effort=high,max_tokens=16384(编程)/8192(数学、中文)
并发3 路并行
测评时间2026-08-02 10:51–10:52(北京时间,处于高峰计费时段)
评分方式编程:本地执行模型代码跑单元测试;数学:答案程序化比对(整数/最简分数);中文:单选题答案比对
工具harness.py(纯标准库无第三方依赖,Codex 搭建)

三道测试均为自建、答案先经程序化校验的题目:

  1. 编程能力:10 道经典算法题(两数之和、括号匹配、合并区间、最长递增子序列、最大子数组和、多数元素、轮转数组、第一个唯一字符、打家劫舍、爬楼梯),共 59 个单元测试用例。模型只输出函数代码,本地独立进程执行评分。
  2. 数学推理:10 道精确答案题(整除求和、含 7 计数、模运算、概率、位数、韦达定理、组合数、排列数、平方和、钟表角度),答案在评测前已用程序逐题验证。
  3. 中文综合:10 道单选题(文学、历史、科学、三段论逻辑、古诗、成语、地理、天文、阅读理解、传递推理),答案固定。

复现方式python harness.py --selftest 可本地校验题目答案(不消耗 API 额度);python harness.py --tests coding,math,chinese --workers 3 可复现完整测评。

局限性(先说清楚):样本量小(每类 10 题)、单轮次运行、题目难度以中档为主,100% 的正确率不等于模型"没有短板";要得到统计意义上的结论需要更大样本和多次采样。这份实测的价值在于:用可复现的真实数据印证官方基准的方向,而非替代全面评测。

二、测试一:编程能力(10/10 题,59/59 用例全过)

每道题由模型生成 solve 函数,交由本地 Python 独立进程执行全部测试用例,禁止模型接触测试数据。

题号题目用例结果耗时
C01两数之和6/6通过1.90s
C02有效的括号7/7通过2.35s
C03合并区间6/6通过2.66s
C04最长递增子序列6/6通过2.08s
C05最大子数组和6/6通过1.80s
C06多数元素5/5通过1.68s
C07轮转数组6/6通过7.00s
C08第一个唯一字符5/5通过2.06s
C09打家劫舍6/6通过1.63s
C10爬楼梯6/6通过1.94s
合计59/59100%平均 2.51s

抽查 C07 轮转数组的实际生成代码(未做任何修改):

python
# C07 轮转数组(7.0s 完成,含思考)
def solve(nums: list[int], k: int) -> list[int]:
    if not nums:
        return []
    k %= len(nums)
    return nums[-k:] + nums[:-k]

代码简洁、边界处理到位(空数组判断、k 取模),10 题全部一次通过,未出现语法错误或运行时异常。C07 多花了几秒,是因为模型在思考里枚举了 k 与数组长度的取模关系——输出本身很短,思考占了大头。

三、测试二:数学推理(10/10 全对)

要求模型给出推导并严格以「答案:xxx」结尾,程序自动解析比对(整数或最简分数)。

题号题目参考答案模型答案耗时
M011–100 中 3 或 5 的倍数之和241824183.11s
M021–2026 中含数字 7 的整数个数54454425.43s
M037^2026 的末三位6496498.67s
M04两骰子点数和为 7 的概率1/61/62.61s
M052^100 的十进制位数31312.68s
M06x²−5x+6=0 两根之和551.81s
M07C(10,4)2102101.52s
M085 选 3 排列数60602.32s
M091²+…+10²3853851.95s
M103 点整时针分针夹角90°901.46s
合计10/10平均 5.16s

两道有含金量的题,模型给出的推导(节选):

M03(7^2026 末三位):因为 7²⁰ ≡ 1 (mod 1000),且 2026 = 20×101 + 6,所以 7²⁰²⁶ ≡ 7⁶ = 117649 ≡ 649 (mod 1000)。答案:649

M02(含 7 计数):不含 7 的数:00002026 中,千位为 0 或 1 时有 2×9³=1458 个;千位为 2 时……共 25 个。所以 12026 中不含 7 的有 1458+25−1=1482 个,含 7 的有 2026−1482=544 个。答案:544

M02 耗时 25.4 秒、输出 3318 token,说明模型对"枚举型"计数题选择了先构造再枚举的稳妥路线——慢,但稳。这也直接拉高了数学组的平均耗时(5.16s),其余 9 题均在 4 秒内完成。

四、测试三:中文综合(10/10 全对)

覆盖文学、历史、科学、逻辑、古诗、成语、地理、天文、阅读理解和传递推理,答案固定。

题号考点模型答案耗时
Z01《红楼梦》作者A(曹雪芹)1.29s
Z02改进造纸术B(蔡伦)1.24s
Z03水的化学式B(H₂O)1.24s
Z04三段论:向日葵需要光合作用A1.10s
Z05会当凌绝顶出自D(杜甫)1.14s
Z06水滴石穿近义B(持之以恒)1.47s
Z07中国首都C(北京)1.14s
Z08最大行星A(木星)1.62s
Z09短文主旨(坚持)B1.71s
Z10传递推理:小明比小李高D1.20s
合计10/10平均 1.31s

中文问答是三道测试里响应最快的(平均 1.3 秒),且能给出正确的解题理由。例如 Z04:"由'所有植物都需要光合作用'和'向日葵是植物',根据三段论可必然推出向日葵需要光合作用。答案:A"。这类常识题对前沿模型来说不算难,但全部秒答且理由正确,说明基础认知没有掉链子。

五、汇总:成绩、速度与成本

测试题数通过正确率平均耗时输入 token输出 token估算成本
编程能力1010100%(59/59 用例)2.51s21901808≈0.006 元
数学推理1010100%5.16s18075739≈0.013 元
中文综合1010100%1.31s1895618≈0.003 元
合计3030100%平均 ≈3.0s58928165≈0.022–0.044 元

三点值得注意的"真实"细节:

  • 思考占比极高:30 题共输出 8165 token,其中思考 token(reasoning)6884 个,占 84%。数学题里思考占比更是达到 93%——模型"想得多、说得少",推理 token 占了输出的大头。
  • 成本可忽略:按平时价(输入 1 元/输出 2 元每百万 token)约 0.022 元;本次运行恰逢高峰时段(10:51 北京时间),按高峰翻倍价约 0.044 元,仍不足 5 分钱。
  • 速度:从发请求到收到完整回答,30 题 API 墙钟总耗时约 40 秒(并行 3 路),单题中位数约 1.8 秒;从 M02 的单请求可粗估生成速度约 130 token/s(含思考)。

六、对照官方与第三方数据

我自己的 30 题与官方口径方向一致,没有出现"分数打架":

来源关键数字
本文实测编程 10/10、数学 10/10、中文 10/10,总计 30/30
官方(Agent 基准)DeepSWE 54.4、Terminal Bench 2.1 82.7、Cybergym 76.7
Artificial Analysis智能指数 50,与 Gemini 3.6 Flash 持平,距 GPT-5.6 Luna(51 分)仅 1 分
媒体报道正式版 Agent 测试 25.2 分,接近 Opus-4.8 的 25.7 分
美标准机构评估V4 实际性能接近 8 个月前的 GPT-5,7 项基准中 5 项成本更低

官方公布的 9 项基准里,几个关键跳变(V4-Flash-0731 vs 预览版):DeepSWE 从 7.3 跳到 54.4(约 7.5 倍),Cybergym 从 38.7 到 76.7,Terminal Bench 2.1 从 61.8 到 82.7——后训练的效果肉眼可见。注意这些是官方口径,非本文实测。

架构上(官方口径):MoE,总参 2840 亿、激活仅 130 亿,100 万 token 上下文,可切换思考/非思考模式(含 speculative decoding 投机解码);与 4 月预览版骨架一致,只重做了后训练。这意味着这次提升主要来自训练方法而非模型变大——"小模型、强后训练"路线的直接验证。

七、价格横评:V4-Flash 到底便宜多少

模型缓存命中输入缓存未命中输入输出
V4-Flash 平时 / 高峰0.02 / 0.04 元1 / 2 元2 / 4 元
V4-Pro 预览版 平时 / 高峰0.025 / 0.05 元3 / 6 元6 / 12 元
GPT-5.5(API 标准)0.5 美元5 美元30 美元
Claude Opus 4.8-5 美元25 美元
Gemini 3.1 Pro--12 美元

按输出价折算,V4-Flash(约 0.28 美元)约为 Opus 4.8 的 1/90、Gemini 3.1 Pro 的 1/43。即使按高峰翻倍价(4 元/百万 token ≈ 0.56 美元),仍然是 Opus 4.8 的 1/45。DeepSeek 还引入了峰谷计费:北京时间 9:00–12:00、14:00–18:00 为高峰时段价格翻倍,其余时段为平时价。如果你的任务对延迟不敏感,避开高峰可以省一半。

八、优点、已知短板与适用场景

优点

  • 三个维度的实测全绿:代码能跑通全部用例,数学推导正确,中文问答快而稳;
  • 速度与成本优势明显:单题秒级返回,30 题成本不足 5 分钱,缓存命中价低至 0.02 元/百万 token;
  • "小模型、强后训练"路线得到验证:130 亿激活参数打出了接近顶级模型的 Agent 分数。

已知短板(转引自公开报道,本次样本未覆盖)

  • 世界知识维度仍落后前沿闭源约 3–6 个月(官方口径);
  • 指令遵循偶发翻车、输出偏"话痨"——Artificial Analysis 跑分烧掉 2.1 亿输出 token,是同级中位数的 3 倍多;
  • 超长文本(~900K)检索能力一般;Agent 模式下推理语言锁英文。

适合谁用:重度代码/Agent 日常任务、批量生成、对成本敏感的团队——性价比目前没有对手。不适合谁用:需要精准百科知识、严格短输出或超长文档检索的场景,建议实测后再上。

一句话总结:V4 Flash 正式版是 2026 年年中"能干活 + 便宜到离谱"的典型代表,我这份 30 题实测没有找到它掉链子的地方——但小样本全对不等于无短板,样本量越大,结论才越稳。

FAQ

Q:30 题全对能说明什么? A:说明在这 30 道中档难度的编程/数学/中文题上,模型没有出错。但样本量小(每类 10 题)、单轮次运行、题目以中档为主,100% 正确率不能推导出"模型没有短板"。要得到统计意义上的结论需要更大样本和多次采样。这份实测的价值在于:用可复现的真实数据印证了官方基准的方向,而非替代全面评测。

Q:和 Claude Opus 4.8 怎么选? A:看场景和预算。V4-Flash 输出价约为 Opus 4.8 的 1/90,日常代码和 Agent 任务性价比碾压。但 Opus 4.8 在 Terminal Bench(85.0 vs 82.7)、Agents' Last Exam(25.7 vs 25.2)等高难基准上仍领先,复杂推理和长链 Agent 场景建议用 Opus 4.8。典型组合:Opus 4.8 做难活、V4-Flash 做量产,按任务难度分流。

Q:成本怎么算的?0.022 元和 0.044 元差在哪? A:DeepSeek 对 V4 系列引入了峰谷计费:北京时间 9:00–12:00、14:00–18:00 为高峰时段,价格翻倍。本次测评在 10:51 北京时间运行,恰逢高峰,所以按高峰价算约 0.044 元;若在平时时段跑同样 30 题,约 0.022 元。两次都不到 5 分钱。

Q:怎么复现这次测评? A:三步。第一步设置 API Key:$env:DEEPSEEK_API_KEY = "sk-..."。第二步本地校验:python harness.py --selftest(不消耗 API 额度,验证题目答案与解析器)。第三步完整复现:python harness.py --tests coding,math,chinese --workers 3。harness.py 纯标准库无第三方依赖,原始结果保存在 results/ 目录的 JSONL 文件中,含每题完整输出、token 用量、耗时,可逐条核对。

Q:高峰计费是什么?平时和高峰怎么区分? A:DeepSeek 对 V4 系列引入了峰谷定价:北京时间 9:00–12:00 和 14:00–18:00 为高峰时段,输入和输出价格翻倍;其余时段(含夜间和周末)为平时价。缓存命中价在高峰也翻倍(0.02 元→0.04 元),但仍极低。如果你的任务是批量跑、对延迟不敏感,避开高峰时段可以省一半成本。


参考来源

  • DeepSeek 官方模型卡 DeepSeek-V4-Flash-0731(ModelScope / HuggingFace):规格与 9 项基准
  • DeepSeek API 文档「模型 & 价格」(api-docs.deepseek.com):模型名、峰谷定价
  • Artificial Analysis 大模型智能指数与公开评测
  • IT之家《DeepSeek-V4-Flash 正式版跑分报告》(2026-07-31)
  • 科技日报《美标准机构评估认为……》(2026-05-05)
  • 本文实测原始数据:harness.py + results/summary.json + raw_{coding,math,chinese}.jsonl(2026-08-02 10:51 北京时间真实调用)

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-02

常见问题

30 题全对能说明什么?
说明在这 30 道中档难度的编程/数学/中文题上,模型没有出错。但样本量小(每类 10 题)、单轮次运行、题目以中档为主,100% 正确率不能推导出「模型没有短板」。要得到统计意义上的结论需要更大样本和多次采样。这份实测的价值在于:用可复现的真实数据印证了官方基准的方向,而非替代全面评测。
和 Claude Opus 4.8 怎么选?
看场景和预算。V4-Flash 输出价约为 Opus 4.8 的 1/90,日常代码和 Agent 任务性价比碾压。但 Opus 4.8 在 Terminal Bench(85.0 vs 82.7)、Agents' Last Exam(25.7 vs 25.2)等高难基准上仍领先,复杂推理和长链 Agent 场景建议用 Opus 4.8。典型组合:Opus 4.8 做难活、V4-Flash 做量产,按任务难度分流。
成本怎么算的?0.022 元和 0.044 元差在哪?
DeepSeek 对 V4 系列引入了峰谷计费:北京时间 9:00–12:00、14:00–18:00 为高峰时段,价格翻倍。本次测评在 10:51 北京时间运行,恰逢高峰,所以按高峰价算约 0.044 元;若在平时时段跑同样 30 题,约 0.022 元。两次都不到 5 分钱。
怎么复现这次测评?
三步。第一步设置 API Key(环境变量 DEEPSEEK_API_KEY)。第二步本地校验:python harness.py --selftest(不消耗 API 额度,验证题目答案与解析器)。第三步完整复现:python harness.py --tests coding,math,chinese --workers 3。harness.py 纯标准库无第三方依赖,原始结果保存在 results/ 目录的 JSONL 文件中,含每题完整输出、token 用量、耗时,可逐条核对。
高峰计费是什么?平时和高峰怎么区分?
DeepSeek 对 V4 系列引入了峰谷定价:北京时间 9:00–12:00 和 14:00–18:00 为高峰时段,输入和输出价格翻倍;其余时段(含夜间和周末)为平时价。缓存命中价在高峰也翻倍(0.02 元到 0.04 元),但仍极低。如果你的任务是批量跑、对延迟不敏感,避开高峰时段可以省一半成本。

相关文章

硬核横评

AI 大模型性价比横评:中国选手为什么便宜这么多

2026 年中美大模型 API 性价比横评:GPT-5 $10/$30 对 DeepSeek-V3 $0.27/$1.10,差一个数量级。含中美价格对比表和客服场景月成本对比表(10M tokens:GPT-5 $140 vs Qwen Flash $0.50)。核心结论:中国模型成本显著低于美国前沿模型,但选型需权衡合规风险(DoorDash 事件)和能力需求线。代表性对比非亲自压测,以官方为准。

2026年8月1日12 分钟阅读
硬核横评

AI 知识管理工具横评:Notion AI、Obsidian、Heptabase、Mem、Capacities、飞书知识库怎么选

2026 年六款主流 AI 知识管理工具代表性对比(非亲自压测,价格以官网为准):Notion AI(all-in-one 工作区,团队协作强,AI add-on $10/人/月)、Obsidian(本地优先 Markdown,数据掌控最强,个人免费)、Heptabase(白板卡片可视化,深度思考)、Mem(AI 自动归类,懒整理党)、Capacities(对象化笔记,结构化新范式)、飞书知识库(国内企业协作)。含两张对比表、逐个拆解、按人群选型、三个避坑与五条 FAQ。

2026年8月7日8 分钟阅读
硬核横评

4 款 AI coding skill 框架横评:ponytail、impeccable、mattpocock、superpowers 怎么选

横评 4 款 AI coding skill 框架:ponytail(★97k,lazy senior dev,~54% less code)、impeccable(★56k,23 commands+59 rules 前端设计指导)、mattpocock/skills(★206k,Real Engineers 不夺权)、superpowers(★267k,subagent+TDD 方法论,11 agents)。2 对比表+逐个拆+选型+避坑+5 FAQ。代表性对比非亲自压测,star 据 GitHub API 2026-08-06,ponytail 减码数据标 README 自报。

2026年8月6日9 分钟阅读