CodeArena 是 LMArena(原 LMSYS Chatbot Arena)于 2025 年 11 月推出的前端代码生成榜单,采用盲测方式评估各家大模型端到端产出完整前端应用(HTML / React)的能力。截至 2026 年 9 月 3 日,榜单的守擂者是 Anthropic 的 Claude Fable 5.1(Max),人类偏好 Elo 约 1765;而阿里巴巴的 Qwen3.8-Max-0902 以每百万 token 5 美元的价格,逼近了每百万 token 40 美元的 Fable 5.1——价格仅为后者的八分之一,却站到了第一梯队。本文不推荐"榜首唯一论",而是把价格性能、方法局限与你的真实需求摆在一起看。
一、横评摘要
这一轮横评的核心结论只有一句话:榜首和性价比冠军不是同一个模型。Claude Fable 5.1 守在分数最高处,Qwen3.8-Max-0902 守在价格性能的最优点。两者之间的 77 个 Elo 差距,对应的是 8 倍的单价差距。对大多数需要高频调用、批量生成前端原型的团队来说,这中间的取舍比"谁第一"更值得算清楚。
需要先把一个误传按死:近期有标题写"Qwen 1691 登顶、击败 GPT-6 Astra"。这句话的前提就是错的。Qwen 的 1691 是 2026 年 9 月 2 日上线首日的瞬时分;而 GPT-6 Astra 直到 9 月 3 日才发布,当天根本还没参赛。把"首日分"和"尚未参赛的对手"摆在一起比胜负,是时间线上的错位,不是事实。本文一律以 2026-09-03 已核实坐标为准。
对买家来说,真正的启示很简单:不要被"某天谁短暂登顶"的耸动标题,盖过模型在票数积累后真正落点的稳定画面。首日峰值确实存在,但它和成千上万次配对比较堆出来的稳定排名,不是同一档证据。我们因此刻意不引用任何榜单尚未发布、属于前瞻性质的具体分数。
二、CodeArena 是什么:把"写代码"变成盲测
传统代码基准往往比准确率、比通过率,模型面对的是被裁剪过的题。CodeArena 换了一个思路:它用 397 条真实用户提示词,覆盖 7 个大类、40 个子类、44 种语言,要求模型端到端生成一整个可运行的前端网页应用(HTML 或 React)。评分沿着三条轴展开:功能性(functionality)、可用性(usability)与保真度(fidelity,即设计是否忠实还原需求)。
最关键的是它的打分机制。CodeArena 采用人类偏好 Elo:同一道题,两个匿名模型各出一份结果,投票者在不知道模型身份的情况下二选一,投完才揭晓是谁。这种盲测显著削弱了品牌光环带来的偏差——你不会因为"这是某大厂"就天然给高分。官方榜单地址为 arena.ai/leaderboard/code/webdev/frontend,所有分数都能在该页面复核。
三轴评分里,"保真度"是 CodeArena 区别于纯功能基准的地方。很多老基准只关心"能不能跑通",CodeArena 额外关心"跑通之后像不像那么回事"。一个界面丑陋但功能齐全的结果,和一个设计精致但边界有瑕疵的结果,投票者会如何选,本身就是这个榜单想捕捉的信号。这也是为什么下文要反复强调:Elo 衡量的是"被选中概率",不是"正确率"。
还要补一句:CodeArena 的盲测虽然远好于"报上名来"的对比,但它终究是人工评判的竞赛。投票者是人,人有口味,口味又会随潮流漂移。九月胜出的模型,可能只是因为它的输出更对上当下的审美预期,而不是因为它的代码更安全。把这个人为因素放在眼里,才是"老实用榜"而非"迷信用榜"的区别。
三、榜单现状(截至 2026-09-03):Fable 5.1 守擂
把当前已核实的坐标摆出来。来源是 LMArena 官方榜单,口径是人类偏好 Elo,不是准确率,日期 2026-09-03。下表同时标注了分数、排名、单价与备注,便于横向核对。
| 模型 | 分数(Elo) | 排名 | 价格(每百万 token) | 备注 |
|---|---|---|---|---|
| Claude Fable 5.1 (Max) | 1765 | 约 #2 | $40 | Anthropic,2026-09-01 发布 |
| Qwen3.8-Max-0902 | 1688(首日 1691) | 曾短暂 #1(仅 9/2) | $5 | 阿里巴巴,价格为 Fable 的 1/8 |
| Kimi K3 (Max) | 约 1674 | 前列 | 未标注 | Moonshot |
| Gemini 3.8 Flash | 1567 | #18 | 未标注 | 仅为廉价 Flash 版,无 Pro 版,离顶尖梯队较远 |
| GPT-6 Astra | 待更新 | 待定 | 未标注 | 2026-09-03 刚发布,代码分待榜单更新 |
需要说明,Fable 5.1 在不同来源中出现 1762–1765 的微小浮动,属于正常区间。把它写成"绝对 1765"不如写成"约 1765"来得诚实。Kimi K3 的约 1674 紧随 Qwen 之后,三者共同构成了当前 1674–1765 这一第一梯队区间。GPT-6 Astra 由于 9 月 3 日才入场,分数尚未在榜单稳定,因此只能标记为"待定"。
四、价格性能:Qwen 以 1/8 价逼近顶级
CodeArena 官方有一张"帕累托前沿"(Pareto frontier)图,专门标出"性能—价格"两个坐标都占优的点。Qwen3.8-Max-0902 正是这张图上的关键角色:它用每百万 token 5 美元的价格,换来了与每百万 token 40 美元的 Fable 5.1 仅差约 77 个 Elo 的成绩。换句话说,你付八分之一的钱,拿到了第一梯队八成以上的体验。
把数字摆平:Fable 5.1 的 1765 与 Qwen 的 1688 之间差 77 分;而 Qwen 的 5 美元相对 Fable 的 40 美元,是 8 倍价差。对预算敏感、且需要大批量生成前端原型或内部工具的中小团队,这个坐标极具吸引力。Gemini 3.8 Flash 的 1567 分虽然排在 #18,但它胜在便宜和快,适合对保真度要求不高的批量场景——只是别把它误认为"Google 的顶级代码模型",因为目前它根本没有 Pro 版,拿 Flash 去和别人的 Max 比,本身就是错配。
价格性能这件事,真正的价值在于"帮你决定默认值"。如果你的业务每天要生成几百个前端页面,单价从 40 跌到 5,单月账单可以差出一个数量级。此时 Qwen 与 Fable 之间那 77 个 Elo 的体验差,是否值回 8 倍账单,就是一个必须算清楚的经营问题,而不是一个可以凭感觉跳过的技术问题。
五、方法论与局限:Elo 不是准确率
读榜之前,有几条铁律必须钉死:
第一,Elo 衡量的是"被选中概率",不是"正确率"。盲测里,界面更漂亮、交互更顺滑的那份往往更容易被投票者 pick,哪怕它在边界场景下藏着 bug。所以高分代表"更讨人喜欢",不代表"更正确"。把榜单分数当成质量认证,是这一轮最该避免的误读。
第二,±15 分以内常常只是噪声。Qwen 曾经以 3 个 Elo 微弱领先 Opus 5,这 3 分在统计上基本等于"打平"。把任何 15 分以内的差距当成"谁更强",都是过度解读。本文里 Qwen 与 Kimi 之间约 14 分的差距,同样应视为同一档位,而非谁压谁一头。
第三,版本漂移真实存在。0902 这类后缀是部署时间戳,模型权重会更新、分数会随之变动,而 API 的 slug 名字却保持不变。你今天看到的 Qwen3.8-Max-0902,和一个月后的同名入口,可能已经不是同一份权重。做长期选型时,要把"分数会漂移"写进风险清单。
第四,各家自己的基准不可直接横比。厂商发布的"自家跑分"往往挑了利于自己的题目与口径,和 CodeArena 这种第三方盲测不是一回事。看到厂商宣称"某项第一"时,先问一句"这是谁的榜、什么口径"。
第五,不要引用未来分数。GPT-6 Astra 于 2026-09-03 发布,其 CodeArena 分数在 9 月 5 日之后才可能有稳定更新;在此之前,任何声称 Astra 已拿 1797 之类的数字,都超出了当前可核实范围。我们只能说"刚发布,代码分待定"。凡是引用 9 月 5 日之后具体分数的说法,本文一律视为不可核实的前瞻数字,不予采纳。
六、"一周三换王"的叙事陷阱
社交平台上喜欢讲"一周之内三次换王"的故事。这类叙事如果用的是 9 月 3 日之后的前瞻分数,就会把尚未坐实的排名当成既成事实。正确的讲法是:9 月 2 日 Qwen 凭首日分短暂登顶,9 月 3 日 Fable 5.1 与 GPT-6 Astra 相继入场,榜首回到 Fable 5.1。我们写的是当下已验证的坐标,不是对未来的预测。
这个陷阱的危害在于,它把"部署节奏"包装成了"能力跃迁"。模型发布有先后,首日分和稳定分也不同,把这些时间差揉成一条"谁碾压谁"的曲线,既误导读者,也伤害榜单本身的公信力。负责任的说法应当把日期和口径一并交代,让读者自己判断这段波动里有多少是能力、多少是排期。
七、选购建议:别只盯着榜首
选模型不该只看谁在榜首。给你三条落地建议:
- 如果你的场景是高频、批量的前端原型生成,且成本敏感,Qwen3.8-Max-0902 的 1/8 价格极具性价比,值得作为默认选项。
- 如果你追求极致的设计保真度与复杂交互,Fable 5.1 仍是当下更稳的那一档,只是要为每百万 token 40 美元买单。
- 如果你只是要快、要便宜、要能跑通的脚手架,Gemini 3.8 Flash 或同类 Flash 模型足够;别为用不上的顶级性能多花钱。
把你的真实调用量、保真度要求与预算代入 CodeArena 的帕累托前沿,比盲信一个排名更可靠。想横向看同批评测,可参考 Gemini 3.8 Flash 的安全热点、DeepSeek 开源评测框架 与 Kimi 双协议实践。
收尾前再补一条时效提醒。本文所有数字均来自 LMArena 官方榜单与二级聚合源在所指日期的口径,其中部分排名属于二手整理而非直接抓取。模型权重与定价都会变,请把任何具体数字都当作某一时刻的读数。做采购决策前,回到实时榜单再核一遍——今天让 Qwen 占优的那八倍价差,到你读这篇文章时可能已经变窄或变宽。
常见问题
Q1:CodeArena 到底是什么?
CodeArena 是 LMArena 运营的前端代码生成盲测榜单,2025 年 11 月以 WebDev V2 形态上线。它用 397 条真实用户提示词,要求模型端到端生成完整前端应用,并沿功能性、可用性、保真度三轴打分,最终以人类偏好 Elo 排名。
Q2:为什么 Elo 分数代表"偏好"而不是"准确率"?
因为投票者是在两个匿名结果里二选一,更漂亮、更好用的那份更容易被选中,哪怕它藏着正确性缺陷。Elo 衡量的是"被选中概率",所以高分意味着"更讨喜",不直接等于"更少 bug"。
Q3:为什么本文不引用 GPT-6 Astra 的 CodeArena 分数?
GPT-6 Astra 于 2026-09-03 才发布,发布当日尚未进入榜单稳定统计;其分数要在 9 月 5 日之后才可能更新。在此之前引用任何具体分数(如 1797)都属于超出可核实范围的前瞻数字,因此我们只说"刚发布,代码分待定"。
Q4:Qwen 的"1/8 价格性能"是怎么算出来的?
Qwen3.8-Max-0902 每百万 token 5 美元,Fable 5.1 每百万 token 40 美元,40 除以 5 等于 8,即 Qwen 价格为 Fable 的八分之一。同时 Qwen 的 Elo(约 1688)与 Fable(约 1765)差距约 77 分,仍处第一梯队,于是形成"八分之一价格、接近顶级性能"的坐标。
Q5:普通团队到底该怎么选?
别只盯榜首。高频批量、成本敏感选 Qwen;要极致保真与复杂交互选 Fable 5.1;只要快而便宜的脚手架选 Flash 类模型。把你的真实调用量、保真度要求与预算代入 CodeArena 的帕累托前沿,比盲信排名更可靠。