8 月 3 日,阿里通义正式发布 Qwen3.8-Max。这不是一次常规迭代——2.4 万亿参数的 MoE 旗舰,上下文捅到 1M,官方直接把定位写成「可自主编程十数天交付完整项目」。一句话:模型不再只被问「会不会」,而是被要求「干完没」。
旗舰规格:2.4 万亿参数 MoE,1M 上下文
Qwen3.8-Max 是 MoE(混合专家)架构,总参数 2.4 万亿,旗舰定位。MoE 的意思是大虽然大,但每次推理只激活一部分专家网络,实际计算量远小于参数总量——这是把模型做大又不把推理成本做飞的关键。
上下文窗口 1M tokens。单次对话最多塞 991K 输入、吐 131K 输出;开思考模式后输入仍到 983K,最大思维链 262K。把一本长篇小说连同参考文档一次性丢进去,它边读边干。原生视觉理解是标配:图像、文本、视频都能进,输出文本。官方强调视觉贯穿「规划-执行-验证」全流程,支持超长文档和长视频的深度语义解析——不是贴个 OCR,是真拿来干活。
定价:缓存命中打到约一折
千问 AI 平台公布的调用价:
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入 | ¥12 |
| 输出 | ¥36 |
| 输入(自动缓存命中) | ¥1.5 |
| 显式缓存创建 | ¥15 |
| 显式缓存命中 | ¥1 |
亮点在缓存。显式缓存命中 ¥1 对比未命中输入 ¥12,差 12 倍。长程任务里前缀重复率高,把公共前缀缓存住,实际输入成本能压到约一折。显式缓存创建 ¥15 比普通输入贵 25%,但只付一次,后续命中就按 ¥1 走。这是给「长对话、多轮迭代」场景准备的成本开关——而 Qwen3.8-Max 的定位恰恰就是长程任务,两件事咬合得很紧。
从「答题」到「干活」:长程自主任务
真正值得盯的不是参数表,是定位变了。官方原文写的是「编程与办公能力全面跃升,可自主编程十数天交付完整项目」「胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果」。
翻译一下:模型被设计成能接住一个需要持续工作十几天的项目,自己规划、自己执行、自己验证、自己迭代,而不是一轮问答。这跟过去「问一句答一句」的用法是两回事。配套能力也照着这个目标铺:函数调用接外部工具、结构化输出保证 JSON 格式、联网搜索补实时信息、批量任务跑规模、还开放微调。前缀补全(Partial Mode)让你给定前缀它严格接续,适合卡住生成节奏的工程场景。
「长程任务中自主规划与闭环迭代,持续进化」——这句话如果实测能撑住,意味的是 agent 框架跟模型本身开始绑定了。过去 agent 是套壳调模型,现在模型自己长出了 agent 的骨头。
怎么立刻上手
三个入口,按用途选:
- 技术博客(看发布详解):https://qwen.ai/blog?id=qwen3.8
- API 调用(千问 AI 平台,含定价):https://www.qianwenai.com/models/qwen3.8-max
- 直接体验(Qwen Studio,对话试手):https://chat.qwen.ai/?models=qwen3.8-max
看法
国产旗舰这一轮拼的已经不是跑分数字,是「能干多久的活」。2.4 万亿参数加 1M 上下文是入场券,自主编程十数天、闭环迭代才是 Qwen3.8-Max 想立的旗。缓存定价打到一折说明阿里也想清楚了:长程任务要跑起来,单次调用必须便宜到敢让它反复试。
真正的问题是「十数天交付」能不能在真实工程里复现。官方定位写得漂亮,但模型自己规划十几天的任务链、中间不跑偏不崩盘,这是最难的事——要等开发者把它扔进真实代码库、跑过长链路任务才见分晓。今天先把入口占住,自己试一把比看任何跑分都实在。
参考来源
- Qwen3.8-Max 技术博客(阿里通义):https://qwen.ai/blog?id=qwen3.8
- Qwen3.8-Max API 与定价(千问 AI 平台):https://www.qianwenai.com/models/qwen3.8-max
- Qwen3.8-Max 在线体验(Qwen Studio):https://chat.qwen.ai/?models=qwen3.8-max