2026 年 10 月 6 日,蚂蚁百灵(InclusionAI)发布了 Ling-3.1-flash,同时开启为期两周的免费体验,其中 Vercel AI Gateway 侧的免费截止日期在 changelog 里写得明明白白:10 月 13 日。换句话说,窗口关上之后,想再用 560B 级别的模型算力,就得按转付费后的价格来——而那个价格官方目前还没有公布。
免费期最大的价值不是省钱,是试错。你可以在不花一分钱的前提下,把模型在长文档整合、办公文档生成、代码长任务这几类场景里跑一遍,判断它到底适不适合自己的工作流。本篇是一份按时间顺序编排的实战 SOP:先算清模型底账,再讲三个入口怎么选,然后是免费期最值得测的三件事、256K 上下文的喂法、API 的通用接法,最后是免费期结束前的必办事项。全程只涉及官方入口的正常注册和调用。
一、先把账算清:这次免费的是什么
用任何模型之前,先看参数,再看限制,两个都看清楚才不会被宣传口径带偏。
Ling-3.1-flash 的底账是这样的:总参数 560B,每 token 激活 25B,上下文上限 1M token。这是一个标准的 MoE(混合专家)架构:512 个路由专家中每个 token 选 8 个,外加 1 个共享专家。注意力层用的是混合设计——7 层 KDA加 1 层 Gated MLA(门控多头潜在注意力),线性注意力占大头,这是它能把上下文推到 1M 量级、同时把推理成本压下来的架构基础。
和前代比一下,你就知道这次升级的量级:Ling-3.0-flash 是 124B 总参数、5.1B 激活。也就是说 Ling-3.1-flash 的总规模是前代的约 4.5 倍,激活参数约 5 倍。这不是小修小补,是换了一代底座。
重点来了,这里有一个必须如实提醒的差距:官方宣传口径里的 1M 上下文上限,体验期并没有完全开放。 免费体验期的服务长度是 256K token。1M 的完整上下文,官方说的是转付费后开放。256K 对绝大多数单篇长文档、中型代码库的任务已经够用,但如果你手里的活是「几百页资料一次喂进去」,就要按第四节讲的分段策略来处理,而不是硬等 1M。把这件事放在最前面,就是防你踩坑:别按 1M 宣传图做方案设计,结果在体验期卡在 256K。
还有一个时间敏感信息:官方提到转付费后会开放 1M 上下文,并且计划同步开源。注意措辞——计划开源,开源时间未定。这个信息影响你的长期决策(见第六节),但不要把它当成已兑现的承诺来排期。
二、三个入口怎么选
免费体验有三条路,各有各的目标人群。选哪条取决于你要不要写代码接 API。
入口一:网页对话,零门槛。 地址是 chat.ant-ling.com。注册账号登录就能用,适合第一批上手试水的人。你的目的很简单:花半小时问几个你日常工作中真实会遇到的问题,看看回答质量、中文语感、长文档理解能力,先建立一个直观印象。如果你只是「想看看蚂蚁的大模型什么水平」,走到这一步就够了,不用再往下。
入口二:蚂蚁数科 MaaS 平台,拿 API key。 地址是 maas.antdigital.com,这是要写代码对接的人的主战场。注册后在平台上开通模型服务、创建 API key。体验期的模型 ID 是 modelservice-1790229240754001388,调用时要用这个 ID 而不是模型名——这是体验期容易忽略的一个细节,模型 ID 和正式的模型命名可能不同,一切以平台控制台展示为准。如果你的目标是判断「这个模型能不能接进我自己的产品」,直接从这个入口开始。
入口三:Vercel AI Gateway,海外开发者通道。 Vercel 已在其 AI Gateway 上线了 Ling-3.1-flash,changelog 明示免费至 10 月 13 日。如果你人在海外、或者你的技术栈本来就跑在 Vercel 生态里,走这个通道最省事,连切换网关的成本都省了。
此外还有 Novita AI 也提供了该模型的接入,属于第四条路,按你现有的服务订阅情况自选即可。
一句合规提醒:以上入口都是官方公开渠道,正常注册调用。网上流传的「免注册直连」「共享账号」渠道一律不要碰——稳定性和数据安全毫无保障,第五节还会展开讲。
三、免费期该测什么:三个场景
两周时间不算长,测什么都想测的结果是什么都测不透。建议集中火力打三个场景,每一个都有官方口径背书。
场景一:长文档整合。 这是 256K 上下文最直接的用武之地。官方在发布口径中重点强调了办公评测 GDPval-AA V2.1 与医疗评测 HealthBench Professional 上的表现突出——注意,官方只说了「突出」,具体分数并未公布,这里不编数字,你正好可以趁免费期自己拿真实材料验证。具体测法:找一份你手头真实的多人协作产出物,比如一份三十页的项目总结、一组会议纪要加周报,喂进去让它做跨文档的信息合并、矛盾点识别、要点提炼。长文档整合是线性注意力架构的强项区,也是你最容易对比出它和现有工具差异的场景。
场景二:Excel 和 PPT 生成。 官方明确提到办公任务可以整合资料生成 Excel 和 PPT。测法要具体:给它一组结构混乱的原始数据,让它整理成规范的 Excel 表格;或者给它一份大纲加参考资料,让它产出可以直接修改使用的 PPT 结构和内容。判断标准不是「生成的东西能不能直接用」(大概率要人工改),而是「省了多少从零搭建的时间」。这类任务平时用通用模型常遇到格式错乱、数据编造的问题,值得专门对比。
场景三:代码长任务。 这是本模型最能打的一个场景,有官方自报的可复跑案例:一个约 17 小时的任务里,模型从零写出一个 Lua 到 x86-64 ELF 的编译器,182 项测试通过 178 项,通过率 97.8%;另一个约 20 小时的任务里,它把一个 C 图像库移植到 Rust,实测加速 8.015 倍,30 项正确性检查全部通过。两个案例都是官方自报口径,但附带了可复跑的测试集,透明度比只报一个基准分数高得多。你不必复刻这么大的工程,可以给它一个你拖了很久的中型重构任务,看它能否在一次会话里持续推进、中途不跑偏。长任务的稳定性——即模型能不能「连续干活不崩」——恰恰是大多数模型拉不开差距的地方,也是这个模型的主打卖点。
如果你只有一个晚上的时间,优先级排序是:代码长任务 > 长文档整合 > 文档生成。因为前两者的能力差异最容易被你的真实任务检验出来。
四、256K 窗口怎么喂:分段摘要加末段全文
体验期只有 256K,这节讲怎么在这个窗口里喂大材料。核心策略一句话:前文压成摘要,末段保留全文。
具体操作分三步。第一步,切块摘要:把长材料按逻辑章节切成块,每块先让模型(或者你自己)生成一份保留关键事实、数字、人名、结论的摘要。第二步,拼接上下文:把所有摘要按原始顺序拼起来,放在上下文的前半部分,这部分是你的「记忆索引」。第三步,末段全文:把最近的一到两章原文完整贴在摘要之后,然后提出你的问题。
为什么要保留末段全文?因为摘要有损。跨段一致性、行文风格、细节表述这些信息在摘要里必然丢失,而你的问题往往恰好落在最后处理的材料上。摘要负责「广度」,末段全文负责「深度」,两者配合才能在有限窗口里逼近完整上下文的效果。
几个实操细节:一是摘要的粒度宁细勿粗,数字、日期、专有名词一个都不要丢,丢一个数字整份材料的可信度就塌了;二是如果你的任务是逐章处理(比如逐章翻译、逐章审校),那就做成滚动窗口——已处理章节的摘要滚动累加,当前章保留全文;三是别把 256K 当成安全余量,提示词、系统指令、 few-shot 示例都占窗口,实际留给你自己材料的份额要提前算。
等转付费后 1M 开放,这套策略依然有用——1M 也有装不下的材料,分段摘要加末段全文是通用方法论,不算白学。
五、API 怎么接:OpenAI 兼容端点
Ling-3.1-flash 的 API 走 OpenAI 兼容协议,这意味着你现有的基于 OpenAI SDK 的代码,理论上只需要改 base_url、模型 ID 和 API key 三处就能跑通。下面是一个通用的接法示例:
from openai import OpenAI
client = OpenAI(
api_key="你的MaaS平台API key",
base_url="以蚂蚁数科MaaS平台文档提供的端点地址为准"
)
resp = client.chat.completions.create(
model="modelservice-1790229240754001388",
messages=[
{"role": "user", "content": "把这段材料整理成要点清单"}
]
)
print(resp.choices[0].message.content)必须强调:上面的示例是通用结构演示,具体的端点 URL、认证方式、可选参数(比如 temperature、max_tokens 取值范围、流式字段名)一律以蚂蚁数科 MaaS 平台的官方文档为准,本篇不做任何猜测性填写。体验期的模型 ID 与正式命名、参数命名都可能和社区流传的版本有出入,唯一可靠的信息源是平台控制台和文档中心。如果某个字段在文档里找不到,就不要用,先用文档里明确列出的参数把链路跑通,再按需加参数逐个验证。
迁移方面的经验可以参考站内几篇接入实战:《DeepSeek V4.1-Flash 接入 SOP》(/zh/posts/deepseek-v4-1-flash-integration-sop)讲的是同一类 OpenAI 兼容端点的对接流程和常见报错排查;《Claude Sonnet 5.5 API 实战》(/zh/posts/claude-sonnet-5-5-api-sop)和《GLM-5.3-Flash 接入指南》(/zh/posts/glm-5-3-flash-integration-sop)则覆盖了另外两家主流模型的接入差异,三篇对照着看,基本能覆盖「同一套代码适配多家模型」的迁移要点。
另外重复一次前文的提醒:只用官方入口的官方 key。第三方转售的「低价 key」、群里流传的「共享 key」,轻则随时失效,重则你的请求内容和返回数据都被中间人记录——用免费期的正式渠道测,本来就是零成本,没有任何理由去承担这个风险。
六、免费期结束前必做的三件事
窗口期结束前,有三件事要办,都和「留下退路」有关。
第一件:数据导出。 免费体验期间你在网页端和平台上的对话记录、生成的文档、调用的日志,趁还能访问,把有价值的内容导出备份。免费体验阶段的服务条款里,体验期数据的保留策略和转付费后是否一致,官方没有单独说明——那就按最保守的方式处理:凡是你觉得有用的产出,本地留一份。尤其是场景测试中跑出来的好结果,那是你后续评估转付费与否的第一手依据。
第二件:盯紧两条公告线。 官方已明确两条后续计划:一是转付费后开放完整 1M 上下文;二是计划同步开源。开源这件事对你意义重大——如果 Ling-3.1-flash 真的以开源权重放出,560B/25B 激活的 MoE 模型可以私有化部署,数据不出域,这对企业用户是完全不同的价值等级。但开源时间未定,不要拿「反正要开源」当理由推迟付费决策,跟着官方渠道的公告走。
第三件:形成你自己的结论。 两周测下来,你应该手里有一份清单:哪些任务它干得好、哪些不行、输出质量对比你现有工具差多少、你的场景每月大概要多少 token。免费期的意义就是让这份清单替你做决定——体验期结束该转付费还是该退场,用数据说话,不要凭印象。
主攻搜索词
围绕这次发布,读者最常搜的三个问题集中回答一下:
- 百灵大模型api:API 走蚂蚁数科 MaaS 平台(maas.antdigital.com)获取,OpenAI 兼容端点,体验期模型 ID 为 modelservice-1790229240754001388,具体端点以平台文档为准;海外开发者也可走 Vercel AI Gateway。
- 百灵大模型官网:网页对话入口是 chat.ant-ling.com,MaaS 平台是 maas.antdigital.com,两个都是官方入口,认准域名。
- 百灵大模型是哪个公司的:蚂蚁集团旗下 InclusionAI 团队的百灵(Ling)系列,本篇的 Ling-3.1-flash 是 2026 年 10 月 6 日发布的最新一代。
FAQ
**Q1:**Ling-3.1-flash 免费是真的吗?免费到什么时候?
**A1:**是真的。官方开启了为期两周的免费体验,其中 Vercel AI Gateway 通道的免费截止日期在其 changelog 中明示为 10 月 13 日。体验期结束后转付费的具体价格官方尚未公布,请以官方后续公告为准。
**Q2:**宣传说 1M 上下文,为什么我用的时候开不了?
**A2:**1M 是该模型的上下文上限,但免费体验期的服务长度只开放 256K,完整 1M 上下文要等转付费后开放。这是体验期最容易被忽略的差距,做超长上下文方案时要按 256K 来设计,或采用分段摘要加末段全文的喂法。
**Q3:**它和通义千问(Qwen)比怎么样?该选哪个?
**A3:**两者架构思路相反:Ling-3.1-flash 用 7 层 KDA 线性注意力加 1 层 Gated MLA 的混合设计,把上下文推到 1M 量级;Qwen3.8 系列则是 DeltaNet 加标准注意力组合。选型建议按场景:超长文档、长程代码任务优先试 Ling(正好免费),通用对话和生态成熟度优先看 Qwen。免费期就是给你做这个对比的机会。
**Q4:**免费期结束后我的对话数据怎么办?
**A4:**按最保守方式处理:免费期内所有有价值的对话记录和生成结果,主动导出并本地备份。体验期数据在转付费后的保留策略官方未单独说明,不要假设数据会一直保留在云端。
**Q5:**说计划开源,开源后能自己部署吗?
**A5:**官方口径是转付费后计划同步开源,开源时间未定,许可证条款也未知。开源兑现后,560B 总参数/25B 激活的 MoE 架构对私有化部署是利好,但在官方公告落地前,不建议把部署计划建立在这个预期上。持续关注百灵官方渠道公告即可。
本文由 AI 辅助生成,经人工审核编辑。