一、这次到底开源了什么
2026 年 9 月 10 日,蚂蚁集团旗下的灵波科技(Robbyant)在其 GitHub 仓库 Robbyant/lingbot-world-v2 补齐了 LingBot-World 2.0 的剩余全部变体。这件事需要放回时间线里看,才不会被"又一个世界模型"的疲劳感淹没。
时间线是这样的:2026 年 7 月 9 日,灵波科技首度开源,一次性放出技术报告、推理代码与模型权重;2026 年 9 月 10 日,又补齐了 14B causal-pretrained、14B bidirectional、1.3B causal-fast 三款变体。换句话说,七月的版本更像"技术报告加初版代码",九月的版本才是"全家桶齐活"。
截至 2026 年 9 月 14 日,GitHub API 实测数据:仓库收获 1,755 颗星、135 次 fork,主语言 Python,创建于 2026 年 7 月 8 日,最近一次 push 在 2026 年 9 月 10 日,当前开放 issue 7 个。模型另有别名 LingBot-World-Infinity,官方变体清单包括 lingbot-world-v2-14b-causal-fast、lingbot-world-v2-14b-causal-pretrain、lingbot-world-v2-14b-bid、lingbot-world-v2-1.3b-causal-fast,HuggingFace 与 ModelScope 双平台均可获取。技术报告 arXiv 编号 2607.07534,标题是 "Infinite Worlds with Versatile Interactions"。技术实现上,代码基于并致谢 Wan2.2(Wan-Video)。想直接体验而非本地部署,官方提供了两个入口:国际 Web 端的 Reactor,以及国内的移动端 LingGuang;官方称完整能力 demo 在 WAIC 2026 展出。
把事实摆清楚后,我的判断是:这次发布的真正价值,不在"又一个能生成游戏画面的世界模型",而在两项底层范式变化——因果预训练把交互时程从分钟级推到小时级,以及 Agentic Harness 把智能体塞进了世界模型内部。但与此同时,它有两个落地隐患几乎被媒体忽略:许可证是非商用的,硬件门槛的口径在官方内部就自相矛盾。
二、真正的信号:因果预训练把时程推到小时级
先看第一个信号。世界模型过去最大的短板是"记忆衰减":连续生成几十秒后,画面开始漂移,角色长相、场景布局逐渐失稳。LingBot-World 2.0 给出的解法是因果预训练(causal pretraining)范式。按官方 README 的表述,依托这种精心设计的训练方式,模型在长时间连续生成时仍能保持画面质量一致,实现所谓"无上限交互时程"(unbounded interaction horizon)。
这一点是整篇里最值得产业关注的部分。行业里大多数实时世界模型,一致性时长以分钟计,Genie 3 的公开报道口径也只是"约 1 分钟"。而灵波官方口径是"小时级连续生成不漂移"。从分钟到小时,不是一个数量级的优化,而是从"玩具 demo"到"可连续使用的生产工具"的距离。
另外两个升级也值得一并记下。其二是快速响应:官方从基座模型蒸馏出实时变体,足以驱动 720p@60fps 的视频流。其三是高度多样的交互元素:攻击、射箭、施法、射击等动作,以及更丰富的文本驱动事件,比如雨雪天气。这四点合在一起,才是 README 里"四项升级"的完整面貌。
需要立刻泼一盆冷水:上述时程与帧率是官方口径,不是第三方实测。我们在后文会专门讨论。但即便只按官方口径,把"交互时程"作为核心指标单独拎出来,本身就是一次正确的技术叙事——它逼着所有人去问,一个世界模型到底能"连着聊多久"而不崩。
三、Agentic Harness:把"智能体"塞进世界模型内部
第二个信号更有意思。LingBot-World 2.0 提出了 Agentic Harness,官方称这是世界模型领域的首创。它的核心是两个分工明确的智能体:
Pilot Agent 负责规划并执行角色行为。你可以理解为,它决定"角色下一步该往哪走、做什么动作"。Director Agent 随场景推进合成新的环境元素,比如新的地形、新的物体、新的天气。
过去的世界模型,生成逻辑是"给定输入帧加动作,预测下一帧",智能体的决策在模型之外。灵波的做法是把决策层也搬进模型内部,让世界自己长出叙事。这更像是在造一个"会自己编排剧情的世界",而不是一个"被动响应按键的视频生成器"。
这个方向我认为是世界模型从"生成工具"走向"模拟环境"的关键一步。具身智能训练场、交互式教育这类场景,恰恰需要的不是"画面好看",而是"世界内部有因果、有逻辑、能自洽"。Agentic Harness 至少在架构叙事上,朝这个方向迈了一步。
四、避坑一:CC BY-NC-SA 4.0,商业化先想清楚
现在说第一个落地隐患,也是本篇最重要的"避坑钩子"。
LingBot-World 2.0 采用 CC BY-NC-SA 4.0 许可证。拆开看:CC 是知识共享协议;BY 要求署名;NC 是非商业性使用,也就是说,任何以盈利为目的的使用都需要额外授权;SA 是相同方式共享,衍生作品必须以相同协议发布。
对开发者意味着什么?如果你拿它做个人研究、教学演示、开源二次开发,没问题。但如果你想把它做成付费产品、接进商业游戏、做成 SaaS 服务,NC 这一条会直接卡住你。更麻烦的是 SA:你基于它做的改进,若对外发布,也必须以 CC BY-NC-SA 4.0 开源,不能闭源商用。
这和两个常见的参照物形成反差。Genie 3 是闭源,只能订阅体验,根本没有"拿去改"的入口。而许多开源模型用的是更宽松的协议。LingBot-World 2.0 把"代码加 14B/1.3B 多款权重加技术报告"全开源了,看起来很大方,但协议上的 NC 把商业化的门只开了一条缝。
我的建议很直接:在动手之前,先把你的使用场景写清楚。纯研究、教学、原型验证,放心用。一旦涉及营收,先去谈授权,别等产品上线被律师找上门。关于本地部署的具体步骤,可以看姊妹篇 LingBot-World 小模型本地部署 SOP。
五、避坑二:硬件门槛口径三重分歧
第二个落地隐患,是我认为最需要被如实写出来的部分。LingBot-World 2.0 的硬件门槛,在公开信息里出现了三个互相矛盾的口径,而且矛盾就发生在官方自己的材料内部。
口径一,来自官方 README 的推理示例:1.3B causal-fast 用的是 --nproc_per_node=4 --ulysses_size 4,也就是 4 卡。
口径二,来自仓库内的 run_fast.sh 脚本注释。注释写得很明确:1.3B 有 12 个注意力头,Ulysses 并行度必须能整除 12,给出的参考设置是 2 卡(ulysses_size=2),对应的是 "1.3B causal-ODE CP=1 recipe";14B 有 40 个头,则用 8 卡。
口径三,来自媒体与官方 demo 的宣传话术:1.3B Small 版可在消费级单卡 GPU 上实时运行。
这三个口径互不兼容。最尴尬的是前两个都出自官方——README 说 4 卡,run_fast.sh 说参考 2 卡,连脚本注释都在悄悄纠正文档。
正确的写法不是替厂商圆场。我的结论是:以官方代码仓为准,目前可复现的最低参考配置是 2 卡(ulysses_size=2);"消费级单卡实时"在代码仓里找不到任何可复现的路径,应标注为"官方未确认"。我们既不该断言单卡能跑,也不该断言绝对跑不了——但凡要立项,请以 2 卡作为预算底线,把单卡说法当作宣传待证实。
这里还有一个容易被忽略的配套信息:官方明确表示不计划开源部署代码。如果你要自建部署,README 指向的是 SGLang cookbook 或 NVIDIA flashdreams,也就是说,真正能跑通的工程链路,需要你自己补。
关于开源资源的横向梳理,可以参考姊妹篇 上帝视角:开源世界模型资源盘点。
六、横向对比:LingBot-World 2.0 vs Genie 3
把对标对象摆出来,信号会更清楚。需要强调:所有涉及 Genie 3 的数字都来自公开报道口径,不是实测;LingBot-World 2.0 的数字来自官方口径,同样未经第三方独立验证。
| 维度 | LingBot-World 2.0 | Genie 3 |
|---|---|---|
| 出品方 | 蚂蚁灵波科技(Robbyant) | Google DeepMind |
| 实时规格 | 官方口径 720p@60fps | 公开报道 720p@24fps |
| 一致性时长 | 官方口径小时级不漂移 | 公开报道约 1 分钟 |
| 多人协作 | 官方口径支持多人共享同一世界 | 公开报道暂不支持 |
| 开放程度 | 代码加 14B/1.3B 多款权重加技术报告全开源 | 闭源,仅 Gemini Ultra 订阅体验 |
| 许可证 | CC BY-NC-SA 4.0(非商用) | 闭源,无公开协议 |
这张表最值得读的,不是谁的参数更好看,而是"开放程度"这一行。DeepMind 把 Genie 3 锁在订阅里,灵波把整套东西摊在 GitHub 上。对研究者和小团队,这中间的差距是"能不能动手改"五个字。
但请别把这张表读成"灵波完胜"。Genie 3 的数字虽是闭源口径,人家至少跑通了对外服务;灵波的小时级、多人协作,目前还停留在官方口径。两者都不该被当成已落地的产品规格。
七、能用在哪:五个官方列举方向
官方列举了五个应用方向,我按"落地可行性"重新排了个序,纯属个人判断:
第一,具身智能训练场。这是最契合 Agentic Harness 逻辑的场景——世界内部有因果、能自洽,正好给机器人策略训练提供可控环境。NC 协议在这里不是障碍,因为训练研究往往是非营利的。
第二,AI 游戏开发。用世界模型做关卡原型、做 NPC 行为预演,效率高。但注意 NC,商业游戏发行前要谈授权。
第三,影视与虚拟拍摄预演。导演先用世界模型把镜头跑一遍,再决定实拍方案,省钱。
第四,VR/AR 与数字文旅。多人共享同一生成世界,理论上能支撑虚拟展厅、数字景区。
第五,交互式教育。学生不是看视频,而是在一个可交互的世界里学物理、学历史。
这五个方向里,我的判断是:第一和第五离"媒体话术"最近、离"可交付产品"最远;第二和第三最容易被中小企业拿来试水,但都会先撞上许可证这堵墙。
八、冷思考:开源世界模型离媒体话术还有多远
该泼冷水了。过去一年,每隔几周就有一个"世界模型"刷屏,话术高度一致:无限时长、实时交互、开放世界、颠覆游戏。但把 LingBot-World 2.0 拆开看,真实成熟度是这样的:
技术报告是真开源的,代码是真能拉的,权重是真能下的是。这一点必须给灵波正面评价——在"开源"两个字越来越像营销词的当下,把 14B 和 1.3B 多款权重、技术报告、推理代码一并放出,是实打实的贡献。
但反过来说,"小时级不漂移""多人共享同一世界""消费级单卡实时"这些最抓眼球的说法,目前没有一个被第三方独立验证。一致性时长我们没有看到长时间连续录屏;多人协作没有公开的压力测试;单卡实时在代码仓里甚至自相矛盾。
更要命的是协议。一个被宣传成"世界模型基础设施"的项目,挂着 NC 协议,意味着它天然无法成为别人商业产品的地基。基础设施应该像水电一样可被商用调用,而 CC BY-NC-SA 4.0 把这条路堵上了。这不是灵波的问题,是它选择的商业策略——但对"想拿它造东西"的开发者,这是必须提前算清的账。
我的结论:LingBot-World 2.0 是开源世界模型里目前最完整、最值得拉下来跑的一个,但请把它当"研究样本"而非"生产底座"。拉下来读代码、做实验、写论文,都极好;指望直接商业化,先谈授权、先备好 2 卡预算。
九、结语与姊妹篇导航
一句话总结:灵波这次把"交互时程"和"内部智能体"两件事往前推了一步,是 2026 年开源世界模型里值得记一笔的进展;但它同时用非商用协议和混乱的硬件口径,给所有想"拿来就用"的人设了两道硬坎。看清信号,也看清门槛,才算真正读懂了这次发布。
如果你想横向比较各家开源世界模型,看这篇横评:开源世界模型横评。想动手本地部署小模型,看:LingBot-World 小模型本地部署 SOP。想系统盘点开源资源,看:上帝视角:开源世界模型资源盘点。