当可灵 4.0、Seedance 2.5 这些云端视频模型忙着拼规格、拼定价的时候,另一条路线悄悄把牌摊上了桌面:Lightricks 在 GitHub 上开放了 LTX-2 的完整权重,一个 22B 参数的模型,画面和声音一起生成。按官方 README 的说法,这是首个基于 DiT 架构的音视频一体基础模型,同步生成音画、多个性能档位、生产级输出、API 与开放权重并存。截至 2026 年 10 月 2 日实核,仓库 Lightricks/LTX-2 拿到 9,569 颗星,最近一次代码推送也停在 10 月 2 日,项目热度没有冷下来的迹象。
这篇文章把它讲清楚:模型里到底装了什么、推理效率做到了什么程度、十二条管线分别管什么;更重要的核真在许可证——GitHub 的 License 栏写着 NOASSERTION,背后是一份自定义社区协议,和 Apache、MIT 那种公认的开源不是一回事,商用前必须读懂。想先看云端阵营的动向,可以对照本站的 可灵 4.0 官宣 10 月上线 与 Seedance 2.5 正式发布。
一个模型全包:66GiB 权重里都有什么
先说定位。主流视频生成模型大多只出画面,配音、音效要靠另一套工具拼接;LTX-2 的卖点是音画一体——一段提示词进来,视频和配套的音频同步产出,口型、音效与画面天然对齐。这在架构层面就省掉了后期对轨的工序,也是它敢自称「基础模型」的底气。
推荐版本是 LTX-2.5,权重按组件拆开发布,你只需要下载自己那条管线用得上的部分。核心是一颗 22B 参数的蒸馏 transformer,以 bf16 的 safetensors 格式发布;另有 dev 完整版,供带引导的两阶段管线使用。文本编码器是 Gemma 4 12B 的 LTX 定制版,注意它和 Google 原版 Gemma 4 不通用,加载时会校验编码器版本与训练时是否一致,随手拿原版权重顶替会直接报错。再往下是视频 VAE 与音频 VAE 各一枚,视频 VAE 还分扩散解码与卷积解码两个版本,前者质量更高、更吃显存,后者更轻、无额外依赖;加上空间与时间上采样器,全套权重约 66GiB。
工程细节上有几处值得提前知道。视频 VAE 的扩散解码器装了 natten 依赖后跑得最快,但这个加速后端只支持 Linux 加 CUDA,Windows 与 macOS 会自动回落到 Triton 或普通实现,同一套安装命令在各平台都能用。权重托管在 Hugging Face 上且属受控模型,遇到 401 或 403 报错,先在模型页同意使用条款,再用带读取权限的令牌登录。仓库还提供一个可选的时长预测头,装上之后可以不指定帧数,由模型根据提示词自行判断片段长度。旧版 LTX-2.3 的权重仍在维护,但它是把 transformer、VAE 和文本投影打成单文件的思路,文本编码器要单独下载,新旧两代的文件互不通用,LoRA 也只认训练时用的那一版模型。
66GiB 意味着什么?意味着下载本身就是第一道门槛,也意味着它不是手机端或轻薄本上能跑的东西。但对目标用户来说,这个体积换来的是完整的自部署能力:权重在你手里,生成不经过任何第三方服务器,这一点我们在后文的选型对比里还会展开。
八步推理与十二条管线
LTX-2 在效率上的关键动作是蒸馏。DistilledPipeline 只用 8 个预设 sigma,拆开是阶段 1 八步加阶段 2 四步,属于最快出片的起步路线。默认输出 1024x1536、24fps;要上 4K,参数是 3840x2176——README 特意注明不是常见的 2160,这一点写脚本时别想当然。
显存吃紧还有后手:FP8 量化,CLI 上是 fp8-cast,Hopper 及以上架构的卡可以换 fp8-scaled-mm;再不够就开 CPU 或磁盘 offload。注意力后端也有讲究:数据中心级的 Blackwell B200 要手动安装 FlashAttention 4,而且官方点名了与 torch 2.9.1 版本核对过的特定修订版,更新的测试版在消费级 Blackwell 上有已知问题;Hopper 显卡装 FlashAttention 3,其余 CUDA 显卡自动使用 PyTorch 自带的 SDPA。还有一条官方技巧叫梯度估计,能把常规管线的四十步去噪压到二三十步而基本不损质量。换句话说,消费级显卡也有得玩,只是要在速度和质量之间做取舍。
管线一共 12 条,覆盖了视频生产的大部分环节。挑重点说:
- DFR(Diffusion Fidelity Rendering)是生产级的文生视频与图生视频路线,用的是同一颗蒸馏 transformer,外加一枚 detailing IC-LoRA,先多生成关键帧再做空间细节增强,代价是更长的耗时和更高显存。
- DubIt 管换词配音:改台词,同时保住说话人的音色身份和口型动作,这对做多语种内容的团队是实打实的刚需。
- Retake 做局部重生成:对已有视频的指定时间段重新生成,不用整段推翻重来。
- HDR IC-LoRA 负责把 SDR 视频转成 HDR,输出 BT.2020/HLG 母版外加 ACEScct 的 EXR 序列,直接对接专业调色流程;原生 EXR 与 HDR 输入输出也是标准能力。
- A2Vid 反过来,拿一段音频作为条件生成对应视频;其余还有 IC-LoRA 视频到视频转换、关键帧插值,以及 TI2Vid 的两阶段、HQ、单阶段三个变体。
训练侧也没留空白:ltx-trainer 包支持 LoRA、全量微调和 IC-LoRA,意味着你可以拿自己的素材把模型调成专有风格,这是云端按次付费模型给不了的自由度。工作流党则可以直接用官方 ComfyUI 插件 ComfyUI-LTXVideo 接进节点流程。提示词写法上,官方指南的建议是 200 词以内、按时间顺序描述动作,把镜头语言写具体——这套方法迁移到其他视频模型同样适用,本站的 AI 视频生成 SOP 里有过通用化的整理。
许可证核真:NOASSERTION 不是随便标的
打开 GitHub 仓库,License 栏显示的是 NOASSERTION,而不是熟悉的 Apache 或 MIT。这不是托管平台的显示故障,而是仓库确实没有采用任何被 OSI 认可的开源协议——LTX-2 用的是 Lightricks 自拟的「LTX Community License」,适用于 2026 年 8 月 11 日起发布的 LTX-2.5 各版本。下载即视为接受条款,以下是几处关键内容,均有协议原文可查。
第一条,收入门槛。年收入达到 1,000 万美元及以上的实体(含子公司、关联公司在内合并计算)对 LTX-2 及其衍生品的任何商用,都必须先向 Lightricks 购买 Commercial Use Agreement,官方留了联系邮箱;违反者被认定重大违约,须在书面催告后三十天内按标准费率补缴使用期间的费用。
第二条,免费范围。个人以非商业目的使用——研究、学习、爱好、个人娱乐,且不与任何商业活动直接或间接关联——免费;商业实体在非生产环境的测试、评估与非商业研发也豁免。换句话说,学生、爱好者和做技术验证的团队可以放心跑,一旦接上营收业务,先看第一条。
第三条,衍生品的定义把蒸馏明确写了进去。任何通过迁移权重、参数、激活值或输出而「学」到 LTX-2 能力的模型,包括用中间表示或合成数据训练的蒸馏模型,都属于衍生品,同样受协议约束。想拿 LTX-2 当老师去蒸自己的商用模型?先买协议。
第四条,分发链条义务。衍生品(微调权重、LoRA 适配器都在内)分发时必须附带完整协议、按同条款授权;把衍生品转给商业实体之前,对方必须先自己取得付费许可,转出方有书面告知义务。另外协议明确训练数据不在授权范围内;附件 A 列了 20 条使用限制,包括商用场景下不得训练竞品模型、不得用于与 Lightricks 产品直接竞争的产品、不得移除水印与溯源等透明度功能、内容须标注机器生成等。输出内容的权利协议方不主张,责任由使用者自负。
还有几处容易被略过的条款值得一提。协议保留了远程限制违规使用的权利,并要求使用者尽合理努力跟进最新版本,跑旧版本的风险自担;一旦因违约被终止授权,不但要立即停用,还要删除或销毁手头的所有副本,并把终止一事通知下游分发对象。争议解决适用纽约州法律,约定由国际商会的仲裁规则处理。
还有一个耐人寻味的细节:协议原文写明,按欧盟 AI 法案第 53(2) 条,Licensor 的意图是让 LTX-2 作为自由开源通用 AI 模型被对待。官方自己也在「开源」与「商业化」之间走钢丝——想对比真正的宽松协议长什么样,看参照系即可:同赛道的 Wan2.2 仓库是 Apache-2.0,前代 LTX-Video 也是 Apache-2.0。LTX-2 从前代的完全宽松转向收入门槛制,这个转向本身就说明 22B 级视频权重的维护成本,厂商不愿再白送。
自部署的诱惑与门槛
把视角拉回选型。当前的旗舰视频模型——可灵 4.0(10 月上线)、Seedance 2.5(已上线)、阿里 Wan3.0(8 月 24 日正式上线,见 Wan3.0 上线专文)——清一色是云端服务:打开网页输入提示词,算力在厂商机房里烧。LTX-2 是这一梯队里唯一可以把权重拉回自己机器的选项。
自部署的诱惑很具体:数据不出内网,对内容合规敏感的团队是刚需;没有按次计费,批量生成时边际成本趋近电费;模型可以微调,LoRA 训出来的风格是你独占的资产。落到实际场景,收益也各有着落:做多语种内容的团队,DubIt 保口型换台词能省掉重拍;做 archive 修复的团队,SDR 转 HDR 的管线直接输出调色可用的 EXR 序列;做短视频批量的团队,本地跑蒸馏管线没有配额焦虑。门槛同样具体:自备够用的 GPU,先吞下 66GiB 下载,生产级质量要跑 DFR、显存要求再上一档;商用要看收入线,1,000 万美元以上的公司绕不开付费协议。
一句话给结论:个人学习、爱好创作、技术验证,LTX-2 当前免费随便跑;年收入线以下的创业团队,它是市面上唯一「权重在手」的音视频一体模型;再往上,买 Commercial Use Agreement 或者干脆继续用云端旗舰。它同时提供官方 API 与网页试玩入口,想先零成本试效果再决定要不要自建,也是一条稳妥路径。四款代表当前格局的模型怎么横向取舍,本站另有一篇 视频模型横评:可自部署对云端 专门展开。
FAQ
Q1: LTX-2 算真正的开源模型吗?
A1:严格说不算。GitHub License 栏显示 NOASSERTION,实际是自定义的 LTX Community License,不是 Apache、MIT 那种 OSI 认证开源。个人非商业用途免费,年收入 1,000 万美元以上的实体商用必须购买 Commercial Use Agreement,且衍生品(含蒸馏模型)同样受协议约束。
Q2: 自己部署需要什么硬件条件?
A2:需要一块像样的 NVIDIA 显卡,全套权重约 66GiB 要先下载。显存不足可以开 FP8 量化(fp8-cast,Hopper 以上用 fp8-scaled-mm)加 CPU 或磁盘 offload;生产级 DFR 管线更吃显存,量力选择。
Q3: 4K 输出的实际分辨率是多少?
A3:3840x2176,README 特别注明不是 3840x2160,写脚本时别按惯性填参数。默认输出是 1024x1536、24fps,时间上采样器可以再提帧率。
Q4: 我可以拿它做商业项目吗?
A4:分情况。年收入低于 1,000 万美元的实体可以商用,但分发衍生品时必须随附完整协议;达到或超过这条线的,任何商用都要先购买 Commercial Use Agreement。另外商用场景下不得训练竞品模型、不得用于与 Lightricks 直接竞争的产品。
Q5: 它和可灵 4.0、Seedance 2.5 该怎么选?
A5:看需求。要省心、要顶级画质、按量付费,选云端旗舰;要数据私有、要批量生成不受计费限制、要用 LoRA 微调专属风格,LTX-2 是唯一的自部署选项。两者不互斥,很多团队是云端出片加本地做私有定制的组合。
互动
你会把 66GiB 拉回自己的显卡吗?评论区聊聊你的选型:云端旗舰,还是自部署的自由。