开源项目
开源项目

LTX-2开源:22B权重66GB,画面声音一个模型全包

LTX-2 开源深拆(2026-10-02 GitHub 实核):Lightricks/LTX-2 9,569 星、Python、推送停在 10 月 2 日;官方定位首个 DiT 架构的音视频一体基础模型,画面与同步音频一次生成。LTX-2.5 组成:22B 蒸馏 transformer(bf16)+ Gemma 4 12B 定制文本编码器(与 Google 原版不通用)+ 视频/音频双 VAE + 空间与时间上采样器,全套约 66GiB;DistilledPipeline 仅 8 个预设 sigma(阶段 1 八步 + 阶段 2 四步)最快出片,FP8 量化与 CPU/磁盘 offload 降显存,4K 为 3840x2176(README 特别注明非 2160);12 条管线含 DFR 生产级、DubIt 保口型换词配音、Retake 局部重生成、SDR 转 HDR(BT.2020/HLG + ACEScct EXR);ltx-trainer 支持 LoRA/全量微调/IC-LoRA,ComfyUI 有官方插件。许可证核真:GitHub License 栏 NOASSERTION,实为自定义 LTX Community License(2026-08-11 起 LTX-2.5 适用),非 OSI 开源——个人非商业免费,年收入 1000 万美元及以上实体任何商用须购买 Commercial Use Agreement,衍生品定义含蒸馏,分发须随附完整协议。自部署唯一解的价值:数据不出内网、批量边际成本趋近电费、LoRA 风格资产独占。

发布于 2026年10月3日10 分钟阅读
<!-- ltx-2-open-source-video-resource | open-source | LTX-2开源:22B权重66GB,画面声音一个模型全包 -->

当可灵 4.0、Seedance 2.5 这些云端视频模型忙着拼规格、拼定价的时候,另一条路线悄悄把牌摊上了桌面:Lightricks 在 GitHub 上开放了 LTX-2 的完整权重,一个 22B 参数的模型,画面和声音一起生成。按官方 README 的说法,这是首个基于 DiT 架构的音视频一体基础模型,同步生成音画、多个性能档位、生产级输出、API 与开放权重并存。截至 2026 年 10 月 2 日实核,仓库 Lightricks/LTX-2 拿到 9,569 颗星,最近一次代码推送也停在 10 月 2 日,项目热度没有冷下来的迹象。

这篇文章把它讲清楚:模型里到底装了什么、推理效率做到了什么程度、十二条管线分别管什么;更重要的核真在许可证——GitHub 的 License 栏写着 NOASSERTION,背后是一份自定义社区协议,和 Apache、MIT 那种公认的开源不是一回事,商用前必须读懂。想先看云端阵营的动向,可以对照本站的 可灵 4.0 官宣 10 月上线 与 Seedance 2.5 正式发布。

一个模型全包:66GiB 权重里都有什么

先说定位。主流视频生成模型大多只出画面,配音、音效要靠另一套工具拼接;LTX-2 的卖点是音画一体——一段提示词进来,视频和配套的音频同步产出,口型、音效与画面天然对齐。这在架构层面就省掉了后期对轨的工序,也是它敢自称「基础模型」的底气。

推荐版本是 LTX-2.5,权重按组件拆开发布,你只需要下载自己那条管线用得上的部分。核心是一颗 22B 参数的蒸馏 transformer,以 bf16 的 safetensors 格式发布;另有 dev 完整版,供带引导的两阶段管线使用。文本编码器是 Gemma 4 12B 的 LTX 定制版,注意它和 Google 原版 Gemma 4 不通用,加载时会校验编码器版本与训练时是否一致,随手拿原版权重顶替会直接报错。再往下是视频 VAE 与音频 VAE 各一枚,视频 VAE 还分扩散解码与卷积解码两个版本,前者质量更高、更吃显存,后者更轻、无额外依赖;加上空间与时间上采样器,全套权重约 66GiB。

工程细节上有几处值得提前知道。视频 VAE 的扩散解码器装了 natten 依赖后跑得最快,但这个加速后端只支持 Linux 加 CUDA,Windows 与 macOS 会自动回落到 Triton 或普通实现,同一套安装命令在各平台都能用。权重托管在 Hugging Face 上且属受控模型,遇到 401 或 403 报错,先在模型页同意使用条款,再用带读取权限的令牌登录。仓库还提供一个可选的时长预测头,装上之后可以不指定帧数,由模型根据提示词自行判断片段长度。旧版 LTX-2.3 的权重仍在维护,但它是把 transformer、VAE 和文本投影打成单文件的思路,文本编码器要单独下载,新旧两代的文件互不通用,LoRA 也只认训练时用的那一版模型。

66GiB 意味着什么?意味着下载本身就是第一道门槛,也意味着它不是手机端或轻薄本上能跑的东西。但对目标用户来说,这个体积换来的是完整的自部署能力:权重在你手里,生成不经过任何第三方服务器,这一点我们在后文的选型对比里还会展开。

八步推理与十二条管线

LTX-2 在效率上的关键动作是蒸馏。DistilledPipeline 只用 8 个预设 sigma,拆开是阶段 1 八步加阶段 2 四步,属于最快出片的起步路线。默认输出 1024x1536、24fps;要上 4K,参数是 3840x2176——README 特意注明不是常见的 2160,这一点写脚本时别想当然。

显存吃紧还有后手:FP8 量化,CLI 上是 fp8-cast,Hopper 及以上架构的卡可以换 fp8-scaled-mm;再不够就开 CPU 或磁盘 offload。注意力后端也有讲究:数据中心级的 Blackwell B200 要手动安装 FlashAttention 4,而且官方点名了与 torch 2.9.1 版本核对过的特定修订版,更新的测试版在消费级 Blackwell 上有已知问题;Hopper 显卡装 FlashAttention 3,其余 CUDA 显卡自动使用 PyTorch 自带的 SDPA。还有一条官方技巧叫梯度估计,能把常规管线的四十步去噪压到二三十步而基本不损质量。换句话说,消费级显卡也有得玩,只是要在速度和质量之间做取舍。

管线一共 12 条,覆盖了视频生产的大部分环节。挑重点说:

  • DFR(Diffusion Fidelity Rendering)是生产级的文生视频与图生视频路线,用的是同一颗蒸馏 transformer,外加一枚 detailing IC-LoRA,先多生成关键帧再做空间细节增强,代价是更长的耗时和更高显存。
  • DubIt 管换词配音:改台词,同时保住说话人的音色身份和口型动作,这对做多语种内容的团队是实打实的刚需。
  • Retake 做局部重生成:对已有视频的指定时间段重新生成,不用整段推翻重来。
  • HDR IC-LoRA 负责把 SDR 视频转成 HDR,输出 BT.2020/HLG 母版外加 ACEScct 的 EXR 序列,直接对接专业调色流程;原生 EXR 与 HDR 输入输出也是标准能力。
  • A2Vid 反过来,拿一段音频作为条件生成对应视频;其余还有 IC-LoRA 视频到视频转换、关键帧插值,以及 TI2Vid 的两阶段、HQ、单阶段三个变体。

训练侧也没留空白:ltx-trainer 包支持 LoRA、全量微调和 IC-LoRA,意味着你可以拿自己的素材把模型调成专有风格,这是云端按次付费模型给不了的自由度。工作流党则可以直接用官方 ComfyUI 插件 ComfyUI-LTXVideo 接进节点流程。提示词写法上,官方指南的建议是 200 词以内、按时间顺序描述动作,把镜头语言写具体——这套方法迁移到其他视频模型同样适用,本站的 AI 视频生成 SOP 里有过通用化的整理。

许可证核真:NOASSERTION 不是随便标的

打开 GitHub 仓库,License 栏显示的是 NOASSERTION,而不是熟悉的 Apache 或 MIT。这不是托管平台的显示故障,而是仓库确实没有采用任何被 OSI 认可的开源协议——LTX-2 用的是 Lightricks 自拟的「LTX Community License」,适用于 2026 年 8 月 11 日起发布的 LTX-2.5 各版本。下载即视为接受条款,以下是几处关键内容,均有协议原文可查。

第一条,收入门槛。年收入达到 1,000 万美元及以上的实体(含子公司、关联公司在内合并计算)对 LTX-2 及其衍生品的任何商用,都必须先向 Lightricks 购买 Commercial Use Agreement,官方留了联系邮箱;违反者被认定重大违约,须在书面催告后三十天内按标准费率补缴使用期间的费用。

第二条,免费范围。个人以非商业目的使用——研究、学习、爱好、个人娱乐,且不与任何商业活动直接或间接关联——免费;商业实体在非生产环境的测试、评估与非商业研发也豁免。换句话说,学生、爱好者和做技术验证的团队可以放心跑,一旦接上营收业务,先看第一条。

第三条,衍生品的定义把蒸馏明确写了进去。任何通过迁移权重、参数、激活值或输出而「学」到 LTX-2 能力的模型,包括用中间表示或合成数据训练的蒸馏模型,都属于衍生品,同样受协议约束。想拿 LTX-2 当老师去蒸自己的商用模型?先买协议。

第四条,分发链条义务。衍生品(微调权重、LoRA 适配器都在内)分发时必须附带完整协议、按同条款授权;把衍生品转给商业实体之前,对方必须先自己取得付费许可,转出方有书面告知义务。另外协议明确训练数据不在授权范围内;附件 A 列了 20 条使用限制,包括商用场景下不得训练竞品模型、不得用于与 Lightricks 产品直接竞争的产品、不得移除水印与溯源等透明度功能、内容须标注机器生成等。输出内容的权利协议方不主张,责任由使用者自负。

还有几处容易被略过的条款值得一提。协议保留了远程限制违规使用的权利,并要求使用者尽合理努力跟进最新版本,跑旧版本的风险自担;一旦因违约被终止授权,不但要立即停用,还要删除或销毁手头的所有副本,并把终止一事通知下游分发对象。争议解决适用纽约州法律,约定由国际商会的仲裁规则处理。

还有一个耐人寻味的细节:协议原文写明,按欧盟 AI 法案第 53(2) 条,Licensor 的意图是让 LTX-2 作为自由开源通用 AI 模型被对待。官方自己也在「开源」与「商业化」之间走钢丝——想对比真正的宽松协议长什么样,看参照系即可:同赛道的 Wan2.2 仓库是 Apache-2.0,前代 LTX-Video 也是 Apache-2.0。LTX-2 从前代的完全宽松转向收入门槛制,这个转向本身就说明 22B 级视频权重的维护成本,厂商不愿再白送。

自部署的诱惑与门槛

把视角拉回选型。当前的旗舰视频模型——可灵 4.0(10 月上线)、Seedance 2.5(已上线)、阿里 Wan3.0(8 月 24 日正式上线,见 Wan3.0 上线专文)——清一色是云端服务:打开网页输入提示词,算力在厂商机房里烧。LTX-2 是这一梯队里唯一可以把权重拉回自己机器的选项。

自部署的诱惑很具体:数据不出内网,对内容合规敏感的团队是刚需;没有按次计费,批量生成时边际成本趋近电费;模型可以微调,LoRA 训出来的风格是你独占的资产。落到实际场景,收益也各有着落:做多语种内容的团队,DubIt 保口型换台词能省掉重拍;做 archive 修复的团队,SDR 转 HDR 的管线直接输出调色可用的 EXR 序列;做短视频批量的团队,本地跑蒸馏管线没有配额焦虑。门槛同样具体:自备够用的 GPU,先吞下 66GiB 下载,生产级质量要跑 DFR、显存要求再上一档;商用要看收入线,1,000 万美元以上的公司绕不开付费协议。

一句话给结论:个人学习、爱好创作、技术验证,LTX-2 当前免费随便跑;年收入线以下的创业团队,它是市面上唯一「权重在手」的音视频一体模型;再往上,买 Commercial Use Agreement 或者干脆继续用云端旗舰。它同时提供官方 API 与网页试玩入口,想先零成本试效果再决定要不要自建,也是一条稳妥路径。四款代表当前格局的模型怎么横向取舍,本站另有一篇 视频模型横评:可自部署对云端 专门展开。

FAQ

Q1: LTX-2 算真正的开源模型吗?

A1:严格说不算。GitHub License 栏显示 NOASSERTION,实际是自定义的 LTX Community License,不是 Apache、MIT 那种 OSI 认证开源。个人非商业用途免费,年收入 1,000 万美元以上的实体商用必须购买 Commercial Use Agreement,且衍生品(含蒸馏模型)同样受协议约束。

Q2: 自己部署需要什么硬件条件?

A2:需要一块像样的 NVIDIA 显卡,全套权重约 66GiB 要先下载。显存不足可以开 FP8 量化(fp8-cast,Hopper 以上用 fp8-scaled-mm)加 CPU 或磁盘 offload;生产级 DFR 管线更吃显存,量力选择。

Q3: 4K 输出的实际分辨率是多少?

A3:3840x2176,README 特别注明不是 3840x2160,写脚本时别按惯性填参数。默认输出是 1024x1536、24fps,时间上采样器可以再提帧率。

Q4: 我可以拿它做商业项目吗?

A4:分情况。年收入低于 1,000 万美元的实体可以商用,但分发衍生品时必须随附完整协议;达到或超过这条线的,任何商用都要先购买 Commercial Use Agreement。另外商用场景下不得训练竞品模型、不得用于与 Lightricks 直接竞争的产品。

Q5: 它和可灵 4.0、Seedance 2.5 该怎么选?

A5:看需求。要省心、要顶级画质、按量付费,选云端旗舰;要数据私有、要批量生成不受计费限制、要用 LoRA 微调专属风格,LTX-2 是唯一的自部署选项。两者不互斥,很多团队是云端出片加本地做私有定制的组合。

互动

你会把 66GiB 拉回自己的显卡吗?评论区聊聊你的选型:云端旗舰,还是自部署的自由。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-03

常见问题

LTX-2 算真正的开源模型吗?
A1:严格说不算。GitHub License 栏显示 NOASSERTION,实际是自定义的 LTX Community License,不是 Apache、MIT 那种 OSI 认证开源。个人非商业用途免费,年收入 1,000 万美元以上的实体商用必须购买 Commercial Use Agreement,且衍生品(含蒸馏模型)同样受协议约束。
自己部署需要什么硬件条件?
A2:需要一块像样的 NVIDIA 显卡,全套权重约 66GiB 要先下载。显存不足可以开 FP8 量化(fp8-cast,Hopper 以上用 fp8-scaled-mm)加 CPU 或磁盘 offload;生产级 DFR 管线更吃显存,量力选择。
4K 输出的实际分辨率是多少?
A3:3840x2176,README 特别注明不是 3840x2160,写脚本时别按惯性填参数。默认输出是 1024x1536、24fps,时间上采样器可以再提帧率。
我可以拿它做商业项目吗?
A4:分情况。年收入低于 1,000 万美元的实体可以商用,但分发衍生品时必须随附完整协议;达到或超过这条线的,任何商用都要先购买 Commercial Use Agreement。另外商用场景下不得训练竞品模型、不得用于与 Lightricks 直接竞争的产品。
它和可灵 4.0、Seedance 2.5 该怎么选?
A5:看需求。要省心、要顶级画质、按量付费,选云端旗舰;要数据私有、要批量生成不受计费限制、要用 LoRA 微调专属风格,LTX-2 是唯一的自部署选项。两者不互斥,很多团队是云端出片加本地做私有定制的组合。

相关文章

开源项目

LobeHub:8万星的开源 AI Agent 调度台,凭什么

LobeHub(原 LobeChat)是 GitHub 上 8 万星的开源 AI Agent 调度框架,已从"聊天框平替"进化为"首席 Agent 调度员"。文章拆解其定位演变、与 OpenAI WebUI/Claude 官网的差异(自部署/多模型/数据主权)、自部署路径与门槛、10,000+ MCP 插件生态,并提醒其协议为 LobeHub Community License(非 MIT),衍生商用需购买商业许可。

2026年7月31日5 分钟阅读
开源项目

开源 Dots 三天 2400 星:浏览器归它管

feder-cr/dots 深拆(2026-10-02 GitHub API 快照):2,416★、421 forks、MIT、Python,2026-09-29 创建——OpenAI 闭源 Dots 发布次日就冲出的开源同位素。核心论点「模型一参可换,浏览器才是网站看到的东西」:真 Firefox 引擎打 C++ 补丁、指纹在引擎内部决定而非页面 JS 涂层(页面无法用 JS 检出);一个 seed 一个身份(屏幕/字体/GPU/时区/语言互相一致、可复现);页面无可检物(无 WebDriver 标志、无 DevTools 协议、无自动化全局变量);指针先移动再点击、逐键受信事件;--profile-dir 跨次保留登录与 Cookie;--proxy 出口即时区语言跟身份走。模型走 OpenRouter 任意模型、--model 一键换;伴侣仓 invisible_playwright_mcp 把同一浏览器以 MCP server 形式接给 Claude Code/Codex/Gemini CLI。README 明确「与 OpenAI 无关、MIT 许可」。附合规边界:遵守目标网站服务条款与当地法规,不用于欺诈/抢票/批量注册。

2026年10月2日9 分钟阅读
开源项目

438 星的终端 agent:阶跃 Step-Code 开源深拆

stepfun-ai/Step-Code 仓库实核(2026-09-27 GitHub API 快照:438 星、41 fork、TypeScript、license 字段 MIT、created 2026-06-01、pushed 2026-09-26、44 open issues)。终端编程智能体,覆盖读代码、改代码、跑测试的完整任务环;与 Step provider 配套绑定(登录自动发现 Step 模型,与 MiniMax Code 的 BYOK 多提供商路线相反);开箱支持 MCP servers、Agent Skills、多智能体编排;/goal 命令委派长时任务;StepPage 一键把本地页面发布为可访问静态站。官方自报 Terminal Bench 2.1 通过率 80.9% 并列第一、自建 Multi-Frame 基准 73.3% 居首、平均 5.09M tokens 最低——全部标厂商自报口径,未独立复测。

2026年9月27日9 分钟阅读