开源项目
开源项目

开源视频模型LTX-2.5:连视频解码器都拿去训练

Lightricks 2026-08-11 发布 LTX-2.5,替换 LTX-2.3。仓库地址(双形态):huggingface.co/Lightricks/LTX-2.5(HF API 实核 2026-10-09:gated=auto 即登录同意条款自动放行、license 标签 other=自定义 LTX-2.x Community License、168.9 万下载;Diffusers 版 Lightricks/LTX-2.5-Diffusers 同 gated=auto),代码 github.com/Lightricks/LTX-2。架构:22B 视频音频一体骨干 + 自定义 Gemma 4 12B 文本编码器 + 扩散视频解码器——VAE 解码器本身是扩散模型,激进攻画 latent 压缩与高画质不再互斥,是本代最大架构亮点;另有 DFR 自适应算力分配。能力:4K(3840×2176)HDR、最高 50fps、24kHz 立体声同 pass 同步生成、原生多镜头(跨切保持角色/环境/光照/声音)、RAW/EXR 工作流。时长两说并存标注:pinggy 称单次最长 20 秒(Extend 管线可扩),innfactory 称单次 121 帧@24fps 约 5 秒——不写死。显存:全量 80GB+,distilled/FP8 变体单卡 12GB 起,全组件约 66GiB 下载。许可:年收入低于 1000 万美元免费商用,达到须购 Commercial Use Agreement。VFX 定位:HDR 化/修复/上色/日夜转换等 LoRA 全家桶、AlphaGen 抠像、Tiled Fusion 4K/8K 上采样。生态:ComfyUI(int8_convrot 构建)、Diffusers 0.40.0、ltx-trainer 微调。

发布于 2026年10月10日10 分钟阅读
<!-- ltx-2-5-open-source-video-resource | open-source | 开源视频模型LTX-2.5:连视频解码器都拿去训练 -->

聊开源视频模型,总绕不开一个老矛盾:想把画质做上去,就得把 latent 压缩放轻、显存往高堆;想把显存打下来,压缩一狠,解码端还原不出细节,画面就糊。这个矛盾在视频生成上比图像尖锐得多——视频的 latent 要同时压时间和空间两个维度,一分钟素材背后的数据量摆在那里,压缩策略几乎直接决定了模型的上限和下限。Lightricks 在 2026 年 8 月 11 日发布的 LTX-2.5(定位是替换 LTX-2.3)给出了一个相当激进的答案——把视频解码器本身也做成扩散模型,让「还原细节」这一步从查表式前向变成生成式重建。权重托管在 Lightricks/LTX-2.5,代码在 Lightricks/LTX-2。先把两个地址明文放在这里,方便直接搜:权重地址:huggingface.co/Lightricks/LTX-2.5;代码地址:github.com/Lightricks/LTX-2。

本站此前写过 LTX-2 开源篇,聚焦当时 22B 权重开放与社区许可的逐条核真;这一篇不重复那些内容,专注讲 LTX-2.5 的架构演进——尤其是那颗扩散视频解码器——以及 distilled 与 FP8 变体把单卡门槛打到 12GB 之后,普通玩家和中小团队实际能拿到什么。一句话概括本篇立场:LTX-2.5 真正值得聊的不是「又发了一版」,而是它在架构层面动了解码器这块几乎没人动过的骨头。

把解码器也拿去训练,值在哪

先过一遍整体架构。LTX-2.5 是一颗 22B 参数的视听一体模型,文本侧挂的是 Gemma 4 12B 的 LTX 定制版编码器,视频侧最值得注意的是解码端:VAE 解码器本身是一个扩散模型。再加上 DFR 自适应算力分配,几件套拼出了这套架构的完整面貌。

拆开说。22B 视听一体,意思是画面与声音出自同一颗模型,而不是「视频模型加音频模型」的拼盘——音画之间的对应关系在训练阶段就被建模进去,这也是后文「同 pass 生成」的前提。Gemma 4 12B 定制编码器负责把提示词变成模型听得懂的语义表示,Lightricks 选了为自家任务特调的版本,而不是直接搬原版。

再看那颗扩散视频解码器。传统管线里,VAE 解码器是一次前向网络:训练时学会「从压缩 latent 还原像素」,推理时一步算完。它的重建上限,被 latent 压缩率锁死——压缩越激进,丢掉的信息越多,解码器再努力也补不回来。所以开源视频模型长期两头受气:压得轻,显存和算力爆表;压得狠,画质塌方。

LTX-2.5 的思路是把矛盾拆掉:既然查表式还原有上限,那就让解码器别查表,改做生成式重建。解码这一步本身跑扩散过程,模型可以根据上下文把被压缩「挤掉」的细节重新渲染出来。压缩端于是可以放心激进——省下来的显存和算力,正好交给解码端的扩散计算。激进压缩与高画质从此不再互斥,这是整套架构里最值得记住的一笔,标题里的「连视频解码器都拿去训练」说的就是它。

代价当然也有:解码端跑扩散,意味着解码不再是那个便宜的一次前向步骤,出片的总耗时里解码的权重会上升。这本质上是一次交换——把一部分算力压力从生成端挪到解码端,换取压缩端更大的自由度。值不值,取决于你的显存和时长预算,但至少这是一道有得选的题了。

DFR 自适应算力分配则是另一面的平衡术:不同片段、不同场景对算力的需求天然不均,按需分配而不是一律拉满,把预算花在刀刃上。

4K HDR、原生多镜头、音画同 pass

规格层面,LTX-2.5 给出的是:4K(3840×2176)HDR 输出,最高 50fps,24kHz 立体声音频与画面在同一个 pass 里同步生成。注意「同 pass」的分量:不是先出视频再配音轨的对齐拼接,而是生成过程中口型、音效与画面天然同步,这继承自 LTX-2 音画一体的路线,也是它区别于大多数纯画面开源模型的地方。对做口播、短剧、产品演示的团队来说,音画同步省掉的不只是后期对轨的工时,还有拼接误差带来的那种说不出的「违和感」。

多镜头能力是原生设计:跨切镜头时保持角色、环境、光照与声音的连贯。做过分镜内容的人知道,跨镜一致性正是当前视频模型最普遍的短板——单镜头惊艳,一切镜头就换脸换景,声音也从房间A跳到大厅里。原生多镜头意味着可以直接按叙事节奏出片,而不是把模型输出当素材再剪。

工程侧还有两处贴心:自动时长预测,不指定帧数时由模型根据内容自行判断片段长度,提示词写到哪、模型判断这段动作该多久,就生成多久;RAW/EXR 工作流,直接对接专业调色与后期管线——EXR 是影视后期的通用 interchange 格式,意味着 LTX-2.5 的输出可以不经过转码损耗地进入调色台,这一点配合后文的 VFX 定位看更清楚。

时长这里必须如实标注:两套口径并存。pinggy 称单次最长 20 秒,可用 Extend 管线扩展;innfactory 的整理则称单次 121 帧、按 24fps 算约 5 秒。前者偏官方宣传口径,后者偏第三方整理,本文不写死,以你实际跑出来的为准。但无论按哪套口径,它都属于「短片节奏」的模型,长内容要靠分段加拼接的思路来规划。

显存账:从 80GB 到 12GB 的下探

跑全量模型,账面要求是 80GB 以上显存,这是数据中心级的门槛,多数个人玩家和中小工作室可以先把全量版从备选里划掉。但 LTX-2.5 同时提供 distilled 与 FP8 变体,单卡 12GB 起步,消费级显卡被重新拉回了牌桌。

解释一下这两个变体为什么能砍显存。distilled 是蒸馏路线:用原模型当老师,把多步生成的结果教给一个更小的学生模型,学生用少得多的步数逼近老师的输出,算力开销随之大幅下降;FP8 则是量化路线,把权重从更高精度压到 FP8,显存占用直接减半级别。两条路线不互斥,实际部署里常常是蒸馏加量化一起上——ComfyUI 侧的 int8_convrot 构建就是这类思路的产物。

当然别忽略下载体积:全组件约 66GiB。显存门槛下探不等于下载门槛消失,硬盘和带宽依然是第一道筛子,拉满全组件之前先看看磁盘余量。具体的文件摆放、目录坑点和分步操作,本站另有一篇 ComfyUI 视频生成 SOP 专门拆解,此处不展开。

12GB 起步的意义不止于「能跑」。对独立创作者,它意味着 LoRA 微调、风格定制这些原本属于持卡大户的能力进入了消费级预算;对中小团队,批量生成的边际成本从按次付费变成了电费,量大了之后这条账算得过来。至于是选 distilled 快出片还是全量拼质量,那是另一道选择题,本站的 开源视频模型本地部署横评 把四强模型按许可、显存、音频、时长几个轴摆在一起对比过,可以对照着看。

许可证:Community License,不是 Apache 2.0

架构讲完,照例核真许可——这是本站开源篇的保留节目。LTX-2.5 采用 LTX-2.x Community License,许可文本日期 2026-08-11,Lightricks 自己明确说过它不是 Apache 2.0。核心条款一句话:年收入低于 1000 万美元的实体免费商用;达到这条线的,商用须购买 Commercial Use Agreement。这条收入线的含义是「小团队免费、大企业付费」的双轨制:绝大多数独立开发者和创业团队落在免费侧,而天花板之上的公司用付费协议反哺模型维护成本。

下载侧也有讲究:模型在 Hugging Face 上是 gated=auto 模式——需要登录并同意使用条款,同意后自动放行,连模型卡页面都要登录才能看全。这个设计和「点开就下」的 Apache 项目体验差别很大,第一次下载前把账号和条款流程预留出来。本站于 2026-10-09 通过 HF API 实核:模型页 license 标签显示为 other,即自定义许可;下载量约 168.9 万,热度在开源视频模型里相当靠前。Diffusers 版仓库同样 gated=auto。

协议文本这里不逐条展开了——此前那篇 LTX-2 开源篇已经把同族许可的收入门槛、免费范围、衍生品定义(蒸馏也算)、分发义务逐条核过,LTX-2.5 延续的是同一套框架,细节可以直接参照 LTX-2 开源篇。要提醒的只有一条:合规这件事,开源视频模型之间差异极大,有 Apache 2.0 的,也有按地区排除、按收入设线的,选型前务必逐个看,别拿上一家的结论套下一家。

不止生成:VFX 工作流的全家桶

如果说很多开源视频模型的定位是「一句话出片」,LTX-2.5 的定位更偏生产管线——按 pixelsham 的第三方整理,它在 Hugging Face 上挂着一整套 LoRA:SDR 转 HDR、Restore、Refine、Deblur、Colorization、Day-To-Night,覆盖修复、精修、去模糊、上色、昼夜转换这些后期刚需。这套 LoRA 全家桶均为 HF 实存,不是纸面生态——随便点开一个都是可以独立加载的权重。

再往工具链深处走,还有 Layout to Render 布局转渲染、AlphaGen 的 alpha 抠像、Union Control 的深度/边缘/姿态控制、In/Outpaint 局部补绘,以及 Tiled Fusion 的 4K/8K 上采样。挨个说下用途:Layout to Render 让你先摆布局再生成画面,构图权回到创作者手里;AlphaGen 直接产出带 alpha 通道的素材,抠像合成省一道工序;Union Control 把深度、边缘、姿态三类控制统一进一套接口,动作戏和运镜的还原度靠它兜底;In/Outpaint 处理画幅扩张和局部修补;Tiled Fusion 则用分块思路把上采样推到 4K/8K,显存友好。

这套组合拳勾勒出的用户画像很清晰:不是只想看个新鲜的尝鲜党,而是把模型嵌进后期流程的 VFX 与内容团队。RAW/EXR 工作流、HDR 输出、alpha 抠像、控制网——每一项都对着专业管线去的。

生态配套也在跟上:ComfyUI 之外,有 ltx-pipelines 提供 CLI 与 Python 两条调用路径,脚本党和应用开发者各取所需;Diffusers 0.40.0 完整支持,接入现有 Python 生成管线几乎零改造;ltx-trainer 支持 LoRA 微调,自家的素材能训出自家的风格;甚至还有面向机器人方向的 checkpoint,供 physical AI 预训练使用——视频生成模型被拿去做机器人世界的先验,这个用法这两年越来越常见。一个开源视频模型同时被内容团队和机器人研究盯上,这个组合不多见。

回到选型:云端旗舰拼质量和服务,开源阵营拼门槛和控制权。LTX-2.5 在开源这边的位置是「音画一体加生产管线」,配上 12GB 的下探门槛,它大概是当前想把视频生成真正搬回自己机器上的团队,最值得认真评估的候选之一。如果更看重完全宽松的许可,也别忘了对比 Apache 2.0 的选手——本站 开源对云端横评 里有更完整的坐标系。

常见问题

Q1: LTX-2.5 算真正的开源模型吗?

A1:按 OSI 标准不算。它采用自定义的 LTX-2.x Community License,Hugging Face 上 license 标签为 other,Lightricks 自己也明说不是 Apache 2.0。年收入低于 1000 万美元的实体可免费商用,达到该线须购买 Commercial Use Agreement。个人学习、研究和非商业创作落在免费侧,商用前建议通读一遍许可文本。

Q2: 12GB 显存能跑什么版本?

A2:distilled 或 FP8 变体单卡 12GB 起步;全量模型需要 80GB 以上显存。全组件下载约 66GiB,ComfyUI 侧用 int8_convrot 构建。建议先跑 distilled 路线验证效果,确认工作流通了再考虑要不要往全量升级。

Q3: 单次生成最长能到多少秒?

A3:两套口径并存:官方宣传口径(pinggy 引)称单次最长 20 秒、Extend 管线可扩展;第三方整理(innfactory)称单次 121 帧、按 24fps 约 5 秒。本文不写死,以实际跑通为准。规划长内容时,按「分段生成加后期拼接」的思路做预案更稳妥。

Q4: 它和之前开源的 LTX-2 是什么关系?

A4:LTX-2.5 于 2026 年 8 月 11 日发布,定位替换 LTX-2.3,核心演进是把 VAE 解码器本身做成扩散模型,加上 DFR 自适应算力分配;许可延续同一套 Community License 框架。发布与许可的逐条核真见本站 LTX-2 开源篇,两篇配合读正好覆盖「发布、架构、许可」三块。

Q5: 下载权重前要做什么?

A5:模型是 gated=auto 模式,需要登录 Hugging Face 并同意使用条款,同意后自动放行;Diffusers 版仓库同样如此。建议同时确认自家年收入是否触及 1000 万美元门槛,并预留好磁盘空间——全组件约 66GiB,别下到一半才发现盘满。

互动

你的显卡在 12GB 这条线上吗?评论区聊聊:你会为「连解码器都是扩散模型」的架构买单,还是继续留在云端?

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-10

常见问题

LTX-2.5 算真正的开源模型吗?
A1:按 OSI 标准不算。它采用自定义的 LTX-2.x Community License,Hugging Face 上 license 标签为 other,Lightricks 自己也明说不是 Apache 2.0。年收入低于 1000 万美元的实体可免费商用,达到该线须购买 Commercial Use Agreement。个人学习、研究和非商业创作落在免费侧,商用前建议通读一遍许可文本。
12GB 显存能跑什么版本?
A2:distilled 或 FP8 变体单卡 12GB 起步;全量模型需要 80GB 以上显存。全组件下载约 66GiB,ComfyUI 侧用 int8_convrot 构建。建议先跑 distilled 路线验证效果,确认工作流通了再考虑要不要往全量升级。
单次生成最长能到多少秒?
A3:两套口径并存:官方宣传口径(pinggy 引)称单次最长 20 秒、Extend 管线可扩展;第三方整理(innfactory)称单次 121 帧、按 24fps 约 5 秒。本文不写死,以实际跑通为准。规划长内容时,按「分段生成加后期拼接」的思路做预案更稳妥。
它和之前开源的 LTX-2 是什么关系?
A4:LTX-2.5 于 2026 年 8 月 11 日发布,定位替换 LTX-2.3,核心演进是把 VAE 解码器本身做成扩散模型,加上 DFR 自适应算力分配;许可延续同一套 Community License 框架。发布与许可的逐条核真见本站 LTX-2 开源篇,两篇配合读正好覆盖「发布、架构、许可」三块。
下载权重前要做什么?
A5:模型是 gated=auto 模式,需要登录 Hugging Face 并同意使用条款,同意后自动放行;Diffusers 版仓库同样如此。建议同时确认自家年收入是否触及 1000 万美元门槛,并预留好磁盘空间——全组件约 66GiB,别下到一半才发现盘满。

相关文章

开源项目

ai-manju:AI 漫剧短剧本地生产流水线,ComfyUI+MiniMax-H3 从中文草稿到带音轨成片

catiseyeqaq/ai-manju-shengcheng-xitong:写实 AI 电影/短剧本地生产流水线。ComfyUI 0.31.0 编排 + MiniMax-H3 音视频联合生成(BF16 权重约 129G,8 卡 PPU-ZW810E)+ Qwen3.6-35B-A3B 中文润色。33 套模板工作流,T2V/I2V/R2V,majicFlus+PuLID 跨镜脸锁+H3 首尾帧接戏+48k 音画对齐。漫剧全链解析+硬件门槛+5 FAQ。早期个人项目(4 星),成片在 Releases 验收。

2026年8月15日8 分钟阅读
开源项目

ComfyUI:专业玩家为何不用网页生图(星12.3万)

ComfyUI 是 GitHub 星数最高的开源 AI 图像生成项目(12.3万星,GPL-3.0),把扩散模型生图拆成可视化节点图。专业玩家选它四理由:控制(ControlNet/LoRA/IPAdapter 可自由连线组装)、复现(workflow 即 JSON 可一模一样重跑)、免费本地(数据不出本机)、自定义节点生态。门槛陡、吃显卡、GPL-3.0 copyleft,适合要做精细控制和可复现后端的画师与开发者。

2026年7月30日10 分钟阅读
实战 SOP

ComfyUI视频生成SOP:12GB显卡跑通LTX-2.5

ComfyUI 本地视频生成 SOP,以 LTX-2.5 为实例跑通 12GB 显卡。模型文件与目录(int8_convrot 构建,非 BF16):transformer 进 models/diffusion_models/、gemma4-12b-with-proj 进 models/text_encoders/、视频与音频两个 VAE bf16 进 models/vae/、2x latent 上采样器进 models/latent_upscale_models/。坑点先列:音频 VAE 是独立文件,跳过它=无声视频;提示词增强器约 5GB 额外模型且每代多 1-2 分钟,默认关;HF gated=auto 需登录同意条款才能下载(连模型卡都要登录)。硬件底线:distilled/int8 12GB 显存起步,CUDA 12.7+、PyTorch 约 2.7、Python 3.12+(innfactory 整理口径);8GB 卡建议改走 Wan 2.2 TI2V-5B+offload。工作流三型:T2V/I2V 两阶段(生成+2x latent 上采样精修)、单阶段(快、预览用)、A2V(音频驱动)。显存策略:量化/distilled 优先、ComfyUI 原生 offload、短低分辨率生成再上采样。仓库地址:github.com/Lightricks/ComfyUI-LTXVideo、huggingface.co/Lightricks/LTX-2.5。

2026年10月10日9 分钟阅读