实战 SOP
实战 SOP

ComfyUI视频生成SOP:12GB显卡跑通LTX-2.5

ComfyUI 本地视频生成 SOP,以 LTX-2.5 为实例跑通 12GB 显卡。模型文件与目录(int8_convrot 构建,非 BF16):transformer 进 models/diffusion_models/、gemma4-12b-with-proj 进 models/text_encoders/、视频与音频两个 VAE bf16 进 models/vae/、2x latent 上采样器进 models/latent_upscale_models/。坑点先列:音频 VAE 是独立文件,跳过它=无声视频;提示词增强器约 5GB 额外模型且每代多 1-2 分钟,默认关;HF gated=auto 需登录同意条款才能下载(连模型卡都要登录)。硬件底线:distilled/int8 12GB 显存起步,CUDA 12.7+、PyTorch 约 2.7、Python 3.12+(innfactory 整理口径);8GB 卡建议改走 Wan 2.2 TI2V-5B+offload。工作流三型:T2V/I2V 两阶段(生成+2x latent 上采样精修)、单阶段(快、预览用)、A2V(音频驱动)。显存策略:量化/distilled 优先、ComfyUI 原生 offload、短低分辨率生成再上采样。仓库地址:github.com/Lightricks/ComfyUI-LTXVideo、huggingface.co/Lightricks/LTX-2.5。

发布于 2026年10月10日9 分钟阅读
<!-- comfyui-video-workflow-sop | sop | ComfyUI视频生成SOP:12GB显卡跑通LTX-2.5 -->

2026 年 8 月 11 日,Lightricks 发布 LTX-2.5,替换此前的 LTX-2.3。这个 22B 参数的视频音频一体模型,架构上限是 4K HDR、最高 50fps 与 24kHz 立体声同步生成,听上去像数据中心专属。但 ComfyUI 生态为它准备了 int8_convrot 构建,把显存门槛压到 12GB 起,一张普通的消费级显卡就能参与。

本文不是资源盘点,也不是图像风格教程,而是一份可以直接照做的 ComfyUI 视频生成实操记录:从对表硬件、下载模型文件,到搭工作流、绕开三个最贵的坑。模型本身的架构演进与许可细节,见本站开源篇LTX-2.5 开源资源详解,这里只聚焦「在 ComfyUI 里跑通」这一件事。

动手前先说清预期:12GB 档位跑出来的不是 4K 直出大片,而是低分辨率短片段加上采样精修的产物,这在 LTX-2.5 的官方工作流设计里本来就是标准路线,不是权宜之计。想明白这一点,后面的每一步都会顺很多。

通读全文你会发现,这篇 SOP 的主线只有一句话:把 22B 模型塞进消费级显卡,靠的不是某个神器级开关,而是量化变体、两阶段结构、offload 与上采样四件事的组合拳。每一步都是在给显存做减法,每一步也都有明确的操作对象,照着做即可。

第零步:对表硬件,先确认你能跑哪一档

ComfyUI 本地视频生成的第一课,是别高估自己的显卡。以 LTX-2.5 为例,全量 BF16 权重需要 80GB 以上显存,那是数据中心的事;个人玩家走的是 distilled 或 int8 量化变体,单卡 12GB 显存起步,distilled 的 FP8 变体同样压在 12GB 这一档。ComfyUI 里用的 int8_convrot 构建就属于这类量化产物,而不是 BF16 原版。

软件环境方面,innfactory 整理的口径是 CUDA 12.7 及以上、PyTorch 约 2.7、Python 3.12 及以上。这三个版本号建议动手前逐项核对,老环境的 CUDA 与 PyTorch 组合经常在装视频模型时出兼容问题。稳妥做法是新建一个干净的虚拟环境专供 ComfyUI,避免与旧项目的依赖打架;节点与整合包资源可以参考本站此前的ComfyUI 资源盘点,本文不再重复罗列。

还有一件事比显存更容易被忽略:磁盘空间。LTX-2.5 全组件下载约 66GiB,即便只下 ComfyUI 所需的量化文件,加上音频 VAE、上采样器这些周边,也要预留出足够的空盘,别下到一半才发现空间见底。

另外提醒一句心态问题:第一次搭视频工作流,从装节点到出第一条片,折腾一整个晚上是常态。视频生成与图像生成的调试成本不在一个量级,一次生成的等待更久、变量更多,越是急着想看成片,越容易在参数上乱调。把第零步的环境核对当成正式步骤来做,后面能少走很多回头路。

如果你的显卡只有 8GB,不必硬凑 LTX-2.5:Wan 2.2 的 TI2V-5B 加上 offload 是更现实的起点,短片为主、480p 到 720p 分辨率,足够把工作流完整跑熟。各家模型的许可与显存门槛差异不小,选型对比详见本站横评篇,这里先按下不表。

一句话总结这一步:12GB 走 LTX-2.5 的 distilled/int8 构建,8GB 选 Wan 2.2 TI2V-5B,不要在硬门槛上赌运气。

第一步:下齐四类模型文件,一个都不能少

LTX-2.5 的权重托管在huggingface.co/Lightricks/LTX-2.5(明文地址:huggingface.co/Lightricks/LTX-2.5)。注意它是 gated=auto 模式:不登录、不同意许可条款,连模型卡页面都看不了,更别提下载。所以流程是先注册登录,进模型页点同意条款,等页面放行后再逐个下载文件。许可为 LTX-2.x Community License,年收入低于 1000 万美元(含)免费商用,达到门槛则须购买商业协议;同族许可的细节,本站 41 批那篇LTX-2 发布报道已核过一轮,可对照阅读。

顺带分清两个仓库页:Hugging Face 上还有一个 Lightricks/LTX-2.5-Diffusers 版本,同样 gated=auto,那是给 Diffusers 库用的;ComfyUI 路线认准上面那个主仓库的 comfy 构建文件即可,别下混。

ComfyUI 要用的是 int8_convrot 构建,四类文件与对应目录如下,建议逐个核对文件名再下载:

文件目录
ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensorsmodels/diffusion_models/
gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrotmodels/text_encoders/
ltx-2.5-video-vae-bf16models/vae/
ltx-2.5-audio-vae-bf16models/vae/
ltx-2.5-latent-spatial-upscaler-x2-bf16models/latent_upscale_models/

几个容易忽略的点:文本编码器是自定义 Gemma 4 12B,不是常见开源视频模型默认搭配的通用编码器,放错目录工作流会直接报错;视频 VAE 与音频 VAE 是两个独立文件,后文会讲到漏下音频 VAE 的代价;latent 空间上采样器是两阶段工作流精修环节的核心,不少教程把它当成可选项,实际上它决定你成片的分辨率上限。

工作流节点与示例模板来自官方自定义节点仓库ComfyUI-LTXVideo(明文地址:github.com/Lightricks/ComfyUI-LTXVideo),克隆或下载后按 ComfyUI 自定义节点的常规方式装好。装完节点、放好四类文件、刷新页面能看到 LTX 的模板工作流,第一步才算闭环。

第二步:三种工作流,按用途选型

官方模板把工作流分成三型,先想清楚用途再选,能省一半调试时间。

第一型是 T2V/I2V 两阶段工作流,也是成片质量的主路线。T2V 从纯文字提示词生成,I2V 以一张图作为首帧起点,二者共享同一套两阶段结构:第一阶段完成主体生成,输出低分辨率的 latent;第二阶段加载 ltx-2.5-latent-spatial-upscaler-x2-bf16,把 latent 做 2 倍空间上采样后精修。两阶段的设计本质,是把「画内容」与「修细节」拆开,各自把显存压力控制在可承受的范围内。

第二型是单阶段工作流,一次生成直接出片。速度快、显存占用低,代价是没有上采样精修环节,画面细节上限明显更低,适合构图预览与参数试错。实战建议:先用单阶段把提示词和镜头调顺,锁定结果后再切两阶段出成品,这比上来就在两阶段里盲调省时得多。

两类入口的选择也有讲究。T2V 适合从零开始构思镜头,提示词里把主体、动作、镜头运动分层写清楚;I2V 则适合已经有参考图的场合,比如把角色定妆图、产品图动起来,生成结果与首帧图的贴合度是主要观察点。无论哪类入口,先在单阶段里确认构图没有跑偏,再进入两阶段精修,顺序不要反。

第三型是 A2V 音频驱动工作流,从一段音频生成对应视频。LTX-2.5 的音频能力是 24kHz 立体声同 pass 同步生成,A2V 则反过来以音轨为驱动,适合对口型、音乐可视化一类的内容。

另外提醒一个 LTX-2.5 的特性:原生多镜头,跨镜头切换时保持角色、环境、光照与声音的一致性,这在写提示词时可以直接利用。至于时长,自动时长预测会按内容估长,但单次生成的最长时长存在口径分歧:官方宣传称最长约 20 秒(可用 Extend 管线扩展),第三方整理则称约 121 帧、24fps 下约 5 秒。两说并存,建议以你本地实测为准,不要拿任何一方的数字当承诺。

三个坑,每一个都以显存或时间为代价

坑一:音频 VAE 是独立文件,跳过它就是无声视频。这是本工作流最经典的翻车点。很多人按清单下到视频 VAE 就以为齐活了,渲染半天得到一段哑片,因为 ltx-2.5-audio-vae-bf16 是单独的文件,不在视频 VAE 的依赖链里,节点图中它是独立的解码分支。排查无声问题时,先看 models/vae/ 目录里有没有它,再检查节点连线。LTX-2.5 的卖点之一就是音画同 pass 同步生成,为省一个文件的下载把它丢掉,等于白瞎了模型最值钱的能力。

坑二:提示词增强器默认关闭,不是坏了,是故意关的。它会额外加载约 5GB 的模型,每次生成多花 1 到 2 分钟。显存紧张或批量跑任务时,这个默认值是合理的;但如果你写的提示词偏简单、想要更细的镜头描述,开它通常划算。建议的用法:构思阶段开着让它帮你扩写,摸清它的扩写风格后关掉,改成自己写全提示词,把那 1 到 2 分钟省回来。批量出片时同理,扩写一次定稿,比每代都过一遍增强器效率高。

坑三:显存策略错在「一次到位」。想直接生成高分辨率长片段,是 12GB 显卡爆显存最快的路径。正确做法是三段式:优先用量化或 distilled 变体;依赖 ComfyUI 的原生 offload 机制,让暂时不用的组件让出显存;生成短的低分辨率片段,再交给专用 upscaler 放大。生成短低分辨率再上采样,在这个硬件档位不是妥协,而是标准省法,LTX-2.5 官方的两阶段设计本身就是按这个思路组织的。它的架构里连 VAE 解码器都是一个扩散模型,解码环节本身也吃算力,就更没有一步到位的余裕了。

收尾:什么时候不该用 LTX-2.5

跑通之后,值得回头想一步:LTX-2.5 是不是你的最优解。按场景给结论。

要音画一体、许可门槛可接受,LTX-2.5 是目前 ComfyUI 生态里最顺的选择,12GB 的 distilled/int8 门槛也友好。

要最宽松的许可,选 Wan 2.2:Apache 2.0,商用几乎没有附加条件,TI2V-5B 对 8GB 显卡也友好,代价是无原生音频。

24GB 卡且不受地区限制,可以考虑 HunyuanVideo 1.5:14GB 显存起步,4090 上 step-distilled 版本约 75 秒渲染一条,但腾讯社区许可不适用于欧盟、英国和韩国,1 亿月活以上需另行协商。

要参考音频与对白能力,看 MiniMax H3:32kHz 立体声加 11 语言对白,但它是 33B dense 模型,本地部署显存口径未公布,社区许可排除欧盟、英国、韩国和美国,年收入 2000 万美元以上需书面授权。

收尾补一句工程视角的判断:这套流程跑熟之后,你会发现自己大部分时间花在提示词与镜头设计上,而不是盯着显存曲线。这是好现象,说明硬件层已经不构成瓶颈,工作流层开始接管效率。届时若想继续深入,模型自带的 RAW 与 EXR 工作流、VFX 方向的 LoRA 全家桶都是下一步的扩展方向,这些在本站开源篇里有更完整的梳理。五轴完整对比数据则在横评篇开源视频模型本地部署横评,本文不重复展开。回到 ComfyUI 视频生成本身:硬件对表、文件下齐、工作流选对型、三个坑绕开,12GB 显卡从今天就能出片。

常见问题

Q1: 12GB 显存真的能跑 LTX-2.5 吗? 可以,但仅限 distilled/int8 量化变体,ComfyUI 用的是 int8_convrot 构建,单卡 12GB 显存起步,FP8 变体也在这一档。全量 BF16 权重需要 80GB 以上显存,那是数据中心路线。

Q2: 为什么生成的视频没有声音? 大概率是漏下了音频 VAE。ltx-2.5-audio-vae-bf16 与视频 VAE 是两个独立文件,都要放进 models/vae/ 目录,节点图里音频解码是独立分支,缺文件或断线都会导致无声。

Q3: 8GB 显卡怎么参与 ComfyUI 视频生成? 换模型:Wan 2.2 的 TI2V-5B 加 offload 是 8GB 档的现实起点,短片为主、480p 到 720p。先把工作流跑熟,再考虑升级硬件。

Q4: 从 Hugging Face 下载 LTX-2.5 提示无权限怎么办? 权重是 gated=auto 模式,必须登录并同意许可条款后才会放行下载,连浏览模型卡都需要登录。许可为 LTX-2.x Community License,年收入低于 1000 万美元(含)免费商用。

Q5: 提示词增强器值得开吗? 它额外占用约 5GB 模型、每次生成多 1 到 2 分钟,所以默认关闭。显存富余且提示词写得简单时值得开;摸清扩写风格后,可改为手写完整提示词并关掉它,省下这 1 到 2 分钟。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-10

常见问题

12GB 显存真的能跑 LTX-2.5 吗?
可以,但仅限 distilled/int8 量化变体,ComfyUI 用的是 int8_convrot 构建,单卡 12GB 显存起步,FP8 变体也在这一档。全量 BF16 权重需要 80GB 以上显存,那是数据中心路线。
为什么生成的视频没有声音?
大概率是漏下了音频 VAE。ltx-2.5-audio-vae-bf16 与视频 VAE 是两个独立文件,都要放进 models/vae/ 目录,节点图里音频解码是独立分支,缺文件或断线都会导致无声。
8GB 显卡怎么参与 ComfyUI 视频生成?
换模型:Wan 2.2 的 TI2V-5B 加 offload 是 8GB 档的现实起点,短片为主、480p 到 720p。先把工作流跑熟,再考虑升级硬件。
从 Hugging Face 下载 LTX-2.5 提示无权限怎么办?
权重是 gated=auto 模式,必须登录并同意许可条款后才会放行下载,连浏览模型卡都需要登录。许可为 LTX-2.x Community License,年收入低于 1000 万美元(含)免费商用。
提示词增强器值得开吗?
它额外占用约 5GB 模型、每次生成多 1 到 2 分钟,所以默认关闭。显存富余且提示词写得简单时值得开;摸清扩写风格后,可改为手写完整提示词并关掉它,省下这 1 到 2 分钟。

相关文章

实战 SOP

LLaDA-Image 本地部署 SOP:五步跑通 6B 生图模型

把蚂蚁开源 6B 生图模型 LLaDA-Image 跑起来的五步 SOP:①环境准备(依赖与国内镜像加速下载);②四档权重怎么选(Base 50 步 / Turbo 4 步 × BF16 / FP8,国内走 ModelScope);③跑通第一张图(Base 与 Turbo 最小可用命令);④进阶(参考图编辑、文字渲染、ComfyUI 接入、显存不足时的降级策略);⑤生产化(批量队列、并发容量规划、成本监控、结果入库与故障降级)。含 6 条踩坑与 10 项上线自检清单,命令逐字取自官方 README;仓库 license 为 null,商用前须确权。

2026年9月9日11 分钟阅读
实战 SOP

MiMo-V2.6接入实操:三条路线从桌面端到RL训练

把 MiMo-V2.6 接进工作流的三条路线实操 SOP,按门槛递进:①MiMo Desktop 客户端(下载安装、登录订阅或自配 API Key、模型列表切 MiMo-V2.6-Pro/Flash、UltraSpeed 超高速场景、截图反馈迭代);②MiMo 开放平台 API(建应用取 Key、传模型名/消息/工具与多模态输入、Agent 任务接环境日志/测试通过率/截图/验证器反馈形成执行-检查-修正闭环、先小流量灰度验证价格延迟成功率);③本地权重(HF 集合 collections/XiaomiMiMo/mimo-v26 下载,参数量未公布、硬件门槛以模型卡为准;进阶复现 RL 训练走 XiaomiMiMo/verl 的五套环境脚本)。附常见坑速查表与上线前自查清单;API 定价以开放平台文档为准。

2026年9月27日10 分钟阅读
实战 SOP

80G显卡才跑得动?蚂蚁Ming-Image本地部署+图层SOP

把蚂蚁 Ming-Image-0.1-Design 真机本地跑起来的实操 SOP。硬件门槛是单张 80 GiB 显存 BF16(唯一官方验证配置);不走 diffusers 标准包,须 git clone 推理仓后 python infer.py。文生设计默认 steps 12、CFG 1.0、2048,图层拆解 steps 12、CFG 2.0、1024;原生 RGBA 需加仓库随附 prompt 前缀;Prompt Enhancement 用 Ling-3.0-flash-VL 或 qwen3.8-27B 把短需求改写成结构化规范;部署走 diffusers、vLLM-Omni 或 ComfyUI。24 GiB 消费卡无官方指引,社区量化属非官方。附上线前自查清单与踩坑速查表。所有速度或基准数字标模型卡或厂商口径、未独立复测。

2026年9月25日10 分钟阅读