硬核横评
硬核横评

开源视频模型对比:许可显存地区三道坎

开源视频模型四强横评,比「本地部署门槛」五轴:许可/显存/音频/时长与分辨率/地区限制,不比生成质量、无横向跑分不排名。LTX-2.5(22B,distilled/FP8 12GB 起步,24kHz 立体声同步,LTX Community 许可 $10M 门槛 gated=auto);Wan 2.2(TI2V-5B,8GB+offload,Apache 2.0 最宽松,短片 480p-720p,无原生音频);HunyuanVideo 1.5(8.3B,14GB 起,4090 step-distilled 约 75 秒/条,腾讯社区许可不适用 EU/UK/南韩、1 亿 MAU 需另谈,无原生音频);MiniMax H3(33B dense,32kHz 立体声+对白 11 语言,15s/768p 默认而 2K 需未开源 regenerator,社区许可排除 EU/UK/南韩/美国、超 $20M 需书面授权,显存无统一口径不编)。各家数据标来源(bestfreewebresources/pinggy 整理+官方模型卡口径);fal H3 Max i2v with audio 榜 #1 为第三方口径。选型结论按场景给不仲裁:要最宽松许可选 Wan 2.2,要音画一体选 LTX-2.5,24GB 卡且不受地区限制选 HunyuanVideo 1.5,要参考音频/多语对白选 H3(在许可适用区内)。

发布于 2026年10月10日9 分钟阅读
<!-- open-video-model-local-comparison-review | review | 开源视频模型对比:许可显存地区三道坎 -->

一、先分工:本篇只比门槛,不比质量

本站此前的 开源与云端视频模型横评 把可灵 4.0、Seedance 2.5、Wan3.0、LTX-2.5 摆在同一张桌上,比的是「30 秒俱乐部」的成片质量与价格。本篇换一条赛道:只看纯开源、能拉到自己 GPU 上跑的那一档,而且先立纪律:不比生成质量、不跑横向跑分、不排名,只比一件事,本地部署的门槛。

为什么在 2026 年 10 月专门比门槛?因为这几个月开源视频赛道的关键词已经从「追上云端」变成「谁能装进你的机器」。LTX-2.5 在 2026 年 8 月 11 日发布、替换 LTX-2.3,把蒸馏版门槛压到单卡 12GB;Wan 2.2 用 5B 小模型把门票打到 8GB;腾讯与 MiniMax 也各自放出了可自部署的权重。权重公开意味着数据不出内网、可以离线推理、可以按业务微调,这些是云端 API 给不了的东西,但前提是你先迈过门槛:许可条款、显存底线、音频能力、时长分辨率上限,以及最容易被忽视的地区限制。

四强名单由此确定:LTX-2.5(Lightricks)、Wan 2.2(阿里)、HunyuanVideo 1.5(腾讯)、MiniMax H3(MiniMax)。比法是五轴:许可、显存、原生音频、时长与分辨率、地区限制。前四轴决定你的卡能不能跑,第五轴决定你所在的地方能不能用。后者是本批整理下来最容易被忽视的一轴,也是发现最扎心的一轴。

口径先说清:数据以各家官方模型卡与仓库说明为主,第三方整理(bestfreewebresources、pinggy、innfactory)作补充,逐处标注;本篇非亲自压测,两说的数字并列呈现不拍板,未公布的明确写未公布。

二、五轴对比表:四强同框

轴LTX-2.5Wan 2.2HunyuanVideo 1.5MiniMax H3
参数规模22B(distilled/FP8 降门槛)TI2V-5B 等多档8.3B33B dense
许可LTX Community,年收入 1000 万美元门槛,gated=autoApache 2.0,最宽松腾讯社区许可,不适用 EU/UK/南韩,1 亿 MAU 需另谈社区许可,排除 EU/UK/南韩/美国,超 2000 万美元需书面授权
显存门槛12GB(distilled/FP8),全量 80GB+8GB(5B 加 offload)14GB 起,4090 step-distilled 约 75 秒一条未公布统一口径
原生音频24kHz 立体声同步生成无无(另有 Avatar 系产品线)32kHz 立体声,对白 11 语言
时长与分辨率单次最长约 20 秒(两说并存),4K HDR短片为主,480p 至 720p(5B 档)约 75 秒渲染一条,指耗时非时长默认 15 秒、768p,2K 组件未开源
代码与权重github.com/Lightricks/LTX-2github.com/Wan-Video/Wan2.2官方模型卡渠道官方模型卡渠道

表中数据来源:许可与显存以官方模型卡口径为主;4090 约 75 秒、LTX-2.5 时长两说与 H3 榜单信息为第三方整理(bestfreewebresources、pinggy、innfactory)口径。

表格第一眼请看「许可」一行:四款里三款是自定义社区许可,只有 Wan 2.2 拿着标准开源许可。再看许可里的地区字眼:同一份权重,在不同法域的可用性完全不同。这件事比显存更早决定生死,显卡不够可以降档,许可把你排除在外,买再贵的卡也没用。

三、许可轴:一条 Apache 2.0,三份自定义合同

Wan 2.2 用的是 Apache 2.0,四强里唯一一份 OSI 意义上的开源许可:无收入门槛、无地区排除条款,商用、修改、再分发都按标准条款走。代码与权重托管在 Wan-Video/Wan2.2(明文地址 github.com/Wan-Video/Wan2.2)。对合规敏感的团队,这一条几乎一票定音。

LTX-2.5 是 LTX-2.x Community License(许可文本日期 2026-08-11),Lightricks 在自家材料里明说它不是 Apache 2.0。关键条款两条:年收入低于 1000 万美元的实体免费商用(含临界值),达到或超过须购买商用协议;权重下载走 gated=auto,登录 Hugging Face 同意条款后自动放行。要注意这个 gated 不只是下个权重的事,连模型卡页面都要登录后才能看全。门槛是合同性质的,不拦个人与中小团队,拦的是把营收做上去那一天。

HunyuanVideo 1.5 与 MiniMax H3 的许可都带地区条款,方向一致但范围不同。腾讯社区许可不适用 EU/UK/南韩,月活跃用户达到 1 亿需另行商谈;H3 的社区许可排除 EU/UK/南韩/美国,年收入超过 2000 万美元的商用需书面授权。合起来读:欧洲、英国的用户两款都用不了,南韩同样双双出局,美国用户则被 H3 单独排除。地区限制是本批对比的核心发现,它不写在系统需求里,却比任何硬件参数都硬。很多人下载前只看显存够不够,结果在许可条款这一步才发现自己的法域根本不在适用范围内,时间已经白花。

四份许可里,Apache 2.0 最宽松没有争议;LTX Community 有收入门槛但无地区排除字眼;两款社区许可则同时挂着规模条款与地区条款。这是条款宽严的陈述,不是质量评价,本篇不比质量。

四、显存轴:8GB 与 80GB 之间

LTX-2.5 的底子是 22B,全量权重需要 80GB 以上显存,全组件下载约 66GiB;蒸馏与 FP8 变体把单卡门槛压到 12GB 起(官方模型卡口径)。同一族的 LTX-2 在 41 批的 LTX-2 开源篇 里拆过发布与许可,2.5 版的架构演进与 12GB 门槛下探,见本批 LTX-2.5 开源篇。代码仓库在 Lightricks/LTX-2(明文地址 github.com/Lightricks/LTX-2)。

Wan 2.2 的 TI2V-5B 档位搭配 offload 策略,8GB 显存可跑(官方口径),是四强里最低的显存门票。代价在音频轴会看到。

HunyuanVideo 1.5 是 8.3B,显存 14GB 起;第三方整理口径称 4090 上跑 step-distilled 版本约 75 秒渲染一条。这个数字让 24GB 卡的用户值得把它排进候选。

MiniMax H3 是 33B dense,显存需求未公布统一口径,本篇不编。33B 的参数体量摆在那里,想尝试的团队按试错预期做预算,别按别人的数字立项。

显存不够时的通用省法,本批整理下来三条:优先选量化或蒸馏变体,能用 ComfyUI 原生 offload 就开,先出短片段与低分辨率再用专用上采样器放大。生成短、低分辨率再上采样,是最省显存的路径,也是所有显存策略里最没有门槛的一条。环境侧的底线可以参考 innfactory 整理口径:CUDA 12.7 以上、PyTorch 约 2.7、Python 3.12 以上。

五、音频轴:四款里只有两款会出声

LTX-2.5 的视频与 24kHz 立体声音频在同一个 pass 里同步生成(官方模型卡口径),音画一体意味着省掉后期配音、对口型的整段工序。对做短片与营销素材的团队,这一轴的实际价值不亚于分辨率。

H3 走得更远:32kHz 立体声,对白支持 11 种语言;omni-reference 最多吃 9 张图、3 段视频、3 段音频作为参考,这意味着可以直接喂参考音频去驱动对白。第三方榜单口径:8 月上线的 fal H3 Max 在 i2v with audio 榜排第一。不自部署的话,H3 API 定价快照口径为 768p 每秒 0.08 美元、2K 每秒 0.13 美元。

Wan 2.2 与 HunyuanVideo 1.5 都没有原生音频(官方口径)。腾讯另有 Avatar 系列产品线做声音驱动,但那是独立产品线,不算进本批对比。需要声音的两条路:选会出声的两款,或者后期自己接 TTS,后者要多养一条工具链,对口型与音画同步的活也得自己补。反过来说,如果你的成片本来就要配解说、配音乐,原生音频的加分就会缩水,选型时按自己的成片形态折算,别被参数表牵着走。

六、时长与分辨率轴:一个两说,一个缺组件

LTX-2.5 的单次时长有两说:pinggy 整理口径称单次最长 20 秒,Extend 管线可扩;innfactory 整理口径称单次 121 帧,24fps 下约 5 秒。前者接近官方宣传,后者是第三方部署整理,两说并存,以你实际跑的管线为准。分辨率上限没有争议:4K(3840×2176)HDR、最高 50fps(官方模型卡口径),另有自动时长预测与跨镜头保持角色、环境、光照的能力(官方口径)。

Wan 2.2 以短片为主,TI2V-5B 档输出 480p 到 720p。HunyuanVideo 1.5 的「约 75 秒」是渲染耗时而非成片时长,别读反。H3 默认 15 秒、768p;想要 2K 得靠 regenerator 组件,而它没有开源,本地链路想上 2K,目前不完整。这一点对自部署用户尤其要紧:你拿到的开源部分,能力边界就在 768p,宣传里的 2K 属于另一套未公开的组件。

把这一轴和显存轴放在一起读会更有用:长片段直接吃显存,想跑 20 秒以上的镜头,先确认自己的卡装得下,装不下就用上采样器把短片段接长,这是四强通用的工作流,不是某一家的独门技巧。

七、门槛之外的实操账

选定模型只是第一关,装起来还有几笔账要算。以 LTX-2.5 为例,ComfyUI 侧用 int8_convrot 构建(非 BF16),配套的音频 VAE 是独立文件,跳过它就直接得到一条无声视频,这是本批整理里最冤枉的一种浪费。提示词增强器另有约 5GB 的额外模型,开启后每次生成多花一到两分钟,默认关闭,按需取舍。ComfyUI 官方插件在 Lightricks/ComfyUI-LTXVideo(明文地址 github.com/Lightricks/ComfyUI-LTXVideo),工作流覆盖文生视频、图生视频与音频驱动三类。

生态成熟度也该折进选型:LTX-2.5 有 ltx-pipelines 命令行、Diffusers 0.40.0 完整支持与 ltx-trainer 微调工具,还有 SDR 转 HDR、重绘、上采样等一整排 LoRA 可挂(pixelsham 整理口径);Wan 2.2 与 ComfyUI 的组合是 8GB 卡用户的主流路线;HunyuanVideo 与 H3 的本地工具链相对年轻。想看逐文件的安装步骤与目录摆放,本批的 ComfyUI 视频工作流 SOP 写得更细,本篇只负责帮你把模型选对。

八、按场景给结论

要最宽松的许可,选 Wan 2.2。 Apache 2.0、8GB 显存起步、无地区排除、无收入门槛。代价:无原生音频、短片为主、分辨率上限不高。

要音画一体,选 LTX-2.5。 12GB distilled 版起步、24kHz 立体声同步生成、4K HDR 上限。代价:记住 1000 万美元商用门槛与 gated 下载流程。

有 24GB 卡且不受地区限制,选 HunyuanVideo 1.5。 4090 上 step-distilled 约 75 秒渲染一条(第三方口径),8.3B 体量对硬件友好。前提是你和你的用户都不在 EU/UK/南韩。

要参考音频与对白,选 H3。 32kHz 立体声加 11 语言对白、多模态参考阵容最大。前提是你在许可适用区内(美国用户出局),且接受显存未公布、2K 组件未开源的不确定性。

四条结论没有一条是全能冠军。本地部署选型的本质,是在自己的显卡、自己的法域、自己的营收曲线之间找交集。先用法域砍掉一半名单,再用显存砍掉一半,最后剩下的那个,往往就是唯一解——这也是横评比到「门槛」这一层和比质量最大的不同:质量决定你做出来的片子好不好,门槛决定你到底能不能开始做。

九、常见问题

Q1: 四款里谁才是真正的开源? A:严格口径下只有 Wan 2.2(Apache 2.0)。LTX-2.5 是自定义社区许可加 gated=auto 下载,HunyuanVideo 1.5 与 H3 都是带规模与地区条款的社区许可。把「开源」理解为「权重公开」更贴近现实。

Q2: 在欧盟、英国或南韩能用哪几款? A:HunyuanVideo 1.5 的许可不适用 EU/UK/南韩,H3 排除 EU/UK/南韩/美国。这三地的可选面收窄到 Wan 2.2 与 LTX-2.5,后者注意 1000 万美元商用门槛。美国用户再减一款 H3。

Q3: MiniMax H3 本地部署要多少显存? A:官方未公布统一口径,本篇不编。33B dense 的参数体量摆在那里,自部署前按试错预期做预算;等不及可以先看它的 API 定价快照口径。

Q4: LTX-2.5 单次到底能生成多长? A:两说并存:pinggy 整理称单次最长 20 秒(Extend 管线可扩),innfactory 整理称单次 121 帧、24fps 下约 5 秒。本篇不写死,以你实际使用的管线版本为准。

Q5: 看完选型想动手,从哪里入手? A:先读本批 ComfyUI 本地视频生成 SOP,模型文件放哪个目录、哪些坑会浪费一晚上(音频 VAE 是独立文件,跳过它就是无声视频)都写在里面。

互动

你的卡是哪一档,所在法域又卡掉了哪几款?是抱着 8GB 卡跑 Wan 2.2,还是用 12GB distilled 版在跑 LTX-2.5,或者干脆被许可条款劝退转投云端?评论区聊聊你的部署实录,高频问题会进后续更新。

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-10-10

常见问题

四款里谁才是真正的开源?
A:严格口径下只有 Wan 2.2(Apache 2.0)。LTX-2.5 是自定义社区许可加 gated=auto 下载,HunyuanVideo 1.5 与 H3 都是带规模与地区条款的社区许可。把「开源」理解为「权重公开」更贴近现实。
在欧盟、英国或南韩能用哪几款?
A:HunyuanVideo 1.5 的许可不适用 EU/UK/南韩,H3 排除 EU/UK/南韩/美国。这三地的可选面收窄到 Wan 2.2 与 LTX-2.5,后者注意 1000 万美元商用门槛。美国用户再减一款 H3。
MiniMax H3 本地部署要多少显存?
A:官方未公布统一口径,本篇不编。33B dense 的参数体量摆在那里,自部署前按试错预期做预算;等不及可以先看它的 API 定价快照口径。
LTX-2.5 单次到底能生成多长?
A:两说并存:pinggy 整理称单次最长 20 秒(Extend 管线可扩),innfactory 整理称单次 121 帧、24fps 下约 5 秒。本篇不写死,以你实际使用的管线版本为准。
看完选型想动手,从哪里入手?
A:先读本批 [ComfyUI 本地视频生成 SOP](/zh/posts/comfyui-video-workflow-sop),模型文件放哪个目录、哪些坑会浪费一晚上(音频 VAE 是独立文件,跳过它就是无声视频)都写在里面。

相关文章

硬核横评

嵌入模型选型:RAG四强横评,换错重嵌全库

RAG 嵌入模型四强横评(价格口径 2026-10-09 官方页快照):EmbeddingGemma 2、Qwen3-Embedding(0.6B/4B/8B)、BGE-M3、OpenAI text-embedding-3-large,另附 gemini-embedding-001 对照行。许可全部 HF API 实核(2026-10-09):google/embeddinggemma-2 与 Qwen3-Embedding-8B 均 apache-2.0 ungated,BAAI/bge-m3 为 mit(3370 万下载)。工程账逐项对齐:上下文 8192(EG2/BGE-M3/OpenAI)vs 32768(Qwen3);维度 768(MRL 裁至 128)/1024-4096/1024/3072(MRL 至 256);价格三款自部署免费 vs OpenAI 每百万 token 0.13 美元。纪律先立:各家基准分各引各表(EG2 的 MTEB Code +9.92 与 gemini-embedding-001 三榜第一均为官方自报口径;Qwen3-8B 多语约 70.6 为第三方转述),严禁跨表排名;生产流行度(转述 LangChain/LlamaIndex telemetry):BGE-M3 第一、Qwen3 第二、OpenAI 第三。结论按场景给不仲裁:端侧多模态选 EG2、长文档与中文选 Qwen3、混合检索与成熟生态选 BGE-M3、零运维 API 选 OpenAI;换模型=全库重嵌,先想清楚再动手。

2026年10月9日10 分钟阅读
硬核横评

0.1美元俱乐部开战:小模型价格战四款横评

小模型价格战横评(2026-10-08 价格快照口径,五列四行):Claude Haiku 5.5、GPT-6 Luna、Sonnet 5.5、Qwen3.8-27B(开源自部署档)。价格行:Haiku 5.5 每百万 0.1/0.5 美元(<100K 提示档)、Luna 0.1/0.5 美元(≤272K)、Sonnet 5.5 单价 2/10 美元但缓存读减半至 0.1、Qwen3.8-27B 权重免费(Apache-2.0)自备 GPU。核心发现:短提示档 Haiku 5.5 与 Luna 同价打平,但 100K 以上 Haiku 5.5 输入价 0.5 美元 vs Luna 0.2 美元——「同价」只在短提示档成立,长文档批量任务账单会反转。基准各引各的官方数并标注(跨基准禁互比):Haiku 5.5 Terminal-Bench 4.0 39.2%、OSWorld 72.4%;Luna 未随文给新基准;Sonnet 5.5 TB4 70.6%;Qwen3.8-27B 无横向同表。可调 effort 档位对比(Haiku 5.5 首次下放 Haiku 级;Luna none→max)、上下文(Haiku/Luna 1M、Qwen 262K 可扩 1M)。结论按需求给:高吞吐子代理、批量分类、主力编码、私有化部署各归各位;本站无压测不仲裁。内链四篇同题专文做深读。

2026年10月8日10 分钟阅读