开源项目
开源项目

ai-manju:AI 漫剧短剧本地生产流水线,ComfyUI+MiniMax-H3 从中文草稿到带音轨成片

catiseyeqaq/ai-manju-shengcheng-xitong:写实 AI 电影/短剧本地生产流水线。ComfyUI 0.31.0 编排 + MiniMax-H3 音视频联合生成(BF16 权重约 129G,8 卡 PPU-ZW810E)+ Qwen3.6-35B-A3B 中文润色。33 套模板工作流,T2V/I2V/R2V,majicFlus+PuLID 跨镜脸锁+H3 首尾帧接戏+48k 音画对齐。漫剧全链解析+硬件门槛+5 FAQ。早期个人项目(4 星),成片在 Releases 验收。

发布于 2026年8月15日8 分钟阅读
<!-- ai-manju-resource | open-source | ai-manju:AI 漫剧短剧本地生产流水线,ComfyUI+MiniMax-H3 从中文草稿到带音轨成片 -->

AI 漫剧(漫画短剧)赛道正热,但大多数玩家卡在同一关:单张图能出,连贯成片很难。GitHub 上 catiseyeqaq/ai-manju-shengcheng-xitong(AI Film & Short Drama Generation System)给出了一套完整的本地答案:基于 ComfyUI + MiniMax-H3 音视频联合生成模型 + Qwen3.6 提示词润色的写实 AI 电影/短剧生产流水线,从中文创意草稿一路到带立体声音轨的视频片段,而且作者自己吃狗粮--成片直接挂在 Releases 里可下载。这篇解析它的架构、能干什么、上手门槛和避坑。

先说清边界:仓库信息基于 GitHub API 与 README 实测整理(截至 2026-08-15,4 星,Python,当天仍在更新);成片质量以作者 Releases 展示为准,本文非亲自部署复现。漫剧赛道的方法论背景见本站 小红书爆款内容 SOP,视频方向的工具格局见 AI 视频工具对比

一、这条流水线解决什么:从「能出图」到「能出片」

单点能力 AI 都有了,但短剧生产是链路问题:中文创意 -> 英文影视级提示词 -> 节点图推理 -> 角色跨镜一致 -> 首尾帧接戏 -> 音画对齐拼接。ai-manju 把整条链封装成可复用的工作流资产:

环节方案说明
提示词润色Qwen3.6-35B-A3B(SGLang 部署)中文草稿 -> MiniMax-H3 友好英文提示,含运镜/光影/音效,已接入 MiniMax 官方 H3 提示词写作技能
视频生成MiniMax-H3(T2V/I2V/R2V)文生视频/图生视频/参考生视频三模式,原生联合生成立体声音轨
角色一致性majicFlus 人物出图 + PuLID 跨镜脸锁同一角色跨镜头不换脸
画质链FaceDetailer + USRU/USDU 修复面部与画面细节兜底
接戏H3 首尾帧接戏相邻镜头动作与场景衔接
成片48k 音画对齐拼接带音轨完整片段

仓库提供 33 套可直接导入的模板工作流:视频 T2V/I2V/R2V、电影级关键帧/分镜/连贯片管线、「大师」六件套、《万灵绘卷》琴书画系列,以及 QwenImage/FLUX2 出图、洗图改图与室内效果图管线。技术栈一句话:ComfyUI 0.31.0 做编排与 UI(端口 8188),SGLang 跑润色服务(端口 8030),前后台一键启停。

二、硬件门槛与部署形态

这是全仓库最需要先看的一节:MiniMax-H3 BF16 权重本地加载约 129GB。作者的部署形态是 8 卡 PPU-ZW810E 集群,配 ComfyUI 加速参数与注意力后端切换脚本。对个人玩家的直接含义:

  • 没有 8 卡级硬件,就别指望本地跑满 H3 BF16;考虑量化方案或云端推理,工作流逻辑仍然可复用
  • 仓库定位是部署配置 + 模板工作流 + 运维脚本 + 文档,不含百 GB 级权重与 ComfyUI 上游源码,按文档自行拉取
  • 成片(1080p 含音轨)发布在 GitHub Releases 而非 Git 历史,避免仓库膨胀--《story · rain day v2》《万灵绘卷 · 琴书画》都可下载验收

三、适合谁用、怎么用

典型用途(README 自述 + 我们的判断):

  1. AI 漫剧/短剧工作室:分镜预演、批量镜头生产,PuLID 脸锁 + 首尾帧接戏正是漫剧最痛的两关
  2. 产品广告/角色 PV/概念片:R2V 参考生视频保持产品与角色一致性
  3. 二次开发者:ComfyUI API 化 + 队列调度 + 多卡批处理,可对接业务系统
  4. 学习样本:想搞懂「电影级连贯片管线」怎么搭的人,33 套工作流就是 33 份可拆解的教材

需要冷静的地方也说清楚:仓库 4 星、单人维护,属于早期个人项目而非社区级工程,CI 虽在跑但文档完备度与问题响应有限;「写实电影级」的效果以上手实测为准,README 展示帧更接近「咖啡馆/雨夜街头」级别的写实短片而非院线质感;商用前注意生成素材的版权与肖像合规(README 也标注了素材版权归作者、未授权不得商用)。

常见问题

Q1:ai-manju 是什么定位的开源项目? A1:一套「写实 AI 电影/短剧本地生成与生产流水线」的部署工程:ComfyUI 0.31.0 做编排、MiniMax-H3 做音视频联合生成、Qwen3.6-35B-A3B 做中文到英文影视级提示词润色,覆盖 T2V/I2V/R2V 三种生成模式与角色一致性、首尾帧接戏、音画对齐拼接的完整短剧链路。仓库提供 33 套模板工作流与一键启停脚本,不含模型权重本体。

Q2:本地跑起来需要什么硬件? A2:MiniMax-H3 BF16 权重约 129GB,作者用 8 卡 PPU-ZW810E 集群部署。个人设备跑不动满血 BF16,可考虑量化或云端推理;ComfyUI(8188 端口)与 SGLang 润色服务(8030 端口)的前后台架构本身可以拆开按需部署。

Q3:角色跨镜头一致是怎么做到的? A3:组合拳:majicFlus 负责人物出图定基础形象,PuLID 做跨镜脸锁保证同一张脸,R2V 参考生视频模式以参考图约束角色/产品一致性,再叠加 FaceDetailer/USDU 画质链与 H3 首尾帧接戏保证镜头衔接。

Q4:和直接用即梦/可灵这类在线视频工具做漫剧比,价值在哪? A4:三点:链路完整性(提示词润色->生成->脸锁->接戏->拼接一体化,在线工具每关都要人肉搬运);可控性(ComfyUI 节点图每个参数可改、工作流可存可复用);成本形态(本地部署把边际成本压到电费与硬件折旧,适合批量生产)。代价是部署门槛与硬件投入。

Q5:现在成熟度如何,能直接商用吗? A5:属于早期个人项目(4 星、单人维护、当天仍在更新),CI 在跑但文档与响应有限,建议先下载 Releases 成片验收效果、小规模复现工作流后再评估。商用需注意两点:生成素材版权与肖像合规;README 明确素材版权归作者、未经授权不得商用。


参考来源

  • GitHub:catiseyeqaq/ai-manju-shengcheng-xitong(README 与仓库结构实测,2026-08-15,4★/Python/当日有推送)
  • 项目文档:docs/production-asset-inventory.md(写实短剧全链资产清单)
  • 成片展示:GitHub Releases「showcase-videos」(《story · rain day v2》《万灵绘卷 · 琴书画》,1080p 含音轨)
  • 关联组件官方仓库:Comfy-Org/ComfyUI、MiniMax-H3、Qwen3.6-35B-A3B(SGLang 部署)

本文基于公开仓库信息整理(2026-08-15),非亲自部署复现;效果与硬件要求以实际验证为准。相关阅读:AI 视频工具对比小红书爆款内容 SOPComfyUI 本地工作流

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-15

常见问题

ai-manju 是什么定位的开源项目?
一套「写实 AI 电影/短剧本地生成与生产流水线」的部署工程:ComfyUI 0.31.0 做编排、MiniMax-H3 做音视频联合生成、Qwen3.6-35B-A3B 做中文到英文影视级提示词润色,覆盖 T2V/I2V/R2V 三种生成模式与角色一致性、首尾帧接戏、音画对齐拼接的完整短剧链路。仓库提供 33 套模板工作流与一键启停脚本,不含模型权重本体。
本地跑起来需要什么硬件?
MiniMax-H3 BF16 权重约 129GB,作者用 8 卡 PPU-ZW810E 集群部署。个人设备跑不动满血 BF16,可考虑量化或云端推理;ComfyUI(8188 端口)与 SGLang 润色服务(8030 端口)的前后台架构本身可以拆开按需部署。
角色跨镜头一致是怎么做到的?
组合拳:majicFlus 负责人物出图定基础形象,PuLID 做跨镜脸锁保证同一张脸,R2V 参考生视频模式以参考图约束角色/产品一致性,再叠加 FaceDetailer/USDU 画质链与 H3 首尾帧接戏保证镜头衔接。
和直接用即梦/可灵这类在线视频工具做漫剧比,价值在哪?
三点:链路完整性(提示词润色->生成->脸锁->接戏->拼接一体化,在线工具每关都要人肉搬运);可控性(ComfyUI 节点图每个参数可改、工作流可存可复用);成本形态(本地部署把边际成本压到电费与硬件折旧,适合批量生产)。代价是部署门槛与硬件投入。
现在成熟度如何,能直接商用吗?
属于早期个人项目(4 星、单人维护、当天仍在更新),CI 在跑但文档与响应有限,建议先下载 Releases 成片验收效果、小规模复现工作流后再评估。商用需注意两点:生成素材版权与肖像合规;README 明确素材版权归作者、未经授权不得商用。

相关文章

开源项目

ComfyUI:专业玩家为何不用网页生图(星12.3万)

ComfyUI 是 GitHub 星数最高的开源 AI 图像生成项目(12.3万星,GPL-3.0),把扩散模型生图拆成可视化节点图。专业玩家选它四理由:控制(ControlNet/LoRA/IPAdapter 可自由连线组装)、复现(workflow 即 JSON 可一模一样重跑)、免费本地(数据不出本机)、自定义节点生态。门槛陡、吃显卡、GPL-3.0 copyleft,适合要做精细控制和可复现后端的画师与开发者。

2026年7月30日10 分钟阅读
开源项目

LLaDA-Image:蚂蚁全开源的 6B 统一生图编辑模型

蚂蚁 InclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image(GitHub 2026-09-09 快照 208 星 / Python / 创建 2026-08-31)。单一权重同时做文生图与指令编辑,backbone 与 DiT 都是扩散模型的统一框架,图像-only 预训练建视觉先验,Turbo 版用 Twin-DMD 蒸馏把 50 步压到 4 步;Qwen-Image-Bench 英文 53.53、中文 53.38 双料 SOTA;HF 与 ModelScope 提供 Base/Turbo 各含 FP8 四档权重,9-07 起有社区 ComfyUI。最重要避坑:仓库 license 字段为 null、无 LICENSE 文件,商用前须向官方确认,不可臆测为 Apache/MIT。

2026年9月9日10 分钟阅读
开源项目

OpenMAIC周增八千星登顶,把文档变多智能体课堂

THU-MAIC/OpenMAIC 以周增 8,095 星登顶 GitHub 周榜(2026-09-08 快照 33,053 星 / 5,369 fork / TypeScript / MIT)。它把任意主题或文档变成多智能体互动课堂:AI 老师与 AI 同学实时讲课、讨论、白板板书、TTS 朗读,生成幻灯片、测验、交互式模拟与 PBL 项目制学习,可导出 .pptx 与交互 HTML。v1.0.0(2026-08-27)新增 Agent workbench 聊天式构建、持久化会话、20 个内置技能;技术栈 Next.js 16 / React 19 / LangGraph 1.1;v0.3.0 起由 AGPL-3.0 转 MIT,并内置 SKILL.md 标准技能包,可从 OpenClaw、Codex、WorkBuddy 等工作台直接生成课堂。

2026年9月8日10 分钟阅读