实战 SOP
实战 SOP

AI 数字人制作实战 SOP:从脚本到成品的可复制流程

把 AI 数字人制作拆成六步可复制流程:明确用途选工具(HeyGen/D-ID/Synthesia/Colossyan/DeepBrain 及国内腾讯智影/硅基智能)、写口播脚本(附 prompt 模板)、选或定制形象、先定音色再生成口型、字幕剪辑与合规后处理、平台适配发布。附 5 个避坑(形象授权/口型对不齐/多语言音色/长视频成本/合规标识)和 5 条 FAQ。代表性流程,非单一工具实测,功能以官网为准。

发布于 2026年8月7日8 分钟阅读
<!-- ai-digital-human-creation-sop | sop | AI 数字人制作实战 SOP:从脚本到成品的可复制流程 -->

数字人已经不是新鲜词,但真正能把它做成稳定产出的人不多。常见的两种死法:一种是拿 HeyGen 点两下就交差,结果口型对不上、表情僵硬,观众三秒划走;另一种是一上来就追求 hyper-realistic,纠结皮肤毛孔渲染,结果一个月憋不出一条片子。

问题不在工具,在流程。数字人制作本质是六件事的串联:选对工具、写好脚本、定好形象、生成配音、后期处理、合规发布。每一步都有坑,但每一步也都有可复制的解法。这条 SOP 把这六步拆开讲,附可跑的 prompt 模板和五个真实避坑。本文是代表性流程梳理,非单一工具实测;流程通用,具体功能以各工具官网为准——这类工具调价和改版很勤,动手前先去官网核一眼。

一句话定位:数字人不是"选个头像点生成",而是一条"脚本驱动形象、形象驱动配音、配音驱动口型"的流水线。脚本质量决定上限,工具只决定下限。


一、明确用途选工具:先想清楚给谁看

90% 的人卡在第一步,是因为没想清楚用途就开做。给销售做产品讲解、给 HR 做新人培训、给短视频做口播、给电商做直播切片,这四类场景对数字人的要求完全不同:讲解类要的是信息清楚,口型差不多就行;培训类要的是稳定多语言;口播类要的是情绪和自然度;直播切片要的是能长时间不崩。

先按用途框定工具,别倒过来。下面这张表是 2026 年主流工具的代表性定位(综合 comparegen.ai、heygen.com/blog、colossyan.com 等公开对比整理,价格以官网为准):

工具定位强项适合场景
HeyGen头部数字人视频avatar 自然度高、多语言、可克隆营销/口播/培训
D-ID图片+音频生成说话头像门槛低、一张照片即可起步轻量讲解/快速验证
Synthesia企业级数字人模板多、多语言覆盖广企业培训/合规内训
Colossyan企业培训向对话场景、多角色互动场景化培训
DeepBrain AI韩系 hyper-realistic写实度高形象要求高的品牌片
腾讯智影国内中文生态、模板全中文口播/短视频
硅基智能国内直播/克隆直播数字人

选型三问:①预算多少(按分钟计费还是订阅)?②要不要多语言?③要不要克隆自己形象?前两个决定你选海外 SaaS 还是国内工具,第三个决定你走"选预制 avatar"还是"定制克隆"路线。预算紧、只验证想法,D-ID 起步最快;要稳定产出商业片,HeyGen 或 Synthesia 是稳妥选择;中文场景优先腾讯智影或硅基智能试水。

避坑预告:别只看官网 demo 就下单。demo 都是精挑细选的最佳案例,自己上手跑一条真实脚本再决定要不要付费。


二、写口播脚本:数字人的灵魂是文本

很多人误以为数字人的难点在形象,其实在上限的是脚本。形象再真实,脚本空洞,观众一样划走。数字人脚本和真人出镜脚本的区别在于:数字人没有即兴发挥能力,每一句话都要写死,停顿、语气、强调全靠文本驱动。

脚本结构用"钩子-正文-收尾"三段式。钩子三秒抓注意力,正文讲清一件事(别贪多),收尾给行动指令。字数按语速算:中文口播每分钟约 220-260 字,英文约 130-160 词。一条 60 秒的片子,中文脚本控制在 220-260 字。

可复制的脚本生成 prompt(丢给大模型):

text
你是一个资深口播编剧。为[产品/主题]写一条 60 秒数字人口播脚本。
要求:
1. 三段式:开头 3 秒钩子(提问或反常识断言)+ 正文(讲清 1 个核心卖点,配 1 个具体例子)+ 收尾(1 句行动指令);
2. 中文,220-250 字,口语化,短句为主,避免书面长句;
3. 标注每段预计时长和语气(平静/兴奋/强调);
4. 不用"众所周知""综上所述"这类套话。
输出格式:[时长|语气] 文本

拿到脚本后自己念一遍,卡嘴的地方改短。数字人不喘气,但听众会累,长句拆成两短句。多语言版本别直接机翻,让大模型按目标语言的口语习惯重写(不是翻译),否则英文版会带着中式句法,D-ID 和 HeyGen 的 TTS 念出来会很别扭。


三、选/定制形象:预制 avatar 还是克隆自己

形象分两条路:用平台预制 avatar,或克隆自己/模特的形象。

预制 avatar 最快。HeyGen、Synthesia、腾讯智影都自带几十到上百个形象,按性别、年龄、职业、着装筛选,选一个直接用。优点是合规风险低(平台已授权),缺点是同质化——你可能和别家用同一个 avatar。适合验证阶段和预算紧的场景。

克隆自己形象(HeyGen 的 Instant Avatar、D-ID 的 Custom Avatar、硅基智能的克隆)需要录一段 1-2 分钟的素材:正面、光线均匀、背景纯色、念指定文本。录完上传,平台训练几分钟到几小时出模型。这是目前商业片的常规路线,自然度远高于预制。但要注意授权问题——见避坑一。

定制形象的操作要点:

  1. 录制环境:纯色背景(绿幕或白墙),正面柔光(别用顶光,会压出眼窝阴影),收音干净(避免回声);
  2. 录制内容:平台给的校准文本必须念全,缺词会导致口型模型训练偏差;
  3. 着装:别穿细密条纹(摩尔纹),别戴反光饰品,纯色带领衣服最稳;
  4. 时长:按平台要求,一般 1-2 分钟,别图省事剪短。

避坑预告:克隆形象务必用本人或已签授权的模特。用网图或他人形象训练,平台会封号,商用还可能吃肖像权官司。


四、生成与配音:先定音色再生成口型

配音和口型是耦合的:先选/合成音色,再用这段音频驱动数字人口型。顺序反了(先生成视频再配音)口型必然对不齐。

音色三条路:①平台自带音色(HeyGen、Synthesia 都有几十种多语言音色);②克隆自己声音(需录样本,HeyGen Voice Cloning、ElevenLabs 都支持);③外部 TTS 生成音频再导入(用豆包、剪映文本朗读生成,导入 D-ID 这类支持"音频驱动"的工具)。

多语言音色是重灾区(见避坑三)。HeyGen 和 Synthesia 的多语言是同一音色跨语言,相对自然;外部 TTS 跨语言经常变声。要发多语言版本,优先选平台原生多语言音色,别用外部 TTS 拼凑。

生成时的操作要点:

  1. 把脚本分段贴进工具,每段对应一个镜头,别一整段塞进去(长文本容易在中段口型漂移);
  2. 选好音色和语言,预览音频(听一遍语速和断句,不满意调语速参数再生成);
  3. 确认音频后生成视频,单段控制在 30-60 秒,超长视频按段生成再拼接(见避坑四);
  4. 生成完逐段检查口型和表情,明显不对的段重生成,别指望后期修口型(成本极高)。

可复制的多语言脚本适配 prompt:

text
把下面的中文口播脚本改写为[英文/日文]版本。
要求:
1. 不是直译,按目标语言口语习惯重写,保持口语化和短句;
2. 保持原意和三段式结构(钩子-正文-收尾);
3. 时长与中文版一致(约 60 秒,英文 130-150 词);
4. 避免文化不通的表达,本地化例子。
输出:直接给改写后的脚本,不要解释。

五、后处理:字幕、剪辑与合规

数字人原生视频通常需要三步后处理:加字幕、剪辑拼接、加合规标识。

字幕:用剪映或 Whisper 自动生成字幕,校对一遍(专有名词、数字必错)。字幕样式别花哨,白字黑边或白底黑字最清楚,字号占画面宽 1/15 左右。中英双语字幕分两行,上中下英。

剪辑:多段拼接用交叉溶解,别硬切(数字人硬切比真人更跳)。镜头间可插产品图或关键信息卡片打破单调。背景音乐压到人声 -15dB 以下,别喧宾夺主。

合规标识:这是最容易被忽略但最要命的一步。多地法规要求 AI 生成内容明确标识(见避坑五)。视频画面加"AI 生成"水印或角标,描述区标注"本视频含 AI 生成内容",平台要求勾选"AI 生成"标签的务必勾。

避坑预告:合规标识不是"可选美化",是硬性要求。漏标可能被平台下架,商用场景还可能触犯当地 AI 内容法规。


六、发布:平台适配与版本管理

发布前按平台规格导出:竖版 9:16(抖音/视频号/Reels)、横版 16:9(YouTube/B 站)、方版 1:1(部分信息流)。分辨率至少 1080P,码率按平台推荐。同一脚本的多语言版本用文件名区分(如 intro_zh.mp4intro_en.mp4),别覆盖。

发布时三件事:①描述区写清主题和要点(SEO 友好);②勾选 AI 内容标签(各平台都有);③跟踪前 24 小时数据,完播率低于 30% 多半是钩子没抓人,回去改脚本前 3 秒。


踩坑速查

坑一 形象授权踩雷。 克隆形象只能用本人或已签书面授权的模特。用网图、名人照片、他人形象训练,轻则平台封号,重则肖像权诉讼。商业项目务必留授权文件存档。

坑二 口型对不齐。 根因是配音和视频生成顺序颠倒,或长文本中段漂移。解法:先定音频再生成视频,单段控制在 30-60 秒,超长分段生成。别指望后期修口型,成本比重新生成还高。

坑三 多语言音色变声。 外部 TTS 跨语言经常换音色,同一数字人中文是女声、英文变男声。解法:优先用平台原生多语言音色(HeyGen、Synthesia 同音色跨语言),或每语言分别克隆音色。

坑四 长视频成本失控。 这类工具多按分钟或点数计费,10 分钟视频成本可能是 1 分钟的 10 倍。解法:长内容拆成短段,每段独立生成再拼接;预制 avatar 比克隆 avatar 便宜,验证阶段先用预制。

坑五 合规标识漏标。 多地法规要求 AI 生成内容显式标识。画面加"AI 生成"角标,描述区标注,平台标签勾选。商用尤其严格,发布前过一遍合规清单。


常见问题

Q1:数字人能完全替代真人出镜吗? 还不能。数字人适合口播、讲解、培训这类"信息传递"场景,情绪表达和即兴互动仍弱于真人。品牌主片、情感叙事类内容,真人出镜效果更好。数字人是降本工具,不是替代品。

Q2:克隆自己形象和声音要多少钱? 以官网为准。代表性区间:HeyGen 的 Instant Avatar 和 Voice Cloning 通常需订阅 Creator 及以上计划;D-ID 门槛较低,适合小成本验证;国内硅基智能、腾讯智影按分钟或套餐计费。各平台调价频繁,动手前查官网。

Q3:哪个工具多语言最好? Synthesia 和 HeyGen 的多语言覆盖最广(数十种语言同音色),适合企业培训全球化。D-ID 多语言支持较全但音色一致性弱于前两者。中文为主选腾讯智影或硅基智能。具体语言列表以各工具官网为准。

Q4:数字人视频会被平台限流吗? 取决于平台政策和是否标识。多数主流平台对明确标识的 AI 内容不限流,但未标识或伪装真人可能被降权。抖音、视频号、YouTube 都有 AI 内容标签,发布时务必勾选。

Q5:零基础第一次做,最短路径是什么? 注册 D-ID 或腾讯智影(门槛低、可免费试),用平台预制 avatar + 自带音色,跑通一条 30 秒讲解视频。脚本用上面的 prompt 让大模型写。先跑通流程再考虑克隆形象和多语言。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-07

常见问题

数字人能完全替代真人出镜吗?
还不能。数字人适合口播、讲解、培训这类信息传递场景,情绪表达和即兴互动仍弱于真人。品牌主片、情感叙事类内容真人出镜效果更好。数字人是降本工具,不是替代品。
克隆自己形象和声音要多少钱?
以官网为准。代表性区间:HeyGen 的 Instant Avatar 和 Voice Cloning 通常需订阅 Creator 及以上计划;D-ID 门槛较低适合小成本验证;国内硅基智能、腾讯智影按分钟或套餐计费。各平台调价频繁,动手前查官网。
哪个工具多语言最好?
Synthesia 和 HeyGen 的多语言覆盖最广(数十种语言同音色),适合企业培训全球化。D-ID 多语言支持较全但音色一致性弱于前两者。中文为主选腾讯智影或硅基智能。具体语言列表以各工具官网为准。
数字人视频会被平台限流吗?
取决于平台政策和是否标识。多数主流平台对明确标识的 AI 内容不限流,但未标识或伪装真人可能被降权。抖音、视频号、YouTube 都有 AI 内容标签,发布时务必勾选。
零基础第一次做,最短路径是什么?
注册 D-ID 或腾讯智影(门槛低、可免费试),用平台预制 avatar 加自带音色,跑通一条 30 秒讲解视频。脚本用文中的 prompt 让大模型写。先跑通流程再考虑克隆形象和多语言。

相关文章

实战 SOP

block/buzz 自托管部署 SOP:从 Docker 到 agent 入组

block/buzz 自托管部署完整 SOP(与 buzz-hive-mind 热点文成对):本地开发栈(just setup/build/dev)+ 生产单节点(deploy/compose Docker,Postgres/Redis/MinIO)+ 配置(.env:RELAY_URL/BUZZ_RELAY_PRIVATE_KEY/RELAY_OWNER_PUBKEY)+ agent 入组(Nostr keypair NIP-98 签名,buzz-admin 管成员)+ 闭门 relay + 5 FAQ。部署命令全据 README/compose/.env/CLI/ARCHITECTURE,未编造。

2026年8月6日9 分钟阅读
实战 SOP

n8n 搭建 AI agent 工作流实战 SOP:部署与避坑

在 n8n 画布里搭一个能自主调用工具的 AI agent 工作流的完整 SOP:Docker 自托管一条命令部署、AI Agent 节点四件套解剖(Language Model+Memory+Tools+System Prompt)、分步搭建(选触发器->配节点->加工具->输出->测试发布)、五个避坑(Memory 失忆/API Key 硬编码/过度设计/上下文漂移/数据格式不匹配)+5 FAQ。节点参数以 n8n 官方文档为准,给配置逻辑不伪造完整 JSON。

2026年8月6日9 分钟阅读