数字人已经不是新鲜词,但真正能把它做成稳定产出的人不多。常见的两种死法:一种是拿 HeyGen 点两下就交差,结果口型对不上、表情僵硬,观众三秒划走;另一种是一上来就追求 hyper-realistic,纠结皮肤毛孔渲染,结果一个月憋不出一条片子。
问题不在工具,在流程。数字人制作本质是六件事的串联:选对工具、写好脚本、定好形象、生成配音、后期处理、合规发布。每一步都有坑,但每一步也都有可复制的解法。这条 SOP 把这六步拆开讲,附可跑的 prompt 模板和五个真实避坑。本文是代表性流程梳理,非单一工具实测;流程通用,具体功能以各工具官网为准——这类工具调价和改版很勤,动手前先去官网核一眼。
一句话定位:数字人不是"选个头像点生成",而是一条"脚本驱动形象、形象驱动配音、配音驱动口型"的流水线。脚本质量决定上限,工具只决定下限。
一、明确用途选工具:先想清楚给谁看
90% 的人卡在第一步,是因为没想清楚用途就开做。给销售做产品讲解、给 HR 做新人培训、给短视频做口播、给电商做直播切片,这四类场景对数字人的要求完全不同:讲解类要的是信息清楚,口型差不多就行;培训类要的是稳定多语言;口播类要的是情绪和自然度;直播切片要的是能长时间不崩。
先按用途框定工具,别倒过来。下面这张表是 2026 年主流工具的代表性定位(综合 comparegen.ai、heygen.com/blog、colossyan.com 等公开对比整理,价格以官网为准):
| 工具 | 定位 | 强项 | 适合场景 |
|---|---|---|---|
| HeyGen | 头部数字人视频 | avatar 自然度高、多语言、可克隆 | 营销/口播/培训 |
| D-ID | 图片+音频生成说话头像 | 门槛低、一张照片即可起步 | 轻量讲解/快速验证 |
| Synthesia | 企业级数字人 | 模板多、多语言覆盖广 | 企业培训/合规内训 |
| Colossyan | 企业培训向 | 对话场景、多角色互动 | 场景化培训 |
| DeepBrain AI | 韩系 hyper-realistic | 写实度高 | 形象要求高的品牌片 |
| 腾讯智影 | 国内 | 中文生态、模板全 | 中文口播/短视频 |
| 硅基智能 | 国内 | 直播/克隆 | 直播数字人 |
选型三问:①预算多少(按分钟计费还是订阅)?②要不要多语言?③要不要克隆自己形象?前两个决定你选海外 SaaS 还是国内工具,第三个决定你走"选预制 avatar"还是"定制克隆"路线。预算紧、只验证想法,D-ID 起步最快;要稳定产出商业片,HeyGen 或 Synthesia 是稳妥选择;中文场景优先腾讯智影或硅基智能试水。
避坑预告:别只看官网 demo 就下单。demo 都是精挑细选的最佳案例,自己上手跑一条真实脚本再决定要不要付费。
二、写口播脚本:数字人的灵魂是文本
很多人误以为数字人的难点在形象,其实在上限的是脚本。形象再真实,脚本空洞,观众一样划走。数字人脚本和真人出镜脚本的区别在于:数字人没有即兴发挥能力,每一句话都要写死,停顿、语气、强调全靠文本驱动。
脚本结构用"钩子-正文-收尾"三段式。钩子三秒抓注意力,正文讲清一件事(别贪多),收尾给行动指令。字数按语速算:中文口播每分钟约 220-260 字,英文约 130-160 词。一条 60 秒的片子,中文脚本控制在 220-260 字。
可复制的脚本生成 prompt(丢给大模型):
你是一个资深口播编剧。为[产品/主题]写一条 60 秒数字人口播脚本。
要求:
1. 三段式:开头 3 秒钩子(提问或反常识断言)+ 正文(讲清 1 个核心卖点,配 1 个具体例子)+ 收尾(1 句行动指令);
2. 中文,220-250 字,口语化,短句为主,避免书面长句;
3. 标注每段预计时长和语气(平静/兴奋/强调);
4. 不用"众所周知""综上所述"这类套话。
输出格式:[时长|语气] 文本拿到脚本后自己念一遍,卡嘴的地方改短。数字人不喘气,但听众会累,长句拆成两短句。多语言版本别直接机翻,让大模型按目标语言的口语习惯重写(不是翻译),否则英文版会带着中式句法,D-ID 和 HeyGen 的 TTS 念出来会很别扭。
三、选/定制形象:预制 avatar 还是克隆自己
形象分两条路:用平台预制 avatar,或克隆自己/模特的形象。
预制 avatar 最快。HeyGen、Synthesia、腾讯智影都自带几十到上百个形象,按性别、年龄、职业、着装筛选,选一个直接用。优点是合规风险低(平台已授权),缺点是同质化——你可能和别家用同一个 avatar。适合验证阶段和预算紧的场景。
克隆自己形象(HeyGen 的 Instant Avatar、D-ID 的 Custom Avatar、硅基智能的克隆)需要录一段 1-2 分钟的素材:正面、光线均匀、背景纯色、念指定文本。录完上传,平台训练几分钟到几小时出模型。这是目前商业片的常规路线,自然度远高于预制。但要注意授权问题——见避坑一。
定制形象的操作要点:
- 录制环境:纯色背景(绿幕或白墙),正面柔光(别用顶光,会压出眼窝阴影),收音干净(避免回声);
- 录制内容:平台给的校准文本必须念全,缺词会导致口型模型训练偏差;
- 着装:别穿细密条纹(摩尔纹),别戴反光饰品,纯色带领衣服最稳;
- 时长:按平台要求,一般 1-2 分钟,别图省事剪短。
避坑预告:克隆形象务必用本人或已签授权的模特。用网图或他人形象训练,平台会封号,商用还可能吃肖像权官司。
四、生成与配音:先定音色再生成口型
配音和口型是耦合的:先选/合成音色,再用这段音频驱动数字人口型。顺序反了(先生成视频再配音)口型必然对不齐。
音色三条路:①平台自带音色(HeyGen、Synthesia 都有几十种多语言音色);②克隆自己声音(需录样本,HeyGen Voice Cloning、ElevenLabs 都支持);③外部 TTS 生成音频再导入(用豆包、剪映文本朗读生成,导入 D-ID 这类支持"音频驱动"的工具)。
多语言音色是重灾区(见避坑三)。HeyGen 和 Synthesia 的多语言是同一音色跨语言,相对自然;外部 TTS 跨语言经常变声。要发多语言版本,优先选平台原生多语言音色,别用外部 TTS 拼凑。
生成时的操作要点:
- 把脚本分段贴进工具,每段对应一个镜头,别一整段塞进去(长文本容易在中段口型漂移);
- 选好音色和语言,预览音频(听一遍语速和断句,不满意调语速参数再生成);
- 确认音频后生成视频,单段控制在 30-60 秒,超长视频按段生成再拼接(见避坑四);
- 生成完逐段检查口型和表情,明显不对的段重生成,别指望后期修口型(成本极高)。
可复制的多语言脚本适配 prompt:
把下面的中文口播脚本改写为[英文/日文]版本。
要求:
1. 不是直译,按目标语言口语习惯重写,保持口语化和短句;
2. 保持原意和三段式结构(钩子-正文-收尾);
3. 时长与中文版一致(约 60 秒,英文 130-150 词);
4. 避免文化不通的表达,本地化例子。
输出:直接给改写后的脚本,不要解释。五、后处理:字幕、剪辑与合规
数字人原生视频通常需要三步后处理:加字幕、剪辑拼接、加合规标识。
字幕:用剪映或 Whisper 自动生成字幕,校对一遍(专有名词、数字必错)。字幕样式别花哨,白字黑边或白底黑字最清楚,字号占画面宽 1/15 左右。中英双语字幕分两行,上中下英。
剪辑:多段拼接用交叉溶解,别硬切(数字人硬切比真人更跳)。镜头间可插产品图或关键信息卡片打破单调。背景音乐压到人声 -15dB 以下,别喧宾夺主。
合规标识:这是最容易被忽略但最要命的一步。多地法规要求 AI 生成内容明确标识(见避坑五)。视频画面加"AI 生成"水印或角标,描述区标注"本视频含 AI 生成内容",平台要求勾选"AI 生成"标签的务必勾。
避坑预告:合规标识不是"可选美化",是硬性要求。漏标可能被平台下架,商用场景还可能触犯当地 AI 内容法规。
六、发布:平台适配与版本管理
发布前按平台规格导出:竖版 9:16(抖音/视频号/Reels)、横版 16:9(YouTube/B 站)、方版 1:1(部分信息流)。分辨率至少 1080P,码率按平台推荐。同一脚本的多语言版本用文件名区分(如 intro_zh.mp4、intro_en.mp4),别覆盖。
发布时三件事:①描述区写清主题和要点(SEO 友好);②勾选 AI 内容标签(各平台都有);③跟踪前 24 小时数据,完播率低于 30% 多半是钩子没抓人,回去改脚本前 3 秒。
踩坑速查
坑一 形象授权踩雷。 克隆形象只能用本人或已签书面授权的模特。用网图、名人照片、他人形象训练,轻则平台封号,重则肖像权诉讼。商业项目务必留授权文件存档。
坑二 口型对不齐。 根因是配音和视频生成顺序颠倒,或长文本中段漂移。解法:先定音频再生成视频,单段控制在 30-60 秒,超长分段生成。别指望后期修口型,成本比重新生成还高。
坑三 多语言音色变声。 外部 TTS 跨语言经常换音色,同一数字人中文是女声、英文变男声。解法:优先用平台原生多语言音色(HeyGen、Synthesia 同音色跨语言),或每语言分别克隆音色。
坑四 长视频成本失控。 这类工具多按分钟或点数计费,10 分钟视频成本可能是 1 分钟的 10 倍。解法:长内容拆成短段,每段独立生成再拼接;预制 avatar 比克隆 avatar 便宜,验证阶段先用预制。
坑五 合规标识漏标。 多地法规要求 AI 生成内容显式标识。画面加"AI 生成"角标,描述区标注,平台标签勾选。商用尤其严格,发布前过一遍合规清单。
常见问题
Q1:数字人能完全替代真人出镜吗? 还不能。数字人适合口播、讲解、培训这类"信息传递"场景,情绪表达和即兴互动仍弱于真人。品牌主片、情感叙事类内容,真人出镜效果更好。数字人是降本工具,不是替代品。
Q2:克隆自己形象和声音要多少钱? 以官网为准。代表性区间:HeyGen 的 Instant Avatar 和 Voice Cloning 通常需订阅 Creator 及以上计划;D-ID 门槛较低,适合小成本验证;国内硅基智能、腾讯智影按分钟或套餐计费。各平台调价频繁,动手前查官网。
Q3:哪个工具多语言最好? Synthesia 和 HeyGen 的多语言覆盖最广(数十种语言同音色),适合企业培训全球化。D-ID 多语言支持较全但音色一致性弱于前两者。中文为主选腾讯智影或硅基智能。具体语言列表以各工具官网为准。
Q4:数字人视频会被平台限流吗? 取决于平台政策和是否标识。多数主流平台对明确标识的 AI 内容不限流,但未标识或伪装真人可能被降权。抖音、视频号、YouTube 都有 AI 内容标签,发布时务必勾选。
Q5:零基础第一次做,最短路径是什么? 注册 D-ID 或腾讯智影(门槛低、可免费试),用平台预制 avatar + 自带音色,跑通一条 30 秒讲解视频。脚本用上面的 prompt 让大模型写。先跑通流程再考虑克隆形象和多语言。
参考来源
- HeyGen 官网与定价
- D-ID 官网
- Synthesia 官网
- Colossyan 官网
- DeepBrain AI 官网
- 腾讯智影
- AI 数字人工具对比(comparegen.ai)
- 流程与功能依据各工具官方文档(2026-08,以官网实时为准)