实战 SOP
实战 SOP

AI 播客制作全流程 SOP:从选题到分发一条龙

一人不录音不买设备也能做播客--选题、脚本、TTS 合成、润色、剪辑、分发六步全流程,附 3 个可复制 Prompt、踩坑记录和 FAQ。

发布于 2026年7月31日7 分钟阅读
<!-- ai-podcast-production-sop | sop | AI 播客制作全流程 SOP:从选题到分发一条龙 -->

做播客最劝退的不是没内容写,是"录不出来"--没设备、没安静环境、对着话筒念稿舌头打结、念完一听全是"嗯啊"废话。AI 把这道门槛基本铲平了:脚本交给大模型写,配音交给 TTS 合成,剪辑对着文字删废话,分发就一个 RSS 链接。一个人不露脸、不录音、不买设备,也能跑出一档周更播客。

这篇走一遍从选题到分发的全流程:选题、脚本、TTS 合成、润色校听、剪辑、分发六步,每步给真实工具和可复制 Prompt,文末附踩坑记录和 FAQ。工具定价和能力截至 2026-07-31,以官方为准--TTS 和剪辑工具调价很勤,动手前先去官网核一眼。


一、思路:AI 播客全流程一览

AI 播客的核心是把"录"换成"生成 + 剪"。全流程六步,每步都有对应工具:

环节做什么主流工具
选题AI 找题、验受众大模型 + 小宇宙热度
脚本写能念的口语稿大模型(带 Prompt)
合成TTS 配音 / 声音克隆ElevenLabs、豆包语音合成、即梦配音
润色口语化、防念错大模型 + 手动校听
剪辑去废话、配字幕、出 shownotesDescript、剪映、通义听悟
分发上架各播客平台小宇宙 + Apple Podcasts + Spotify

选型一句话:英文/多语/声音克隆质量要高,上 ElevenLabs;中文自然度 + API 价格,豆包语音合成(火山引擎)更划算;想一站式不花钱,剪映文本朗读 + 智能剪口播够走通;要对着文字剪音频像剪文档,用 Descript。


二、选题:用 AI 锁定选题

选题别拍脑袋。让大模型基于你的播客定位批量给题,再挑一个痛点最实、最容易讲透的。关键是给 AI 喂定位和受众,否则它给的都是空泛标题。

text
你是播客选题策划。我的播客定位是「[填定位,如 AI 工具实战]」,受众是 [填受众,如 想用 AI 提效的职场人]。
基于关键词「[填关键词]」给我 5 个选题,每个含:
1. 标题(≤20 字,口语化、有钩子)
2. 一句话痛点(听众为什么非听不可)
3. 大纲(3-5 个要点)
4. 建议时长(分钟)
5. 一句开场白示例
最后点名哪个最容易出爆款并说理由。

挑题标准:痛点具体(不是"AI 很重要"这种空话)、你能在一期内讲透、有可执行结论。三占其二就定。


三、脚本:写出能念的口语稿

播客脚本最大的坑是写成"文章"--书面句太长,TTS 念出来拗口、断句怪。脚本要短句、要口语、要留语气位。

text
你是播客脚本编辑。基于选题「[填选题]」,写一档单人口播脚本,时长约 [8] 分钟。要求:
- 纯口语,短句为主,每句不超过 25 字,念着不拗口
- 开场 30 秒抓人(提问 / 反差 / 故事起手)
- 中间分 3 段讲透,段间用过渡句衔接
- 结尾给一个可执行动作 + 下期预告
- 标注 [停顿][强调][轻笑] 等语气提示,方便 TTS 调情绪
- 禁书面化、禁"首先其次最后"、禁小标题
输出格式:[开场]…[段一]…[段二]…[段三]…[结尾]

写完自己默念一遍,哪里卡壳就改哪里--这步省了,TTS 合成后会加倍暴露。


四、合成:TTS 配音与声音克隆

脚本定稿进 TTS。三款工具定位不同,按需选:

  • ElevenLabs(国际首选):声音克隆和情绪表达最强。免费版每月约 1 万字符额度(不可商用、需署名);Starter $5/月(3 万字符,含即时克隆 + 商用权);Creator $22/月(10 万字符,专业克隆)。采用 credit 制,约 1 credit ≈ 2 字符。
  • 豆包语音合成(火山引擎):中文 TTS + 高拟真声音克隆,能智能预测情绪语调,按 API 调用计费,新用户有免费额度,适合中文播客量产。需申请 appid/token/secret_key。
  • 即梦配音(字节即梦 AI):偏视频配音--视频 3.5 Pro 支持画面+声音同步生成、口型对齐,适合做带画面的播客片段;纯音频播客不首选。

操作要点:文本别一次整篇丢进去,分段生成(每段≤30 秒)再拼接,长文容易停顿怪、尾音飘、情绪跑偏。品牌名、英文缩写、数字容易念错,用工具的发音词典或 SSML 标注纠正,没有就标 [读作 xxx]。

想克隆自己的声音:ElevenLabs Professional 克隆和 Descript Overdub 都要约 10 分钟干净样本(无底噪、单人、自然语速),样本脏克隆出来就发糊。


五、润色与校听:让 AI 念得像真人

TTS 出来的初稿九成有"机器味"--停顿位置怪、书面的"因此/此外"念出来生硬、品牌名读错。这步专门修这些。

text
你是播客口语化润色编辑。把下面片段改成"能直接念、像真人说话"的版本:
[粘贴片段]
规则:
- 书面词换口语("因此"->"所以","此外"->"还有","然而"->"不过")
- 长句拆短,每句一口气念得完
- 数字 / 英文品牌名 / 缩写后加 [读作 xxx] 防念错
- 加 2-3 处 [停顿] 和语气词("对吧""你想想")让节奏自然
- 保留原意,不加新观点
输出:润色后全文 + 一句改了哪里。

润色完必须戴上耳机逐段校听,别只看文字。重点查:数字读法、品牌名、专有名词、停顿是否自然。发现问题回脚本改,再重新合成那一段--别整篇重来。


六、剪辑:Descript / 剪映 + 出 shownotes

剪辑不是加特效,是去废话、配字幕、出节目说明。

  • Descript(文字剪辑):把音频转成文字稿,你删文字 = 删音频,像改文档一样剪。Creator 约 $24/月,含 Overdub(克隆你自己声音补错词)、filler 去除(一键删"嗯啊")、studio sound(降噪提亮)。英文播客首选。
  • 剪映(免费一站式):文本朗读(选热门音色或音色克隆)+ 智能剪口播(AI 识别无效词、对着文本剪)+ 人声分离 + 音频降噪 + 响度统一。中文播客零成本跑通全链路。
  • 通义听悟(阿里):录音转文字 0.6 元/小时,大模型能力(摘要/章节/思维导图)0.22 元/小时起、多个能力叠加计费。用它把成片转写出 shownotes 和章节时间戳,分发时贴上。

剪辑顺序:先降噪 + 响度统一打底 -> 删废话和口误 -> 加片头片尾和过场 -> 导出 MP3 128kbps(30 分钟约 30MB,平台都吃)-> 通义听悟转 shownotes。


七、分发:小宇宙 + Apple Podcasts + Spotify

国内播客分发就一套机制:托管平台生成 RSS,再提交到各目录

  1. 小宇宙托管:在主播后台建节目,上传音频 + 封面(3000×3000 正方形 PNG)+ 节目信息,小宇宙生成 RSS 链接(节目设置 -> 多平台同步)。国内首选,免费。
  2. Apple Podcasts:用 Apple ID 登录 podcasters.apple.com(Apple Podcasts Connect),"添加新节目"粘贴 RSS,提交审核,1-5 个工作日。这是覆盖最广的目录。
  3. Spotify:到 Spotify for Creators(podcasters.spotify.com)同样粘 RSS 认领节目,或用托管平台的直连按钮。

关键坑:封面图必须正方形、高分辨率(3000×3000 通过率最高);RSS 里节目描述、分类、作者字段不能空,否则 Apple 审核被拒;每期发布后在托管平台更新一次,三个平台自动同步,不用重复传。


八、踩坑记录

坑一:整篇稿子一次丢给 TTS。 长文合成出来停顿怪、情绪跑偏、尾音飘。解法:按段切,每段≤30 秒,逐段生成再拼接,还能单段重做。

坑二:品牌名 / 数字 / 缩写念错。 ElevenLabs 念品牌名重音、数字读法常错。用发音词典或 SSML 标注,没有就标 [读作 xxx] 自己后期知道怎么改。

坑三:声音克隆样本太短或有底噪。 克隆出来发糊、不像。样本要 10 分钟以上、干净、单人、自然语速。没专业设备就在衣柜里录,衣物能压回声。

坑四:拿即梦配音当纯 TTS 用。 即梦强项是视频+声音同步(口型对齐),单独导音频反而绕。纯音频播客用 ElevenLabs / 豆包,即梦留给做带画面短片。

坑五:Apple Podcasts 封面被拒。 九成是图非正方形或分辨率不够。用 3000×3000 正方形 PNG,且 RSS 里描述/分类/作者填全,再重新提交。

坑六:免费版 TTS 拿来商用。 ElevenLabs 免费版不可商用(需署名),商用至少 Starter 起步。涉及商用逐个查工具授权,别想当然。

坑七:只发音频不填 shownotes。 分发到 Apple 后没节目说明,听众划走。用通义听悟转写出 shownotes + 章节时间戳贴上。


九、常见问题 FAQ

Q1:一个人没设备没预算,能做播客吗? 能。脚本大模型写、配音用剪映文本朗读或 ElevenLabs 免费额度、剪辑剪映、分发小宇宙,全程零录音零设备。但声音克隆和商用要付费。

Q2:ElevenLabs 和豆包语音合成怎么选? 英文 / 多语 / 克隆自己声音且要高质量,选 ElevenLabs;中文自然度 + 大量 API 调用,豆包(火山引擎)按量计费更划算。中文播客优先豆包试水。

Q3:AI 配音的播客听众会划走吗? 高拟真 TTS(ElevenLabs / 豆包高拟真克隆)听众基本无感;纯机械音会被秒划。建议在节目里标注"AI 辅助配音",自然度够就不影响留存。

Q4:Apple Podcasts 提交后被拒怎么办? 多半是封面图(非正方形 / 分辨率低)或 RSS 缺字段(描述/分类/作者空)。回小宇宙后台补全,图换 3000×3000 正方形,重新提交即可。

Q5:每期音频文件多大、什么格式合适? 导出 MP3、128kbps,30 分钟约 30MB。小宇宙 / Apple / Spotify 都接受 MP3,别传 WAV(太大上传慢,平台也会再压一遍)。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-31

常见问题

一个人没设备没预算,能做播客吗?
能。脚本大模型写、配音用剪映文本朗读或 ElevenLabs 免费额度、剪辑剪映、分发小宇宙,全程零录音零设备。但声音克隆和商用要付费。
ElevenLabs 和豆包语音合成怎么选?
英文 / 多语 / 克隆自己声音且要高质量,选 ElevenLabs;中文自然度 + 大量 API 调用,豆包(火山引擎)按量计费更划算。中文播客优先豆包试水。
AI 配音的播客听众会划走吗?
高拟真 TTS(ElevenLabs / 豆包高拟真克隆)听众基本无感;纯机械音会被秒划。建议在节目里标注"AI 辅助配音",自然度够就不影响留存。
Apple Podcasts 提交后被拒怎么办?
多半是封面图(非正方形 / 分辨率低)或 RSS 缺字段(描述/分类/作者空)。回小宇宙后台补全,图换 3000×3000 正方形,重新提交即可。
每期音频文件多大、什么格式合适?
导出 MP3、128kbps,30 分钟约 30MB。小宇宙 / Apple / Spotify 都接受 MP3,别传 WAV(太大上传慢,平台也会再压一遍)。

相关文章