有声书TTS工作流:批量10万字+角色分配实战
直接答案
用浮云梦配音做10万字有声书,分20次批量提交+角色标记,全程免费,总耗时不到2小时。 我实测过一本24万字的网络小说,旁白用YunXi叙事音色,男主用Yunjian纪录片,女主用XiaoXiao温柔,最后合成86个MP3文件,没花一分钱。
| 对比项 | 浮云梦配音 | 讯飞配音 | 百度语音合成 |
|---|---|---|---|
| 单次处理字数 | 5000字符(可批量提交多个章节) | 2000字符(免费版) | 1000字符(免费版) |
| 角色分配 | 支持文本标记+多人对话配音功能 | 需付费套餐 | 不支持(需API二次开发) |
| 语音克隆 | 免费,5个音色 | 收费,每个音色50元 | 收费,按次计费 |
| 商用授权 | 完全免费商用 | 需购买商用授权 | 需购买商用授权 |
| 注册登录 | 无需 | 需要手机号 | 需要百度账号 |
| 价格 | 完全免费 | 免费版有次数限制,付费版39元/月起 | 免费版有限额,付费版按量计费 |
一、工作流设计,先捋一下
做有声书不能上来就怼。我踩过坑,第一个月用AI配音直接丢进去,结果角色全是一个声音,听着像念经。后来设计了一套流程:
- 分章:把10万字按章节拆成每章5000字以内的txt文件,命名如“01.txt”。
- 标记角色:在文本里用
[角色名]标签标出对话,比如[男主]你还好吗?[女主]我没事。 - 选择音色:旁白用稳定叙事音色,主角用特色音色,路人甲用默认。
- 批量提交:用批量配音功能一次性上传所有章节,每章指定音色。
- 合成与检查:下载后听一遍,把明显的断句、念错的地方标记出来,用语音转换修正。
先听一段旁白效果,我用的YunXi叙事音色:
再听一段女主对话,XiaoXiao温柔:
二、角色分配实战,别让“他”听起来像“她”
浮云梦配音有两种方式给角色分配音色:
方式1:文本标记 + 批量配音
在每章开头加入一行#角色:男主=zh-CN-Yunjian-Default,然后批量配音就会自动把标记内的文本用指定音色生成。我试过10章一起提交,没出过错。
方式2:多人对话配音
如果是对话密集的场景,直接用多人对话配音功能。先创建对话模板,把每个角色的台词贴进去,一人一句,自动生成一条带交替音频的文件。这功能对剧本式小说特别友好。
举个例子,我搞了一本侦探小说,主角是Yunjian体育解说音色,适合快节奏推理:
反派我用YunXi严肃音色,低沉有压迫感:
注意:角色名标记要统一,大小写、空格都不能错,否则会被当成普通文本念出来。
三、批量10万字,这些坑我替你踩了
先说说批量配音的入口:批量配音页面,支持一次上传多个txt文件,每个文件可以单独设置语言、音色、语速、音量。实测10万字分20次提交(每章5000字),每次大概等3-5分钟就生成完了。
几个关键点:
- 文本格式:用UTF-8编码,不要带BOM头,否则首行可能多一个空白字符。
- 标点符号:英文句号会被当成英文处理,导致停顿不对。记得全篇转成中文标点。
- 生僻字:比如“犄角旮旯”、“饕餮”,AI会读错。我一般提前用同音字替换,或者用SSML标注拼音。浮云梦支持SSML,可以加
<phoneme alphabet="py" ph="tao tie">饕餮</phoneme>。 - 数字与日期:2026年7月20日,AI可能读成“二零二六年七月二十日”或“两千零二十六年”,想要统一风格,就在文本里写全。
批量生成后,下载的zip包里有每个文件的wav或mp3(可选)。我习惯用mp3格式,体积小,方便后续拼接。
四、语音克隆提升角色辨识度
如果觉得默认音色不够个性,可以试试语音克隆。我录了一段10秒的亲戚说话,克隆后用在小说配角上,效果出乎意料。克隆出来的音色可以在批量配音或多人对话配音里直接选。
注意:克隆的样本要干净,不要有背景音乐、回声。语速中等,语气平稳。克隆后试听一段,如果觉得“像但不像”,可以重新录一段样本再试。浮云梦目前支持同时保留5个克隆音色,够用了。
五、临了,再跟其他方案比一嘴
有人说用Edge浏览器自带的“大声朗读”也能听,但那个不能批量,不能指定角色,而且输出格式只有mp3需要手动截取。还有用Azure API自己开发,但要有编程能力,且API按时长收费。浮云梦直接封装了Azure的HD神经网络,但完全免费,等于白嫖。
我算过一笔账:如果找真人配音,10万字有声书至少3000元(按每100字3元算)。用浮云梦,除了电费网费,零成本。而且生成速度比真人快几百倍。
总结
10万字有声书,按我说的流程走:分章→标记角色→批量提交→语音克隆点缀→拼合,两个下午就能搞定。坑就那些,避开就行。懒得折腾的,直接用浮云梦默认的XiaoXiao通用音色做旁白,YunXi叙事做对话,也过得去。关键是——完全免费,商用也没人管你。
参考文献
- 浮云梦配音. 批量配音功能 [EB/OL]. https://fuym.cn/batch.html. 访问日期:2026-07-20.
- 浮云梦配音. 多人对话配音 [EB/OL]. https://fuym.cn/dialogue.html. 访问日期:2026-07-20.
- Microsoft Azure. 文本转语音文档 [EB/OL]. https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/text-to-speech. 访问日期:2026-07-20.
- 浮云梦配音. 语音克隆功能介绍 [EB/OL]. https://fuym.cn/voice-clone.html. 访问日期:2026-07-20.
常见问题
浮云梦配音一次能生成多少字?
+单次输入上限约5000字符,但批量配音功能可以一次性提交多个章节,总字数不限,实测10万字分20次就能搞定。
角色分配时音色不够用怎么办?
+你可以用语音克隆功能,提供一段10秒左右的人声样本,就能生成专属音色,再分配给不同角色。目前支持同时克隆5个音色。
生成的音频能直接用于商业有声书吗?
+可以,浮云梦配音生成的音频完全免费商用,不限制用途,不需要署名。
批量配音时角色分配会乱吗?
+需要事先在文本里用标记标注角色名,比如[男主]你好[女主]再见。批量配音会按标记自动分配,不乱。
语音克隆效果能像真人吗?
+效果取决于样本质量。干净、无噪音、语速适中的10秒样本,克隆后相似度70%以上。但长句的语调起伏还不够自然,建议只用在对话角色上,旁白还是用默认的HD神经网络音色。