微软 Azure TTS 神经语音怎么用?微软配音免费在线指南
直接答案
微软 Azure TTS 神经语音,就是微软 Azure AI Speech 里的神经网络发音人。浮云梦配音(fuym.cn)把它做成了不用登录的网页工具:站内收录 774 条微软神经音色、覆盖 154 个语种,其中 620 条为 GA 状态;单次能合成 5000 字,各功能每日提供免费额度,具体以站内实时显示为准。
微软 Azure AI Speech、Azure TTS、微软配音:四个词说的是同一套引擎
搜这几个词的人,多半被绕晕过。我一开始也当它们是三四个不同的产品,翻完微软的文档才发现,差别只在叫法出现的时间和人。
| 你搜到的词 | 官方名字 | 实际指什么 |
|---|---|---|
| 微软 Azure AI Speech | Azure AI Speech | 整套语音服务,文本转语音和语音识别都在里面 |
| 微软 Azure TTS | Text to Speech | AI Speech 下的合成能力,输入文字输出音频 |
| 微软 Azure 神经语音 | Neural Voices | 神经网络发音人本身,站内收录 774 条 |
| 微软配音 | 口语说法 | 用微软音色给视频、有声书配上人声这件事 |
微软现在的服务名是 Azure AI Speech,更早叫 Azure 认知服务语音(Cognitive Services Speech)。文本转语音是它下面的一项能力,英文缩写 TTS。至于「微软配音」,官方文档里查不到这个词,它是中文内容圈自己造的说法。
这四个说法的落点都是神经网络语音(Neural Voices)。它和十年前的拼接式合成是两条技术路线,听感差别一耳朵就能分出来。
神经语音和老式 TTS 差在哪
老式 TTS 靠拼接:把字切成音节,从录音库里挑音节再连起来。听感像导航播报。多音字和数字基本靠规则表硬扛,遇到人名和金额就容易翻车。
神经网络语音走的是另一条路,声调、停顿、语气一起在模型里算,拼出来的是波形本身。拿站内的晓晓(Xiaoxiao)举例,这条音色在音色数据里的采样率是 48kHz,可选风格有 20 种,从 newscast(新闻播报)到 whispering(耳语)都在列表里。这个数字是我打开站内音色数据一条条数的,不是从别处抄来的。
站内音色库共 774 条微软神经音色,覆盖 154 个语种,其中 620 条为 GA 状态;另有 108 条带 Dragon HD 标记、59 条为多语言音色,这两类与 GA 有重叠。站内推广口径写的是「140+ 语言、400+ 音色」,那个数字更保守;这里给的是把 Preview 和多语言音色一起算进去的完整清单,两个数字取自同一份音色数据。HD 是微软较新的一档,中文里的晓晓、晓辰、晓涵、云希、云扬、云野都有对应版本。
多语言音色值得单独提一句。这类音色能用同一条嗓子读多种语言,做中英混排的稿子时不用中途换人,省掉了拼接两段音频的手续。
微软配音的两条路:自己调接口,还是用现成网页
想用微软的音色配音,落到操作上只有两条路。一条是在 Azure 上开通服务、拿密钥,自己写 SSML 或用 SDK 调接口;另一条是找已经把接口封装好的网页工具。
两条路拿到的是同一批发音人。差别在流程:写代码那条自由度最高,多角色、批量、输出格式全部自己控,代价是要有开发和运维能力;网页那条省掉了账号和对接,但参数选项被封装层定了范围。
| 对比维度 | 浮云梦配音(fuym.cn) | 微软 Azure 官方 |
|---|---|---|
| 是否需注册登录 | 免登录即可用 | 需 Azure 账号与密钥 |
| 音色与语种 | 774 条神经音色 / 154 个语种 | 同一批音色,以官方语音列表为准 |
| 单次字数上限 | 5000 字 | 以官方说明为准 |
| 长文本与批量 | 批量生成单任务 10 万字 | 需自行封装异步批量接口 |
| 多角色对话 | 内置多人对话配音,逐段分配音色 | 需自行用 SSML 分配发音人 |
| 导出格式与水印 | MP3 八档码率 / WAV,无水印 | 音频格式可自行指定 |
| 附加工具链 | 语音克隆、语音转换、字幕生成与校准 | 语音识别需另接接口 |
| 上手门槛 | 打开网页输入文字 | 需要开发对接与账号配置 |
顺带说下 Edge 那条线。Edge 浏览器「大声朗读」用的是微软语音体系里的另一套音色,不用账号,但只能在浏览器里听。它的定位和上面两条路都不同,想细看可以翻 EdgeTTS 页面。
微软配音怎么用:4 步拿到 MP3
下面这四步是我在站内跑通微软中文音色的最短路径,全程不用登录。
中文音色清点:普通话 65 条,方言口音另有 6 个设置
中文是站内最厚的一档。普通话(zh-CN)下有 65 条音色,其中 54 条是 GA 状态、11 条是 Preview 状态。
| 中文相关设置 | 音色数 | 音色名 |
|---|---|---|
| 普通话 zh-CN | 65 条(GA 54 / Preview 11) | 晓晓、晓辰、晓涵、晓墨、晓伊、晓秋、晓柔、晓睿、晓双、晓悠、晓宇、晓甄、晓梦、云希、云健、云扬、云枫、云皓、云杰、云夏、云野、云泽等 |
| 粤语 yue-CN | 2 条 | 晓敏、云松 |
| 吴语 wuu-CN | 2 条 | 晓彤、云哲 |
| 广西口音 zh-CN-guangxi | 1 条(Preview) | 云奇 |
| 河南口音 zh-CN-henan | 1 条 | 云登 |
| 辽宁口音 zh-CN-liaoning | 2 条(Preview) | 晓北、云彪 |
| 陕西口音 zh-CN-shaanxi | 1 条(Preview) | 晓妮 |
| 山东口音 zh-CN-shandong | 1 条 | 云翔 |
| 四川口音 zh-CN-sichuan | 1 条(Preview) | 云希 |
| 香港 zh-HK | 3 条 | HiuMaan、WanLung、HiuGaai |
| 台湾 zh-TW | 3 条 | HsiaoChen、YunJhe、HsiaoYu |
把普通话、粤语、吴语、六种方言口音和港台两个设置加起来,中文相关的语种设置一共 11 个。这份清单可以在 语言列表和 语音列表里逐条核对,音色名与状态都以站内实时显示为准。
要提醒一句:方言音色读的是带口音的普通话,不是方言词汇。四川那条念「摆龙门阵」会不会走音,我不敢打包票,正式用之前建议先把稿子里的方言词试听一遍。
不同活儿该挑哪条嗓子
| 做的东西 | 先试哪条 | 理由 |
|---|---|---|
| 短视频口播 | 晓晓、云希 | 节奏快,风格多,配字幕刚好卡时长 |
| 有声书 | 云健、云扬 | 男声底子稳,长文本听久了不累 |
| 方言内容 | 云登(河南)、云翔(山东) | 这两条是 GA 状态,比 Preview 口音更稳 |
| 粤语内容 | 晓敏、云松 | 粤语专用设置,不是普通话带口音 |
| 中英混排 | 晓辰 多语言、云逸 多语言 | 一条音色读两种语言,不用中途换人 |
做长文有声书的,直接走批量;做对话剧情的,走多人对话配音把每个角色分开配。真要一句话推荐:短视频选晓晓,有声书选云健或云扬,方言内容优先挑 GA 那两条。
我没搞明白的地方
这页不是软文,有几处得说清楚。
我一开始以为方言音色能和普通话一样稳,实测四川云希那条语调偏平,Preview 状态和 GA 的差距是真实存在的,不是心理作用。辽宁的晓北和云彪也是 Preview。
音色名字长也是个小麻烦。HD 音色在列表里叫 Xiaoxiao Dragon HD Flash Latest 这种全名,下拉框一眼扫不完,我找了半天才反应过来应该先按语言筛,再挑音色。
还有风格。不是每条音色都有风格可选,小语种音色的风格下拉常常是空的。那不是页面坏了,是这条音色本身没带风格列表。
老实交代一句边界:这页的中文音色我逐条点开听过,日韩、阿语那些只核对了名字和状态,没逐条试听,不敢替它们下结论。
常见问题
微软配音免费吗?
+微软 Azure AI Speech 本身要开通 Azure 账号、拿到密钥才能调用。浮云梦配音(fuym.cn)把同一批微软神经音色做成了网页工具,免登录就能输入文字导出 MP3,各功能每日提供免费额度,具体以站内实时显示为准。
微软 Azure TTS 和微软 Azure AI Speech 是一回事吗?
+是。Azure AI Speech 是服务名,文本转语音(TTS)是它下面的一项能力,更早的名字叫 Azure 认知服务语音。搜到的 Azure TTS、Azure 神经语音、微软配音,说的是同一套神经网络语音合成。
微软 Azure 神经语音支持中文方言吗?
+支持。中文相关语种设置一共 11 个:普通话之外还有粤语(晓敏、云松)、吴语(晓彤、云哲),以及广西(云奇)、河南(云登)、辽宁(晓北、云彪)、陕西(晓妮)、山东(云翔)、四川(云希)六种方言口音,其中部分标为 Preview 状态。
微软配音单次能读多少字?
+网页端单次上限 5000 字,超了会提示改用批量生成;批量生成单任务最高 10 万字,适合有声书、课程这类长文本。需要按角色分音色就用多人对话配音。
微软 Azure 神经语音生成的音频能商用吗?
+站内导出的音频无水印、没有片头片尾宣传语音,MP3 和 WAV 都能直接下载。商用场景的使用与授权细节以站内说明为准。
Azure 神经语音有什么做不到的?
+方言和 Preview 音色的稳定度不如普通话 GA 音色,四川、辽宁这类口音偶尔语调偏平。情绪风格也不是每条音色都有,晓晓有 20 个风格,很多小语种音色一个都没有,风格下拉是空的。
数据来源
页内数字分两类来源。站内部分取自音色库文件与接口限制配置,用脚本统计,统计日期 2026-10-03;微软侧的名称与服务口径以 Microsoft Learn 官方文档为准,具体音色清单与状态请以官方语音列表和站内实时显示为准。
- 微软 Learn:Azure AI Speech 文本转语音文档. https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/text-to-speech. 访问日期:2026-10-03.
- 微软 Learn:Azure 语音服务的语言和语音支持(发音人清单). https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/language-support?tabs=tts. 访问日期:2026-10-03.
- 微软 Learn:Azure AI Speech 服务概述. https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/overview. 访问日期:2026-10-03.
- 浮云梦配音站内数据:语音列表 https://fuym.cn/voice-list.html、语言列表 https://fuym.cn/languages.html、常见问题. 统计日期:2026-10-03.