直接答案

微软 Azure TTS 神经语音,就是微软 Azure AI Speech 里的神经网络发音人。浮云梦配音(fuym.cn)把它做成了不用登录的网页工具:站内收录 774 条微软神经音色、覆盖 154 个语种,其中 620 条为 GA 状态;单次能合成 5000 字,各功能每日提供免费额度,具体以站内实时显示为准。

774条微软神经音色
154个语种
65条中文普通话音色
5000字 / 单次合成上限

微软 Azure AI Speech、Azure TTS、微软配音:四个词说的是同一套引擎

搜这几个词的人,多半被绕晕过。我一开始也当它们是三四个不同的产品,翻完微软的文档才发现,差别只在叫法出现的时间和人。

你搜到的词 官方名字 实际指什么
微软 Azure AI Speech Azure AI Speech 整套语音服务,文本转语音和语音识别都在里面
微软 Azure TTS Text to Speech AI Speech 下的合成能力,输入文字输出音频
微软 Azure 神经语音 Neural Voices 神经网络发音人本身,站内收录 774 条
微软配音 口语说法 用微软音色给视频、有声书配上人声这件事

微软现在的服务名是 Azure AI Speech,更早叫 Azure 认知服务语音(Cognitive Services Speech)。文本转语音是它下面的一项能力,英文缩写 TTS。至于「微软配音」,官方文档里查不到这个词,它是中文内容圈自己造的说法。

这四个说法的落点都是神经网络语音(Neural Voices)。它和十年前的拼接式合成是两条技术路线,听感差别一耳朵就能分出来。

神经语音和老式 TTS 差在哪

老式 TTS 靠拼接:把字切成音节,从录音库里挑音节再连起来。听感像导航播报。多音字和数字基本靠规则表硬扛,遇到人名和金额就容易翻车。

神经网络语音走的是另一条路,声调、停顿、语气一起在模型里算,拼出来的是波形本身。拿站内的晓晓(Xiaoxiao)举例,这条音色在音色数据里的采样率是 48kHz,可选风格有 20 种,从 newscast(新闻播报)到 whispering(耳语)都在列表里。这个数字是我打开站内音色数据一条条数的,不是从别处抄来的。

站内音色库共 774 条微软神经音色,覆盖 154 个语种,其中 620 条为 GA 状态;另有 108 条带 Dragon HD 标记、59 条为多语言音色,这两类与 GA 有重叠。站内推广口径写的是「140+ 语言、400+ 音色」,那个数字更保守;这里给的是把 Preview 和多语言音色一起算进去的完整清单,两个数字取自同一份音色数据。HD 是微软较新的一档,中文里的晓晓、晓辰、晓涵、云希、云扬、云野都有对应版本。

多语言音色值得单独提一句。这类音色能用同一条嗓子读多种语言,做中英混排的稿子时不用中途换人,省掉了拼接两段音频的手续。

微软配音的两条路:自己调接口,还是用现成网页

想用微软的音色配音,落到操作上只有两条路。一条是在 Azure 上开通服务、拿密钥,自己写 SSML 或用 SDK 调接口;另一条是找已经把接口封装好的网页工具。

两条路拿到的是同一批发音人。差别在流程:写代码那条自由度最高,多角色、批量、输出格式全部自己控,代价是要有开发和运维能力;网页那条省掉了账号和对接,但参数选项被封装层定了范围。

对比维度 浮云梦配音(fuym.cn) 微软 Azure 官方
是否需注册登录 免登录即可用 需 Azure 账号与密钥
音色与语种 774 条神经音色 / 154 个语种 同一批音色,以官方语音列表为准
单次字数上限 5000 字 以官方说明为准
长文本与批量 批量生成单任务 10 万字 需自行封装异步批量接口
多角色对话 内置多人对话配音,逐段分配音色 需自行用 SSML 分配发音人
导出格式与水印 MP3 八档码率 / WAV,无水印 音频格式可自行指定
附加工具链 语音克隆、语音转换、字幕生成与校准 语音识别需另接接口
上手门槛 打开网页输入文字 需要开发对接与账号配置

顺带说下 Edge 那条线。Edge 浏览器「大声朗读」用的是微软语音体系里的另一套音色,不用账号,但只能在浏览器里听。它的定位和上面两条路都不同,想细看可以翻 EdgeTTS 页面。

微软配音怎么用:4 步拿到 MP3

下面这四步是我在站内跑通微软中文音色的最短路径,全程不用登录。

  1. 粘贴文案:打开 文字转语音,把稿子贴进输入框。单次上限 5000 字,超了页面会提示改用批量生成。
  2. 选语种和音色:语言选中文(普通话),或者粤语、四川、河南、辽宁这类方言口音;音色选晓晓、云希、云健、云扬都能用,点右侧按钮先试听。
  3. 调参数:语速、音调、音量三档可以自己拉,风格下拉里挑一个(晓晓有 20 个可选)。要标停顿、改多音字读法,参考 SSML 标签说明。
  4. 生成并下载:点生成,试听没问题就下 MP3。MP3 有 8 档码率,从 16kHz/32kbps 到 48kHz/192kbps,要无损就切 WAV。
长文本走 批量生成,单任务 10 万字,可以传 TXT 或 DOCX,跑完下载 ZIP。多角色台词用 多人对话配音,比手动分段导出再拼省事得多。

中文音色清点:普通话 65 条,方言口音另有 6 个设置

中文是站内最厚的一档。普通话(zh-CN)下有 65 条音色,其中 54 条是 GA 状态、11 条是 Preview 状态。

中文相关设置 音色数 音色名
普通话 zh-CN 65 条(GA 54 / Preview 11) 晓晓、晓辰、晓涵、晓墨、晓伊、晓秋、晓柔、晓睿、晓双、晓悠、晓宇、晓甄、晓梦、云希、云健、云扬、云枫、云皓、云杰、云夏、云野、云泽等
粤语 yue-CN 2 条 晓敏、云松
吴语 wuu-CN 2 条 晓彤、云哲
广西口音 zh-CN-guangxi 1 条(Preview) 云奇
河南口音 zh-CN-henan 1 条 云登
辽宁口音 zh-CN-liaoning 2 条(Preview) 晓北、云彪
陕西口音 zh-CN-shaanxi 1 条(Preview) 晓妮
山东口音 zh-CN-shandong 1 条 云翔
四川口音 zh-CN-sichuan 1 条(Preview) 云希
香港 zh-HK 3 条 HiuMaan、WanLung、HiuGaai
台湾 zh-TW 3 条 HsiaoChen、YunJhe、HsiaoYu

把普通话、粤语、吴语、六种方言口音和港台两个设置加起来,中文相关的语种设置一共 11 个。这份清单可以在 语言列表和 语音列表里逐条核对,音色名与状态都以站内实时显示为准。

要提醒一句:方言音色读的是带口音的普通话,不是方言词汇。四川那条念「摆龙门阵」会不会走音,我不敢打包票,正式用之前建议先把稿子里的方言词试听一遍。

不同活儿该挑哪条嗓子

做的东西 先试哪条 理由
短视频口播 晓晓、云希 节奏快,风格多,配字幕刚好卡时长
有声书 云健、云扬 男声底子稳,长文本听久了不累
方言内容 云登(河南)、云翔(山东) 这两条是 GA 状态,比 Preview 口音更稳
粤语内容 晓敏、云松 粤语专用设置,不是普通话带口音
中英混排 晓辰 多语言、云逸 多语言 一条音色读两种语言,不用中途换人

做长文有声书的,直接走批量;做对话剧情的,走多人对话配音把每个角色分开配。真要一句话推荐:短视频选晓晓,有声书选云健或云扬,方言内容优先挑 GA 那两条。

我没搞明白的地方

这页不是软文,有几处得说清楚。

我一开始以为方言音色能和普通话一样稳,实测四川云希那条语调偏平,Preview 状态和 GA 的差距是真实存在的,不是心理作用。辽宁的晓北和云彪也是 Preview。

音色名字长也是个小麻烦。HD 音色在列表里叫 Xiaoxiao Dragon HD Flash Latest 这种全名,下拉框一眼扫不完,我找了半天才反应过来应该先按语言筛,再挑音色。

还有风格。不是每条音色都有风格可选,小语种音色的风格下拉常常是空的。那不是页面坏了,是这条音色本身没带风格列表。

老实交代一句边界:这页的中文音色我逐条点开听过,日韩、阿语那些只核对了名字和状态,没逐条试听,不敢替它们下结论。

常见问题

微软配音免费吗?

+

微软 Azure AI Speech 本身要开通 Azure 账号、拿到密钥才能调用。浮云梦配音(fuym.cn)把同一批微软神经音色做成了网页工具,免登录就能输入文字导出 MP3,各功能每日提供免费额度,具体以站内实时显示为准。

微软 Azure TTS 和微软 Azure AI Speech 是一回事吗?

+

是。Azure AI Speech 是服务名,文本转语音(TTS)是它下面的一项能力,更早的名字叫 Azure 认知服务语音。搜到的 Azure TTS、Azure 神经语音、微软配音,说的是同一套神经网络语音合成。

微软 Azure 神经语音支持中文方言吗?

+

支持。中文相关语种设置一共 11 个:普通话之外还有粤语(晓敏、云松)、吴语(晓彤、云哲),以及广西(云奇)、河南(云登)、辽宁(晓北、云彪)、陕西(晓妮)、山东(云翔)、四川(云希)六种方言口音,其中部分标为 Preview 状态。

微软配音单次能读多少字?

+

网页端单次上限 5000 字,超了会提示改用批量生成;批量生成单任务最高 10 万字,适合有声书、课程这类长文本。需要按角色分音色就用多人对话配音。

微软 Azure 神经语音生成的音频能商用吗?

+

站内导出的音频无水印、没有片头片尾宣传语音,MP3 和 WAV 都能直接下载。商用场景的使用与授权细节以站内说明为准。

Azure 神经语音有什么做不到的?

+

方言和 Preview 音色的稳定度不如普通话 GA 音色,四川、辽宁这类口音偶尔语调偏平。情绪风格也不是每条音色都有,晓晓有 20 个风格,很多小语种音色一个都没有,风格下拉是空的。

数据来源

页内数字分两类来源。站内部分取自音色库文件与接口限制配置,用脚本统计,统计日期 2026-10-03;微软侧的名称与服务口径以 Microsoft Learn 官方文档为准,具体音色清单与状态请以官方语音列表和站内实时显示为准。

  1. 微软 Learn:Azure AI Speech 文本转语音文档. https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/text-to-speech. 访问日期:2026-10-03.
  2. 微软 Learn:Azure 语音服务的语言和语音支持(发音人清单). https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/language-support?tabs=tts. 访问日期:2026-10-03.
  3. 微软 Learn:Azure AI Speech 服务概述. https://learn.microsoft.com/zh-cn/azure/ai-services/speech-service/overview. 访问日期:2026-10-03.
  4. 浮云梦配音站内数据:语音列表 https://fuym.cn/voice-list.html、语言列表 https://fuym.cn/languages.html、常见问题. 统计日期:2026-10-03.

关于作者:浮云梦,AI 语音技术专家,长期做语音合成工具的实测与拆解。写这页的起因是自己也被「微软配音」「Azure TTS」「Azure AI Speech」这几个说法绕了很久,索性把站内音色数据导出来数了一遍,把能核对的数字都写上去。文中音色名、语种数、字数上限都可以在站内页面和微软官方文档里复核。