文字转语音
输入文本 → 选择语言和音色 → 点击生成,三步完成配音。支持语速、音调、音量参数调节,部分语音支持情感风格(如温柔、愤怒、悲伤)和角色扮演效果。HD 语音模型可自动识别文本情绪,实时调整语调。支持上传 TXT/DOCX 文件和 SRT 字幕文件配音,支持插入停顿和背景音乐。
中文(普通话)文字转语音 · 54 个普通话音色,情感风格可选
普通话配音音色最全的地方在这里:54 个正式可用的普通话神经网络音色,从 Xiaoxiao Dragon HD Flash Latest(女声)、Xiaoxiao2 Dragon HD Flash Latest(女声)、Xiaochen Dragon HD Latest(女声)等 54 个到晓晓、云扬,欢快、悲伤、温柔、严肃、新闻播报这类情感风格都能选,同一个音色换风格就是另一种语气。粘贴中文点生成,MP3 直接下载,不用录音、不用装软件、不用注册。
短视频口播、课程课件、有声书、企业宣传、广告配音、导航与客服提示都能用。多音字怕读错可以用多音字检测,念不顺可以先用 AI 润色顺一遍;语速 0.5x-2x、音调 ±50% 可调,长文一次 10 万字走批量生成。
普通话文字转语音工具:内置 54 个普通话神经网络音色(Xiaoxiao Dragon HD Flash Latest(女声)、Xiaoxiao2 Dragon HD Flash Latest(女声)、Xiaochen Dragon HD Latest(女声)等 54 个等),支持欢快、悲伤、温柔、新闻播报等情感风格切换,单次最多 5000 字符,超长文稿走批量生成、单任务 10 万字,输出无水印 MP3。
把下面这段中文粘进输入框,从 Xiaoxiao Dragon HD Flash Latest(女声)、Xiaoxiao2 Dragon HD Flash Latest(女声)、Xiaochen Dragon HD Latest(女声)等 54 个里挑一个音色试听,再对比换成“欢快”“悲伤”风格的差别:
欢迎使用浮云梦配音,把这段文字粘进输入框,选好音色点一下就能生成语音。
推荐音色:Xiaoxiao Dragon HD Flash Latest(女声)/ Xiaoxiao2 Dragon HD Flash Latest(女声)等
输入文本 → 选择语言和音色 → 点击生成,三步完成配音。支持语速、音调、音量参数调节,部分语音支持情感风格(如温柔、愤怒、悲伤)和角色扮演效果。HD 语音模型可自动识别文本情绪,实时调整语调。支持上传 TXT/DOCX 文件和 SRT 字幕文件配音,支持插入停顿和背景音乐。
按段落分配角色,每个角色配一个音色,系统自动切换生成完整对话音频。做中文广播剧、双人中文访谈、教学对话演练都合适。
每个任务支持最多 10 万字的大规模文本转换,系统采用异步批处理机制,不会实时返回音频。可一次提交多个任务,后台同步执行生成,提交后可关闭页面,稍后返回查看任务状态并下载已完成的音频。中文有声书、整套听力素材走这个入口最省事。
上传一段已有音频,把它换成系统里的目标音色,原来的语速、停顿和语气保留下来。已经录好的中文口播想换音色、或者想给同一段中文配多个版本,用这个不用重新录。
生成配音音频的同时输出对应字幕文件,可直接导入剪映、PR 等剪辑软件。中文视频想上中文字幕或做双语字幕,在这里一次拿到音频和 SRT。
独立的时间轴工具:调整偏移、合并相邻字幕、拆分超长字幕、SRT/ASS/VTT 互转。字幕和音频差半秒这类问题,在这里改比重新生成快。
上传 5-30 秒清晰人声样本(MP3/WAV),系统学习这段声音的特征后用它朗读你写的中文稿,免费单次 500 字(会员 1000 字)。品牌出镜人不想每次录音,或者想让固定声音贯穿一系列视频,可以用它。
用文字描述想要的音色(比如“成熟男声、语速偏慢、适合企业宣传”),系统据此生成专属音色;也能基于上传样本做克隆。系统自带音色都不满意时,这条路比找配音更省事。
zh-CN 语种下提供 Xiaoxiao Dragon HD Flash Latest(女声)、Xiaoxiao2 Dragon HD Flash Latest(女声)、Xiaochen Dragon HD Latest(女声)、Yunxiao Dragon HD Flash Latest(男声)等,共 54 个神经网络音色,单次可转 5000 字符,长文本走批量生成、单任务上限 10 万字。下表是中文(普通话)语音合成的参数口径,界面上的可选项与下表一致。
| 指标 | 数据 |
|---|---|
| 语言名称 | 中文 (普通话) · Chinese (Mandarin, Simplified) |
| 语言代码 | zh-CN |
| 可用音色 | Xiaoxiao Dragon HD Flash Latest(女声)、Xiaoxiao2 Dragon HD Flash Latest(女声)、Xiaochen Dragon HD Latest(女声)、Yunxiao Dragon HD Flash Latest(男声)等,共 54 个神经网络音色;另有 11 个 Preview 音色 |
| 情感风格 | 34 个音色支持风格选择(如温柔、欢快、悲伤、新闻播报等) |
| 发音特点 | 普通话发音,字正腔圆;54 个 GA 音色覆盖男女声与少年、老年角色音,多数支持情感风格 |
| 页面界面 | 中文界面,语言与音色名称按原语言写法显示 |
| 单次转换上限 | 5000 字符(含空格与标点,超出自动截断) |
| 批量生成上限 | 单任务最多 10 万字,异步批处理,可多任务并行 |
| 参数调节 | 语速 0.5x-2x、音调 ±50%、音量 0-100%、静音时长、目标时长 |
| 文件导入 | TXT / DOCX 文本导入,SRT 字幕按时间轴配音 |
| 导出格式 | MP3 / WAV,无水印、无片头片尾宣传语音 |
| 底层引擎 | 微软 Azure 认知服务文本转语音 API(神经网络语音) |
| 使用门槛 | 免登录即可使用,无需绑定手机号;当日可用额度在页面顶部实时显示 |
| 中文(其他方言与地区变体) | wuu-CN、yue-CN、zh-CN-guangxi、zh-CN-henan、zh-CN-liaoning、zh-CN-shaanxi、zh-CN-shandong、zh-CN-sichuan、zh-HK、zh-TW,共 11 个 |
同一段文字换成别的方言,听感差别很明显。要换方言或地区写法,在“语言”下拉里直接切,语音列表会同步刷新;也可以直接进对应的页面:
中文(普通话)是全站音色最丰富的语种:54 个正式可用音色,加上预览音色共 65 个。晓晓、晓辰、晓涵、晓伊等女声,云希、云扬、云健、云野等男声,还有少年音、老年音和角色扮演音色。
情感风格是这个语种的优势:温柔、欢快、悲伤、愤怒、严肃、低语、新闻播报、诗歌朗诵等都能在“风格”下拉里直接选,同一段文字换成不同风格就是完全不同的语气。单次最多 5000 字符,更长的稿子用批量生成,单任务最多 10 万字。
欢迎使用浮云梦配音,把这段文字粘进输入框,选好音色点一下就能生成语音。
界面为中文界面,输入框可直接粘贴中文、英文或其他语言文本;方言内容请在“语言”下拉里切换到对应方言语种。
| 对比维度 | 浮云梦配音(本站口径) | TTSMaker | Edge 大声朗读 | ElevenLabs |
|---|---|---|---|---|
| 使用门槛 | 免登录,网页即用 | 需注册(以官网为准) | 浏览器内置,仅限 Edge 内使用 | 面向开发者与海外用户(以官网为准) |
| 中文地区变体 | 11 个(zh-CN / wuu-CN / yue-CN / zh-CN-guangxi 等) | 以官网为准 | 跟随系统语音包,以官网为准 | 以英语音色为主,以官网为准 |
| 字数与批量 | 单次 5000 字符;批量单任务 10 万字 | 以官网为准 | 无批量与附加功能 | 以官网为准 |
| 多人对话 | 内置,每个角色可配不同音色 | 多角色功能受限 | 不支持 | 以官网为准 |
| 语音克隆 | 上传 5-30 秒样本即可,免费单次 500 字(会员 1000 字) | 以官网为准 | 不支持 | 以官网为准 |
| 字幕工具 | 音频转 SRT + 时间轴校准 | 以官网为准 | 无 | 以官网为准 |
| 导出水印 | 无水印、无片头片尾宣传语音 | 以官网为准 | 无 | 以官网为准 |
| 界面语言 | 中文界面,语言名显示原语言写法 | 以官网为准 | 跟随浏览器语言 | 英文为主 |
竞品一列只做定性描述,具体功能、音色数量与限制以各家官网为准;这里的数值口径均可在上方参数表与站内语言列表中核对。
中文(普通话)语音合成基于微软 Azure 认知服务文本转语音 API(Microsoft Azure Cognitive Services Text-to-Speech),Luna、Wayne 均为神经网络(Neural)音色,情感风格由所选风格参数控制。语音克隆与语音转换使用深度学习模型,与 TTS 引擎分开。整段音频在服务端生成,浏览器只负责播放与下载,本地不需要显卡算力。
zh-CN 语种下有 54 个正式可用(GA)音色,加上预览音色共 65 个,是全站音色最多的语种。女声有晓晓、晓辰、晓涵、晓伊等,男声有云希、云扬、云健、云野等,另有少年音与老年音。
先选音色,再看“风格”下拉里有哪些选项。晓晓支持欢快、悲伤、温柔、严肃、低语、新闻播报等,云希支持悲伤、愤怒、沮丧等。同段文案换成不同风格,语气差别很明显,广告和故事用同一音色也能拉开差距。
用“更多工具”里的多音字检测,它会标出文中容易读错的字并让你指定读音;也可以直接在文本里改写措辞,或用 AI 润色把句子改得更适合朗读。
单次最多 5000 字符,超出部分自动截断。整本小说、整套课程稿用批量生成:单任务最多 10 万字,异步执行,提交后可以关掉页面,稍后回来下载。
在“语言”下拉里切换:四川话、河南话、辽宁话(东北话)、陕西话、山东话、广西口音、粤语、上海话都有独立语种页,发音按各自方言合成。
下载 MP3 或 WAV,无水印、无片头片尾宣传语音,可直接用于剪辑。商用场景的使用与授权细节以站内说明为准。
口播类 1.0x-1.1x 最接近真人语速,课件与有声书 0.9x-1.0x 更耐听,儿童内容 0.85x 左右更清楚。目标时长参数可以反过来指定,比如把 800 字压到 3 分钟。
可以用批量生成,单任务最多 10 万字,异步跑完再下载。建议按章节切分提交,单任务出问题时只影响一章,不用整本重跑。