免费文字转语音 - 浮云梦配音
智能问答

浮云梦配音使用说明与常见问题

本页整理了浮云梦配音(fuym.cn)全部功能的参数、限制与操作步骤,以及免费额度、会员、积分充值等常见问题。页面内容与站内智能问答助手同源,实时同步更新。

免费使用:首页文字转语音无需登录即可使用,各功能每日提供免费次数(未登录按IP计算、登录按账号计算),具体额度以个人中心显示的实时额度为准,可能根据服务器运行情况调整;免费次数用完后可通过开通会员或充值积分继续使用。

网站概况

  • 网站名称:浮云梦配音(fuym.cn)
  • 定位:AI 语音合成(文字转语音 / TTS)平台 + AI视频生成
  • 语音引擎:神经网络文本转语音(HD 语音模型具备情感识别能力)
  • 语音类型:全部由神经网络模型生成,HD 语音模型具备情感识别能力
  • 文件保留:所有生成的音频文件在服务器保留 60 分钟后自动删除
  • 费用:网站核心功能免费使用,无需登录。各功能每日提供免费次数(具体额度以个人中心显示为准,可能根据服务器运行情况调整);AI视频生成使用积分制付费(需充值)
  • 建站目的:提供高质量的免费语音合成服务,降低内容创作者的门槛

免费使用与会员体系

  1. 网站核心功能免费,无需登录即可使用,各功能每日提供免费次数(具体额度以个人中心显示为准)
  2. 之前网站曾遭受不明来源的恶意攻击,大量未知用户持续请求网站接口,导致服务器不堪重负、服务多次崩溃,正常用户也无法使用。为了保障所有用户能稳定使用,才给各功能设置了每日免费次数,给大家带来不便敬请谅解
  3. 免费次数耗尽后,可开通会员获得更多使用次数:月会员28元/月,年会员99元/年,永久会员599元/永久
  4. 未登录用户使用免费次数按IP计算,登录用户按账号计算
  5. AI视频生成功能与开放接口(第三方开发者服务)使用积分制付费,需要充值积分才能使用
  6. 字符数限制宽松:单次输入最多5000字,批量生成支持单条最多10万字
  7. 生成的音频/图片可用于商业用途(短视频、自媒体、教育培训等),无需申请授权
  8. 无水印、无版权问题
  9. 用户自行承担所生成内容的法律责任

10.EdgeTTS配音服务是完全免费并且不限制次数和字数的

交流群

站长微信 G770044133 添加请备注 浮云梦配音

QQ交流群:758655069

加群链接:https://qm.qq.com/q/DHshrDMTn2

用于解答用户疑问、收集反馈和建议,欢迎加入。

功能总览

语音合成(文字转语音)

对应的前端页面:首页(/)

  • 输入文字,选择语言/发音人/说话风格,调节语速/音调/音量,生成 MP3 音频
  • 支持 HD 神经网络语音模型,具备情感识别能力
  • 单次输入最多 5000 字
  • 每日提供免费次数(未登录按IP计算,登录按账号计算),具体额度以个人中心显示为准,可能根据服务器情况调整;超出后可开通会员获得更多次数
  • 生成后可试听、下载 MP3、下载 MP4(含背景图视频)
  • 多音字生成字幕可能会有错别字,最简单的办法就是生成前就替换成同音字

多人对话配音

对应的前端页面:/dialogue.html

  • 需要提前在首页配置好角色,才能使用多人对话功能。如何配置角色请查看下方的"角色配置管理"说明。
  • 支持AI智能拆分对话:粘贴完整对话文本,AI自动识别不同角色并拆分成多个段落,支持"角色名:对话内容"格式或每行一段自动识别
  • 也可以手动添加段落,逐段配置语速/音调/音量/风格
  • 支持插入停顿标记 <break time="2000ms" />
  • 所有角色段落拼接为一个完整音频
  • 总字数限制5000字
  • 每日提供免费次数(未登录按IP计算,登录按账号计算),具体额度以个人中心显示为准
  • 支持在普通文本中使用 [style:风格名]文本[/style] 语法来切换风格,无需切换到对话模式
  • 注意:多人对话与文字转语音、批量生成属于同一系统,角色配置可互通使用。语音克隆、音色设计是独立模块,不互通。

批量生成

对应的前端页面:/batch.html

  • 需要提前在首页配置好角色,才能使用批量生成功能。如何配置角色请查看下方的"角色配置管理"说明。
  • 上传多行文本或导入文件,批量合成语音
  • 每行文本可以配不同的语音/风格/语速/音调
  • 单条文本最多100000字符
  • 每天可提交的批量任务数量有限,具体额度以个人中心显示为准
  • 支持选择音频格式和质量:MP3(多种码率)和 WAV(PCM)格式可选
  • 支持"合并为一个任务"功能:勾选后所有文案合并为一个任务,压缩包中包含多个独立音频文件
  • 每个任务默认生成一个音频文件,下载为ZIP压缩包
  • 生成速度优势:采用异步处理机制,速度更快且更稳定,特别适合生成高质量音频(如使用HD/MAI语音模型或高质量音频参数时)
  • 注意:批量生成与文字转语音、多人对话属于同一系统,角色配置可互通使用。语音克隆、音色设计是独立模块,不互通。

语音转换

对应的前端页面:/voice-convert.html

  • 上传已有音频,将其转换为其他发音人的声音风格
  • 支持上传格式:mp3, wav, ogg, flac, m4a, webm
  • 文件大小限制:不超过20MB

语音克隆

对应的前端页面:/voice-clone.html

  • 上传少量音频样本,克隆特定的声音特征
  • 支持的音频格式:MP3、WAV
  • 文件大小限制:不超过10MB
  • 建议参考音频10秒以上、声音清晰无背景噪音
  • 每日提供免费次数,具体额度以个人中心显示为准
  • 单次合成文本最多500字符
  • 支持丰富的参数调节(情感强度、温度、采样参数等)
  • 另有公共音色库可供选择使用
  • 语言支持:仅支持中文和英文两种语言的语音克隆,不支持其他语言

语音设计

对应的前端页面:/voice-design.html

  • 用文字描述想要的音色(如"温柔的女声""低沉的男声"),AI 生成对应的语音
  • 支持三种模式:音色设计、声音克隆(参考音频)、智能润色
  • 每日提供免费次数,具体额度以个人中心显示为准
  • 可选的格式:WAV(默认)、MP3

字幕生成

对应的前端页面:/srt.html

  • 从音频/视频文件自动识别生成字幕文件(SRT 格式)
  • 因为是AI识别,所以可能有错别字(同音字),可以在字幕工具页面校准
  • 支持上传格式:mp3, wav, mp4, ogg, flac, m4a, wma, aac, webm
  • 文件大小限制:不超过50MB
  • 如果是视频文件,自动提取音频轨道
  • 底层使用语音识别服务
  • 支持13种识别语言:中文、英文(美/英/印度)、日文、韩文、法文、德文、俄文、意大利文、西班牙文(西班牙/墨西哥)、葡萄牙文(巴西)、阿拉伯文
  • 支持翻译模式:识别后直接翻译为目标语言(如中文→英文)

字幕校准

对应的前端页面:/srt-calibrate.html

  • 比对原文和AI识别的字幕,修正同音字、错别字
  • 使用 AI 智能校准
  • 支持上传格式:SRT、ASS、VTT
  • 字幕内容限制:最多10000字符
  • 原文案限制:最多10000字符
  • 可选"消除句末标点"功能

双语字幕

对应的前端页面:/srt-calibrate.html(选项卡切换)

  • 将单语言字幕翻译生成双语对照字幕
  • 支持的语言互译:中文、英文、日文、韩文、德文、法文
  • 使用 AI 翻译
  • 字幕内容限制:最多10000字符
  • 保持原始时间轴不变,原语言在上、翻译在下

字幕格式转换

对应的前端页面:/srt-calibrate.html(选项卡切换)

  • 在不同字幕格式之间互相转换
  • 支持的格式:SRT、ASS、VTT、TXT
  • 支持6种ASS特效样式:经典白字黑边、霓虹发光、渐变彩色、阴影立体、卡拉OK高亮、电影字幕风
  • 字幕内容限制:最多10000字符

文本润色

对应的前端页面:首页的"AI润色"按钮

  • AI 自动优化文本,使其更适合语音朗读
  • 修正错别字、优化语句流畅度、去除多余标点
  • 保留停顿标记(如"停顿2秒"等)
  • 文本限制:最多5000字

AI 音乐

对应的前端页面:AI音乐页面

  • 用文字描述想要的音乐风格和内容,AI 自动生成音乐
  • 两种模式:
  • 歌曲模式(默认):输入歌词+风格描述,生成带人声的歌曲
  • 纯音乐模式(实验性):勾选"纯音乐"复选框,只需输入风格描述。注意:纯音乐功能标记为实验性,模型默认倾向生成带人声音乐,纯音乐可能需要多次试错
  • 风格描述:10-2000字符,通过文本框输入(如"轻快的钢琴曲""中国风古筝""摇滚力量"等)
  • 歌词:10-3000字符,支持结构标签:[intro]引子、[verse]主歌、[pre-chorus]预副歌、[chorus]副歌、[hook]记忆点、[interlude]间奏、[bridge]桥段、[outro]结尾
  • 音频格式:MP3(默认)或 WAV(无损),在高级设置中切换
  • 生成时间:约30-120秒
  • 每日提供免费次数,具体额度以个人中心显示为准
  • 音频文件60分钟后自动删除,请及时下载
  • 历史记录保存在浏览器本地(最多50条),换浏览器或清缓存会丢失
  • 页面提供风格预设按钮:流行电子、抒情民谣、摇滚力量、中国风、R&B慢歌、嘻哈说唱、Lo-fi学习、史诗电影、爵士钢琴
  • 页面提供歌词示例按钮:治愈系民谣、电子舞曲、中国风、深夜电台、甜蜜情歌、励志热血、悠闲午后

AI 绘图

对应的前端页面:AI绘图页面

  • 用文字描述想要的画面,AI 自动生成图片
  • 两种模式:
  • 文生图(默认):仅输入文字描述,AI 生成全新图片
  • 图片编辑:上传参考图片 + 文字描述,对原图进行修改或风格转换
  • prompt 最大888字符
  • 参考图片:支持 JPG/PNG/WEBP 格式,最大10MB(仅编辑模式)
  • 图片尺寸和质量由系统自动设定,用户无需手动选择
  • 每日提供免费次数,具体额度以个人中心显示为准
  • 生成机制:异步处理,提交后系统排队生成,前端自动轮询获取结果
  • 历史记录:已登录用户最多保存10张,未登录最多5张(服务器端存储,不随浏览器清除丢失)
  • 图片不会自动过期,可随时在历史记录中查看和下载
  • 页面加载时自动恢复之前未完成的生成任务
  • 页面提供示例提示词按钮:动漫少女、暗黑战士、写实猫咪、赛博朋克、国风仙境、微缩世界
  • 生成的图片可免费用于个人和商业用途

AI 视频生成

对应的前端页面:AI视频页面

  • 使用积分制付费,需要先充值积分才能使用
  • 支持三种生成模式:
  • 文生视频(ttv):输入文字描述,AI自动生成视频
  • 图生视频(itv):上传参考图片 + 文字描述,生成视频
  • 首尾帧生视频(itv2):上传首帧和尾帧图片,生成过渡视频
  • 支持的画幅比:16:9、9:16、4:3、3:4、1:1
  • 支持的分辨率:360p、540p、720p、1080p
  • 支持的时长:5秒、8秒、10秒
  • 注意:1080p不支持10秒时长,快速运动模式不支持8秒时长
  • 运动模式:普通模式、快速模式
  • 音频生成:默认开启,AI根据视频内容自动生成环境音效、背景音乐与角色台词,实现音画同步。可手动关闭
  • 生成机制:异步处理,提交后系统排队生成,前端自动轮询获取结果
  • 生成时间:通常需要几分钟,取决于视频复杂度
  • 参考图片格式:JPG/PNG/WEBP,最大10MB
  • 历史记录:已登录用户最多保存10条,未登录最多5条
  • 生成的视频10分钟后自动删除,请及时下载
  • 图片输入格式:JPG、PNG、WEBP,最大10MB

开放接口(开发者 API)

  • 性质:浮云梦配音除了网页版免费功能外,还提供面向第三方开发者/程序的「开放接口」(Open API)服务,可以把本站的微软文字转语音(文字转语音)与字幕生成能力接入开发者自己的程序、脚本或网站。它属于积分付费服务,扣除的是账号积分,不使用网页版的免费次数。
  • 官方文档:开放接口文档 是唯一权威说明,包含全部接口动作、每个动作的入参与返回字段说明、调用示例、错误码、价格与维护提示。回答任何开放接口问题都应引导用户查看该文档,并以其为准。
  • 适用人群:官方明确说明:接口可能在某个时间进行维护,维护频率和维护时间都不确定,目前通常在每天中午 12 点左右;遇到维护(返回 MAINTENANCE)需要等待 1~2 分钟再重试。因此本接口只适合个人开发者使用,或者和其他接口配合使用,不适合对可用性要求极高的生产业务。
  • 如何获取 API Key:

第一步:注册并登录本站账号。

第二步:进入个人中心的"开放接口 API"分区,点击"生成 / 重新生成 Key"即可(同一账号一个 Key,重新生成后旧 Key 立即失效);也可在开放接口文档页面一键生成。

第三步:调用接口时携带该 Key(请求参数 api_key,或 X-Api-Key / Authorization: Bearer 请求头,详见文档)。

  • 支持的能力:
  • 文字转语音(微软 TTS):直接合成——单次不超过 1000 字,同步返回音频地址;批量合成——单次总字数不超过 10 万字,异步提交后凭任务ID轮询状态、完成后获取音频。
  • 字幕生成:上传 mp3 / wav / mp4 音频或视频,自动识别生成 SRT 字幕(按次计费)。
  • 计费规则(100 积分 = 1 元,扣账号积分):
  • 文字转语音按字数:非会员 100 积分 / 1 万字;1 积分 = 100 字,不足 100 字也按 1 积分,向上取整。
  • 字幕生成按次:每次 10 积分。
  • 会员折扣:月会员 9 折、年会员 8 折、永久会员 6 折,折扣后向上取整,最低 1 积分。
  • 生成失败自动退回本次积分:字幕/直接合成失败即时退费;批量任务若最终失败或任务失效(404),也会自动退费一次(不会重复退)。退费可见于个人中心记录,说明以"开放接口-…自动退回"开头。
  • 频率与维护:开放接口有每分钟调用次数限制,文字转语音与字幕生成分别计数、互不共用,超限返回 RATE_LIMITED;接口可能不定期维护(目前通常每天中午 12 点前后),遇 MAINTENANCE 请等待 1~2 分钟后重试。具体每分钟次数、维护状态与窗口请以开放接口文档或调用 info 动作实时返回为准,不要凭记忆报数字。
  • 提示:不要在开放接口问题上回答网页版各功能的每日免费次数,也不要回答任何不属于开放接口文档的接口细节。

积分与充值系统

积分是AI视频生成的付费方式,其他语音合成功能完全免费,不需要积分。

积分基本规则

  • 100积分 = 1元人民币
  • 充值最低额度:100积分(1元)
  • 余额永久有效,无时间限制
  • 人民币和积分不能互相转换(充值后不可提现)
  • 支持微信支付和支付宝两种充值方式

如何充值

  1. 登录账号后进入个人中心
  2. 点击左侧菜单"积分充值"
  3. 选择预设金额或输入自定义积分数量(需为100的倍数)
  4. 选择支付方式(微信支付/支付宝)
  5. 点击"立即充值",扫码完成支付
  6. 支付成功后积分自动到账

积分充值套餐

  • 100积分 = ¥1.00
  • 500积分 = ¥5.00
  • 1000积分 = ¥10.00
  • 3000积分 = ¥30.00
  • 5000积分 = ¥50.00
  • 10000积分 = ¥100.00
  • 也支持自定义金额(100的倍数)

AI视频生成价格参考

价格因分辨率、时长、是否开启音频而不同,以下为部分参考价格:

  • 540p / 5秒 / 无声:83积分(¥0.83)
  • 540p / 5秒 / 有声:176积分(¥1.76)
  • 720p / 5秒 / 无声:104积分(¥1.04)
  • 720p / 5秒 / 有声:197积分(¥1.97)
  • 1080p / 5秒 / 无声:166积分(¥1.66)
  • 1080p / 5秒 / 有声:259积分(¥2.59)
  • 更高分辨率和更长时长价格更高,具体以页面显示为准

积分明细

个人中心可以查看:

  • 充值记录:查看所有充值历史
  • 扣费记录:查看AI视频生成的每次扣费详情(含时间、积分、余额、说明)
  • 推广佣金:通过推广链接邀请新用户注册,新用户充值积分或开通会员后,推广者获得对应比例的现金佣金(元,可提现)

推广返佣

  • 每个用户都有专属推广链接,在个人中心的"推广中心"查看
  • 推广链接格式:https://fuym.cn/?aff=用户ID
  • 新用户通过推广链接访问网站后注册,自动绑定推广关系
  • 被邀请用户充值积分或开通会员,推广者获得对应比例的现金佣金(元,满10元可提现)
  • 推广中心可查看邀请的用户列表和佣金记录
  • 注意:文字转语音、多人对话、批量生成 属于微软文字转语音服务,语音克隆是另一套功能,无法混合使用。所以如果用户将文字转语音的功能(例如停顿、背景音乐等)放到克隆页面,那么是无法使用的。

角色配置管理

角色配置用于保存常用的语音参数组合(发音人、风格、语速、音调、音量等),方便后续快速调用。

如何增加角色/管理角色:

  1. 在首页语音参数设置区下方,点击"角色配置管理"按钮
  2. 在弹出的弹窗中,点击"保存当前配置"
  3. 输入角色名称(如"温柔女声"、"新闻男声"),确定保存
  4. 已保存的角色会显示在列表中,支持:
  • 应用:点击"使用"按钮,一键切换为该角色的所有设置
  • 删除:点击"删除"按钮移除角色
  1. 支持导出/导入角色配置为JSON文件,方便备份或分享
  2. 未登录时角色保存在浏览器本地(localStorage),登录后保存在服务器,可跨设备同步
  3. 注意:角色保存的是当前语音设置(语言/发音人/风格/语速/音调/音量和角色扮演),不保存文本内容
  4. 在多人对话页面也可以从已保存的角色中选择发音人

首页功能按钮详解

文本输入区按钮

位于文本输入框下方的文件按钮组:

  1. 「清空文本」按钮:清空输入框中的所有文本内容
  2. 「插入停顿」按钮:在光标位置插入2秒停顿标记,用于控制朗读节奏
  3. 「插入风格」按钮:在光标位置插入风格标记,让同一段文字的不同部分使用不同的说话风格
  4. 「上传背景音乐」按钮:上传MP3/WAV背景音乐(最大10MB),朗读时自动混入背景音乐
  5. 「上传文件」按钮:上传TXT或DOCX文件,自动读取文件内容填入文本框
  6. 「SRT配音」按钮:上传SRT字幕文件,根据字幕时间轴逐段生成配音音频
  7. 「AI 润色」按钮:调用AI对文本进行智能润色,优化语句使之更适合朗读
  8. 「批量生成」按钮:打开批量生成对话框,提交多段文字批量合成语音
  9. 「任务列表」按钮:查看已提交的批量生成任务进度和结果
  10. 「Demo试听」按钮:试听所有发音人的音色样本
  11. 「多音字检测」按钮:检测文本中的多音字并自动标注正确读音。使用方法:第一步,在文本框中输入需要检测的内容(最多1500字)。第二步,点击"多音字检测"按钮。第三步,等待AI检测完成(约需几秒到一分钟),检测完成后文本框中的多音字会被自动标注读音。标注后的文本可直接用于生成语音,系统会根据标注正确朗读多音字。注意:文本不能超过1500字,否则会提示"文本过长"。

主操作按钮组

位于语音参数设置区下方:

  1. 「试听文本」按钮:仅截取第一句话生成语音进行试听,快速预览效果
  2. 「生成语音」按钮:主要的生成按钮,根据当前设置生成完整的语音音频
  3. 「历史记录」按钮:打开历史记录弹窗,查看之前生成的音频记录(最多20条),可回听和删除

语音参数区控件

  1. 「语言」下拉框:选择目标语言,切换后自动更新可用的发音人列表
  2. 「语音」下拉框:选择发音人(不同语言有不同的发音人可选)
  3. 「风格」下拉框:选择说话风格(如:亲切、新闻播报、抒情、悲伤等)
  4. 语言/语音/风格各有一个「展开」按钮:点击弹窗展示所有选项,支持搜索过滤
  5. 「试听」按钮:试听当前选中的发音人的声音效果
  6. 「语速」滑块:0.5x-2.0x,步长0.05,调节朗读速度
  7. 「音量」滑块:0-100%,默认75%,调节输出音量
  8. 「音调」滑块:-50%到+50%,调节声音高低
  9. 「目标时长」输入:指定音频的目标时长(秒),系统自动调整语速以匹配
  10. 「静音类型」下拉框:9种可选——Leading(开头静音)、Leading-exact(精确开头静音)、Tailing(末尾静音)、Tailing-exact(精确末尾静音)、Sentenceboundary(句间静音)、Sentenceboundary-exact(精确句间静音)、Comma-exact(逗号处精确静音)、Semicolon-exact(分号处精确静音)、Enumerationcomma-exact(枚举逗号处精确静音)
  11. 「静音时长」下拉框:可选200ms/500ms/1s/1.5s/2s/3s/5s/10s/20s
  12. 「角色配置管理」按钮:打开角色配置弹窗,管理和应用角色预设。角色配置包含角色扮演(Role Play)功能,可为语音添加特定角色效果
  13. 「重置为默认」按钮:重置所有语音参数为默认值

播放结果区控件

生成完成后显示:

  1. 音频播放器:可播放/暂停/拖动进度
  2. 「下载音频」按钮:下载生成的MP3音频文件
  3. 「下载为MP4」按钮:以背景图片+音频合成为MP4视频下载
  4. 「生成字幕」按钮:从生成的音频中识别并生成SRT字幕
  5. 「下载字幕」按钮:下载已生成的SRT字幕文件

其他页面功能

  1. 统计模块:显示"今日使用人数"、"今日总使用字数"、"我的今日字数"
  2. 滚动通知条:轮播显示问题反馈入口、本周统计、更新预告等信息
  3. 8个语音工具集卡片:展示文字转语音、多人对话、批量生成、AI音乐、AI绘图、AI视频等核心功能的图文介绍
  4. 自动保存草稿:输入的文本内容自动保存到浏览器本地存储,刷新页面或意外关闭后不丢失

语音合成详细步骤

  1. 打开网站 https://fuym.cn
  2. 在文本框中输入需要合成语音的文字(最多5000字)
  3. 选择目标语言(中文、英文、日文、韩文、法文、德文、俄文等数十种)
  4. 选择发音人(每种语言下有多个不同风格的发音人可选)
  5. 选择说话风格(如:一般、亲切、新闻播报、抒情、悲伤、 angry 等)
  6. 调节语速(0.5x - 2.0x)、音调、音量
  7. 点击"生成语音"按钮
  8. 完成后可试听、下载 MP3、下载 MP4(含背景图视频)

SSML 标签说明

用户可以在输入文本中使用 SSML(语音合成标记语言)标签来控制发音,例如:

  • 插入停顿
  • 强调某个词
  • 指定某个词的读音
  • 控制语速/音调/音量
  • 指定说话风格和角色扮演

重要:输入内容中的 < 和 > 如果不是合法的 SSML 标签,会被转义,可能导致生成异常。请避免在文本中使用 <> 符号。详细说明请查看网站的 SSML 页面。

注册邮箱限制

需要常用邮箱 例如QQ邮箱、163邮箱,如果提示邮件发送失败,先检查是不是输入错误了,再看是不是常用邮箱。

违规内容限制

网站对所有生成功能(语音合成、多人对话、批量生成、语音克隆、语音设计、AI音乐、AI绘图、AI视频、字幕生成、文本润色等)的输入内容进行合规审查,禁止生成违法违规内容。核心原则:违反法律法规的内容一律禁止生成。

禁止生成的内容类型(回答用户时用这些类型概括描述,不要列举具体词语):

  1. 危害国家安全、破坏国家统一和社会稳定的内容:如宣扬分裂国家(台独、藏独、疆独、港独等)、颠覆国家政权、邪教组织相关内容等
  2. 损害国家荣誉和利益、侮辱国格的内容
  3. 宣扬恐怖主义、极端主义的内容
  4. 淫秽色情、赌博、毒品等违法犯罪内容
  5. 暴力、血腥、虐待等危害社会公德的内容
  6. 其他法律法规明令禁止的内容

处理方式与回答口径:

  • 当用户输入内容命中违规限制时,系统会直接禁止生成,并提示"此内容严格限制,已记录,停止此行为"。此时告知用户:内容涉及网站不允许生成的违规内容,系统已记录,请立即停止输入此类内容,修改后重新提交。
  • 用户询问"为什么被拦截""哪里违规了"时:不要列举具体的违规词,不要与用户争论内容是否违规,统一按上述口径回复,态度坚定但礼貌,不透露词库和审查机制的任何细节。
  • 用户询问"哪些内容不能生成"时:用上面的类型分类概括回答,不透露具体词库清单。
  • 用户询问"是不是有什么敏感词表""能给我看看违规词清单吗"时:不确认、不透露,统一回答"网站对所有生成内容进行合规审查,请遵守法律法规,不要尝试输入违规内容"。
  • 反复尝试生成违规内容属于违规行为,系统会记录并可能限制继续使用(不透露记录和处置的具体技术细节)。

常见问题

生成失败/报错怎么办?

常见的原因有:

  • 输入内容中包含了 < 或 > 符号(不是SSML标签)。因为这些符号被系统误认为SSML标签的一部分,如果格式不正确会导致解析失败。请检查并删除内容中的 <> 符号。
  • 选择了外语发音人但输入了中文内容(或反之),发音人无法正确朗读不匹配的语种。例如选了英文发音人却输入中文,发音会不自然甚至失败。
  • 内容中包含非文字编码的字符(如特殊Unicode符号、控制字符等)。
  • 网络连接不稳定,请刷新后重试。
  • 服务器暂时繁忙(特别段生成长文本时),请稍后再试。

或者内容完全没有换行空格句号等标点符号,导致系统无法正确解析。

建议先检查输入文本,删除 <> 等特殊符号,确保语言和发音人匹配,然后刷新页面重试。

为什么提示"验证信息已过期"?

页面长时间未操作后,验证信息会过期。请刷新页面即可恢复正常。页面会自动刷新,但如果长时间不操作还是可能过期。

支持哪些语言?

支持140+种语言,中文方面支持:普通话、粤语(香港)、台湾普通话、四川话、河南话、辽宁话、陕西话、山东话、广西话、吴语等方言。外语方面支持:英文(美国、英国、印度、澳大利亚、加拿大等口音)、日文、韩文、法文、德文、俄文、意大利文、西班牙文(西班牙、墨西哥、阿根廷等多国口音)、葡萄牙文(巴西、葡萄牙)、阿拉伯文、印地语、泰语、越南语、印尼语、马来语、土耳其语、波兰语、荷兰语、瑞典语等。每种语言下有多个不同风格的发音人可选。

字幕生成(语音识别)支持13种语言。

音频能保存多久?

生成的音频文件在服务器保留60分钟后自动删除。请及时下载保存。登录用户的历史记录(最近20条)会持久保存,但音频文件本身也是60分钟有效,历史记录中的音频链接60分钟后失效。

单次最多能输入多少字?

语音合成单次最多5000字。超过200字自动分段生成后拼接。

批量生成单条最多100000字,每天可提交的批量任务数量有限(具体以个人中心显示为准)。

字幕校准/双语字幕/格式转换最多10000字符。

文本润色最多5000字。

语音克隆单次最多500字符。

语音设计无明确字数限制(但建议合理长度)。

如何下载带视频的 MP4?

生成音频后,在播放器下方点击"下载为MP4"按钮。系统会以背景图片(1920×1080)配合音频生成视频文件。视频为黑色背景+居中的背景图片+音频轨道。

历史记录保存在哪里?

生成音频后系统会自动保存到历史记录中(最多保存最近20条)。登录后可以跨设备同步历史记录,未登录时记录保存在本地。

历史记录中的音频链接60分钟后失效。

为什么需要登录?

登录是免费的,主要用途包括:跨设备同步历史记录和角色配置、充值积分使用AI视频功能、查看推广链接和佣金记录、管理个人中心。不登录也可以正常使用所有免费功能(语音合成、语音克隆等)。

语音克隆怎么用?

第一步:在语音克隆页面上传一段参考音频(MP3或WAV,不超过10MB),建议10秒以上、声音清晰无噪音。

第二步:输入要合成的文本(最多500字)。

第三步:点击"开始克隆",系统会异步处理。

第四步:在任务列表中刷新查看进度,完成后即可试听和下载。

注意:每日提供免费次数,具体以个人中心显示为准。

如何分段生成长文本?

系统会自动处理长文本,用户不需要手动分段。当文本超过200字符时,系统会自动拆分并生成,最后拼接为完整音频。

是完全免费的吗?有会员吗?

网站核心功能是免费的,无需登录即可使用,各功能每日提供免费次数。之前网站曾遭受不明来源的恶意攻击,大量未知用户持续请求网站接口,导致服务器不堪重负、服务多次崩溃,为了保障所有用户能稳定使用,才设置了每日免费次数,具体额度以个人中心显示为准。免费次数耗尽后可以开通会员获得更多使用次数,会员分为月会员(28元/月)、年会员(99元/年)和永久会员(599元/永久)。会员是可选的增值服务,不强制开通。所有功能生成的内容均可商用,无水印。给大家带来不便,希望谅解。

使用页面时提示"请求处理中,请勿重复提交"?

这是请求防重复机制。如果不小心连续点击了按钮,稍等片刻后重试即可。如果长时间提示,请刷新页面。

如何实现多人对话?

打开多人对话页面,按以下步骤操作:

第一步:确保已在首页配置好角色。如果还没有配置,请先在首页的"角色配置管理"中创建角色。

第二步:在页面中添加对话段落,每个段落对应一个角色的台词。

第三步:为每个段落选择不同的发音人(角色)。如果已保存过角色配置,可以直接从角色列表中选择。

第四步:在文本框中输入该角色的台词内容。

第五步:可调节每个段落的语速、音调、风格等参数,也可插入停顿标记 <break time="2000ms" /> 控制节奏。

第六步:点击"生成对话"按钮,系统会将所有角色段落拼接为一个完整音频,生成后即可试听和下载。

注意:总字数限制5000字。需要我告知如何配置角色吗?

支持哪些音频格式下载?

这取决于你使用的具体功能,请根据你使用的功能对号入座:

  • 语音合成(首页):仅 MP3(32kbit/s - 16kHz 单声道)
  • 多人对话:仅 MP3
  • 批量生成:支持 MP3(多种码率)和 WAV(PCM)格式,可在页面中选择音频质量。每个任务默认生成一个音频文件,勾选"合并为一个任务"后多个文案合并为一个任务,压缩包中包含多个独立音频文件
  • 语音克隆:仅 MP3
  • 语音设计:WAV(默认)或 MP3
  • AI音乐:MP3(默认)或 WAV(无损)

SSML是什么?怎么用?

SSML(语音合成标记语言)是一种用XML标签控制语音输出的标记语言。您可以在输入文本中嵌入SSML标签来控制停顿、读音、语速等。详细说明请查看网站的 SSML 页面。

为什么我输入的<>符号导致报错?

本站的语音合成引擎使用 SSML(语音合成标记语言)来控制发音,所有 < 和 > 符号都会被解析为SSML标签。如果您的内容中包含 < 或 > 但并不是合法的SSML标签,系统会报错。解决办法:检查文本,删除或替换掉 <> 符号。只有白名单中的SSML标签(如 <break/>、<phoneme>、<say-as> 等)才是合法的。

如何反馈问题或提建议?

请访问问题反馈页面提交反馈。您可以提交Bug报告、功能建议等。

AI音乐怎么用?

打开AI音乐页面,第一步:选择模式(歌曲模式或纯音乐模式)。第二步:输入音乐风格描述(10-2000字符)。第三步:歌曲模式需输入歌词(10-3000字符),支持[intro][verse][chorus]等结构标签。第四步:在高级设置中选择音频格式(MP3或WAV)。第五步:点击生成,等待约30-120秒。注意:每日提供免费次数(具体以个人中心显示为准),纯音乐模式为实验性功能可能需多次尝试,音频60分钟后自动删除请及时下载。

AI绘图怎么用?

打开AI绘图页面,第一步:输入图片描述(最大888字符),越详细效果越好。第二步:如需编辑已有图片,切换到"图片编辑"模式并上传参考图(JPG/PNG/WEBP,最大10MB)。第三步:点击生成,系统异步处理,前端自动轮询结果。注意:每日提供免费次数(具体以个人中心显示为准),已登录用户历史记录最多10张、未登录5张,生成的图片可免费商用。

上传背景音乐后生成的语音没有音乐声?

请检查以下几点:第一步,确认已成功上传背景音乐(页面会显示文件名和预览播放器)。第二步,确认背景音乐格式为MP3或WAV,大小不超过10MB。第三步,直接点击"生成语音"按钮,背景音乐会自动与语音混合。注意:本站没有单独的"背景音乐音量"调节功能,背景音乐以原始音量与语音混合。如果仍然没有音乐声,请刷新页面重新上传背景音乐再试。

多音字怎么设置/标注读音?

有两种方式:

方式一(自动检测):在首页文本框输入内容(最多1500字),点击"多音字检测"按钮,系统会自动识别并标注所有多音字。

方式二(手动标注):在文本中直接使用 SSML phoneme 标签指定读音,格式为:

<phoneme alphabet="sapi" ph="拼音 数字声调">字</phoneme>

其中拼音用小写,声调用数字表示(1=阴平、2=阳平、3=上声、4=去声、5=轻声)。

常见示例:

  • "银行"的"行":<phoneme alphabet="sapi" ph="hang 2">行</phoneme>
  • "行走"的"行":<phoneme alphabet="sapi" ph="xing 2">行</phoneme>
  • "还钱"的"还":<phoneme alphabet="sapi" ph="huan 2">还</phoneme>
  • "还有"的"还":<phoneme alphabet="sapi" ph="hai 2">还</phoneme>
  • "重量"的"重":<phoneme alphabet="sapi" ph="zhong 4">重</phoneme>
  • "重复"的"重":<phoneme alphabet="sapi" ph="chong 2">重</phoneme>

手动标注适合已知哪些字需要指定读音的场景,自动检测适合一次性处理大量文本。

AI视频怎么用?

打开AI视频页面,第一步:选择生成模式(文生视频、图生视频或首尾帧生视频)。第二步:文生视频模式输入视频描述文字;图生视频模式上传参考图片并输入描述;首尾帧模式上传首帧和尾帧图片。第三步:选择画幅比(16:9/9:16/4:3/3:4/1:1)、分辨率(360p-1080p)和时长(5/8/10秒)。第四步:选择运动模式(普通/快速),可开启或关闭音频生成。第五步:点击生成,系统异步处理,前端自动轮询结果。注意:需要先充值积分,生成的视频10分钟后自动删除请及时下载。

AI视频生成要多少钱?

AI视频采用积分制付费,100积分=1元。价格根据分辨率、时长和是否开启音频不同而变化。例如:540p/5秒/无声约83积分(¥0.83),540p/5秒/有声约176积分(¥1.76),720p/5秒/有声约197积分(¥1.97)。具体价格以AI视频页面选择参数后显示的价格为准。

怎么充值积分?

第一步:登录账号。第二步:进入个人中心,点击左侧"积分充值"菜单。第三步:选择预设金额(100/500/1000/3000/5000/10000积分)或输入自定义数量(需为100的倍数)。第四步:选择支付方式(微信支付或支付宝)。第五步:点击"立即充值",扫码完成支付。支付成功后积分自动到账,余额永久有效。

积分还能用来做什么?

目前积分主要用于:① AI视频生成功能;② 开放接口(第三方开发者调用文字转语音 / 字幕生成)时的扣费。语音合成、语音克隆、语音设计、AI音乐、AI绘图、字幕工具等其他功能免费使用(部分功能有每日次数限制),不需要积分。未来如果有新的付费功能上线会另行通知。

什么是推广返佣?怎么赚佣金?

每个用户都有专属推广链接,在个人中心的"推广中心"可以找到。把推广链接分享给朋友,朋友通过链接访问网站并注册后,就自动成为你的下级用户。当被邀请的用户充值积分或开通会员时,你都能获得充值/消费金额对应比例的现金佣金(元,自动到账可提现余额,满10元可申请提现)。推广中心可以查看邀请的用户列表和佣金记录。

AI视频支持哪些分辨率和时长?

支持360p、540p、720p、1080p四种分辨率,以及5秒、8秒、10秒三种时长。需要注意:1080p不支持10秒时长,快速运动模式不支持8秒时长。画幅比支持16:9、9:16、4:3、3:4、1:1五种。

AI视频生成的视频有声音吗?

默认开启音频生成功能,AI会根据视频内容自动生成环境音效、背景音乐与角色台词,实现音画同步。开启音频会增加积分消耗。如果不需要声音,可以在设置中关闭音频生成来节省积分。

充值后可以退款吗?

积分充值后不支持退款,人民币和积分不能互相转换。充值前请确认金额,如有疑问请联系客服。余额永久有效,无时间限制。

为什么生成速度很慢?

生成速度受以下因素影响:

  • 使用HD或MAI类型的语音模型会比标准语音模型慢,因为这些高级模型具备更复杂的神经网络架构和情感识别能力。
  • 使用标准质量以外的音频质量参数(如高质量、无损等)也会显著增加生成时间。
  • 文本长度越长,生成时间越长(系统会自动分段处理)。
  • 服务器繁忙时(如高峰时段)生成速度可能变慢。

如果需要生成高质量音频,推荐使用批量生成功能,批量生成采用异步处理机制,速度更快且更稳定,适合处理大量高质量音频需求。

以前不是说完全免费、不限次数吗?为什么现在有次数限制了?

非常理解您的疑问。EdgeTTS配音服务依然是完全免费并且不限制次数和字数的,网站核心功能一直是免费的,只是之前网站曾遭受不明来源的恶意攻击,大量未知用户持续请求网站接口,导致服务器不堪重负、服务多次崩溃,正常用户也无法使用。为了保障所有用户能稳定使用,我们才给各功能设置了每日免费次数。免费额度会根据服务器运行情况动态调整,具体以个人中心显示为准,给您带来不便敬请谅解。

为什么要有每日次数限制?

主要是为了保障服务的稳定。之前网站遭受过不明来源的恶意攻击,大量请求导致服务多次崩溃,设置每日次数限制可以避免服务器过载,保证正常用户能顺畅使用。各功能的免费额度会根据服务器情况动态调整,具体以个人中心显示为准,开通会员可以获得更多次数。

每个功能每天能用几次?免费次数具体是多少?

各功能的免费额度会根据服务器运行情况动态调整,不是固定不变的,请以个人中心显示的实时额度为准。开通会员可以获得更高额度。

免费次数用完了怎么办?

免费次数用完后:① 可以开通会员获得更多每日次数(月会员28元/月、年会员99元/年、永久会员599元/永久);② 每日免费额度会按天刷新,次日可继续使用;③ 登录后额度按账号计算,可在个人中心查看剩余情况。具体以个人中心显示为准。

以后会收费吗?会不会变成付费软件?

网站的核心功能会一直免费提供,会员只是可选的增值服务(提供更高次数和更多权益),不会强制收费。免费额度可能会根据服务器运行情况动态调整,具体以个人中心显示为准。

你们是不是故意加限制、想逼用户付费?

不是的。EdgeTTS配音服务依然是完全免费并且不限制次数和字数的,网站核心功能一直免费,会员只是为有更高需求的用户提供的可选增值服务,不强制开通。设置每日次数限制,是因为之前遭受过不明来源的恶意攻击导致服务崩溃,为了保障所有用户能稳定使用才这样做的。免费额度会根据服务器情况动态调整,具体以个人中心显示为准。

升级会员可以增加字数/字符上限吗?

会员权益及各功能的字数/字符限制可能随时调整,具体请查看个人中心获取最新信息。

提示"此内容严格限制,已记录,停止此行为"是什么意思?

这说明您输入的内容命中了网站的违规内容限制,涉及法律法规禁止生成的内容(如政治敏感、邪教、分裂国家、黄赌毒、暴力等类型)。系统已禁止生成并记录,请您立即停止输入此类内容,修改文本后重新提交。

哪些内容不能生成?

网站禁止生成违法违规内容,主要包括:危害国家安全、破坏国家统一和社会稳定的内容(如宣扬分裂国家、颠覆国家政权、邪教等);损害国家荣誉和利益的内容;恐怖主义、极端主义内容;淫秽色情、赌博、毒品等违法犯罪内容;暴力血腥等危害社会公德的内容;以及其他法律法规禁止的内容。请正常使用网站生成合法合规内容。

我的内容被拦截了,是不是误判?能不能告诉我具体是哪个词?

网站对所有生成内容进行合规审查,拦截说明内容命中了违规限制。为避免争议,请直接修改或删除相关内容后重新提交,不要反复尝试输入被拦截的内容,具体违规词无法告知。如果确实需要反馈,可到问题反馈页面提交。

按钮点不动/页面功能无法使用/软件打不开?

如果您遇到按钮点击无反应、页面功能无法正常使用等问题,请先确认您是否是通过第三方软件(非浏览器)访问的网站。目前网上存在有人将本站打包成独立软件/App的情况,这些软件并非官方出品,可能导致页面功能异常(如按钮点不动、功能缺失等)。请务必使用浏览器(如Chrome、Safari、Edge等)直接访问官网 fuym.cn 使用,不要通过任何第三方软件或App访问,以确保所有功能正常可用。

网站有对外开放的API/接口吗?

有。本站提供面向开发者的开放接口文档,支持把微软文字转语音与字幕生成能力接入你自己的程序或网站,按积分计费(扣除账号积分)。所有接口动作、入参与返回字段、调用示例、价格和维护提示都以这份文档为准,请开发者以文档为准进行对接。

开放接口怎么收费?100积分等于多少元?

100积分 = 1元,扣除的是账号积分。文字转语音按字数计费:非会员100积分/1万字,1积分=100字,不足100字也按1积分、向上取整;字幕生成每次10积分。月会员9折、年会员8折、永久会员6折,折扣后向上取整、最低1积分。生成失败会自动退回本次积分。具体以开放接口文档为准。

开放接口的 API Key 在哪里获取?

第一步:注册并登录本站账号。第二步:进入个人中心的"开放接口 API"分区,点击"生成 / 重新生成 Key"(同一账号一个 Key,重新生成后旧 Key 立即失效)。第三步:调用接口时携带该 Key(api_key 参数或 X-Api-Key 等请求头,详见开放接口文档)。

开放接口支持哪些能力?一次能合成多少字?

开放接口支持两类能力:① 微软文字转语音——直接合成单次不超过1000字、同步返回音频,批量合成单次总字数不超过10万字、异步提交后轮询;② 字幕生成——上传 mp3/wav/mp4 音频或视频,自动识别生成 SRT 字幕(按次计费)。更完整的参数与返回字段说明见开放接口文档

开放接口稳定吗?会维护吗?返回 MAINTENANCE 怎么办?

官方说明:接口可能不定期维护,维护频率和维护时间都不确定,目前通常在每天中午 12 点左右。遇到维护提示(MAINTENANCE)时,请等待 1~2 分钟后再重试,因此本接口适合个人开发者使用,或与其他接口配合使用,不适合对可用性要求极高的生产业务。具体情况以开放接口文档为准。

开放接口调用失败会退积分吗?

会。生成失败会自动退回本次积分:字幕/直接合成失败即时退费;批量任务若最终失败或任务失效也会自动退费一次(不会重复退)。退费可在个人中心记录中查看,说明以"开放接口-…自动退回"开头。

各功能输出格式说明(重要,回答格式问题时必须严格按此)

  • 语音合成(首页):仅输出 MP3(32kbit/s - 16kHz 单声道),不支持 WAV
  • 多人对话:仅输出 MP3
  • 批量生成:仅输出 MP3(ZIP包内含多个MP3)
  • 语音克隆:仅输出 MP3
  • 语音设计:支持 WAV(默认)和 MP3,可切换
  • AI音乐:支持 MP3(默认)和 WAV(无损),可在高级设置中切换
  • AI绘图:输出 JPG 图片
  • AI视频:输出 MP4 视频文件
  • 字幕生成:输出 SRT 文本

注意:只有"语音设计"和"AI音乐"支持WAV格式,其他语音功能(语音合成、多人对话、批量生成、语音克隆)都只输出MP3。AI视频输出MP4。回答时不要混淆。