浮云梦配音使用说明与常见问题
本页整理了浮云梦配音(fuym.cn)全部功能的参数、限制与操作步骤,以及免费额度、会员、积分充值等常见问题。页面内容与站内智能问答助手同源,实时同步更新。
网站概况
- 网站名称:浮云梦配音(fuym.cn)
- 定位:AI 语音合成(文字转语音 / TTS)平台 + AI视频生成
- 语音引擎:神经网络文本转语音(HD 语音模型具备情感识别能力)
- 语音类型:全部由神经网络模型生成,HD 语音模型具备情感识别能力
- 文件保留:所有生成的音频文件在服务器保留 60 分钟后自动删除
- 费用:网站核心功能免费使用,无需登录。各功能每日提供免费次数(具体额度以个人中心显示为准,可能根据服务器运行情况调整);AI视频生成使用积分制付费(需充值)
- 建站目的:提供高质量的免费语音合成服务,降低内容创作者的门槛
免费使用与会员体系
- 网站核心功能免费,无需登录即可使用,各功能每日提供免费次数(具体额度以个人中心显示为准)
- 之前网站曾遭受不明来源的恶意攻击,大量未知用户持续请求网站接口,导致服务器不堪重负、服务多次崩溃,正常用户也无法使用。为了保障所有用户能稳定使用,才给各功能设置了每日免费次数,给大家带来不便敬请谅解
- 免费次数耗尽后,可开通会员获得更多使用次数:月会员28元/月,年会员99元/年,永久会员599元/永久
- 未登录用户使用免费次数按IP计算,登录用户按账号计算
- AI视频生成功能与开放接口(第三方开发者服务)使用积分制付费,需要充值积分才能使用
- 字符数限制宽松:单次输入最多5000字,批量生成支持单条最多10万字
- 生成的音频/图片可用于商业用途(短视频、自媒体、教育培训等),无需申请授权
- 无水印、无版权问题
- 用户自行承担所生成内容的法律责任
10.EdgeTTS配音服务是完全免费并且不限制次数和字数的
交流群
站长微信 G770044133 添加请备注 浮云梦配音
QQ交流群:758655069
加群链接:https://qm.qq.com/q/DHshrDMTn2
用于解答用户疑问、收集反馈和建议,欢迎加入。
功能总览
语音合成(文字转语音)
对应的前端页面:首页(/)
- 输入文字,选择语言/发音人/说话风格,调节语速/音调/音量,生成 MP3 音频
- 支持 HD 神经网络语音模型,具备情感识别能力
- 单次输入最多 5000 字
- 每日提供免费次数(未登录按IP计算,登录按账号计算),具体额度以个人中心显示为准,可能根据服务器情况调整;超出后可开通会员获得更多次数
- 生成后可试听、下载 MP3、下载 MP4(含背景图视频)
- 多音字生成字幕可能会有错别字,最简单的办法就是生成前就替换成同音字
多人对话配音
对应的前端页面:/dialogue.html
- 需要提前在首页配置好角色,才能使用多人对话功能。如何配置角色请查看下方的"角色配置管理"说明。
- 支持AI智能拆分对话:粘贴完整对话文本,AI自动识别不同角色并拆分成多个段落,支持"角色名:对话内容"格式或每行一段自动识别
- 也可以手动添加段落,逐段配置语速/音调/音量/风格
- 支持插入停顿标记 <break time="2000ms" />
- 所有角色段落拼接为一个完整音频
- 总字数限制5000字
- 每日提供免费次数(未登录按IP计算,登录按账号计算),具体额度以个人中心显示为准
- 支持在普通文本中使用 [style:风格名]文本[/style] 语法来切换风格,无需切换到对话模式
- 注意:多人对话与文字转语音、批量生成属于同一系统,角色配置可互通使用。语音克隆、音色设计是独立模块,不互通。
批量生成
对应的前端页面:/batch.html
- 需要提前在首页配置好角色,才能使用批量生成功能。如何配置角色请查看下方的"角色配置管理"说明。
- 上传多行文本或导入文件,批量合成语音
- 每行文本可以配不同的语音/风格/语速/音调
- 单条文本最多100000字符
- 每天可提交的批量任务数量有限,具体额度以个人中心显示为准
- 支持选择音频格式和质量:MP3(多种码率)和 WAV(PCM)格式可选
- 支持"合并为一个任务"功能:勾选后所有文案合并为一个任务,压缩包中包含多个独立音频文件
- 每个任务默认生成一个音频文件,下载为ZIP压缩包
- 生成速度优势:采用异步处理机制,速度更快且更稳定,特别适合生成高质量音频(如使用HD/MAI语音模型或高质量音频参数时)
- 注意:批量生成与文字转语音、多人对话属于同一系统,角色配置可互通使用。语音克隆、音色设计是独立模块,不互通。
语音转换
对应的前端页面:/voice-convert.html
- 上传已有音频,将其转换为其他发音人的声音风格
- 支持上传格式:mp3, wav, ogg, flac, m4a, webm
- 文件大小限制:不超过20MB
语音克隆
对应的前端页面:/voice-clone.html
- 上传少量音频样本,克隆特定的声音特征
- 支持的音频格式:MP3、WAV
- 文件大小限制:不超过10MB
- 建议参考音频10秒以上、声音清晰无背景噪音
- 每日提供免费次数,具体额度以个人中心显示为准
- 单次合成文本最多500字符
- 支持丰富的参数调节(情感强度、温度、采样参数等)
- 另有公共音色库可供选择使用
- 语言支持:仅支持中文和英文两种语言的语音克隆,不支持其他语言
语音设计
对应的前端页面:/voice-design.html
- 用文字描述想要的音色(如"温柔的女声""低沉的男声"),AI 生成对应的语音
- 支持三种模式:音色设计、声音克隆(参考音频)、智能润色
- 每日提供免费次数,具体额度以个人中心显示为准
- 可选的格式:WAV(默认)、MP3
字幕生成
对应的前端页面:/srt.html
- 从音频/视频文件自动识别生成字幕文件(SRT 格式)
- 因为是AI识别,所以可能有错别字(同音字),可以在字幕工具页面校准
- 支持上传格式:mp3, wav, mp4, ogg, flac, m4a, wma, aac, webm
- 文件大小限制:不超过50MB
- 如果是视频文件,自动提取音频轨道
- 底层使用语音识别服务
- 支持13种识别语言:中文、英文(美/英/印度)、日文、韩文、法文、德文、俄文、意大利文、西班牙文(西班牙/墨西哥)、葡萄牙文(巴西)、阿拉伯文
- 支持翻译模式:识别后直接翻译为目标语言(如中文→英文)
字幕校准
对应的前端页面:/srt-calibrate.html
- 比对原文和AI识别的字幕,修正同音字、错别字
- 使用 AI 智能校准
- 支持上传格式:SRT、ASS、VTT
- 字幕内容限制:最多10000字符
- 原文案限制:最多10000字符
- 可选"消除句末标点"功能
双语字幕
对应的前端页面:/srt-calibrate.html(选项卡切换)
- 将单语言字幕翻译生成双语对照字幕
- 支持的语言互译:中文、英文、日文、韩文、德文、法文
- 使用 AI 翻译
- 字幕内容限制:最多10000字符
- 保持原始时间轴不变,原语言在上、翻译在下
字幕格式转换
对应的前端页面:/srt-calibrate.html(选项卡切换)
- 在不同字幕格式之间互相转换
- 支持的格式:SRT、ASS、VTT、TXT
- 支持6种ASS特效样式:经典白字黑边、霓虹发光、渐变彩色、阴影立体、卡拉OK高亮、电影字幕风
- 字幕内容限制:最多10000字符
文本润色
对应的前端页面:首页的"AI润色"按钮
- AI 自动优化文本,使其更适合语音朗读
- 修正错别字、优化语句流畅度、去除多余标点
- 保留停顿标记(如"停顿2秒"等)
- 文本限制:最多5000字
AI 音乐
对应的前端页面:AI音乐页面
- 用文字描述想要的音乐风格和内容,AI 自动生成音乐
- 两种模式:
- 歌曲模式(默认):输入歌词+风格描述,生成带人声的歌曲
- 纯音乐模式(实验性):勾选"纯音乐"复选框,只需输入风格描述。注意:纯音乐功能标记为实验性,模型默认倾向生成带人声音乐,纯音乐可能需要多次试错
- 风格描述:10-2000字符,通过文本框输入(如"轻快的钢琴曲""中国风古筝""摇滚力量"等)
- 歌词:10-3000字符,支持结构标签:[intro]引子、[verse]主歌、[pre-chorus]预副歌、[chorus]副歌、[hook]记忆点、[interlude]间奏、[bridge]桥段、[outro]结尾
- 音频格式:MP3(默认)或 WAV(无损),在高级设置中切换
- 生成时间:约30-120秒
- 每日提供免费次数,具体额度以个人中心显示为准
- 音频文件60分钟后自动删除,请及时下载
- 历史记录保存在浏览器本地(最多50条),换浏览器或清缓存会丢失
- 页面提供风格预设按钮:流行电子、抒情民谣、摇滚力量、中国风、R&B慢歌、嘻哈说唱、Lo-fi学习、史诗电影、爵士钢琴
- 页面提供歌词示例按钮:治愈系民谣、电子舞曲、中国风、深夜电台、甜蜜情歌、励志热血、悠闲午后
AI 绘图
对应的前端页面:AI绘图页面
- 用文字描述想要的画面,AI 自动生成图片
- 两种模式:
- 文生图(默认):仅输入文字描述,AI 生成全新图片
- 图片编辑:上传参考图片 + 文字描述,对原图进行修改或风格转换
- prompt 最大888字符
- 参考图片:支持 JPG/PNG/WEBP 格式,最大10MB(仅编辑模式)
- 图片尺寸和质量由系统自动设定,用户无需手动选择
- 每日提供免费次数,具体额度以个人中心显示为准
- 生成机制:异步处理,提交后系统排队生成,前端自动轮询获取结果
- 历史记录:已登录用户最多保存10张,未登录最多5张(服务器端存储,不随浏览器清除丢失)
- 图片不会自动过期,可随时在历史记录中查看和下载
- 页面加载时自动恢复之前未完成的生成任务
- 页面提供示例提示词按钮:动漫少女、暗黑战士、写实猫咪、赛博朋克、国风仙境、微缩世界
- 生成的图片可免费用于个人和商业用途
AI 视频生成
对应的前端页面:AI视频页面
- 使用积分制付费,需要先充值积分才能使用
- 支持三种生成模式:
- 文生视频(ttv):输入文字描述,AI自动生成视频
- 图生视频(itv):上传参考图片 + 文字描述,生成视频
- 首尾帧生视频(itv2):上传首帧和尾帧图片,生成过渡视频
- 支持的画幅比:16:9、9:16、4:3、3:4、1:1
- 支持的分辨率:360p、540p、720p、1080p
- 支持的时长:5秒、8秒、10秒
- 注意:1080p不支持10秒时长,快速运动模式不支持8秒时长
- 运动模式:普通模式、快速模式
- 音频生成:默认开启,AI根据视频内容自动生成环境音效、背景音乐与角色台词,实现音画同步。可手动关闭
- 生成机制:异步处理,提交后系统排队生成,前端自动轮询获取结果
- 生成时间:通常需要几分钟,取决于视频复杂度
- 参考图片格式:JPG/PNG/WEBP,最大10MB
- 历史记录:已登录用户最多保存10条,未登录最多5条
- 生成的视频10分钟后自动删除,请及时下载
- 图片输入格式:JPG、PNG、WEBP,最大10MB
开放接口(开发者 API)
- 性质:浮云梦配音除了网页版免费功能外,还提供面向第三方开发者/程序的「开放接口」(Open API)服务,可以把本站的微软文字转语音(文字转语音)与字幕生成能力接入开发者自己的程序、脚本或网站。它属于积分付费服务,扣除的是账号积分,不使用网页版的免费次数。
- 官方文档:开放接口文档 是唯一权威说明,包含全部接口动作、每个动作的入参与返回字段说明、调用示例、错误码、价格与维护提示。回答任何开放接口问题都应引导用户查看该文档,并以其为准。
- 适用人群:官方明确说明:接口可能在某个时间进行维护,维护频率和维护时间都不确定,目前通常在每天中午 12 点左右;遇到维护(返回 MAINTENANCE)需要等待 1~2 分钟再重试。因此本接口只适合个人开发者使用,或者和其他接口配合使用,不适合对可用性要求极高的生产业务。
- 如何获取 API Key:
第一步:注册并登录本站账号。
第二步:进入个人中心的"开放接口 API"分区,点击"生成 / 重新生成 Key"即可(同一账号一个 Key,重新生成后旧 Key 立即失效);也可在开放接口文档页面一键生成。
第三步:调用接口时携带该 Key(请求参数 api_key,或 X-Api-Key / Authorization: Bearer 请求头,详见文档)。
- 支持的能力:
- 文字转语音(微软 TTS):直接合成——单次不超过 1000 字,同步返回音频地址;批量合成——单次总字数不超过 10 万字,异步提交后凭任务ID轮询状态、完成后获取音频。
- 字幕生成:上传 mp3 / wav / mp4 音频或视频,自动识别生成 SRT 字幕(按次计费)。
- 计费规则(100 积分 = 1 元,扣账号积分):
- 文字转语音按字数:非会员 100 积分 / 1 万字;1 积分 = 100 字,不足 100 字也按 1 积分,向上取整。
- 字幕生成按次:每次 10 积分。
- 会员折扣:月会员 9 折、年会员 8 折、永久会员 6 折,折扣后向上取整,最低 1 积分。
- 生成失败自动退回本次积分:字幕/直接合成失败即时退费;批量任务若最终失败或任务失效(404),也会自动退费一次(不会重复退)。退费可见于个人中心记录,说明以"开放接口-…自动退回"开头。
- 频率与维护:开放接口有每分钟调用次数限制,文字转语音与字幕生成分别计数、互不共用,超限返回 RATE_LIMITED;接口可能不定期维护(目前通常每天中午 12 点前后),遇 MAINTENANCE 请等待 1~2 分钟后重试。具体每分钟次数、维护状态与窗口请以开放接口文档或调用 info 动作实时返回为准,不要凭记忆报数字。
- 提示:不要在开放接口问题上回答网页版各功能的每日免费次数,也不要回答任何不属于开放接口文档的接口细节。
积分与充值系统
积分是AI视频生成的付费方式,其他语音合成功能完全免费,不需要积分。
积分基本规则
- 100积分 = 1元人民币
- 充值最低额度:100积分(1元)
- 余额永久有效,无时间限制
- 人民币和积分不能互相转换(充值后不可提现)
- 支持微信支付和支付宝两种充值方式
如何充值
- 登录账号后进入个人中心
- 点击左侧菜单"积分充值"
- 选择预设金额或输入自定义积分数量(需为100的倍数)
- 选择支付方式(微信支付/支付宝)
- 点击"立即充值",扫码完成支付
- 支付成功后积分自动到账
积分充值套餐
- 100积分 = ¥1.00
- 500积分 = ¥5.00
- 1000积分 = ¥10.00
- 3000积分 = ¥30.00
- 5000积分 = ¥50.00
- 10000积分 = ¥100.00
- 也支持自定义金额(100的倍数)
AI视频生成价格参考
价格因分辨率、时长、是否开启音频而不同,以下为部分参考价格:
- 540p / 5秒 / 无声:83积分(¥0.83)
- 540p / 5秒 / 有声:176积分(¥1.76)
- 720p / 5秒 / 无声:104积分(¥1.04)
- 720p / 5秒 / 有声:197积分(¥1.97)
- 1080p / 5秒 / 无声:166积分(¥1.66)
- 1080p / 5秒 / 有声:259积分(¥2.59)
- 更高分辨率和更长时长价格更高,具体以页面显示为准
积分明细
在个人中心可以查看:
- 充值记录:查看所有充值历史
- 扣费记录:查看AI视频生成的每次扣费详情(含时间、积分、余额、说明)
- 推广佣金:通过推广链接邀请新用户注册,新用户充值积分或开通会员后,推广者获得对应比例的现金佣金(元,可提现)
推广返佣
- 每个用户都有专属推广链接,在个人中心的"推广中心"查看
- 推广链接格式:https://fuym.cn/?aff=用户ID
- 新用户通过推广链接访问网站后注册,自动绑定推广关系
- 被邀请用户充值积分或开通会员,推广者获得对应比例的现金佣金(元,满10元可提现)
- 推广中心可查看邀请的用户列表和佣金记录
- 注意:文字转语音、多人对话、批量生成 属于微软文字转语音服务,语音克隆是另一套功能,无法混合使用。所以如果用户将文字转语音的功能(例如停顿、背景音乐等)放到克隆页面,那么是无法使用的。
角色配置管理
角色配置用于保存常用的语音参数组合(发音人、风格、语速、音调、音量等),方便后续快速调用。
如何增加角色/管理角色:
- 在首页语音参数设置区下方,点击"角色配置管理"按钮
- 在弹出的弹窗中,点击"保存当前配置"
- 输入角色名称(如"温柔女声"、"新闻男声"),确定保存
- 已保存的角色会显示在列表中,支持:
- 应用:点击"使用"按钮,一键切换为该角色的所有设置
- 删除:点击"删除"按钮移除角色
- 支持导出/导入角色配置为JSON文件,方便备份或分享
- 未登录时角色保存在浏览器本地(localStorage),登录后保存在服务器,可跨设备同步
- 注意:角色保存的是当前语音设置(语言/发音人/风格/语速/音调/音量和角色扮演),不保存文本内容
- 在多人对话页面也可以从已保存的角色中选择发音人
首页功能按钮详解
文本输入区按钮
位于文本输入框下方的文件按钮组:
- 「清空文本」按钮:清空输入框中的所有文本内容
- 「插入停顿」按钮:在光标位置插入2秒停顿标记,用于控制朗读节奏
- 「插入风格」按钮:在光标位置插入风格标记,让同一段文字的不同部分使用不同的说话风格
- 「上传背景音乐」按钮:上传MP3/WAV背景音乐(最大10MB),朗读时自动混入背景音乐
- 「上传文件」按钮:上传TXT或DOCX文件,自动读取文件内容填入文本框
- 「SRT配音」按钮:上传SRT字幕文件,根据字幕时间轴逐段生成配音音频
- 「AI 润色」按钮:调用AI对文本进行智能润色,优化语句使之更适合朗读
- 「批量生成」按钮:打开批量生成对话框,提交多段文字批量合成语音
- 「任务列表」按钮:查看已提交的批量生成任务进度和结果
- 「Demo试听」按钮:试听所有发音人的音色样本
- 「多音字检测」按钮:检测文本中的多音字并自动标注正确读音。使用方法:第一步,在文本框中输入需要检测的内容(最多1500字)。第二步,点击"多音字检测"按钮。第三步,等待AI检测完成(约需几秒到一分钟),检测完成后文本框中的多音字会被自动标注读音。标注后的文本可直接用于生成语音,系统会根据标注正确朗读多音字。注意:文本不能超过1500字,否则会提示"文本过长"。
主操作按钮组
位于语音参数设置区下方:
- 「试听文本」按钮:仅截取第一句话生成语音进行试听,快速预览效果
- 「生成语音」按钮:主要的生成按钮,根据当前设置生成完整的语音音频
- 「历史记录」按钮:打开历史记录弹窗,查看之前生成的音频记录(最多20条),可回听和删除
语音参数区控件
- 「语言」下拉框:选择目标语言,切换后自动更新可用的发音人列表
- 「语音」下拉框:选择发音人(不同语言有不同的发音人可选)
- 「风格」下拉框:选择说话风格(如:亲切、新闻播报、抒情、悲伤等)
- 语言/语音/风格各有一个「展开」按钮:点击弹窗展示所有选项,支持搜索过滤
- 「试听」按钮:试听当前选中的发音人的声音效果
- 「语速」滑块:0.5x-2.0x,步长0.05,调节朗读速度
- 「音量」滑块:0-100%,默认75%,调节输出音量
- 「音调」滑块:-50%到+50%,调节声音高低
- 「目标时长」输入:指定音频的目标时长(秒),系统自动调整语速以匹配
- 「静音类型」下拉框:9种可选——Leading(开头静音)、Leading-exact(精确开头静音)、Tailing(末尾静音)、Tailing-exact(精确末尾静音)、Sentenceboundary(句间静音)、Sentenceboundary-exact(精确句间静音)、Comma-exact(逗号处精确静音)、Semicolon-exact(分号处精确静音)、Enumerationcomma-exact(枚举逗号处精确静音)
- 「静音时长」下拉框:可选200ms/500ms/1s/1.5s/2s/3s/5s/10s/20s
- 「角色配置管理」按钮:打开角色配置弹窗,管理和应用角色预设。角色配置包含角色扮演(Role Play)功能,可为语音添加特定角色效果
- 「重置为默认」按钮:重置所有语音参数为默认值
播放结果区控件
生成完成后显示:
- 音频播放器:可播放/暂停/拖动进度
- 「下载音频」按钮:下载生成的MP3音频文件
- 「下载为MP4」按钮:以背景图片+音频合成为MP4视频下载
- 「生成字幕」按钮:从生成的音频中识别并生成SRT字幕
- 「下载字幕」按钮:下载已生成的SRT字幕文件
其他页面功能
- 统计模块:显示"今日使用人数"、"今日总使用字数"、"我的今日字数"
- 滚动通知条:轮播显示问题反馈入口、本周统计、更新预告等信息
- 8个语音工具集卡片:展示文字转语音、多人对话、批量生成、AI音乐、AI绘图、AI视频等核心功能的图文介绍
- 自动保存草稿:输入的文本内容自动保存到浏览器本地存储,刷新页面或意外关闭后不丢失
语音合成详细步骤
- 打开网站 https://fuym.cn
- 在文本框中输入需要合成语音的文字(最多5000字)
- 选择目标语言(中文、英文、日文、韩文、法文、德文、俄文等数十种)
- 选择发音人(每种语言下有多个不同风格的发音人可选)
- 选择说话风格(如:一般、亲切、新闻播报、抒情、悲伤、 angry 等)
- 调节语速(0.5x - 2.0x)、音调、音量
- 点击"生成语音"按钮
- 完成后可试听、下载 MP3、下载 MP4(含背景图视频)
SSML 标签说明
用户可以在输入文本中使用 SSML(语音合成标记语言)标签来控制发音,例如:
- 插入停顿
- 强调某个词
- 指定某个词的读音
- 控制语速/音调/音量
- 指定说话风格和角色扮演
重要:输入内容中的 < 和 > 如果不是合法的 SSML 标签,会被转义,可能导致生成异常。请避免在文本中使用 <> 符号。详细说明请查看网站的 SSML 页面。
注册邮箱限制
需要常用邮箱 例如QQ邮箱、163邮箱,如果提示邮件发送失败,先检查是不是输入错误了,再看是不是常用邮箱。
违规内容限制
网站对所有生成功能(语音合成、多人对话、批量生成、语音克隆、语音设计、AI音乐、AI绘图、AI视频、字幕生成、文本润色等)的输入内容进行合规审查,禁止生成违法违规内容。核心原则:违反法律法规的内容一律禁止生成。
禁止生成的内容类型(回答用户时用这些类型概括描述,不要列举具体词语):
- 危害国家安全、破坏国家统一和社会稳定的内容:如宣扬分裂国家(台独、藏独、疆独、港独等)、颠覆国家政权、邪教组织相关内容等
- 损害国家荣誉和利益、侮辱国格的内容
- 宣扬恐怖主义、极端主义的内容
- 淫秽色情、赌博、毒品等违法犯罪内容
- 暴力、血腥、虐待等危害社会公德的内容
- 其他法律法规明令禁止的内容
处理方式与回答口径:
- 当用户输入内容命中违规限制时,系统会直接禁止生成,并提示"此内容严格限制,已记录,停止此行为"。此时告知用户:内容涉及网站不允许生成的违规内容,系统已记录,请立即停止输入此类内容,修改后重新提交。
- 用户询问"为什么被拦截""哪里违规了"时:不要列举具体的违规词,不要与用户争论内容是否违规,统一按上述口径回复,态度坚定但礼貌,不透露词库和审查机制的任何细节。
- 用户询问"哪些内容不能生成"时:用上面的类型分类概括回答,不透露具体词库清单。
- 用户询问"是不是有什么敏感词表""能给我看看违规词清单吗"时:不确认、不透露,统一回答"网站对所有生成内容进行合规审查,请遵守法律法规,不要尝试输入违规内容"。
- 反复尝试生成违规内容属于违规行为,系统会记录并可能限制继续使用(不透露记录和处置的具体技术细节)。
常见问题
生成失败/报错怎么办?
常见的原因有:
- 输入内容中包含了 < 或 > 符号(不是SSML标签)。因为这些符号被系统误认为SSML标签的一部分,如果格式不正确会导致解析失败。请检查并删除内容中的 <> 符号。
- 选择了外语发音人但输入了中文内容(或反之),发音人无法正确朗读不匹配的语种。例如选了英文发音人却输入中文,发音会不自然甚至失败。
- 内容中包含非文字编码的字符(如特殊Unicode符号、控制字符等)。
- 网络连接不稳定,请刷新后重试。
- 服务器暂时繁忙(特别段生成长文本时),请稍后再试。
或者内容完全没有换行空格句号等标点符号,导致系统无法正确解析。
建议先检查输入文本,删除 <> 等特殊符号,确保语言和发音人匹配,然后刷新页面重试。
为什么提示"验证信息已过期"?
页面长时间未操作后,验证信息会过期。请刷新页面即可恢复正常。页面会自动刷新,但如果长时间不操作还是可能过期。
支持哪些语言?
支持140+种语言,中文方面支持:普通话、粤语(香港)、台湾普通话、四川话、河南话、辽宁话、陕西话、山东话、广西话、吴语等方言。外语方面支持:英文(美国、英国、印度、澳大利亚、加拿大等口音)、日文、韩文、法文、德文、俄文、意大利文、西班牙文(西班牙、墨西哥、阿根廷等多国口音)、葡萄牙文(巴西、葡萄牙)、阿拉伯文、印地语、泰语、越南语、印尼语、马来语、土耳其语、波兰语、荷兰语、瑞典语等。每种语言下有多个不同风格的发音人可选。
字幕生成(语音识别)支持13种语言。
音频能保存多久?
生成的音频文件在服务器保留60分钟后自动删除。请及时下载保存。登录用户的历史记录(最近20条)会持久保存,但音频文件本身也是60分钟有效,历史记录中的音频链接60分钟后失效。
单次最多能输入多少字?
语音合成单次最多5000字。超过200字自动分段生成后拼接。
批量生成单条最多100000字,每天可提交的批量任务数量有限(具体以个人中心显示为准)。
字幕校准/双语字幕/格式转换最多10000字符。
文本润色最多5000字。
语音克隆单次最多500字符。
语音设计无明确字数限制(但建议合理长度)。
如何下载带视频的 MP4?
生成音频后,在播放器下方点击"下载为MP4"按钮。系统会以背景图片(1920×1080)配合音频生成视频文件。视频为黑色背景+居中的背景图片+音频轨道。
历史记录保存在哪里?
生成音频后系统会自动保存到历史记录中(最多保存最近20条)。登录后可以跨设备同步历史记录,未登录时记录保存在本地。
历史记录中的音频链接60分钟后失效。
为什么需要登录?
登录是免费的,主要用途包括:跨设备同步历史记录和角色配置、充值积分使用AI视频功能、查看推广链接和佣金记录、管理个人中心。不登录也可以正常使用所有免费功能(语音合成、语音克隆等)。
语音克隆怎么用?
第一步:在语音克隆页面上传一段参考音频(MP3或WAV,不超过10MB),建议10秒以上、声音清晰无噪音。
第二步:输入要合成的文本(最多500字)。
第三步:点击"开始克隆",系统会异步处理。
第四步:在任务列表中刷新查看进度,完成后即可试听和下载。
注意:每日提供免费次数,具体以个人中心显示为准。
如何分段生成长文本?
系统会自动处理长文本,用户不需要手动分段。当文本超过200字符时,系统会自动拆分并生成,最后拼接为完整音频。
是完全免费的吗?有会员吗?
网站核心功能是免费的,无需登录即可使用,各功能每日提供免费次数。之前网站曾遭受不明来源的恶意攻击,大量未知用户持续请求网站接口,导致服务器不堪重负、服务多次崩溃,为了保障所有用户能稳定使用,才设置了每日免费次数,具体额度以个人中心显示为准。免费次数耗尽后可以开通会员获得更多使用次数,会员分为月会员(28元/月)、年会员(99元/年)和永久会员(599元/永久)。会员是可选的增值服务,不强制开通。所有功能生成的内容均可商用,无水印。给大家带来不便,希望谅解。
使用页面时提示"请求处理中,请勿重复提交"?
这是请求防重复机制。如果不小心连续点击了按钮,稍等片刻后重试即可。如果长时间提示,请刷新页面。
如何实现多人对话?
打开多人对话页面,按以下步骤操作:
第一步:确保已在首页配置好角色。如果还没有配置,请先在首页的"角色配置管理"中创建角色。
第二步:在页面中添加对话段落,每个段落对应一个角色的台词。
第三步:为每个段落选择不同的发音人(角色)。如果已保存过角色配置,可以直接从角色列表中选择。
第四步:在文本框中输入该角色的台词内容。
第五步:可调节每个段落的语速、音调、风格等参数,也可插入停顿标记 <break time="2000ms" /> 控制节奏。
第六步:点击"生成对话"按钮,系统会将所有角色段落拼接为一个完整音频,生成后即可试听和下载。
注意:总字数限制5000字。需要我告知如何配置角色吗?
支持哪些音频格式下载?
这取决于你使用的具体功能,请根据你使用的功能对号入座:
- 语音合成(首页):仅 MP3(32kbit/s - 16kHz 单声道)
- 多人对话:仅 MP3
- 批量生成:支持 MP3(多种码率)和 WAV(PCM)格式,可在页面中选择音频质量。每个任务默认生成一个音频文件,勾选"合并为一个任务"后多个文案合并为一个任务,压缩包中包含多个独立音频文件
- 语音克隆:仅 MP3
- 语音设计:WAV(默认)或 MP3
- AI音乐:MP3(默认)或 WAV(无损)
SSML是什么?怎么用?
SSML(语音合成标记语言)是一种用XML标签控制语音输出的标记语言。您可以在输入文本中嵌入SSML标签来控制停顿、读音、语速等。详细说明请查看网站的 SSML 页面。
为什么我输入的<>符号导致报错?
本站的语音合成引擎使用 SSML(语音合成标记语言)来控制发音,所有 < 和 > 符号都会被解析为SSML标签。如果您的内容中包含 < 或 > 但并不是合法的SSML标签,系统会报错。解决办法:检查文本,删除或替换掉 <> 符号。只有白名单中的SSML标签(如 <break/>、<phoneme>、<say-as> 等)才是合法的。
如何反馈问题或提建议?
请访问问题反馈页面提交反馈。您可以提交Bug报告、功能建议等。
AI音乐怎么用?
打开AI音乐页面,第一步:选择模式(歌曲模式或纯音乐模式)。第二步:输入音乐风格描述(10-2000字符)。第三步:歌曲模式需输入歌词(10-3000字符),支持[intro][verse][chorus]等结构标签。第四步:在高级设置中选择音频格式(MP3或WAV)。第五步:点击生成,等待约30-120秒。注意:每日提供免费次数(具体以个人中心显示为准),纯音乐模式为实验性功能可能需多次尝试,音频60分钟后自动删除请及时下载。
AI绘图怎么用?
打开AI绘图页面,第一步:输入图片描述(最大888字符),越详细效果越好。第二步:如需编辑已有图片,切换到"图片编辑"模式并上传参考图(JPG/PNG/WEBP,最大10MB)。第三步:点击生成,系统异步处理,前端自动轮询结果。注意:每日提供免费次数(具体以个人中心显示为准),已登录用户历史记录最多10张、未登录5张,生成的图片可免费商用。
上传背景音乐后生成的语音没有音乐声?
请检查以下几点:第一步,确认已成功上传背景音乐(页面会显示文件名和预览播放器)。第二步,确认背景音乐格式为MP3或WAV,大小不超过10MB。第三步,直接点击"生成语音"按钮,背景音乐会自动与语音混合。注意:本站没有单独的"背景音乐音量"调节功能,背景音乐以原始音量与语音混合。如果仍然没有音乐声,请刷新页面重新上传背景音乐再试。
多音字怎么设置/标注读音?
有两种方式:
方式一(自动检测):在首页文本框输入内容(最多1500字),点击"多音字检测"按钮,系统会自动识别并标注所有多音字。
方式二(手动标注):在文本中直接使用 SSML phoneme 标签指定读音,格式为:
<phoneme alphabet="sapi" ph="拼音 数字声调">字</phoneme>
其中拼音用小写,声调用数字表示(1=阴平、2=阳平、3=上声、4=去声、5=轻声)。
常见示例:
- "银行"的"行":<phoneme alphabet="sapi" ph="hang 2">行</phoneme>
- "行走"的"行":<phoneme alphabet="sapi" ph="xing 2">行</phoneme>
- "还钱"的"还":<phoneme alphabet="sapi" ph="huan 2">还</phoneme>
- "还有"的"还":<phoneme alphabet="sapi" ph="hai 2">还</phoneme>
- "重量"的"重":<phoneme alphabet="sapi" ph="zhong 4">重</phoneme>
- "重复"的"重":<phoneme alphabet="sapi" ph="chong 2">重</phoneme>
手动标注适合已知哪些字需要指定读音的场景,自动检测适合一次性处理大量文本。
AI视频怎么用?
打开AI视频页面,第一步:选择生成模式(文生视频、图生视频或首尾帧生视频)。第二步:文生视频模式输入视频描述文字;图生视频模式上传参考图片并输入描述;首尾帧模式上传首帧和尾帧图片。第三步:选择画幅比(16:9/9:16/4:3/3:4/1:1)、分辨率(360p-1080p)和时长(5/8/10秒)。第四步:选择运动模式(普通/快速),可开启或关闭音频生成。第五步:点击生成,系统异步处理,前端自动轮询结果。注意:需要先充值积分,生成的视频10分钟后自动删除请及时下载。
AI视频生成要多少钱?
AI视频采用积分制付费,100积分=1元。价格根据分辨率、时长和是否开启音频不同而变化。例如:540p/5秒/无声约83积分(¥0.83),540p/5秒/有声约176积分(¥1.76),720p/5秒/有声约197积分(¥1.97)。具体价格以AI视频页面选择参数后显示的价格为准。
怎么充值积分?
第一步:登录账号。第二步:进入个人中心,点击左侧"积分充值"菜单。第三步:选择预设金额(100/500/1000/3000/5000/10000积分)或输入自定义数量(需为100的倍数)。第四步:选择支付方式(微信支付或支付宝)。第五步:点击"立即充值",扫码完成支付。支付成功后积分自动到账,余额永久有效。
积分还能用来做什么?
什么是推广返佣?怎么赚佣金?
每个用户都有专属推广链接,在个人中心的"推广中心"可以找到。把推广链接分享给朋友,朋友通过链接访问网站并注册后,就自动成为你的下级用户。当被邀请的用户充值积分或开通会员时,你都能获得充值/消费金额对应比例的现金佣金(元,自动到账可提现余额,满10元可申请提现)。推广中心可以查看邀请的用户列表和佣金记录。
AI视频支持哪些分辨率和时长?
支持360p、540p、720p、1080p四种分辨率,以及5秒、8秒、10秒三种时长。需要注意:1080p不支持10秒时长,快速运动模式不支持8秒时长。画幅比支持16:9、9:16、4:3、3:4、1:1五种。
AI视频生成的视频有声音吗?
默认开启音频生成功能,AI会根据视频内容自动生成环境音效、背景音乐与角色台词,实现音画同步。开启音频会增加积分消耗。如果不需要声音,可以在设置中关闭音频生成来节省积分。
充值后可以退款吗?
积分充值后不支持退款,人民币和积分不能互相转换。充值前请确认金额,如有疑问请联系客服。余额永久有效,无时间限制。
为什么生成速度很慢?
生成速度受以下因素影响:
- 使用HD或MAI类型的语音模型会比标准语音模型慢,因为这些高级模型具备更复杂的神经网络架构和情感识别能力。
- 使用标准质量以外的音频质量参数(如高质量、无损等)也会显著增加生成时间。
- 文本长度越长,生成时间越长(系统会自动分段处理)。
- 服务器繁忙时(如高峰时段)生成速度可能变慢。
如果需要生成高质量音频,推荐使用批量生成功能,批量生成采用异步处理机制,速度更快且更稳定,适合处理大量高质量音频需求。
以前不是说完全免费、不限次数吗?为什么现在有次数限制了?
为什么要有每日次数限制?
主要是为了保障服务的稳定。之前网站遭受过不明来源的恶意攻击,大量请求导致服务多次崩溃,设置每日次数限制可以避免服务器过载,保证正常用户能顺畅使用。各功能的免费额度会根据服务器情况动态调整,具体以个人中心显示为准,开通会员可以获得更多次数。
每个功能每天能用几次?免费次数具体是多少?
各功能的免费额度会根据服务器运行情况动态调整,不是固定不变的,请以个人中心显示的实时额度为准。开通会员可以获得更高额度。
免费次数用完了怎么办?
免费次数用完后:① 可以开通会员获得更多每日次数(月会员28元/月、年会员99元/年、永久会员599元/永久);② 每日免费额度会按天刷新,次日可继续使用;③ 登录后额度按账号计算,可在个人中心查看剩余情况。具体以个人中心显示为准。
以后会收费吗?会不会变成付费软件?
网站的核心功能会一直免费提供,会员只是可选的增值服务(提供更高次数和更多权益),不会强制收费。免费额度可能会根据服务器运行情况动态调整,具体以个人中心显示为准。
你们是不是故意加限制、想逼用户付费?
升级会员可以增加字数/字符上限吗?
会员权益及各功能的字数/字符限制可能随时调整,具体请查看个人中心获取最新信息。
提示"此内容严格限制,已记录,停止此行为"是什么意思?
这说明您输入的内容命中了网站的违规内容限制,涉及法律法规禁止生成的内容(如政治敏感、邪教、分裂国家、黄赌毒、暴力等类型)。系统已禁止生成并记录,请您立即停止输入此类内容,修改文本后重新提交。
哪些内容不能生成?
网站禁止生成违法违规内容,主要包括:危害国家安全、破坏国家统一和社会稳定的内容(如宣扬分裂国家、颠覆国家政权、邪教等);损害国家荣誉和利益的内容;恐怖主义、极端主义内容;淫秽色情、赌博、毒品等违法犯罪内容;暴力血腥等危害社会公德的内容;以及其他法律法规禁止的内容。请正常使用网站生成合法合规内容。
我的内容被拦截了,是不是误判?能不能告诉我具体是哪个词?
网站对所有生成内容进行合规审查,拦截说明内容命中了违规限制。为避免争议,请直接修改或删除相关内容后重新提交,不要反复尝试输入被拦截的内容,具体违规词无法告知。如果确实需要反馈,可到问题反馈页面提交。
按钮点不动/页面功能无法使用/软件打不开?
如果您遇到按钮点击无反应、页面功能无法正常使用等问题,请先确认您是否是通过第三方软件(非浏览器)访问的网站。目前网上存在有人将本站打包成独立软件/App的情况,这些软件并非官方出品,可能导致页面功能异常(如按钮点不动、功能缺失等)。请务必使用浏览器(如Chrome、Safari、Edge等)直接访问官网 fuym.cn 使用,不要通过任何第三方软件或App访问,以确保所有功能正常可用。
网站有对外开放的API/接口吗?
有。本站提供面向开发者的开放接口文档,支持把微软文字转语音与字幕生成能力接入你自己的程序或网站,按积分计费(扣除账号积分)。所有接口动作、入参与返回字段、调用示例、价格和维护提示都以这份文档为准,请开发者以文档为准进行对接。
开放接口怎么收费?100积分等于多少元?
100积分 = 1元,扣除的是账号积分。文字转语音按字数计费:非会员100积分/1万字,1积分=100字,不足100字也按1积分、向上取整;字幕生成每次10积分。月会员9折、年会员8折、永久会员6折,折扣后向上取整、最低1积分。生成失败会自动退回本次积分。具体以开放接口文档为准。
开放接口的 API Key 在哪里获取?
开放接口支持哪些能力?一次能合成多少字?
开放接口支持两类能力:① 微软文字转语音——直接合成单次不超过1000字、同步返回音频,批量合成单次总字数不超过10万字、异步提交后轮询;② 字幕生成——上传 mp3/wav/mp4 音频或视频,自动识别生成 SRT 字幕(按次计费)。更完整的参数与返回字段说明见开放接口文档。
开放接口稳定吗?会维护吗?返回 MAINTENANCE 怎么办?
官方说明:接口可能不定期维护,维护频率和维护时间都不确定,目前通常在每天中午 12 点左右。遇到维护提示(MAINTENANCE)时,请等待 1~2 分钟后再重试,因此本接口适合个人开发者使用,或与其他接口配合使用,不适合对可用性要求极高的生产业务。具体情况以开放接口文档为准。
开放接口调用失败会退积分吗?
会。生成失败会自动退回本次积分:字幕/直接合成失败即时退费;批量任务若最终失败或任务失效也会自动退费一次(不会重复退)。退费可在个人中心记录中查看,说明以"开放接口-…自动退回"开头。
各功能输出格式说明(重要,回答格式问题时必须严格按此)
- 语音合成(首页):仅输出 MP3(32kbit/s - 16kHz 单声道),不支持 WAV
- 多人对话:仅输出 MP3
- 批量生成:仅输出 MP3(ZIP包内含多个MP3)
- 语音克隆:仅输出 MP3
- 语音设计:支持 WAV(默认)和 MP3,可切换
- AI音乐:支持 MP3(默认)和 WAV(无损),可在高级设置中切换
- AI绘图:输出 JPG 图片
- AI视频:输出 MP4 视频文件
- 字幕生成:输出 SRT 文本
注意:只有"语音设计"和"AI音乐"支持WAV格式,其他语音功能(语音合成、多人对话、批量生成、语音克隆)都只输出MP3。AI视频输出MP4。回答时不要混淆。