免费文字转语音 - 浮云梦配音
智能问答

浮云梦配音使用说明与常见问题

本页整理了浮云梦配音(fuym.cn)全部功能的参数、限制与操作步骤,以及免费额度、会员、积分充值等常见问题。页面内容与站内智能问答助手同源,实时同步更新。

完全免费:首页文字转语音无次数和字数限制,无需登录即可使用;其他高级功能每日提供免费次数,超出后可通过开通会员或充值积分继续使用。

网站概况

  • 网站名称:浮云梦配音(fuym.cn)
  • 定位:AI 语音合成(文字转语音 / TTS)平台 + AI视频生成
  • 语音引擎:神经网络文本转语音(HD 语音模型具备情感识别能力)
  • 语音类型:全部由神经网络模型生成,HD 语音模型具备情感识别能力
  • 文件保留:所有生成的音频文件在服务器保留 60 分钟后自动删除
  • 费用:首页文字转语音完全免费、无水印;其他部分高级功能因运营成本较高设置了每日免费次数(希望大家谅解);AI视频生成使用积分制付费(需充值)
  • 建站目的:提供高质量的免费语音合成服务,降低内容创作者的门槛

免费使用与会员体系

  1. 首页的文字转语音功能完全免费,无次数和字数限制,无需登录即可使用
  2. 因为服务器和AI接口的运营成本越来越高,实在顶不住了,所以其他高级功能(语音克隆、语音设计、AI绘图、AI音乐、批量生成、字幕工具、AI智能拆分等)设置了每日免费次数,希望大家谅解
  3. 免费次数耗尽后,可开通会员获得更多使用次数:年会员99元/年,永久会员299元/永久
  4. 未登录用户使用免费次数按IP计算,登录用户按账号计算
  5. AI视频生成功能使用积分制付费,需要充值积分才能使用
  6. 无字数限制(单次输入最多5000字,批量生成支持单条最多10万字)
  7. 生成的音频/图片可用于商业用途(短视频、自媒体、教育培训等),无需申请授权
  8. 无水印、无版权问题
  9. 用户自行承担所生成内容的法律责任

交流群

QQ交流群:758655069

加群链接:https://qm.qq.com/q/DHshrDMTn2

用于解答用户疑问、收集反馈和建议,欢迎加入。

功能总览

语音合成(文字转语音)

对应的前端页面:首页(/)

  • 输入文字,选择语言/发音人/说话风格,调节语速/音调/音量,生成 MP3 音频
  • 支持 HD 神经网络语音模型,具备情感识别能力
  • 单次输入最多 5000 字
  • 生成后可试听、下载 MP3、下载 MP4(含背景图视频)
  • 多音字生成字幕可能会有错别字,最简单的办法就是生成前就替换成同音字

多人对话配音

对应的前端页面:/dialogue.html

  • 需要提前配置好角色,才能使用多人对话配音功能
  • 为不同角色选择不同的发音人(声音),逐段配置语速/音调/音量/风格
  • 支持插入停顿标记 <break time="2000ms" />
  • 所有角色段落拼接为一个完整音频
  • 总字数限制5000字
  • 支持在普通文本中使用 [style:风格名]文本[/style] 语法来切换风格,无需切换到对话模式

批量生成

对应的前端页面:/batch.html

  • 上传多行文本或导入文件,批量合成语音
  • 每行文本可以配不同的语音/风格/语速/音调
  • 单条文本最多100000字符
  • 每天每个用户最多提交10个批量任务
  • 生成后可下载为ZIP压缩包
  • 需要提前配置好角色,才能使用批量生成功能

语音转换

对应的前端页面:/voice-convert.html

  • 上传已有音频,将其转换为其他发音人的声音风格
  • 支持上传格式:mp3, wav, ogg, flac, m4a, webm
  • 文件大小限制:不超过20MB

语音克隆

对应的前端页面:/voice-clone.html

  • 上传少量音频样本,克隆特定的声音特征
  • 支持的音频格式:MP3、WAV
  • 文件大小限制:不超过10MB
  • 建议参考音频10秒以上、声音清晰无背景噪音
  • 每日限制:每人每天最多10次
  • 单次合成文本最多500字符
  • 支持丰富的参数调节(情感强度、温度、采样参数等)
  • 另有公共音色库可供选择使用

语音设计

对应的前端页面:/voice-design.html

  • 用文字描述想要的音色(如"温柔的女声""低沉的男声"),AI 生成对应的语音
  • 支持三种模式:音色设计、声音克隆(参考音频)、智能润色
  • 每日限制:每人每天最多10次
  • 可选的格式:WAV(默认)、MP3

字幕生成

对应的前端页面:/srt.html

  • 从音频/视频文件自动识别生成字幕文件(SRT 格式)
  • 因为是AI识别,所以可能有错别字(同音字),可以在字幕工具页面校准
  • 支持上传格式:mp3, wav, mp4, ogg, flac, m4a, wma, aac, webm
  • 文件大小限制:不超过50MB
  • 如果是视频文件,自动提取音频轨道
  • 底层使用语音识别服务
  • 支持13种识别语言:中文、英文(美/英/印度)、日文、韩文、法文、德文、俄文、意大利文、西班牙文(西班牙/墨西哥)、葡萄牙文(巴西)、阿拉伯文
  • 支持翻译模式:识别后直接翻译为目标语言(如中文→英文)

字幕校准

对应的前端页面:/srt-calibrate.html

  • 比对原文和AI识别的字幕,修正同音字、错别字
  • 使用 AI 智能校准
  • 支持上传格式:SRT、ASS、VTT
  • 字幕内容限制:最多10000字符
  • 原文案限制:最多10000字符
  • 可选"消除句末标点"功能

双语字幕

对应的前端页面:/srt-calibrate.html(选项卡切换)

  • 将单语言字幕翻译生成双语对照字幕
  • 支持的语言互译:中文、英文、日文、韩文、德文、法文
  • 使用 AI 翻译
  • 字幕内容限制:最多10000字符
  • 保持原始时间轴不变,原语言在上、翻译在下

字幕格式转换

对应的前端页面:/srt-calibrate.html(选项卡切换)

  • 在不同字幕格式之间互相转换
  • 支持的格式:SRT、ASS、VTT、TXT
  • 支持6种ASS特效样式:经典白字黑边、霓虹发光、渐变彩色、阴影立体、卡拉OK高亮、电影字幕风
  • 字幕内容限制:最多10000字符

文本润色

对应的前端页面:首页的"AI润色"按钮

  • AI 自动优化文本,使其更适合语音朗读
  • 修正错别字、优化语句流畅度、去除多余标点
  • 保留停顿标记(如"停顿2秒"等)
  • 文本限制:最多5000字

AI 音乐

对应的前端页面:AI音乐页面

  • 用文字描述想要的音乐风格和内容,AI 自动生成音乐
  • 两种模式:
  • 歌曲模式(默认):输入歌词+风格描述,生成带人声的歌曲
  • 纯音乐模式(实验性):勾选"纯音乐"复选框,只需输入风格描述。注意:纯音乐功能标记为实验性,模型默认倾向生成带人声音乐,纯音乐可能需要多次试错
  • 风格描述:10-2000字符,通过文本框输入(如"轻快的钢琴曲""中国风古筝""摇滚力量"等)
  • 歌词:10-3000字符,支持结构标签:[intro]引子、[verse]主歌、[pre-chorus]预副歌、[chorus]副歌、[hook]记忆点、[interlude]间奏、[bridge]桥段、[outro]结尾
  • 音频格式:MP3(默认)或 WAV(无损),在高级设置中切换
  • 生成时间:约30-120秒
  • 每日限制:5次
  • 音频文件60分钟后自动删除,请及时下载
  • 历史记录保存在浏览器本地(最多50条),换浏览器或清缓存会丢失
  • 页面提供风格预设按钮:流行电子、抒情民谣、摇滚力量、中国风、R&B慢歌、嘻哈说唱、Lo-fi学习、史诗电影、爵士钢琴
  • 页面提供歌词示例按钮:治愈系民谣、电子舞曲、中国风、深夜电台、甜蜜情歌、励志热血、悠闲午后

AI 绘图

对应的前端页面:AI绘图页面

  • 用文字描述想要的画面,AI 自动生成图片
  • 两种模式:
  • 文生图(默认):仅输入文字描述,AI 生成全新图片
  • 图片编辑:上传参考图片 + 文字描述,对原图进行修改或风格转换
  • prompt 最大500字符
  • 参考图片:支持 JPG/PNG/WEBP 格式,最大10MB(仅编辑模式)
  • 图片尺寸和质量由系统自动设定,用户无需手动选择
  • 每日限制:5次
  • 生成机制:异步处理,提交后系统排队生成,前端自动轮询获取结果
  • 历史记录:已登录用户最多保存10张,未登录最多5张(服务器端存储,不随浏览器清除丢失)
  • 图片不会自动过期,可随时在历史记录中查看和下载
  • 页面加载时自动恢复之前未完成的生成任务
  • 页面提供示例提示词按钮:动漫少女、暗黑战士、写实猫咪、赛博朋克、国风仙境、微缩世界
  • 生成的图片可免费用于个人和商业用途

AI 视频生成

对应的前端页面:AI视频页面

  • 使用积分制付费,需要先充值积分才能使用
  • 支持三种生成模式:
  • 文生视频(ttv):输入文字描述,AI自动生成视频
  • 图生视频(itv):上传参考图片 + 文字描述,生成视频
  • 首尾帧生视频(itv2):上传首帧和尾帧图片,生成过渡视频
  • 支持的画幅比:16:9、9:16、4:3、3:4、1:1
  • 支持的分辨率:360p、540p、720p、1080p
  • 支持的时长:5秒、8秒、10秒
  • 注意:1080p不支持10秒时长,快速运动模式不支持8秒时长
  • 运动模式:普通模式、快速模式
  • 音频生成:默认开启,AI根据视频内容自动生成环境音效、背景音乐与角色台词,实现音画同步。可手动关闭
  • 生成机制:异步处理,提交后系统排队生成,前端自动轮询获取结果
  • 生成时间:通常需要几分钟,取决于视频复杂度
  • 参考图片格式:JPG/PNG/WEBP,最大10MB
  • 历史记录:已登录用户最多保存10条,未登录最多5条
  • 生成的视频10分钟后自动删除,请及时下载
  • 图片输入格式:JPG、PNG、WEBP,最大10MB

积分与充值系统

积分是AI视频生成的付费方式,其他语音合成功能完全免费,不需要积分。

积分基本规则

  • 100积分 = 1元人民币
  • 充值最低额度:100积分(1元)
  • 余额永久有效,无时间限制
  • 人民币和积分不能互相转换(充值后不可提现)
  • 支持微信支付和支付宝两种充值方式

如何充值

  1. 登录账号后进入个人中心
  2. 点击左侧菜单"积分充值"
  3. 选择预设金额或输入自定义积分数量(需为100的倍数)
  4. 选择支付方式(微信支付/支付宝)
  5. 点击"立即充值",扫码完成支付
  6. 支付成功后积分自动到账

积分充值套餐

  • 100积分 = ¥1.00
  • 500积分 = ¥5.00
  • 1000积分 = ¥10.00
  • 3000积分 = ¥30.00
  • 5000积分 = ¥50.00
  • 10000积分 = ¥100.00
  • 也支持自定义金额(100的倍数)

AI视频生成价格参考

价格因分辨率、时长、是否开启音频而不同,以下为部分参考价格:

  • 540p / 5秒 / 无声:83积分(¥0.83)
  • 540p / 5秒 / 有声:176积分(¥1.76)
  • 720p / 5秒 / 无声:104积分(¥1.04)
  • 720p / 5秒 / 有声:197积分(¥1.97)
  • 1080p / 5秒 / 无声:166积分(¥1.66)
  • 1080p / 5秒 / 有声:259积分(¥2.59)
  • 更高分辨率和更长时长价格更高,具体以页面显示为准

积分明细

个人中心可以查看:

  • 充值记录:查看所有充值历史
  • 扣费记录:查看AI视频生成的每次扣费详情(含时间、积分、余额、说明)
  • 推广佣金:通过推广链接邀请新用户注册,新用户充值后推广者获得20%佣金

推广返佣

  • 每个用户都有专属推广链接,在个人中心的"推广中心"查看
  • 推广链接格式:https://fuym.cn/?aff=用户ID
  • 新用户通过推广链接访问网站后注册,自动绑定推广关系
  • 被邀请用户充值后,推广者获得20%佣金(积分形式自动到账)
  • 推广中心可查看邀请的用户列表和佣金记录
  • 注意:文字转语音、多人对话、批量生成 属于微软文字转语音服务,语音克隆是另一套功能,无法混合使用。所以如果用户将文字转语音的功能(例如停顿、背景音乐等)放到克隆页面,那么是无法使用的。

角色配置管理

角色配置用于保存常用的语音参数组合(发音人、风格、语速、音调、音量等),方便后续快速调用。

如何增加角色/管理角色:

  1. 在首页语音参数设置区下方,点击"角色配置管理"按钮
  2. 在弹出的弹窗中,点击"保存当前配置"
  3. 输入角色名称(如"温柔女声"、"新闻男声"),确定保存
  4. 已保存的角色会显示在列表中,支持:
  • 应用:点击"使用"按钮,一键切换为该角色的所有设置
  • 删除:点击"删除"按钮移除角色
  1. 支持导出/导入角色配置为JSON文件,方便备份或分享
  2. 未登录时角色保存在浏览器本地(localStorage),登录后保存在服务器,可跨设备同步
  3. 注意:角色保存的是当前语音设置(语言/发音人/风格/语速/音调/音量和角色扮演),不保存文本内容
  4. 在多人对话页面也可以从已保存的角色中选择发音人

首页功能按钮详解

文本输入区按钮

位于文本输入框下方的文件按钮组:

  1. 「清空文本」按钮:清空输入框中的所有文本内容
  2. 「插入停顿」按钮:在光标位置插入2秒停顿标记,用于控制朗读节奏
  3. 「插入风格」按钮:在光标位置插入风格标记,让同一段文字的不同部分使用不同的说话风格
  4. 「上传背景音乐」按钮:上传MP3/WAV背景音乐(最大10MB),朗读时自动混入背景音乐
  5. 「上传文件」按钮:上传TXT或DOCX文件,自动读取文件内容填入文本框
  6. 「SRT配音」按钮:上传SRT字幕文件,根据字幕时间轴逐段生成配音音频
  7. 「AI 润色」按钮:调用AI对文本进行智能润色,优化语句使之更适合朗读
  8. 「批量生成」按钮:打开批量生成对话框,提交多段文字批量合成语音
  9. 「任务列表」按钮:查看已提交的批量生成任务进度和结果
  10. 「Demo试听」按钮:试听所有发音人的音色样本
  11. 「多音字检测」按钮:检测文本中的多音字并自动标注正确读音。使用方法:第一步,在文本框中输入需要检测的内容(最多1500字)。第二步,点击"多音字检测"按钮。第三步,等待AI检测完成(约需几秒到一分钟),检测完成后文本框中的多音字会被自动标注读音。标注后的文本可直接用于生成语音,系统会根据标注正确朗读多音字。注意:文本不能超过1500字,否则会提示"文本过长"。

主操作按钮组

位于语音参数设置区下方:

  1. 「试听文本」按钮:仅截取第一句话生成语音进行试听,快速预览效果
  2. 「生成语音」按钮:主要的生成按钮,根据当前设置生成完整的语音音频
  3. 「历史记录」按钮:打开历史记录弹窗,查看之前生成的音频记录(最多20条),可回听和删除

语音参数区控件

  1. 「语言」下拉框:选择目标语言,切换后自动更新可用的发音人列表
  2. 「语音」下拉框:选择发音人(不同语言有不同的发音人可选)
  3. 「风格」下拉框:选择说话风格(如:亲切、新闻播报、抒情、悲伤等)
  4. 语言/语音/风格各有一个「展开」按钮:点击弹窗展示所有选项,支持搜索过滤
  5. 「试听」按钮:试听当前选中的发音人的声音效果
  6. 「语速」滑块:0.5x-2.0x,步长0.05,调节朗读速度
  7. 「音量」滑块:0-100%,默认75%,调节输出音量
  8. 「音调」滑块:-50%到+50%,调节声音高低
  9. 「目标时长」输入:指定音频的目标时长(秒),系统自动调整语速以匹配
  10. 「静音类型」下拉框:9种可选——Leading(开头静音)、Leading-exact(精确开头静音)、Tailing(末尾静音)、Tailing-exact(精确末尾静音)、Sentenceboundary(句间静音)、Sentenceboundary-exact(精确句间静音)、Comma-exact(逗号处精确静音)、Semicolon-exact(分号处精确静音)、Enumerationcomma-exact(枚举逗号处精确静音)
  11. 「静音时长」下拉框:可选200ms/500ms/1s/1.5s/2s/3s/5s/10s/20s
  12. 「角色配置管理」按钮:打开角色配置弹窗,管理和应用角色预设。角色配置包含角色扮演(Role Play)功能,可为语音添加特定角色效果
  13. 「重置为默认」按钮:重置所有语音参数为默认值

播放结果区控件

生成完成后显示:

  1. 音频播放器:可播放/暂停/拖动进度
  2. 「下载音频」按钮:下载生成的MP3音频文件
  3. 「下载为MP4」按钮:以背景图片+音频合成为MP4视频下载
  4. 「生成字幕」按钮:从生成的音频中识别并生成SRT字幕
  5. 「下载字幕」按钮:下载已生成的SRT字幕文件

其他页面功能

  1. 统计模块:显示"今日使用人数"、"今日总使用字数"、"我的今日字数"
  2. 滚动通知条:轮播显示问题反馈入口、本周统计、更新预告等信息
  3. 8个语音工具集卡片:展示文字转语音、多人对话、批量生成、AI音乐、AI绘图、AI视频等核心功能的图文介绍
  4. 自动保存草稿:输入的文本内容自动保存到浏览器本地存储,刷新页面或意外关闭后不丢失

语音合成详细步骤

  1. 打开网站 https://fuym.cn
  2. 在文本框中输入需要合成语音的文字(最多5000字)
  3. 选择目标语言(中文、英文、日文、韩文、法文、德文、俄文等数十种)
  4. 选择发音人(每种语言下有多个不同风格的发音人可选)
  5. 选择说话风格(如:一般、亲切、新闻播报、抒情、悲伤、 angry 等)
  6. 调节语速(0.5x - 2.0x)、音调、音量
  7. 点击"生成语音"按钮
  8. 完成后可试听、下载 MP3、下载 MP4(含背景图视频)

SSML 标签说明

用户可以在输入文本中使用 SSML(语音合成标记语言)标签来控制发音,例如:

  • 插入停顿
  • 强调某个词
  • 指定某个词的读音
  • 控制语速/音调/音量
  • 指定说话风格和角色扮演

重要:输入内容中的 < 和 > 如果不是合法的 SSML 标签,会被转义,可能导致生成异常。请避免在文本中使用 <> 符号。详细说明请查看网站的 SSML 页面。

常见问题

生成失败/报错怎么办?

常见的原因有:

  • 输入内容中包含了 < 或 > 符号(不是SSML标签)。因为这些符号被系统误认为SSML标签的一部分,如果格式不正确会导致解析失败。请检查并删除内容中的 <> 符号。
  • 选择了外语发音人但输入了中文内容(或反之),发音人无法正确朗读不匹配的语种。例如选了英文发音人却输入中文,发音会不自然甚至失败。
  • 内容中包含非文字编码的字符(如特殊Unicode符号、控制字符等)。
  • 网络连接不稳定,请刷新后重试。
  • 服务器暂时繁忙(特别段生成长文本时),请稍后再试。

或者内容完全没有换行空格句号等标点符号,导致系统无法正确解析。

建议先检查输入文本,删除 <> 等特殊符号,确保语言和发音人匹配,然后刷新页面重试。

为什么提示"验证信息已过期"?

页面长时间未操作后,验证信息会过期。请刷新页面即可恢复正常。页面会自动刷新,但如果长时间不操作还是可能过期。

支持哪些语言?

支持140+种语言,中文方面支持:普通话、粤语(香港)、台湾普通话、四川话、河南话、辽宁话、陕西话、山东话、广西话、吴语等方言。外语方面支持:英文(美国、英国、印度、澳大利亚、加拿大等口音)、日文、韩文、法文、德文、俄文、意大利文、西班牙文(西班牙、墨西哥、阿根廷等多国口音)、葡萄牙文(巴西、葡萄牙)、阿拉伯文、印地语、泰语、越南语、印尼语、马来语、土耳其语、波兰语、荷兰语、瑞典语等。每种语言下有多个不同风格的发音人可选。

字幕生成(语音识别)支持13种语言。

音频能保存多久?

生成的音频文件在服务器保留60分钟后自动删除。请及时下载保存。登录用户的历史记录(最近20条)会持久保存,但音频文件本身也是60分钟有效,历史记录中的音频链接60分钟后失效。

单次最多能输入多少字?

语音合成单次最多5000字。超过1000字自动分段生成后拼接。

批量生成单条最多100000字,每天最多50个批量任务。

字幕校准/双语字幕/格式转换最多10000字符。

文本润色最多5000字。

语音克隆单次最多500字符。

语音设计无明确字数限制(但建议合理长度)。

如何下载带视频的 MP4?

生成音频后,在播放器下方点击"下载为MP4"按钮。系统会以背景图片(1920×1080)配合音频生成视频文件。视频为黑色背景+居中的背景图片+音频轨道。

历史记录保存在哪里?

生成音频后系统会自动保存到历史记录中(最多保存最近20条)。登录后可以跨设备同步历史记录,未登录时记录保存在本地。

历史记录中的音频链接60分钟后失效。

为什么需要登录?

登录是免费的,主要用途包括:跨设备同步历史记录和角色配置、充值积分使用AI视频功能、查看推广链接和佣金记录、管理个人中心。不登录也可以正常使用所有免费功能(语音合成、语音克隆等)。

语音克隆怎么用?

第一步:在语音克隆页面上传一段参考音频(MP3或WAV,不超过10MB),建议10秒以上、声音清晰无噪音。

第二步:输入要合成的文本(最多500字)。

第三步:点击"开始克隆",系统会异步处理。

第四步:在任务列表中刷新查看进度,完成后即可试听和下载。

注意:每人每天最多10次。

如何分段生成长文本?

系统会自动处理长文本,用户不需要手动分段。当文本超过1000字符时,系统会自动拆分并生成,最后拼接为完整音频。

是完全免费的吗?有会员吗?

首页的文字转语音功能完全免费,无次数和字数限制,无需登录即可使用。因为服务器和AI接口的运营成本越来越高,实在顶不住了,所以其他高级功能(语音克隆、语音设计、AI绘图、AI音乐、批量生成等)设置了每日免费次数,免费次数耗尽后可以开通会员获得更多使用次数。会员分为年会员(99元/年)和永久会员(299元/永久)。所有功能生成的内容均可商用,无水印。给大家带来不便,希望谅解。

使用页面时提示"请求处理中,请勿重复提交"?

这是请求防重复机制。如果不小心连续点击了按钮,稍等片刻后重试即可。如果长时间提示,请刷新页面。

多人对话怎么用?

打开多人对话页面,第一步:添加对话段落,为每个段落选择不同的发音人(角色)。第二步:在文本框中输入该角色的台词。第三步:可以调节每个段落的语速、音调、风格。第四步:可插入停顿标记控制节奏。第五步:点击"生成对话"即可得到所有角色拼接的完整音频。

支持哪些音频格式下载?

这取决于你使用的具体功能,请根据你使用的功能对号入座:

  • 语音合成(首页):仅 MP3(32kbit/s - 16kHz 单声道)
  • 多人对话:仅 MP3
  • 批量生成:仅 MP3(ZIP压缩包内含多个MP3文件)
  • 语音克隆:仅 MP3
  • 语音设计:WAV(默认)或 MP3
  • AI音乐:MP3(默认)或 WAV(无损)

SSML是什么?怎么用?

SSML(语音合成标记语言)是一种用XML标签控制语音输出的标记语言。您可以在输入文本中嵌入SSML标签来控制停顿、读音、语速等。详细说明请查看网站的 SSML 页面。

为什么我输入的<>符号导致报错?

本站的语音合成引擎使用 SSML(语音合成标记语言)来控制发音,所有 < 和 > 符号都会被解析为SSML标签。如果您的内容中包含 < 或 > 但并不是合法的SSML标签,系统会报错。解决办法:检查文本,删除或替换掉 <> 符号。只有白名单中的SSML标签(如 <break/>、<phoneme>、<say-as> 等)才是合法的。

如何反馈问题或提建议?

请访问问题反馈页面提交反馈。您可以提交Bug报告、功能建议等。

AI音乐怎么用?

打开AI音乐页面,第一步:选择模式(歌曲模式或纯音乐模式)。第二步:输入音乐风格描述(10-2000字符)。第三步:歌曲模式需输入歌词(10-3000字符),支持[intro][verse][chorus]等结构标签。第四步:在高级设置中选择音频格式(MP3或WAV)。第五步:点击生成,等待约30-120秒。注意:每日限5次,纯音乐模式为实验性功能可能需多次尝试,音频60分钟后自动删除请及时下载。

AI绘图怎么用?

打开AI绘图页面,第一步:输入图片描述(最大500字符),越详细效果越好。第二步:如需编辑已有图片,切换到"图片编辑"模式并上传参考图(JPG/PNG/WEBP,最大10MB)。第三步:点击生成,系统异步处理,前端自动轮询结果。注意:每日限5次,已登录用户历史记录最多10张、未登录5张,生成的图片可免费商用。

上传背景音乐后生成的语音没有音乐声?

请检查以下几点:第一步,确认已成功上传背景音乐(页面会显示文件名和预览播放器)。第二步,确认背景音乐格式为MP3或WAV,大小不超过10MB。第三步,直接点击"生成语音"按钮,背景音乐会自动与语音混合。注意:本站没有单独的"背景音乐音量"调节功能,背景音乐以原始音量与语音混合。如果仍然没有音乐声,请刷新页面重新上传背景音乐再试。

多音字怎么设置/标注读音?

有两种方式:

方式一(自动检测):在首页文本框输入内容(最多1500字),点击"多音字检测"按钮,系统会自动识别并标注所有多音字。

方式二(手动标注):在文本中直接使用 SSML phoneme 标签指定读音,格式为:

<phoneme alphabet="sapi" ph="拼音 数字声调">字</phoneme>

其中拼音用小写,声调用数字表示(1=阴平、2=阳平、3=上声、4=去声、5=轻声)。

常见示例:

  • "银行"的"行":<phoneme alphabet="sapi" ph="hang 2">行</phoneme>
  • "行走"的"行":<phoneme alphabet="sapi" ph="xing 2">行</phoneme>
  • "还钱"的"还":<phoneme alphabet="sapi" ph="huan 2">还</phoneme>
  • "还有"的"还":<phoneme alphabet="sapi" ph="hai 2">还</phoneme>
  • "重量"的"重":<phoneme alphabet="sapi" ph="zhong 4">重</phoneme>
  • "重复"的"重":<phoneme alphabet="sapi" ph="chong 2">重</phoneme>

手动标注适合已知哪些字需要指定读音的场景,自动检测适合一次性处理大量文本。

AI视频怎么用?

打开AI视频页面,第一步:选择生成模式(文生视频、图生视频或首尾帧生视频)。第二步:文生视频模式输入视频描述文字;图生视频模式上传参考图片并输入描述;首尾帧模式上传首帧和尾帧图片。第三步:选择画幅比(16:9/9:16/4:3/3:4/1:1)、分辨率(360p-1080p)和时长(5/8/10秒)。第四步:选择运动模式(普通/快速),可开启或关闭音频生成。第五步:点击生成,系统异步处理,前端自动轮询结果。注意:需要先充值积分,生成的视频10分钟后自动删除请及时下载。

AI视频生成要多少钱?

AI视频采用积分制付费,100积分=1元。价格根据分辨率、时长和是否开启音频不同而变化。例如:540p/5秒/无声约83积分(¥0.83),540p/5秒/有声约176积分(¥1.76),720p/5秒/有声约197积分(¥1.97)。具体价格以AI视频页面选择参数后显示的价格为准。

怎么充值积分?

第一步:登录账号。第二步:进入个人中心,点击左侧"积分充值"菜单。第三步:选择预设金额(100/500/1000/3000/5000/10000积分)或输入自定义数量(需为100的倍数)。第四步:选择支付方式(微信支付或支付宝)。第五步:点击"立即充值",扫码完成支付。支付成功后积分自动到账,余额永久有效。

积分还能用来做什么?

目前积分仅用于AI视频生成功能。语音合成、语音克隆、语音设计、AI音乐、AI绘图、字幕工具等其他功能免费使用(部分功能有每日次数限制),不需要积分。未来如果有新的付费功能上线会另行通知。

什么是推广返佣?怎么赚积分?

每个用户都有专属推广链接,在个人中心的"推广中心"可以找到。把推广链接分享给朋友,朋友通过链接访问网站并注册后,就自动成为你的下级用户。当被邀请的用户充值积分时,你能获得充值金额20%的佣金(以积分形式自动到账)。推广中心可以查看邀请的用户列表和佣金记录。

AI视频支持哪些分辨率和时长?

支持360p、540p、720p、1080p四种分辨率,以及5秒、8秒、10秒三种时长。需要注意:1080p不支持10秒时长,快速运动模式不支持8秒时长。画幅比支持16:9、9:16、4:3、3:4、1:1五种。

AI视频生成的视频有声音吗?

默认开启音频生成功能,AI会根据视频内容自动生成环境音效、背景音乐与角色台词,实现音画同步。开启音频会增加积分消耗。如果不需要声音,可以在设置中关闭音频生成来节省积分。

充值后可以退款吗?

积分充值后不支持退款,人民币和积分不能互相转换。充值前请确认金额,如有疑问请联系客服。余额永久有效,无时间限制。

各功能输出格式说明(重要,回答格式问题时必须严格按此)

  • 语音合成(首页):仅输出 MP3(32kbit/s - 16kHz 单声道),不支持 WAV
  • 多人对话:仅输出 MP3
  • 批量生成:仅输出 MP3(ZIP包内含多个MP3)
  • 语音克隆:仅输出 MP3
  • 语音设计:支持 WAV(默认)和 MP3,可切换
  • AI音乐:支持 MP3(默认)和 WAV(无损),可在高级设置中切换
  • AI绘图:输出 JPG 图片
  • AI视频:输出 MP4 视频文件
  • 字幕生成:输出 SRT 文本

注意:只有"语音设计"和"AI音乐"支持WAV格式,其他语音功能(语音合成、多人对话、批量生成、语音克隆)都只输出MP3。AI视频输出MP4。回答时不要混淆。