免费文字转语音 - 浮云梦配音
智能问答

给音频添加混响和回声

混响在浏览器里现场生成:四档空间预设加自定义,衰减 0.2 到 8 秒、湿声 0 到 100%、预延迟 0 到 120 毫秒都能拧,干声不上传服务器。

把一段干到发涩的人声推远一点,是这一页最常被用到的场景。四个预设里我更常用大厅,2.4 秒的尾巴给口播留出空间,又不会盖住咬字;教堂那个 4.5 秒的拖尾更适合念白和旁白,语速快的内容会糊成一团。

头一回用我把湿声推到 80%,整段像在浴室里说话。退回 35% 到 40% 之间,再把预延迟从 20 毫秒加到 45 毫秒,字头重新清楚起来。板式那个 1.4 秒的预设我用得最少,它亮而密,放在流行歌上还行,压口播会显得毛。

🎁 全员免费 🔒 文件不上传,全部在你的浏览器里处理

本地处理混响运算在你浏览器的内存里完成,音频文件不会上传,服务器不留存,也不需要注册登录。
格式与限制这一页依赖 OfflineAudioContext 与 ConvolverNode 做离线渲染,浏览器太旧时页面会提示换 Chrome、Edge 或 Firefox 新版。导出 MP3 与 WAV 最稳,其它格式看浏览器。
合法使用请确认你有权处理这段音频。加一层混响不改变版权归属,工具不做版权判断。
全员免费
🎵

把文件拖到这里,或者点击选择文件

支持 MP3 / WAV / OGG / FLAC / M4A / AAC 等常见格式;文件不上传,全部在你的浏览器里处理

00:00 / 00:00

2.4 秒
35%

干声会自动让出位置(湿声越大,直达声相对越低),所以拉到 100% 也不会爆

20 毫秒

拉长一点人声会更清楚,混响不会糊住咬字

45

数值越低混响越闷(像铺了地毯的房间),越高越亮(像瓷砖大厅)

混响是程序现场算出来的(指数衰减噪声 + 早期反射),不依赖任何素材库,所以任何音频拖进来都能用,也不用上传。

不用写扩展名,导出时按所选格式自动补上

本工具累计服务 39 次 今天 25 次 已导出 2 次 全部工具累计 303 次

怎么用:4 步完成

  1. 导入干声点“选择文件”或把音频拖进页面。素材越干,空间感越明显;已经带现场混响的录音再叠一层,很容易糊。
  2. 挑一个空间预设小房间 0.6 秒紧实,大厅 2.4 秒最常用,教堂 4.5 秒拖尾长,板式 1.4 秒亮而密。拿不准就先点大厅,再往下调。
  3. 微调四个参数湿声默认 35%,预延迟默认 20 毫秒,阻尼默认 45,衰减可以在 0.2 到 8 秒之间走。湿声越大干声会自动让位,推到 100% 也不会爆。
  4. 试听并导出混响糊住咬字就把预延迟拉到 40 到 60 毫秒,或者把湿声降回 25% 左右。导出时选 MP3(32 到 320 kbps)或 WAV(16 位/24 位),首次导 MP3 会加载约 120KB 的编码脚本。

四档预设对应的空间

预设只是四个起点,点进去以后参数还能接着改:

预设衰减听感我一般用在哪
小房间0.6 秒紧实,几乎不拖尾贴麦口播、播客对话
大厅2.4 秒尾巴适中,空间清楚人声、独奏、旁白
教堂4.5 秒拖尾长,泛音多念白、合唱、氛围铺底
板式1.4 秒亮而密,听不出方向流行歌、打击乐
自定义0.2 ~ 8 秒四个参数自己拧四档都不合适的时候

混响是现场生成的,不靠素材库

页面里的混响不是从素材库里挑一段现成的厅堂录音贴上去,而是每次处理时现算一条脉冲响应:一段指数衰减的噪声,再点几个早期反射。

这么做的直接好处有两个。任何音频拖进来都能用,不受素材和采样率的限制;衰减时间能从 0.2 秒一路转到 8 秒,不用在预设里迁就。代价是它不模拟具体房间的形状,声源绕到身后那种移动感做不出来。

湿声、预延迟、阻尼各管什么

三个参数管三件不同的事,分开调比一股脑往上推好使。

  • 湿声:混响占多少,默认 35%。拉到 60% 以上人声明显往后退;湿声越大,干声会自动让出位置(干声约为 1 减去湿声的一半),所以推到 100% 也不会爆掉。
  • 预延迟:干声和混响之间隔多久,范围 0 到 120 毫秒,默认 20。语音内容拉到 40 到 60 毫秒,咬字会重新清楚起来;留在 0 毫秒,人声会有一种贴着墙面说话的压迫感。
  • 阻尼(明暗):混响尾巴的亮度,10 到 100,默认 45。数值越低尾巴越闷,像铺了地毯的房间;越高越亮,像瓷砖大厅。我一般先留默认,觉得刺耳再往下挪。

边界与限制:这一页做不到的事

短板也写在这里。

  • 只能加,不能去。混响一旦写进文件就成了一段音频,这一页没有反卷积去混响的功能。
  • 不能导入自己的脉冲响应。空间只有四档预设和自定义参数,想复刻某个真实厅堂得另找工具。
  • 不做声像移动。混响均匀铺在两边,声音从左走到右这种效果它做不出来。
  • 浏览器太旧会直接提示。它靠离线渲染与卷积运算完成,老版本环境跑不起来,页面会建议你换 Chrome、Edge 或 Firefox 的新版。
  • 长音频吃内存。两个小时以上的素材在内存较小的设备上可能中途失败,单个文件建议不超过 200MB。

素材本身的质量还是决定性的。底噪大、爆音多的录音加上混响,这些毛病会跟着尾巴一起被拉长。

常见问题

数字上做了让步:湿声越大,干声自动降低,干声约为 1 减去湿声的一半。35% 时人声还站在前面,70% 时已经明显靠后。听不清咬字就把湿声降回 30% 附近,一般立刻好转。
语音类内容 40 到 60 毫秒比较稳妥,人声和混响之间留出一道缝,咬字不会被尾巴糊住。默认的 20 毫秒适合本来就不密集的音乐。上限是 120 毫秒,再长听起来就像回声,不像混响了。
干声会自动让位。湿声 100% 时干声大约只剩一半,两路加起来峰值不会翻倍,推到头也不会削波。听感上它更像纯空间,人声退得很靠后,念白类内容还有用,口播基本没人这么调。
不是。每次处理时程序现场算一条脉冲响应,用指数衰减噪声加若干早期反射拼出来,不依赖任何素材库。好处是不受素材限制,0.2 到 8 秒任意衰减都能给,任何音频拖进来直接就能用。
先把预延迟从 20 毫秒挪到 50 毫秒左右,给咬字留出空隙;糊通常还来自 4 秒以上的长衰减,把它压到 2 秒以内会干净很多。阻尼这个数值我一直没找到固定答案,刺就往低走,闷就往高走,听一遍再定。
它不能去掉已经录进文件里的混响,不能导入自己的脉冲响应,也不做左右移动的声像效果,老浏览器还不支持离线渲染。手上那段现场录脏的素材想救,这一页帮不上忙。