免费文字转语音 - 浮云梦配音
智能问答

去除音频静音(自动删掉空白片段)

去除静音按音量找停顿:阈值 -70 到 -20 dB 可调,默认 -45 dB,最短静音时长默认 0.35 秒,首尾空白一起删。文件不上传,在浏览器里跑完。

它适合把手机录的口播、访谈、课程音频压紧。每段保留间隔默认 0.08 秒,删完句子之间还留着一点呼吸,不会听着像被人掐断;比最短静音时长更短的停顿它索性不碰,换气和字间空隙就这么留住了。

我拿一段 14 分钟的课程录音跑默认参数,删掉 60 多段停顿、合计 2 分 20 秒上下。重听一遍才反应过来,原来那么多地方是老师停下来等我反应。把阈值换成 -35 dB 之后只删了明显的空场,反而更像原样讲课。参数没有标准答案,得靠耳朵定。

🎁 全员免费 🔒 文件不上传,全部在你的浏览器里处理

本地处理扫描与重写全程在你浏览器的内存里完成,音频不会上传,服务器留不下东西,也不需要注册登录。
格式与限制读文件与写文件都看浏览器:MP3、WAV、OGG、FLAC、M4A/AAC、WebM 一般读得进来,导出 MP3 与 WAV 最稳,WebM(Opus)、OGG(Opus) 和 Safari 上的 M4A 支持情况不一。处理长音频占内存,单个文件建议不超过 200MB。
合法使用请确认你有权处理这段音频。删掉停顿不改变版权归属,工具也不会替你做版权判断。
全员免费
🎵

把文件拖到这里,或者点击选择文件

支持 MP3 / WAV / OGG / FLAC / M4A / AAC 等常见格式;文件不上传,全部在你的浏览器里处理

00:00 / 00:00
-45 dB

低于这条线的当作静音。录音底噪大就往上调(-35 左右),干净素材保持 -45

0.35 秒

比这个短的停顿不动(避免把换气声和字间空隙切碎)

0.08 秒

删静音时每段留一点呼吸,听起来不会像被硬剪断

处理完会告诉你一共删掉了几段、合计多少秒。首尾的静音也会一起处理,所以「开头半秒空白」这种问题一次解决。

不用写扩展名,导出时按所选格式自动补上

本工具累计服务 16 次 今天 4 次 已导出 0 次 全部工具累计 299 次

怎么用:4 步完成

  1. 导入录音点“选择文件”或把文件拖进页面。MP3、WAV、OGG、FLAC、M4A/AAC、WebM 这些浏览器能解码的格式都能读,部分 MP4、MOV 里的音轨也能解出来。
  2. 先按默认参数跑一遍静音阈值留 -45 dB,最短静音时长 0.35 秒,每段保留间隔 0.08 秒。点开始处理,它会以 10 毫秒为一窗从头扫到尾。
  3. 看报告再调参数页面会告诉你删掉几段、合计多少秒、时长从多少变成多少。删得太少就把阈值往 -35 dB 挪,切得太碎就把最短静音时长调短,每段保留间隔给到 0.15 秒以上。
  4. 导出成品选 MP3(32 到 320 kbps)或 WAV(16 位/24 位)保存。头一回导出 MP3 会先加载约 120KB 的编码脚本,脚本没加载成功就改导 WAV。

静音是怎么被判出来的

判断方式很直白:音频以 10 毫秒为一窗从头扫到尾,只有连续低于阈值的部分才会被当成静音,而且这段连续长度得达到最短静音时长才会真的被删。

把阈值从 -45 dB 调到 -35 dB,被判成静音的部分变多,底噪大的手机录音也能清干净;往 -60 dB 走,只有真的安静到听不见的地方才会被删。比「最短静音时长」更短的停顿一律不动,这正是它不会把换气声和字间空隙切碎的原因。

首尾的静音同样在删除范围内,开头半秒空白这种毛病一次就解决了。

三个参数怎么配合

参数不多,写在一张表里更好查:

参数可调范围默认值往上调会怎样
静音阈值-70 ~ -20 dB-45 dB更多片段被判成静音,底噪大的录音该调高
最短静音时长0.1 ~ 3 秒0.35 秒只有更长的停顿才会被删,短停顿一律不动
每段保留间隔0 ~ 0.5 秒0.08 秒删完每段之间留下的呼吸更长,听着更松
扫描粒度10 毫秒一窗固定不是可调参数,改不了

我压紧口播的走法

先跑一遍默认参数,听删完的效果,别急着导出。这一遍基本能清掉八成废话停顿,但总会留几处让你皱眉的接缝。

第二遍我只改一个参数。要么把最短静音时长从 0.35 秒压到 0.2 秒,让半秒级别的停顿也进名单;要么反过来,把它提到 0.6 秒,只清掉那些超过半秒的大空场。一次改一个,改完立刻听,两轮以内能定下来。

顺序上还有一个坑:删完停顿再去 字幕生成 会顺很多,反过来先出字幕再删停顿,时间轴就对不上了。这个顺序我搞反过一次,后来固定成先去停顿、再出字幕。

边界与限制:它不做什么

几条限制写明白,免得你白等。

  • 不认说话内容。判断只看音量,翻页声、键盘声、空调底噪这些有响度的东西,在它眼里都算“有声”。
  • 不降噪。它只是把安静的部分删掉,留下的底噪原样保留,想压底噪得先过 音量调节 那一类处理。
  • 不去口水音,也不修爆音。齿音和口水声都落在“有声”区间里,删不掉。
  • 找不到符合条件的静音段时,页面会提示你把阈值调高,比如 -35 dB,或者把最短静音时长调短。
  • 处理全程占用本机内存,两小时以上的素材在内存小的设备上可能失败,单个文件建议控制在 200MB 以内。

版权这一关得你自己过。这一页不会判断你手上这段录音能不能删、能不能发到平台上。

常见问题

不会。扫描、重写、导出都在你浏览器的内存里跑,文件不上传,服务器也不留存,注册登录都不需要。页面加载完之后断网照样能用,只是别忘了导出,关掉标签页结果就没了。
干净素材就用默认的 -45 dB。底噪明显的手机录音往 -35 dB 试,能多清掉一批呼吸之间的小空隙;如果这段音频本身安静到几乎没有底噪,把阈值往 -55 dB 调,避免把轻声说话误删。
两种原因最常见:这段停顿的音量没有全程低于阈值,中途有杂音闯进来;或者它的长度没到最短静音时长。把最短静音时长从 0.35 秒往下调到 0.2 秒再跑一遍,通常就删掉了。
会。首尾的静音和中间的静音一起处理,开头半秒空白、结尾两秒空场都在删除范围内。删完之后如果听着太突然,把每段保留间隔调到 0.2 秒左右,给头尾留一点缓冲就顺了。
把每段保留间隔往上调,0.08 秒太紧就试 0.2 到 0.3 秒;顺手把阈值往回调 5 dB。停顿删得太干净,语速听着会比本人快,我一般留到 0.15 秒左右才觉得自然。
它不识别说话内容,只按音量判断,所以翻页声、空调声不会被删;也不降噪、不去口水音、不修爆音,导出的音质上限还是你导入的那份文件。噪声大的录音里,它可能连人声尾音一起删掉,那种素材得先做降噪。