免费文字转语音 - 浮云梦配音
智能问答

音频变速(加速或减速,音调保持不变)

音频速度可调 0.25x 到 4x。勾保持音调走波形拼接,慢;不勾直接重采样,快,音调随速度一起被拉高或压低。

同一段音频改成 0.5x,面前就两个选项:音调保住,人声只是被拖慢;音调不保,声音跟着沉下去。这个选择在成品里很难回头补救。

我拿一段两分钟的普通话旁白做过对照。1.5x 加保持音调,处理等了大约 8 秒,音色和原声基本一致;同样的 1.5x 不勾保持音调,一秒不到就出结果,但人声明显偏高,像掐着嗓子说话。

🎁 全员免费 🔒 文件不上传,全部在你的浏览器里处理

本地处理本地处理:解码、变速、导出都在你自己的浏览器内存里跑,音频不上传服务器,也不需要注册或登录。
格式与限制格式与限制:常见音频格式基本都能读;能导出哪些格式由你的浏览器决定,MP3 和 WAV 一定可用,WebM(Opus)、OGG(Opus) 视浏览器而定。素材体积控制在 200MB 以下更稳妥,保持音调的处理时间会随体积上升。
合法使用合法使用:请确认你有权处理这些音频,工具本身不做版权判断。
全员免费
🎵

把文件拖到这里,或者点击选择文件

支持 MP3 / WAV / OGG / FLAC / M4A / AAC 等常见格式;文件不上传,全部在你的浏览器里处理

00:00 / 00:00
1.25x

0.25x 到 4x;1.25x 常用于把啰嗦的口播压紧一点

保持音调:用波形拼接算法变速,音高不变,文件越长处理越久

不用写扩展名,导出时按所选格式自动补上

本工具累计服务 18 次 今天 2 次 已导出 0 次 全部工具累计 295 次

怎么用:4 步完成

  1. 载入并听基线拖入文件,先在原始速度下听一遍,记住这段素材原本的语速,改完才有得比。
  2. 选倍速滑块范围 0.25x 到 4x。听力材料常停 0.75x,会议录音常停 1.5x 到 2x。我一般先试 1.5x,觉得不够再往上加。
  3. 决定音调保不保人声、乐器、要交出去的成品勾上保持音调,走波形拼接;只想快速找位置,取消勾选走重采样,瞬间出结果。
  4. 试听两个位置再导出从头听 10 秒,再跳到中间听 10 秒,确认没有拼接带来的断续感,然后导成 MP3 或 WAV。

两种算法,两条不同的路

变速页只有一个开关,但这一个开关决定了音频要过哪种处理。搞清楚它,就知道为什么有时候等 8 秒,有时候不到 1 秒。

  • 保持音调:用波形拼接(SOLA/WSOLA)算法,在时域上找相似的片段重新码放,长度变了、音高没动。文件越长,找片段的时间越长,处理就越久。
  • 不保持音调:直接重采样,把采样点按新速度重新排一遍,几乎瞬间完成。代价是音调跟着速度一起走,变快就尖,变慢就闷。

要做成品,就勾上。要扫素材,就别勾。

0.25x 到 4x,各档位实际拿来干什么

倍速典型用法保持音调
0.25x–0.5x听清外语材料里的连读和吞音勾上,再慢人声会发糊
0.75x跟读、跟练乐器勾上
1.25x–1.5x过一遍两小时的会议录音勾上,语速快但字还听得清
2x快速扫素材找时间点可以不勾,省处理时间
3x–4x只用来定位,不出成品不用勾,勾了内容也听不清

为什么慢速比加速更容易露馅

往慢里调,算法要把相邻片段拉开,空隙得有内容补上,补得不好就是一股金属味的断续。往快里调是丢掉一部分片段,丢掉的常常正好是静音和重复,反而不容易听出来。

我试 0.3x 的时候,人声里会冒出轻微的金属味断续,单句听还行,连着放就明显;同一段素材用 3x 处理反而干净一些。低于 0.5x 的倍速,我一般只用来核对某句台词,不当成品用。

变速页的边界

它改的是整段速度,不是某一句的速度。想让一段采访里只有主持人那段快一点,得先在剪辑页切开,分别变速,再拼回去。

我踩过一次坑:整段 2x 处理完,访谈里的问和答挤在一起,嘉宾插话的位置全乱了。从那以后,高倍速我只对单人口播用。

  • 半小时以上的素材,处理期间内存占用会明显上去;内存小的设备跑两小时的录音有失败的可能,先切开再变速更稳。
  • 幅度大到 4x 或 0.25x,即便勾了保持音调,咬字也会含糊,语音素材建议停在 0.5x 到 2x 之间。
  • Chrome、Edge、Firefox 新版都跟得上;Safari 读常见格式没问题,导出的格式选择会少。
  • MP3 编码脚本加载失败时,页面会提示改用 WAV,变速结果照样能导出来。

常见问题

前者用波形拼接重排片段,时长变了音高不变;后者直接重采样,音高跟着速度一起改。要交成品就勾上保持音调;我扫 40 分钟的会议素材时不勾,反正只是找位置。
不勾保持音调就会变。1.5x 时人声明显偏高,0.5x 时明显偏低,这是重采样的必然结果而不是故障。勾上之后音高基本保持,代价是要多等一段处理时间。
范围内都能处理。听感上 0.5x 到 2x 是语音素材比较稳的区间,0.25x 附近会出现轻微的金属味断续,3x 以上只剩节奏和方向,具体内容已经听不清了。
跟素材长度成正比。两分钟的旁白我这边大约等 8 秒,十几分钟的录音就要按分钟算。等待期间页面会有进度提示,别切走标签页,切到后台浏览器会压低计算优先级。
能,把倍速设成原值的倒数就行,比如 1.5x 之后用 0.6667x 左右。但要清楚这是二次处理,波形拼接过一次的素材再拼第二次,细碎感会累加,能拿原文件重做就别在成品上反复折腾。
需要音乐节奏严格对齐画面卡点的片段,变速后节拍位置全变了,得回剪辑软件重排。带强烈混响的录音在慢速下会把尾音拉得更糊,效果并不好。它也不做局部变速,整段统一速度,没有按句分别处理的选项。