免费文字转语音 - 浮云梦配音
智能问答

在线合并音频(多段拼成一个文件)

多段音频按你定的顺序首尾相接,接缝能设 0–10 秒交叉淡化,段间可插 0–60 秒静音,采样率与声道数不同的素材自动统一。

播客片头、课程合集、有声书分章,素材都是一段段单独录的。合并要处理的无非两件事:谁排在前,接缝处听起来顺不顺。顺序错了,整条音频的叙事就断了。

我上周把三段素材丢进去试:44.1 kHz 的旁白、48 kHz 的背景音乐、22.05 kHz 的手机补录。硬拼完,手机那段明显发闷;后来勾上统一音量、把背景音乐段压到 -6 dB,再听就顺了。

🎁 全员免费 🔒 文件不上传,全部在你的浏览器里处理

本地处理本地处理:解码、拼接、导出全在你自己的浏览器内存里完成,音频不上传服务器,也不需要注册或登录。
格式与限制格式与限制:MP3、WAV、OGG、Opus、FLAC、M4A 一般都能读;能导出哪些格式由你的浏览器决定,MP3 和 WAV 一定可用。拼之前,每段素材建议压在 200MB 以内。
合法使用合法使用:请确认你有权处理这些音频素材,工具本身不做版权判断。
全员免费
🎵

把文件拖到这里,或者点击选择文件

可以一次拖入多个文件,顺序可以调整;文件不上传,全部在你的浏览器里处理

00:00 / 00:00
待合并文件 0 个文件
    0 秒

    两段之间做等功率交叉淡化,接歌、接口播都不会突兀

    0 秒

    不想让两段贴太紧就插一段静音,交叉淡化为 0 时才生效

    按峰值把每一段拉到同一水平,避免拼完忽大忽小

    不用写扩展名,导出时按所选格式自动补上

    本工具累计服务 17 次 今天 3 次 已导出 0 次 全部工具累计 300 次

    怎么用:4 步完成

    1. 把素材加进来一次选中要拼的几段音频拖进页面,默认按文件名的自然顺序排列;加完还能拖动左侧手柄调前后。
    2. 定顺序和接缝想让两段融在一起,交叉淡化填 0.5–2 秒;想留一口气,段间静音填 1–3 秒。我串播客习惯把淡化压在 0.8 秒附近,填 0 就是硬接。
    3. 逐段修增益某段录轻了,就在那一段的增益框填 +6 到 +12 dB;某段太冲,填 -3 到 -6 dB,不必回头重录。
    4. 导出成一条音频选 MP3 码率(128 或 192 kbps 够日常发平台)或 16 位 WAV,点导出。首次导 MP3 会先加载约 120KB 的编码脚本。

    顺序排错,后面怎么调都救不回来

    合并页的入口就是一个文件列表,导出的音频严格按列表顺序首尾相接,中间不留任何自动判定的余地。我上次帮人串课程合集,把开场白留在了列表末尾,导完听了 12 分钟才发现开头是第三讲的尾巴。顺序这种事,动手前花十秒核对一遍省事得多。

    • 文件名带 01、02 这类序号,加进来顺序基本就是对的。
    • 拖动每段左侧的手柄可以改先后,列表顺序等于成品顺序。
    • 先想清楚这条音频给谁听:按章节排还是按录制时间排,结果可能完全相反。

    交叉淡化、段间静音、单段增益怎么搭

    这三个参数管的是接缝手感。淡化给平滑,静音给停顿,增益给响度。填之前先判断接缝两边是什么关系。

    场景交叉淡化段间静音单段增益
    播客分段串场0.3–1 秒0 秒不动
    有声书章节之间0–0.2 秒1–2 秒按章节响度微调 +3 到 +6 dB
    背景音乐垫在旁白下2–4 秒0 秒音乐段 -12 到 -18 dB
    手机补录与专业录音相接0.5 秒0 秒手机段 +6 dB,并勾统一音量

    淡太长有个副作用:两段开头的字会咬在一起。旁白接旁白我一般不超 1 秒。

    采样率和声道数不一样会怎样

    44.1 kHz 的旁白接 48 kHz 的音乐,页面会先统一采样率再拼;单声道素材和立体声素材放一起,声道也会自动对齐。统一这一步要算,素材总长五分钟以内基本感觉不到,十几段的合集就要等几秒。

    统一之后的听感差异,主要在原来采样率偏低的那一段。22.05 kHz 的手机录音被拉到 44.1 kHz,不会变好听,只是不再突兀。

    合并工具的边界

    它只做首尾相接,不做别的。想在中间挖掉一句话,去剪辑页;想让整条音频响度一致,勾统一音量只是把各段拉到接近,要读峰值和 RMS 精确数字,得用音量页。

    • 处理全程吃本机内存。两小时以上的合集,在内存小的设备上可能中途失败,建议把单文件控制在 200MB 以内。
    • Chrome、Edge、Firefox 新版支持得比较完整;Safari 能读常见格式,可导出格式少一些;IE 和老版本浏览器不支持。
    • MP3 编码脚本加载失败时,页面会提示改用 WAV,导出功能不受影响。
    • 降噪、识别说话人、自动去掉口误,这些都不在能力范围里,得先在前面的工具里处理干净再拿来拼。

    常见问题

    能。44.1 kHz、48 kHz、22.05 kHz 混在一起时,页面先把它们统一到同一采样率再拼,单声道与立体声也会对齐声道。统一过程要花一点计算时间,五分钟以内的素材基本等不到。
    0 到 60 秒随便填。有声书章节之间我一般留 1.5 秒,播客串场留 0.5 秒。填 0 是硬接,两段语音直接贴上会听到明显的换气断裂。
    让相邻两段的接缝平滑过渡,范围 0 到 10 秒。旁白接旁白用 0.3 到 1 秒足够,音乐垫底可以给到 2 到 4 秒。淡得太长,两段开头的字会互相压住。
    不用。每段能单独调 -40 到 +40 dB 增益。手机补录的段落加 +6 dB 通常就够靠近专业录音,加过头会先听到底噪,这时候改勾统一音量更稳。
    MP3(32 到 320 kbps)和 WAV(16 位或 24 位)一定可以,WebM(Opus)、OGG(Opus) 以及 Safari 上的 M4A 要看你的浏览器。发平台我一般选 192 kbps 的 MP3。
    总时长超过两小时、素材加起来接近 200MB 时,内存小的设备可能中途失败。它也只做顺序拼接:降噪、对齐说话人、删掉某句口误都不在能力范围里,这类活儿得先在剪辑页和音量页处理完再来拼。