# 声音别打架：人声、音乐、音效的分层与三个开关

短视频声音分三层，主次是“人声最大、音效其次、背景乐垫底”；把音量基准调对，再开闪避让音乐自动让路，最后用淡入淡出抹平音乐进出时的切口。

> 剪映入门 · 音频分层 · 剪辑思维 · 约 5 分钟 · 09 月 10 日

## 本篇要点

1. 短视频的声音分三层：人声管信息、背景音乐管情绪、音效管具体事件；优先级一句话——人声最大，音效其次，背景音乐垫底，听不清人声观众就会划走。
2. 音量基准经验值：剪映里人声 0 到 -6dB、音效 -6 到 -12dB、背景音乐 -12 到 -20dB；手机版按百分比显示时，约等于人声留 100%、音乐调到 20% 到 30%；任何轨道不要超过 0dB，超了就是爆音。
3. “闪避”让背景乐自动让路：检测到人声就压低音乐，人声一停再平滑回升；压低幅度从 6 到 12dB 起步，压太狠会让音乐忽大忽小，比大声更吵。
4. 版本里没有自动闪避或效果不理想时，手动方案一样成立：在每句话前后把音乐分割开，中间段调低音量，再给这一段头尾各加约 1 秒淡化。
5. 淡入淡出只加在背景音乐的头尾：开头淡入约半秒到 1 秒，结尾淡出约 2 秒（收在安静镜头里可到 3 秒）；音效和人声通常不加淡化。
6. 操作顺序固定为“调基准 → 开闪避 → 加淡入淡出”，最后用手机外放通听一遍：每句话都听得清、音乐没消失也没跳变，声音这层就完工了。

---

上一篇把字幕收到“通看定稿”，声音这层还一直没人管：素材自带的人声、你刚加的背景音乐，现在还都按各自的原始音量叠在一起。新手加完 BGM 最常见的结局有两种——说话时音乐把人声盖住，或者音乐开头“啪”一下炸出来、结尾“咔”一声断掉。这两个问题其实是同一件事：没给声音排座次。今天把声音分成三层，再拧三个开关。

## 先分清三层声音，每层只干一件事

短视频的声音，按职责只有三类。

**人声**（口播、解说、对话）管信息，观众必须听清。**背景音乐**管情绪，它从片头铺到片尾，负责让画面不尴尬、让片子有氛围。**音效**管事件，提示音、“嗖”的转场声、按键的“咔哒”、风声雨声，作用是提醒观众“这里发生了一件具体的事”。

主次规则一句话就够：**人声最大，音效其次，背景音乐垫底** [3]。原因很现实：短视频大多在手机外放、嘈杂环境里被看，人声一被盖住观众就划走了；背景音乐的角色是背景，让人听出情绪但不注意它本身；音效只在动作或笑点上出现，用多了比不用更乱。

在剪映里，这三类从不同入口进来：视频素材自带的声音（人声）跟着主轨走；点“音频”可以搜音乐库里挑 BGM，或在“音效”里找效果音。它们到了时间线上都是独立片段，各自可以单独调音量——这正是第一篇认识过的轨道玩法，现在开始真正用起来。

## 第一步：先把基准音量调对

剪映的音量数值以 dB 为单位显示，数字越负声音越轻，0dB 是上限，再往上就爆音了（电平会变红）。选中任意声音片段，点工具栏的“音量”就能调。经验配比是一张表：

| 声音 | 在片子里干什么 | 目标音量 |
| --- | --- | --- |
| 人声 | 承载信息，观众必须听清 | 0 到 -6dB |
| 音效 | 提醒具体事件，点到为止 | -6 到 -12dB |
| 背景音乐 | 铺情绪底色，不能抢话 | -12 到 -20dB |

[3] 手机版音量如果显示的是百分比，记住换算：人声留在 100%，背景音乐调到 20% 到 30%，听觉效果大致就在 -12dB 上下 [1]。数字别死记，听感标准就两条：人声清晰不费劲，背景乐“有存在感但不抢话”。

调完立刻验证一次：把播放头停在整条片子里说话最密、音乐最响的一段，完整听十秒。如果这里人声清楚、音乐不捣乱，基准就对了。

## 第二步：开闪避，人声一开口音乐自动让路

基准调对后，还有一类情况它管不了：有些段落没说话，音乐可以响一些；一开口就得让路。手动去掐每个说话段太累，剪映的“闪避”就是为这件事做的。

闪避（英文叫 ducking）的逻辑是：软件检测到人声出现，自动把背景音乐的音量压低；人声一停，音乐再平滑地回升 [1]。听起来就像一段“懂事”的背景乐——你说话它退后，你停顿它补位。

剪映手机版在选中音乐片段后的工具栏里找“闪避”，电脑专业版一般在右侧音频面板，名字可能写作“自动闪避”或“避让”，各版本入口略有差异，找不到就在工具栏左右滑动找找 [2]。打开后通常有两个参数：**压低多少**（闪避幅度，从 6 到 12dB 起步就够）和**什么声音会触发**（灵敏度或阈值，保持默认）。人声停止后音乐回升要慢而平滑——回升太快，观众会听成音乐在一句一句地“弹跳”，比大声更难受 [1]。

你的版本里没有闪避开关，或自动效果不理想，有个手动兜底，原理一样：找到第一句话开始前约半秒的位置，选中音乐点“分割”；在这句话结束的位置再分割一次；把中间那段音乐的音量调低（约 -12dB 或 20% 音量），再给这一小段的头尾各加约 1 秒淡化，让压低和回升都柔和。每句话重复一遍。慢，但效果完全成立 [2]。

这里有一个新手最容易踩的坑：**闪避幅度别开满**。如果每说一句话都把音乐压掉 15 到 20dB，观众注意到的就不是你的内容，而是背景乐忽大忽小的“抽风感” [1]。压低一点、让音乐只是退到后排，而不是彻底消失。

## 第三步：淡入淡出，音乐进出不留切口

音乐一上来就满音量，听感是“炸出来”；片子结束音乐戛然而止，听感是“被掐断”。原因是音量从 0 直接跳到满格、又从满格直接落到 0，中间没有渐变。修法就是给音乐的头尾各加一段斜坡：开头音量从 0 渐渐升到基准，叫淡入；结尾渐渐降到 0，叫淡出。

剪映里选中音频片段，点底部工具栏的“淡化”（电脑版在右侧面板），分别拖动“淡入时长”和“淡出时长” [4]。经验值：开头淡入 0.5 到 1 秒就够，别让观众等音乐“爬”起来；结尾淡出留 2 秒左右，如果音乐正好收在画面黑屏或一段安静的长镜头里，可以放宽到 3 秒。

记住三件事：背景音乐只在片子的头和尾各设一次，不需要每句话都做；两段音乐相接时，让前段尾部淡出、后段头部淡入，听感接近无缝换歌；音效和人声一般不加淡化——音效要的就是瞬间，人声加了反而含糊。

## 三个开关的顺序别乱

调基准、开闪避、加淡入淡出，这个顺序有讲究：基准先把“谁大谁小”固定下来，闪避才有意义——音乐本来就不响，说话时它只是再让一小步；淡入淡出放在最后，专管音乐出现和消失的那两个瞬间。

全部做完，导出前用手机外放完整通听一遍，检查标准就两条：每一句话都能不费劲地听清；背景音乐从头到尾没消失过，也没在任何一处突然变大变小。两条都过，声音这层就收工了。画面、字幕、声音都立住之后，下一篇可以开始处理画面与画面之间的衔接——转场。

## 来源

1. [CapCut 官方教程：闪避原理、6–12dB 起步幅度、回升要平滑、过度闪避的警示与手机外放检查法](https://www.capcut.com/create/audio-ducking-for-clear-dialogue-in-video)
2. [CapCut 官方教程：移动端提供语音触发闪避、版本不适用时用手动音量关键帧兜底](https://www.capcut.com/create/audio-ducking-in-capcut-for-clear-commentary)
3. [剪映专业版实操教程：人声 0–-6dB、音效 -6–-12dB、背景乐 -12–-20dB 的配比与音量指示器用法](https://www.douyin.com/shipin/7304905628172978216)
4. [中关村在线：手机版剪映选中音频轨道后在“淡化”面板调淡入淡出时长的操作步骤](https://soft.zol.com.cn/1137/11371466.html)

---

原文：https://pangzhengboyin.com/articles/audio-layering-voice-music-sfx-a5231fdb

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
