# 字幕别手打：让剪映识别，再拧好四个开关把它调不难看

识别字幕自动对齐语音后，真正花时间的是校对错字和调样式：字号、位置、对比度、动画四个开关怎么拧，让字幕清晰但不抢画面。

> 剪映入门 · 字幕样式 · 剪辑思维 · 约 6 分钟 · 09 月 10 日

## 本篇要点

1. 手打字幕最难的不是打字而是对时间：识别字幕按每句话的语音时长自动生成字幕块，你只负责改错和调样式，别从零手打。
2. 识别结果只是草稿，同音字、专有名词、英文数字和语气词是校对重点；字幕是给观众读的阅读文本，“然后”“嗯”这类口头禅可以直接从字幕删掉，不影响声音。
3. 样式四开关：字号宁小勿大（手机版默认约 18、常用 20–28、竖屏别超 30 左右）；位置守一个不贴边；白字加深色描边最通用、画面花时加半透明圆角底；花字和动画只留给标题或强调词。
4. 断句经验值：竖屏每行 6～10 字、横屏 10～15 字，一屏最多两行，超长就在语义气口处回车断行。
5. 导出前按固定顺序通看：先开声听一遍抓错字和不同步，再静音看画面查压脸、贴边、堆行，最后开声完整过一遍。

---

上一篇那版能顺看的粗剪立住之后，可以开始上包装了。第一层为什么是字幕，而不是滤镜或转场？因为短视频里，字幕是观众获取信息的主通道：画面来不及看全、环境音吵听不清时，是字幕把话递到观众眼前。新手这时最容易犯的错，是点“新建文本”开始逐句敲字。这篇先把结论说透：先别敲，让剪映先“听写”一遍，你只负责改错和调样式。真正的功夫，在识别之后的两步——校对和样式。

先弄清识别字幕是什么：它读取时间线上的人声，把语音自动转成文字，再按每句话的实际时长，在字幕轨道上生成一条条字幕块。这一步同时解决了手打最难的三个问题。第一是对时间：字幕提前或滞后哪怕半秒，观众都会觉得“声画对不上”，比字丑更伤观感；识别把每条字幕的起止时间自动对准语音。第二是断句：识别按说话停顿切句，切出来的每块，正好接近“一次读得完”的阅读单元。第三是速度：有创作者实测过，同一段十分钟素材，识别加校对约 15–20 分钟，纯手打加校对要 70 分钟往上 [3]。整条路线是四站，如图：

```mermaid
flowchart LR
    A["识别字幕：机器先听写"] --> B["校对：改错字、调断句、对时间"]
    B --> C["样式：字号、位置、对比、动画"]
    C --> D["通看定稿：先听后看"]
```

## 识别字幕在哪：点两下，得到一条对齐好的轨道

手机版剪映：素材上轨后，点底部工具栏的“文本”，在面板里选“识别字幕”，按提示点“开始识别”；若弹出语言选项，选对人声的语言即可 [1]。电脑版（专业版）路径类似：顶部菜单“文本/文字”→“智能字幕”→“识别字幕”。进度条走完，时间线顶部就多出一条字幕轨道——正是第一篇认识过的那种可独立编辑的轨道，只是这回每条字幕块的长度，已经和对应那句话的语音时长严丝合缝，你基本不用亲手对时间。

两个提升成功率的小动作：背景音乐或环境噪声大时，先在音频轨道上选中人声片段做“提取人声”，再回来识别，正确率会明显更高 [2]；口音重、中英夹杂的视频要预期错字更多，校对时多留时间。另外，不同版本对识别功能的额度和入口规则会调整，一切以你当前版本的界面为准。

## 校对：识别只是草稿，这步才真正花时间

识别不是誊写。同音字、专有名词、口音、噪声都会让机器写错，而错字出现在成片里比没字幕更扎眼——观众会把它当成作者粗心的证据。所以识别完别急着导出，把每条字幕过一遍，重点盯三类：同音近音字（比如把“焯水”听成“超水”）；人名、地名、品牌、数字和英文缩写，机器对它们最没把握；还有语气词和口头禅——“然后”“就是”“嗯”“啊”这类字，字幕里可以直接删掉 [1]。要记住：字幕是给观众读的阅读文本，不是语音的逐字誊抄；删的是字幕上的字，声音一点不受影响。

改法对应三件事。改字：点字幕块，编辑框展开，直接改，确认保存 [1]。改断句：觉得某句太长、屏幕上堆了超过两行，就在语义气口处回车断行——竖屏每行六到十字、横屏十到十五字、一屏最多两行，是常见的经验值 [5]。对时间：选中字幕块，拖左右两端的白色菱形控制点，可分别改起点和终点；按住字幕块中间整体拖动，可平移整条字幕 [1]。

## 四个开关：把字幕从“默认”调到“不难看”

样式这关的目标只有一句：看得清、不抢画面。按顺序拧好四个开关。

**字号**。手机版字号滑块默认约 18，短视频常用 20–28，竖屏超过 30 左右就开始压人脸了 [4]。数值别死记，标准就两条：全屏预览时不眯眼能读，同时不遮住人脸。宁可小一点——观众读得清就行，满屏都是字反而显廉价。

**位置**。默认的底部居中是个好起点，但别贴边：竖屏短视频的底边常被平台的点赞、评论区按钮盖住，字幕下缘至少留出画面高度约 15% 的空白 [5]，上边同理别顶到屏幕。打开样式面板里的“安全区域”参考线，让字幕落在虚线内，就不会踩到各平台的按钮区 [6]。最后一条硬规矩：一整条片子只守一个位置，别忽左忽右；人物在画面中间说话时，可以把字幕整批移到左下或右下。

**对比度**。白字加深色描边，是几乎任何背景上都稳的通用组合 [4]。画面本身就花（白墙、天空、人群）时，光靠描边可能不够，就在样式里给字幕加一层半透明深色圆角底，可读性立刻兜底。字体选黑体类的无衬线字（默认字体或思源黑体都稳），一条片子里只守一款。正文字幕的功能是让字一秒被读出来，不是展示字形，花体留给片头标题就好。

**动画与花字**。花字、气泡、逐字打字机这类效果，只留给片头标题或想强调的一个词；逐句字幕不加动画，或最多加个很短的入场淡入——动画时长超过一秒，观众得先等字幕“演完”才开始读，句子短一点的字还没读完就切走了 [7]。每句字幕都表演一次，观众的注意力就被反复打断，画面反而没人看。四个开关都调好后，点“应用到全部”统一整批字幕 [4]，再单独微调需要强调的那一两条。

## 定稿前的一遍通看，顺序别反

识别、校对、样式都做完，导出前完整看一遍，顺序固定成三步。先开声音听一遍，眼睛跟着字幕走，抓错字和不同步——这步解决“对不对”；再静音通看画面，只盯字幕本身，看有没有压脸、贴边、堆成三行——这步解决“好不好看”；最后恢复声音完整过一遍，确认每条字幕出现和消失的时机都舒服。三步都过，字幕这层包装就收工了。下一步该处理声音了：音乐、音效和人声在时间线上怎么分层、谁大谁小，是下一篇的问题。

## 来源

1. [识别字幕入口、错字修正、时间轴菱形控制点校准的操作流程](https://www.guofenmi.net/wz/626732.html)
2. [用“提取人声”再识别以提升准确率的实操方法](https://cj.sina.cn/articles/view/7879848900/1d5acf3c401902rsea)
3. [识别加校对比纯手打的耗时对比（十分钟素材约 15–20 分钟对 70 分钟以上）](https://penchan.co/zh-cn/ai/creative/capcut-ai-subtitle-guide/)
4. [字号默认值与推荐区间、白字黑描边、“应用到全部”等样式经验](https://capcut.wang/archives/1311)
5. [每行字数、按意群断行与底部留白的排版经验](https://jianyinvv.com.cn/post/3991.html)
6. [字幕遮挡处理：安全区域参考线、位置统一的规范](https://diantuoyi.com/article/8245.html)
7. [字幕动画时长控制与特效克制的实操建议](https://jianyinvv.com.cn/post/96.html)

---

原文：https://pangzhengboyin.com/articles/jianying-auto-subtitle-cleanup-0a889fdc

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
