主页/文档库/字幕基础
字幕基础#时轴#工作流#Aegisub

字幕工艺入门:从时轴到交付

梳理字幕制作的完整流程,覆盖听写、断句、时轴、校对、样式、压制六个环节,附常见工具组合与新手避坑清单。

9 分钟阅读发布于 2026/06/08Smyx1ayang

字幕工艺入门:从时轴到交付

字幕制作是一个看似简单实际很讲究的工艺。新手以为就是"听写下来打时间轴",做了才知道里面水很深。这篇按工作流顺序梳理整个流程。

六个环节

1. 听写

把视频里的对话用文字记下来。听写质量决定了后续所有工作的上限。

  • 听不清的地方用 [???] 标记,不要瞎猜
  • 标点按原语言规范,不提前本地化
  • 跨语言素材(日漫里的英文)单独标记 [EN]
  • 专有名词按音译记录,校对时统一

工具选择:

  • 纯手工:Subspace Edit、Subtitle Edit
  • 半自动:VideoCaptioner(Whisper 转录 + 人工校对)
  • 全自动:Whisper large-v3 + 后处理

2. 断句

把听写文本切分成可显示的字幕行。断句质量直接影响可读性。

断句原则:

  • 单条字幕不超过 18 个中文字符(日文 24 字)
  • 单条字幕显示 1.2-7 秒
  • 句末标点(。!?)必断
  • 长句在自然停顿处断(逗号、连词前)
  • 主谓宾结构尽量不拆散

Aegisub 的"Karaoke"功能可以辅助断句:把整句拆成音节后,按音节重组字幕行,时间戳自动对齐。

3. 时轴

给每条字幕打时间戳。这是最耗时的环节。

时轴原则:

  • 字幕出现比声音晚 50-100 毫秒(视觉先于听觉的心理预期)
  • 字幕消失比声音早 0-100 毫秒
  • 相邻字幕间隔 100-200 毫秒(避免视觉跳切)
  • 镜头切换时字幕跟随切换(视觉一致性)

工具:Aegisub 的音频波形可视化是行业标杆,能看到每个音节的能量峰值,对齐时间戳很直观。

4. 校对

时轴完成后通读校对。校对分三轮:

  • 一校:错字、漏字、错时戳
  • 二校:术语一致性、人名统一、专有名词规范
  • 三校:风格统一、语气把握、文化适配

校对最好换人做,自校容易产生"看顺眼"效应。

5. 样式

ASS 字幕的样式包括字体、字号、颜色、边框、阴影、定位。样式不是"好看就行",要考虑:

  • 与画面风格匹配(古风片用宋体,现代片用黑体)
  • 与底色对比度足够(深色场景用白字 + 黑边)
  • 与阅读距离匹配(电视用大字,手机用小字)
  • 与字幕组品牌一致(同组所有作品风格统一)

ASS 样式定义示例:

[V4+ Styles]
Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, OutlineColour, BackColour, Bold, Italic, Underline, StrikeOut, ScaleX, ScaleY, Spacing, Angle, BorderStyle, Outline, Shadow, Alignment, MarginL, MarginR, MarginV, Encoding
Style: Default,HarmonyOS Sans SC,48,&H00FFFFFF,&H000000FF,&H00000000,&H64000000,0,0,0,0,100,100,0,0,1,2,1,2,20,20,40,1

6. 压制

把字幕嵌入视频文件。两种方式:

  • 软封装:字幕作为独立轨道封装到 mkv/mp4,播放器可选择开关
  • 硬压制:字幕"烧"进视频画面,无法关闭

软封装用 ffmpeg:

ffmpeg -i video.mp4 -i subtitle.ass -c copy -c:s ass output.mkv

硬压制:

ffmpeg -i video.mp4 -vf "ass=subtitle.ass" -c:a copy output.mp4

软封装不损失画质,文件小,但播放器兼容性差。硬压制文件大、压制慢,但所有播放器都能看。

常见工具组合

我见过几种主流组合:

日漫组:Aegisub + ffmpeg + ASS

  • 优势:ASS 特效支持好,适合做 Karaoke 字幕
  • 劣势:协作差,单机模式

纪录片组:Subtitle Edit + Premiere + SRT

  • 优势:与剪辑软件集成好,适合长篇
  • 劣势:SRT 样式有限

电影组:Arctime + Avid + AAF

  • 优势:商业级工作流,专业度高
  • 劣势:学习曲线陡峭

AI 流水线:VideoCaptioner + yt-dlp + LLM

  • 优势:自动化程度高,适合批量
  • 劣势:质量上限受模型限制

新手避坑清单

  • 不要用 Word 编辑字幕文件,会写入 BOM 头导致乱码
  • 字幕文件保存为 UTF-8 无 BOM
  • ASS 文件不能用 `"`` 转义,反斜杠要用双反斜杠
  • 中日文标点不要混用,统一为全角
  • 数字用半角阿拉伯数字("5 个"而非"五个")
  • 不要在字幕里加表情、emoji
  • 字幕结束前不要超过画面 90% 区域
  • 不要让字幕盖住人脸

这些坑我都趟过。

翻译理论札记

写到这里想插入一段翻译理论的思考。奈达的功能对等强调译文读者读到译文时的反应,应当与原文读者读到原文时的反应基本一致,这意味着翻译不是字面替换,而是要在目标语里重新构造等值效果。我们做字幕,观众在屏幕前只有几秒钟读完一行字,反应时间被严重压缩,所以功能对等在字幕里被推到了极端——可读性优先于忠实度。

纽马克的区分更实用:交际翻译关注译文效果,语义翻译关注原文意义。字幕绝大多数时候走交际翻译路线,但遇到关键术语、专有名词、文化负载词时又要切回语义翻译,避免观众被误导。这两条路线在字幕里不停切换,做久了会形成直觉。

韦努蒂的归化异化是另一条轴线。归化是让译文流畅得像目标语原创,异化是保留原文的陌生感。日漫字幕里大量保留"前辈""学园""王道"等词就是异化,因为这些词在中文语境里已经形成了稳定的亚文化共识,强行归化反而失味。但纪录片、欧美剧的台词又需要强归化,否则观众跳戏。题材决定策略,没有一招通吃的方案。

—— 这些理论看起来抽象,但实际做字幕时每天都在用,只是未必意识到。把直觉变成方法论,是新人到熟手的分水岭。