字幕工艺入门:从时轴到交付
梳理字幕制作的完整流程,覆盖听写、断句、时轴、校对、样式、压制六个环节,附常见工具组合与新手避坑清单。
字幕工艺入门:从时轴到交付
字幕制作是一个看似简单实际很讲究的工艺。新手以为就是"听写下来打时间轴",做了才知道里面水很深。这篇按工作流顺序梳理整个流程。
六个环节
1. 听写
把视频里的对话用文字记下来。听写质量决定了后续所有工作的上限。
- 听不清的地方用
[???]标记,不要瞎猜 - 标点按原语言规范,不提前本地化
- 跨语言素材(日漫里的英文)单独标记
[EN] - 专有名词按音译记录,校对时统一
工具选择:
- 纯手工:Subspace Edit、Subtitle Edit
- 半自动:VideoCaptioner(Whisper 转录 + 人工校对)
- 全自动:Whisper large-v3 + 后处理
2. 断句
把听写文本切分成可显示的字幕行。断句质量直接影响可读性。
断句原则:
- 单条字幕不超过 18 个中文字符(日文 24 字)
- 单条字幕显示 1.2-7 秒
- 句末标点(。!?)必断
- 长句在自然停顿处断(逗号、连词前)
- 主谓宾结构尽量不拆散
Aegisub 的"Karaoke"功能可以辅助断句:把整句拆成音节后,按音节重组字幕行,时间戳自动对齐。
3. 时轴
给每条字幕打时间戳。这是最耗时的环节。
时轴原则:
- 字幕出现比声音晚 50-100 毫秒(视觉先于听觉的心理预期)
- 字幕消失比声音早 0-100 毫秒
- 相邻字幕间隔 100-200 毫秒(避免视觉跳切)
- 镜头切换时字幕跟随切换(视觉一致性)
工具:Aegisub 的音频波形可视化是行业标杆,能看到每个音节的能量峰值,对齐时间戳很直观。
4. 校对
时轴完成后通读校对。校对分三轮:
- 一校:错字、漏字、错时戳
- 二校:术语一致性、人名统一、专有名词规范
- 三校:风格统一、语气把握、文化适配
校对最好换人做,自校容易产生"看顺眼"效应。
5. 样式
ASS 字幕的样式包括字体、字号、颜色、边框、阴影、定位。样式不是"好看就行",要考虑:
- 与画面风格匹配(古风片用宋体,现代片用黑体)
- 与底色对比度足够(深色场景用白字 + 黑边)
- 与阅读距离匹配(电视用大字,手机用小字)
- 与字幕组品牌一致(同组所有作品风格统一)
ASS 样式定义示例:
[V4+ Styles]
Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, OutlineColour, BackColour, Bold, Italic, Underline, StrikeOut, ScaleX, ScaleY, Spacing, Angle, BorderStyle, Outline, Shadow, Alignment, MarginL, MarginR, MarginV, Encoding
Style: Default,HarmonyOS Sans SC,48,&H00FFFFFF,&H000000FF,&H00000000,&H64000000,0,0,0,0,100,100,0,0,1,2,1,2,20,20,40,1
6. 压制
把字幕嵌入视频文件。两种方式:
- 软封装:字幕作为独立轨道封装到 mkv/mp4,播放器可选择开关
- 硬压制:字幕"烧"进视频画面,无法关闭
软封装用 ffmpeg:
ffmpeg -i video.mp4 -i subtitle.ass -c copy -c:s ass output.mkv
硬压制:
ffmpeg -i video.mp4 -vf "ass=subtitle.ass" -c:a copy output.mp4
软封装不损失画质,文件小,但播放器兼容性差。硬压制文件大、压制慢,但所有播放器都能看。
常见工具组合
我见过几种主流组合:
日漫组:Aegisub + ffmpeg + ASS
- 优势:ASS 特效支持好,适合做 Karaoke 字幕
- 劣势:协作差,单机模式
纪录片组:Subtitle Edit + Premiere + SRT
- 优势:与剪辑软件集成好,适合长篇
- 劣势:SRT 样式有限
电影组:Arctime + Avid + AAF
- 优势:商业级工作流,专业度高
- 劣势:学习曲线陡峭
AI 流水线:VideoCaptioner + yt-dlp + LLM
- 优势:自动化程度高,适合批量
- 劣势:质量上限受模型限制
新手避坑清单
- 不要用 Word 编辑字幕文件,会写入 BOM 头导致乱码
- 字幕文件保存为 UTF-8 无 BOM
- ASS 文件不能用 `"`` 转义,反斜杠要用双反斜杠
- 中日文标点不要混用,统一为全角
- 数字用半角阿拉伯数字("5 个"而非"五个")
- 不要在字幕里加表情、emoji
- 字幕结束前不要超过画面 90% 区域
- 不要让字幕盖住人脸
这些坑我都趟过。
翻译理论札记
写到这里想插入一段翻译理论的思考。奈达的功能对等强调译文读者读到译文时的反应,应当与原文读者读到原文时的反应基本一致,这意味着翻译不是字面替换,而是要在目标语里重新构造等值效果。我们做字幕,观众在屏幕前只有几秒钟读完一行字,反应时间被严重压缩,所以功能对等在字幕里被推到了极端——可读性优先于忠实度。
纽马克的区分更实用:交际翻译关注译文效果,语义翻译关注原文意义。字幕绝大多数时候走交际翻译路线,但遇到关键术语、专有名词、文化负载词时又要切回语义翻译,避免观众被误导。这两条路线在字幕里不停切换,做久了会形成直觉。
韦努蒂的归化异化是另一条轴线。归化是让译文流畅得像目标语原创,异化是保留原文的陌生感。日漫字幕里大量保留"前辈""学园""王道"等词就是异化,因为这些词在中文语境里已经形成了稳定的亚文化共识,强行归化反而失味。但纪录片、欧美剧的台词又需要强归化,否则观众跳戏。题材决定策略,没有一招通吃的方案。
—— 这些理论看起来抽象,但实际做字幕时每天都在用,只是未必意识到。把直觉变成方法论,是新人到熟手的分水岭。