第八部 配音、旁白、音乐与声音设计
第 41 章 对白录制、生成与表演控制#
本章目录
41.1 不要把每句当独立文件#
逐句生成会让呼吸、音高和情绪每次归零。优先按同一场景中的情绪段生成,再在自然停顿处切分。需要精确口型的短句可以单独生成,但要与上下文匹配。
41.2 三层脚本#
文字稿保存台词;表演稿加入目的、重音、停顿、打断和情绪;录音稿加入发音、文件 ID 与技术参数。
dialogue_take:
line: E001_L012
speaker: VO_LINYUN_01
text: 那就请收购方代表参加。
objective: 让在场者承认她的正式资格
emphasis: 收购方
pace: controlled
pause_before_ms: 420
tail_hold_ms: 300
emotion_in: restrained_2
emotion_out: dominance_3
lip_sync: true
41.3 按意图导演#
“更生气”不如“压住音量,让对方不得不靠近听”。给声音演员或模型动作目的、听者、不能暴露的情绪。表演会比情绪标签具体。
每次只调整一两个变量:重音、速度、停顿、音量或气息。一次要求“更愤怒、更克制、更有力量、更自然”互相冲突。
41.4 呼吸和停顿#
呼吸是表演与剪辑接口。保留自然吸气,删除噪声时不要把人物变成无呼吸机器。重要停顿写原因:思考、压制、等待对手反应或让证据落地。
停顿长度最终由画面和音乐共同决定,不完全锁在文字稿。
41.5 抢话与重叠#
分别生成完整干净台词,再在时间线设计重叠。真正被打断的角色保留未完成语尾,打断者入点要有攻击性。不要让两条同频声音长时间互盖。
字幕通常优先显示主导台词,次要声音可简化或错开。
41.6 真人、TTS 与混合#
真人适合复杂情绪和临场互动;TTS 适合规模、修改和多语言;混合路线可用真人导演样本控制合成声音,或关键高潮真人、普通段落合成。混合必须统一音色、房间感和响度。
选择依据是项目风险与授权,不是意识形态。
41.7 口型工作流#
先批准最终对白音频,再生成或同步口型。句子控制短,正面嘴部清楚。长台词拆成短口型开头、插入/反应上的画外延续、结尾回到人物。
口型 QC 同时检查音素、表情、身份、牙齿和头部运动。同步准确但脸崩仍失败。
41.8 音频清理#
保存原始干声;在副本上去噪、去爆破、齿音控制、均衡和轻压缩。处理保持角色一致,不让不同集数像不同麦克风世界。
过度降噪会产生水下伪影,过度压缩会让每句话同样用力。
41.9 Take 管理#
每句或段保存 take、表演差异、状态和选择理由。候选不能只叫 line_final_2.wav。
E001_L012__VO_LINYUN_01__take03__restrained.wav
选定 take 后锁定,口型和字幕引用该音频哈希。
41.10 场景录制单元#
一个场景先生成或录制“主表演通条”,让角色从进入状态走到出口。主通条不一定全部用于成片,但它建立呼吸、音高和策略连续性。之后只对关键句、口型句和失败句做 pickup;pickup 必须携带前一句和后一句上下文,并在同一监听电平下比较。
多角色无法真正同录时,先制作临时对手轨。第二个角色听着第一角色的批准或接近批准版本表演;再返回修第一角色的反应和抢话。完全孤立生成两边,会出现双方都在强调、双方都没有听见对方的感觉。
41.11 台词编辑不是清除一切瑕疵#
编辑先处理错误字、爆破、点击、过长空白和明显音色跳变,再保留有意义的吸气、吞咽、犹豫和未完成语尾。呼吸的位置应服务意图:威胁前的吸气与说完后的泄气含义不同。把所有呼吸统一削弱,会删除表演结构。
拼接 pickup 时检查三类连续:音高和共鸣是否接上,背景与处理链是否接上,情绪动量是否接上。技术无缝但人物突然从克制变成朗诵,仍是坏剪辑。
41.12 对白锁定与变更纪律#
进入口型、字幕和终混后,对白音频成为依赖源。任何换字、换 take 或改变停顿都必须产生新版本,并通知口型、字幕、剪辑和音乐。不能在终混里偷偷挪一句 300 毫秒,却让字幕和嘴形继续引用旧哈希。
紧急修字应评估最小影响路线:能否在画外覆盖,能否保持原时长,是否需要重做正面口型,是否改变后续角色反应。语义错误优先修;仅仅“另一版更好听”通常不足以在锁定后触发昂贵返工。
41.13 《逆光收购》的会议抢话#
林薇试图说“她根本没有资格……”,林筠在“资格”之前打断:“授权书在这里。”制作时先保留林薇完整句作为干净资产,再导出未完成语尾版本;林筠的吸气提前进入 80 毫秒,台词起点压住林薇最后一个辅音,但“授权书”保持清楚。群众底噪在打断瞬间下降,文件落桌声紧接“这里”。
字幕不同时显示两整句:先出现“她根本没有……”,打断后立即替换为“授权书在这里”。声音、动作和字幕共同表明权力被夺走,而不是把两条音频简单叠在一起。
41.14 对白音频 SOP#
第一步,按情绪段组织场景。第二步,制作表演稿。第三步,生成/录制完整段。第四步,选择表演并自然切分。第五步,设计打断和重叠。第六步,清理但保留干声。第七步,锁最终 take。第八步,制作口型。第九步,强制对齐字幕。第十步,放入场景声和音乐审核。
41.15 故障树#
**症状:每句像重新开口。**逐句生成。按情绪段重录或用重叠上下文。
**症状:声音自然但不推动戏。**只追求情绪,没有行动目的。按目标重导。
**症状:抢话像两段音频叠放。**未设计未完成语尾和频率空间。重做入点与混音。
**症状:口型准确却僵硬。**句子过长或只优化音素。拆句并保留表演镜头。
41.16 检查表、练习与交付物#
检查是否按段而非逐句;每句是否有目的;重音和停顿是否记录;重叠是否设计;干声是否保留;最终 take 是否锁定;口型是否用最终音频;字幕是否重新对齐。
练习一:为同一句话录制攻击、试探、地位声明三版。练习二:设计一次自然打断。练习三:把十二秒长句拆成口型与画外覆盖。
本章交付物:Performance Script、Dialogue Takes、Take Decision、Clean Dialogue、Overlap Map、Lip-sync Audio、Alignment Data。
41.17 Scene Take Map:保持整场表演弧线#
对白不能只记录“每句选了第几个 take”。Scene Take Map 把整场按 beat 排列,标出每个角色的策略、强度、呼吸、停顿、打断和最终选择。审核者横向听一名角色从入场到离场的变化,防止单句都精彩却情绪忽高忽低。
scene_take_map:
scene: E001_SC03
beats:
B01: {linyun: T03, intensity: 2, tactic: observe}
B02: {linwei: T02, intensity: 3, tactic: humiliate}
B03: {linyun: T05, intensity: 2, tactic: withhold}
B04: {linyun: T04, intensity: 3, tactic: prove}
bridges:
B03_to_B04: inhale_from_T04_alt2
rejected:
- take: B04_T01
reason: 过早胜利,破坏后续压制
最佳单句未必属于最佳场景。若 T05 的爆发很震撼,却让角色在证据真正出现前达到峰值,应选更克制的 T04。Take Decision 必须说明场景功能,不以“更有感情”作为唯一理由。
41.18 呼吸、口水音和身体动作的连续#
呼吸是表演和剪辑的接缝。角色在前镜深吸气准备发言,下一镜不能从完全无气息的干净句首开始;哭后急促呼吸也不能切镜后立刻恢复播音稳定。保留有意义的吸气、吞咽和衣料动作,删除分散注意的噪声,但不要把人处理成无身体的声音。
口水音、爆破音和齿音需要按可感知性处理。完全去除会让近距离声音失真,过多又会在耳机中令人不适。先修明显技术问题,再在整场和目标设备上判断。AI 生成声音中的周期性呼吸、重复口腔声和奇怪尾音要单独标记,因为它们可能在长段累积成“机器节奏”。
身体动作与声音同步:站起会改变气息和声线距离,背对人物会改变高频,走近后混响比例应降低。即使画面由独立镜头生成,声音透视仍应沿调度连续。
41.19 最终对白母版与口型变更协议#
只有最终批准的对白母版才能驱动口型、字幕和音乐。临时 take 可以用于粗剪,但必须带明显状态,防止下游误认为已锁。母版保存原始干声、编辑会话、处理版、时间码、词级对齐和内容哈希。
改一个字会影响音素、时长、口型、字幕断句、画面切点和音乐 ducking。Change Impact 先判断能否用同一呼吸段局部替换;若替换破坏语气或背景噪声,重做完整思想单元。绝不能把新词硬塞进旧口型,再依靠快速剪辑掩盖关键台词。
变更完成后回归检查前后呼吸、房间声、角色状态、字幕和镜头长度。只有音频内容一致还不够,表演动量也必须接上。对已发布多语言版本,母版变更触发各语言的重新评估,而不是自动套用同样字数。
研究依据说明#
声音生成速度很快,但表演连续性取决于上下文、切分和最终时间线。逐句按钮式配音无法自动形成场景。