第七部 图像、视频、表演与合成生成
第 37 章 AI 表演导演#
本章目录
37.1 情绪标签不能导演表演#
“愤怒、震惊、悲伤”会让模型放大眉眼和嘴,人物却没有具体意图。表演来自角色正在压制什么、想让对方做什么,以及身体哪些部位泄露真实状态。
37.2 六个表演通道#
视线决定注意对象;呼吸决定节奏;嘴与下颌显示控制;肩背显示张力;手显示冲动或习惯;距离显示关系。每镜只强调少数通道。
performance_spec:
character: CH_LINYUN
objective: 不让周岚看出父亲姓名击中了自己
emotion: shock_suppressed
intensity: 3_of_5
eyes: 在姓名上停0.5秒,再看日期
breath: 短吸气后屏住
mouth: 下颌轻收,不张嘴
shoulders: 保持平直
hands: 停止转笔,钢笔滑落
distance: 不后退
37.3 表演有进入与退出#
一镜从上一情绪状态进入,经触发达到峰值,再通过调节离开。模型只收到峰值会突然做脸。把“先克制—短暂失守—重新控制”写成时间轴。
37.4 视线导演#
人物先看什么、看多久、何时移开,决定观众如何阅读。看文件、看对手、看旁观者具有不同意义。视线目标必须与空间账本一致。
眨眼不是随机生命感。延迟眨眼可增加控制,快速眨眼可显示认知负荷,但不要每镜机械指定。
37.5 微动作与习惯#
旧钢笔、整理袖口、压住杯沿等动作可成为人物调节方式。重复建立后,动作停止本身就有意义。运动签名要变化使用,避免变成固定动画。
37.6 强度分级#
为同一情绪定义 1–5:轻微可疑、明显防御、压制冲击、失控边缘、完全失控。高潮不是简单把五官拉大,而可能让人物改变策略、越过距离或打破习惯。
同场人物强度应有对比。所有人同时 5,观众没有关注中心。

图 37-1 同一刺激下的五级强度。数字增大不只是面部更夸张,而是视线、呼吸、下颌、肩背和手部逐步失去控制。身份、镜头、服装与光线保持不变,才能比较表演本身。
制作 take 时不必每级都生成,但应至少准备低、标准和高三个锚点。导演在相邻镜头中选择强度曲线,而不是单独挑“最会演”的一张。若第一个反应已经达到 5,后续场景就没有升级空间。
37.7 后配音与口型#
无口型表演最稳定,适合反应、旁白和画外台词;后配音可让嘴部轻动但不严格同步;精确口型用于关键正面短句。长句拆成短口型和插入画面上的画外延续。
先锁最终音频,再口型。口型完成后检查脸型、牙齿、年龄和情绪,不能只看音素同步。
37.8 哭、笑和喊#
哭分含泪、泪落、呼吸断裂和大哭;笑分礼貌、胜利、掩饰和失控。写出目的和身体,不只写结果。喊叫极易变脸,使用短句、侧面或切反应。
37.9 Performance Take#
同一镜可生成克制、标准和增强三种 take,导演按场景曲线选择。不是永远选择最强。每个 take 记录 Spec 版本,防止情绪不连续。
37.10 从台词动作到可见行为#
演员不会直接表演“我很委屈”,模型也不应该。导演先找台词背后的动作:逼迫、试探、拖延、羞辱、求证、掩饰、诱导、拒绝、安抚。相同一句“你终于来了”,可以是迎接、控诉、威胁或确认。动作不同,视线、距离、语速和身体选择都会不同。
每个 Performance Spec 至少写出四层:角色此刻想让对方做什么;他不愿暴露什么;触发变化的具体信息;观众最终应读到什么。比如林筠看到父亲签名时,不是笼统的“震惊”,而是“继续审问周岚,同时不让她发现自己已认出签名;钢笔停止转动泄露了冲击”。这给模型和剪辑提供了一个可观察的差异。
37.11 反应镜头要有认知顺序#
一个可信反应通常经历感知、识别、解释、抑制或行动。短剧节奏很快,可以压缩这些阶段,却不能完全颠倒。人物尚未看清屏幕就开始哭,观众会觉得表演是预制表情;人物先看、再短暂停顿、最后改变呼吸,即使只占一秒,也会产生思考感。
导演可以用“反应拍点”安排微表演:
0.00–0.35 视线落到签名,不动。
0.35–0.60 瞳孔和呼吸出现第一次变化。
0.60–1.10 下颌收紧,手指停止转笔。
1.10–1.60 抬眼看周岚,恢复控制。
如果模型无法在一条中完成,就拆成物件插入、眼睛反应、手部停止和对手回看。剪辑能够重建认知过程,不必强迫一个面部镜头承担全部阶段。
37.12 双人表演的权力差#
双人场景不应分别给两个人同一个“紧张”提示。先定义谁拥有空间、谁控制时间、谁允许沉默、谁先移开视线。权力较高的人通常可以少动、晚答、占据中心或侵入对方空间;权力较低的人可能解释过多、频繁确认旁观者反应、身体后撤。但这些只是可选语法,不是固定套路,角色可以故意反用。
多人同框生成困难时,表演关系仍可以通过覆盖镜头建立。A 的视线离开画面右侧,B 的反打必须接住同一高度和时间;A 台词结束后留出的停顿,决定 B 的反应是被击中还是早有准备。表演连续性因此不仅属于脸,也属于切点之间的时间。
37.13 声音表演先于嘴部表演#
关键台词先完成声音导演:重音落在哪个词,哪里吸气,哪里故意放慢,句尾是收住还是推出。再根据最终音频选择正面口型、侧面弱口型、过肩或画外。若先生成嘴部运动再逼声音去配,台词往往失去自然节奏。
长句按意义拆,不按固定字数拆。正面只保留必须看见角色说出的攻击或承诺,其余部分可跨到对方反应、道具、空间或回忆。这样既降低口型风险,也让台词产生行动对象。口型镜头的通过标准应同时包括音素、身份、牙齿、下颌幅度、眼神和情绪;只有嘴对上,不算表演通过。
37.14 表演连续性表#
每场建立情绪基线、触发、最高强度和出口,不让镜头各自选择表情:
performance_arc:
scene: SC_E003_ARCHIVE
character: CH_LINYUN
baseline: controlled_investigation_2
triggers:
- beat: B04
event: 发现父亲签名
change: shock_suppressed_3
- beat: B06
event: 周岚说出只有家人才知道的旧称呼
change: fear_and_suspicion_4
maximum: 4
forbidden: [open_crying, shouting]
exit: controlled_dominance_3
carry_to_next_scene: 左手继续握紧旧钢笔
剪辑选择 take 时,以这张表为准。若某个单镜版本很精彩,却提前达到全场最高强度,应拒绝或移到真正触发点。表演弧线比单镜“演得足”更重要。
37.15 表演审片方法#
第一遍关闭声音,只看身体、视线与切点,判断人物是否像在互相影响。第二遍闭眼听声音,判断意图、呼吸和关系是否成立。第三遍正常播放,检查声音和画面是否在同一时刻达到峰值;如果所有通道同时强调,往往会显得用力过猛。第四遍将场景前后各接一镜,检查人物是否凭空换情绪。
审片意见必须写成可执行行为,例如“抬眼早 6–10 帧,让她先读完签名”“嘴部幅度降低,保留下颌紧张”“右手不要重复敲桌,因为上一镜已经停住”。“再克制一点”仍然太抽象。
37.16 《逆光收购》的压抑哭戏#
林筠确认父亲死亡与自己提交的线索有关。失败版本让她立刻落泪、捂嘴、摇头,情绪信息很清楚,却与人物长期建立的控制型行为冲突。新版不先生成哭:她读完日期,手里的旧钢笔停住;第二镜她问了一个过分专业的问题;第三镜对方离开后,钢笔从掌心滑落;直到场景末尾才出现一滴泪,她没有擦。
这组设计把悲伤变成一次控制失败,而不是通用哭泣模板。它也给声音留下层次:前半段保持干燥近讲,发现日期后出现一次短吸气,房间底噪略被主观压低,钢笔落地成为情绪落点,音乐在泪出现之前不进入。
37.17 表演 SOP#
第一步,读取人物目标和情绪进入状态。第二步,写压制与泄露。第三步,选择视线、呼吸、嘴、肩、手、距离中的重点。第四步,设强度和时间轴。第五步,决定无口型、后配或同步。第六步,生成少量强度 take。第七步,放入相邻镜头审表演连续。第八步,回写情绪出口。
37.18 故障树#
**症状:表情夸张。**只有情绪标签,没有目标和控制。降低强度并指定身体通道。
**症状:单镜好,连起来情绪跳。**未继承 emotion_in/out。放回序列选 take。
**症状:口型准但不像本人。**同步改变脸部结构。缩短句子或改画外。
**症状:人物像木偶。**完全没有呼吸、视线和微动作。加入一项低幅度生命通道,不让全身乱动。
37.19 检查表、练习与交付物#
检查表演是否有目标;是否说明压制和泄露;强度是否分级;视线是否有对象;习惯动作是否有意义;口型路线是否匹配风险;take 是否在序列中选择;情绪出口是否回写。
练习一:把“愤怒”写成三种不同策略的 Performance Spec。练习二:用无口型表现一句未说出口的话。练习三:为同一哭戏设计 2、3、5 三种强度。
本章交付物:Performance Spec、情绪时间轴、Take Matrix、Lip-sync Plan、Sequence Acting Review。
37.20 表演 Beat 的三层合同#
每个表演 Beat 分为公开意图、被压抑状态和身体泄漏。模型最容易把“悲伤”演成通用皱眉;导演应写“保持会议控制,压住恐惧,看到照片后呼吸停半秒、拇指压紧手机,再抬眼”。可见动作与时序比形容词更可控。
表演合同还包含禁止项,如不后退、不哭出声、不提前看向门。禁止项保护人物策略和后续升级空间。
37.21 Take Matrix 与表演选择#
候选不按“更有情绪”排序,而按意图清晰、身份稳定、强度、动作准确、口型和前后连续评分。导演可选表演最准确但需要局部技术修复的 take,而不是技术最干净却没有戏的 take。
同一场所有镜头并排审查情绪曲线。单镜强度 5 很精彩,但前后都只有 2,会像突然换演员。Sequence Acting Review 决定是否换 take、增加调节动作或重新生成。
37.22 声音驱动与嘴部所有权#
先锁表演音频,再决定哪些词必须看见口型、哪些可以画外延续。长句用稳定近景承担当面关键段,其余切反应、手或空间;不要让每个字都绑在持续变形的嘴部。
多人镜头只给一个主要嘴部所有权,其他角色使用低幅反应。抢话通过声音提前进入和切镜完成,避免两张嘴同时精准同步造成身份融合。口型通过后仍要判断眼神、呼吸和身体是否像在说这句话。
研究依据说明#
AI 表演的稳定性来自可观察微动作和短时控制,而不是更强烈的情绪词。表演选择必须在镜头序列中完成。