第 37 章 AI 表演导演

第七部 图像、视频、表演与合成生成

第 37 章 AI 表演导演#

本章目录
37.1 情绪标签不能导演表演37.2 六个表演通道37.3 表演有进入与退出37.4 视线导演37.5 微动作与习惯37.6 强度分级37.7 后配音与口型37.8 哭、笑和喊37.9 Performance Take37.10 从台词动作到可见行为37.11 反应镜头要有认知顺序37.12 双人表演的权力差37.13 声音表演先于嘴部表演37.14 表演连续性表37.15 表演审片方法37.16 《逆光收购》的压抑哭戏37.17 表演 SOP37.18 故障树37.19 检查表、练习与交付物37.20 表演 Beat 的三层合同37.21 Take Matrix 与表演选择37.22 声音驱动与嘴部所有权研究依据说明

37.1 情绪标签不能导演表演#

“愤怒、震惊、悲伤”会让模型放大眉眼和嘴,人物却没有具体意图。表演来自角色正在压制什么、想让对方做什么,以及身体哪些部位泄露真实状态。

37.2 六个表演通道#

视线决定注意对象;呼吸决定节奏;嘴与下颌显示控制;肩背显示张力;手显示冲动或习惯;距离显示关系。每镜只强调少数通道。

performance_spec:
  character: CH_LINYUN
  objective: 不让周岚看出父亲姓名击中了自己
  emotion: shock_suppressed
  intensity: 3_of_5
  eyes: 在姓名上停0.5秒,再看日期
  breath: 短吸气后屏住
  mouth: 下颌轻收,不张嘴
  shoulders: 保持平直
  hands: 停止转笔,钢笔滑落
  distance: 不后退

37.3 表演有进入与退出#

一镜从上一情绪状态进入,经触发达到峰值,再通过调节离开。模型只收到峰值会突然做脸。把“先克制—短暂失守—重新控制”写成时间轴。

37.4 视线导演#

人物先看什么、看多久、何时移开,决定观众如何阅读。看文件、看对手、看旁观者具有不同意义。视线目标必须与空间账本一致。

眨眼不是随机生命感。延迟眨眼可增加控制,快速眨眼可显示认知负荷,但不要每镜机械指定。

37.5 微动作与习惯#

旧钢笔、整理袖口、压住杯沿等动作可成为人物调节方式。重复建立后,动作停止本身就有意义。运动签名要变化使用,避免变成固定动画。

37.6 强度分级#

为同一情绪定义 1–5:轻微可疑、明显防御、压制冲击、失控边缘、完全失控。高潮不是简单把五官拉大,而可能让人物改变策略、越过距离或打破习惯。

同场人物强度应有对比。所有人同时 5,观众没有关注中心。

图 37-1 同一人物的五级表演强度与身体通道

图 37-1 同一刺激下的五级强度。数字增大不只是面部更夸张,而是视线、呼吸、下颌、肩背和手部逐步失去控制。身份、镜头、服装与光线保持不变,才能比较表演本身。

制作 take 时不必每级都生成,但应至少准备低、标准和高三个锚点。导演在相邻镜头中选择强度曲线,而不是单独挑“最会演”的一张。若第一个反应已经达到 5,后续场景就没有升级空间。

37.7 后配音与口型#

无口型表演最稳定,适合反应、旁白和画外台词;后配音可让嘴部轻动但不严格同步;精确口型用于关键正面短句。长句拆成短口型和插入画面上的画外延续。

先锁最终音频,再口型。口型完成后检查脸型、牙齿、年龄和情绪,不能只看音素同步。

37.8 哭、笑和喊#

哭分含泪、泪落、呼吸断裂和大哭;笑分礼貌、胜利、掩饰和失控。写出目的和身体,不只写结果。喊叫极易变脸,使用短句、侧面或切反应。

37.9 Performance Take#

同一镜可生成克制、标准和增强三种 take,导演按场景曲线选择。不是永远选择最强。每个 take 记录 Spec 版本,防止情绪不连续。

37.10 从台词动作到可见行为#

演员不会直接表演“我很委屈”,模型也不应该。导演先找台词背后的动作:逼迫、试探、拖延、羞辱、求证、掩饰、诱导、拒绝、安抚。相同一句“你终于来了”,可以是迎接、控诉、威胁或确认。动作不同,视线、距离、语速和身体选择都会不同。

每个 Performance Spec 至少写出四层:角色此刻想让对方做什么;他不愿暴露什么;触发变化的具体信息;观众最终应读到什么。比如林筠看到父亲签名时,不是笼统的“震惊”,而是“继续审问周岚,同时不让她发现自己已认出签名;钢笔停止转动泄露了冲击”。这给模型和剪辑提供了一个可观察的差异。

37.11 反应镜头要有认知顺序#

一个可信反应通常经历感知、识别、解释、抑制或行动。短剧节奏很快,可以压缩这些阶段,却不能完全颠倒。人物尚未看清屏幕就开始哭,观众会觉得表演是预制表情;人物先看、再短暂停顿、最后改变呼吸,即使只占一秒,也会产生思考感。

导演可以用“反应拍点”安排微表演:

0.00–0.35 视线落到签名,不动。
0.35–0.60 瞳孔和呼吸出现第一次变化。
0.60–1.10 下颌收紧,手指停止转笔。
1.10–1.60 抬眼看周岚,恢复控制。

如果模型无法在一条中完成,就拆成物件插入、眼睛反应、手部停止和对手回看。剪辑能够重建认知过程,不必强迫一个面部镜头承担全部阶段。

37.12 双人表演的权力差#

双人场景不应分别给两个人同一个“紧张”提示。先定义谁拥有空间、谁控制时间、谁允许沉默、谁先移开视线。权力较高的人通常可以少动、晚答、占据中心或侵入对方空间;权力较低的人可能解释过多、频繁确认旁观者反应、身体后撤。但这些只是可选语法,不是固定套路,角色可以故意反用。

多人同框生成困难时,表演关系仍可以通过覆盖镜头建立。A 的视线离开画面右侧,B 的反打必须接住同一高度和时间;A 台词结束后留出的停顿,决定 B 的反应是被击中还是早有准备。表演连续性因此不仅属于脸,也属于切点之间的时间。

37.13 声音表演先于嘴部表演#

关键台词先完成声音导演:重音落在哪个词,哪里吸气,哪里故意放慢,句尾是收住还是推出。再根据最终音频选择正面口型、侧面弱口型、过肩或画外。若先生成嘴部运动再逼声音去配,台词往往失去自然节奏。

长句按意义拆,不按固定字数拆。正面只保留必须看见角色说出的攻击或承诺,其余部分可跨到对方反应、道具、空间或回忆。这样既降低口型风险,也让台词产生行动对象。口型镜头的通过标准应同时包括音素、身份、牙齿、下颌幅度、眼神和情绪;只有嘴对上,不算表演通过。

37.14 表演连续性表#

每场建立情绪基线、触发、最高强度和出口,不让镜头各自选择表情:

performance_arc:
  scene: SC_E003_ARCHIVE
  character: CH_LINYUN
  baseline: controlled_investigation_2
  triggers:
    - beat: B04
      event: 发现父亲签名
      change: shock_suppressed_3
    - beat: B06
      event: 周岚说出只有家人才知道的旧称呼
      change: fear_and_suspicion_4
  maximum: 4
  forbidden: [open_crying, shouting]
  exit: controlled_dominance_3
  carry_to_next_scene: 左手继续握紧旧钢笔

剪辑选择 take 时,以这张表为准。若某个单镜版本很精彩,却提前达到全场最高强度,应拒绝或移到真正触发点。表演弧线比单镜“演得足”更重要。

37.15 表演审片方法#

第一遍关闭声音,只看身体、视线与切点,判断人物是否像在互相影响。第二遍闭眼听声音,判断意图、呼吸和关系是否成立。第三遍正常播放,检查声音和画面是否在同一时刻达到峰值;如果所有通道同时强调,往往会显得用力过猛。第四遍将场景前后各接一镜,检查人物是否凭空换情绪。

审片意见必须写成可执行行为,例如“抬眼早 6–10 帧,让她先读完签名”“嘴部幅度降低,保留下颌紧张”“右手不要重复敲桌,因为上一镜已经停住”。“再克制一点”仍然太抽象。

37.16 《逆光收购》的压抑哭戏#

林筠确认父亲死亡与自己提交的线索有关。失败版本让她立刻落泪、捂嘴、摇头,情绪信息很清楚,却与人物长期建立的控制型行为冲突。新版不先生成哭:她读完日期,手里的旧钢笔停住;第二镜她问了一个过分专业的问题;第三镜对方离开后,钢笔从掌心滑落;直到场景末尾才出现一滴泪,她没有擦。

这组设计把悲伤变成一次控制失败,而不是通用哭泣模板。它也给声音留下层次:前半段保持干燥近讲,发现日期后出现一次短吸气,房间底噪略被主观压低,钢笔落地成为情绪落点,音乐在泪出现之前不进入。

37.17 表演 SOP#

第一步,读取人物目标和情绪进入状态。第二步,写压制与泄露。第三步,选择视线、呼吸、嘴、肩、手、距离中的重点。第四步,设强度和时间轴。第五步,决定无口型、后配或同步。第六步,生成少量强度 take。第七步,放入相邻镜头审表演连续。第八步,回写情绪出口。

37.18 故障树#

**症状:表情夸张。**只有情绪标签,没有目标和控制。降低强度并指定身体通道。

**症状:单镜好,连起来情绪跳。**未继承 emotion_in/out。放回序列选 take。

**症状:口型准但不像本人。**同步改变脸部结构。缩短句子或改画外。

**症状:人物像木偶。**完全没有呼吸、视线和微动作。加入一项低幅度生命通道,不让全身乱动。

37.19 检查表、练习与交付物#

检查表演是否有目标;是否说明压制和泄露;强度是否分级;视线是否有对象;习惯动作是否有意义;口型路线是否匹配风险;take 是否在序列中选择;情绪出口是否回写。

练习一:把“愤怒”写成三种不同策略的 Performance Spec。练习二:用无口型表现一句未说出口的话。练习三:为同一哭戏设计 2、3、5 三种强度。

本章交付物:Performance Spec、情绪时间轴、Take Matrix、Lip-sync Plan、Sequence Acting Review。

37.20 表演 Beat 的三层合同#

每个表演 Beat 分为公开意图、被压抑状态和身体泄漏。模型最容易把“悲伤”演成通用皱眉;导演应写“保持会议控制,压住恐惧,看到照片后呼吸停半秒、拇指压紧手机,再抬眼”。可见动作与时序比形容词更可控。

表演合同还包含禁止项,如不后退、不哭出声、不提前看向门。禁止项保护人物策略和后续升级空间。

37.21 Take Matrix 与表演选择#

候选不按“更有情绪”排序,而按意图清晰、身份稳定、强度、动作准确、口型和前后连续评分。导演可选表演最准确但需要局部技术修复的 take,而不是技术最干净却没有戏的 take。

同一场所有镜头并排审查情绪曲线。单镜强度 5 很精彩,但前后都只有 2,会像突然换演员。Sequence Acting Review 决定是否换 take、增加调节动作或重新生成。

37.22 声音驱动与嘴部所有权#

先锁表演音频,再决定哪些词必须看见口型、哪些可以画外延续。长句用稳定近景承担当面关键段,其余切反应、手或空间;不要让每个字都绑在持续变形的嘴部。

多人镜头只给一个主要嘴部所有权,其他角色使用低幅反应。抢话通过声音提前进入和切镜完成,避免两张嘴同时精准同步造成身份融合。口型通过后仍要判断眼神、呼吸和身体是否像在说这句话。

研究依据说明#

AI 表演的稳定性来自可观察微动作和短时控制,而不是更强烈的情绪词。表演选择必须在镜头序列中完成。