人物一致性为什么总会失控
“同一个人”不是单一视觉参数。观众同时读取颅面比例、五官间距、发际线、年龄、体态、标志性细节、服装、光线、表情与运动方式。模型可能保住其中一部分,却在角度、说话、极端表情或长镜头中悄悄替换其余部分。
因此,一致性不能靠一张正面头像或一个 Seed。它是一条从身份合同、参考资产、静态关键帧、运动生成、逐帧审查到回锚修复的控制链。
第一步:写身份合同
把角色信息分成四层,避免把可变状态误当成身份:
| 层级 | 典型内容 | 变化规则 |
|---|---|---|
| 身份不变量 | 脸型、骨相、年龄区间、眼距、鼻唇关系、体态 | 未经角色重设计不得变化 |
| 长期造型 | 发型、妆面、标志性配饰 | 按剧情阶段批准新版本 |
| 场景状态 | 服装、伤痕、湿度、污渍、疲劳 | 由连续性账本驱动 |
| 镜头表演 | 表情、视线、姿态、口型、动作相位 | 随镜头任务变化 |
身份合同要同时写正向特征和禁止漂移项。例如,与其只写“清冷年轻女性”,不如记录脸部比例、眼型、下颌轮廓、年龄范围、妆容边界,以及“不增加成熟感、不改变眼距、不变成尖下巴”。
第二步:建立可生产的参考板
角色参考板至少覆盖正面、左右 3/4、左右侧面、全身比例与中性光。再增加故事实际需要的表情包络:克制、怀疑、恐惧、愤怒、哭泣、说话和极端角度。缺少的角度会在生产时被模型即兴补全。
每个镜头只装载最小相关参考集。正面近景不需要十张互相冲突的造型图;右侧 3/4 哭泣镜头应优先读取同角度身份锚、当前服装和接近的情绪参考。
第三步:先静态归锚,再生成运动
先批准关键帧中的身份、构图、服装和道具,再把它作为图生视频起点。文本直出视频会同时求解人物、空间、构图与运动,任何一个变量失败都可能迫使整镜重来。
视频阶段要限制动作复杂度和时长。一次生成只承担清楚的动作意图,并保留头尾编辑把手。长时间说话、遮挡后重现、快速转身和极端表情是高漂移任务,应拆镜或安排局部修复。
第四步:测量漂移,而不是凭感觉争论
身份审查至少抽取首帧、中间帧、末帧和风险帧,分别检查:
- 颅面与五官几何是否保持;
- 年龄、肤质和妆面是否突然变化;
- 发型轮廓与发际线是否稳定;
- 身材比例、肩颈和惯常姿态是否一致;
- 当前服装、配饰、伤痕和污渍状态是否正确;
- 说话、闭眼、转头或遮挡恢复后是否换脸。
把结果按镜头、模型、角度和动作类型记录。连续几个批次的漂移率上升,意味着参考包、模型版本或提示词编译器已经变化,不是某位操作员“运气不好”。
第五步:按错误范围选择修复层级
- 只错了手、耳环或道具:局部重绘或合成。
- 单帧身份对、运动中漂移:保留关键帧,降低运动幅度、缩短时长或换视频路线。
- 静态帧已经不对:回到身份参考与关键帧,不要继续视频重试。
- 多个角度持续失败:补做角色角度格或更换身份控制能力更合适的模型。
- 角色设计本身难以稳定:在资产锁定阶段简化发型、纹理、配饰或极端轮廓。
人物一致性的本质不是消灭所有变化,而是让身份不变量稳定、剧情状态按规则变化、表演变化仍然属于同一个人。