不要追求一张像;要建立一条不会漂移的身份链

AI 视频人物一致性

系统讲解 AI 视频人物一致性:身份合同、角色参考板、角度格、表情包络、静态归锚、图生视频、回锚、漂移评分与返工路径。

人物一致性为什么总会失控

“同一个人”不是单一视觉参数。观众同时读取颅面比例、五官间距、发际线、年龄、体态、标志性细节、服装、光线、表情与运动方式。模型可能保住其中一部分,却在角度、说话、极端表情或长镜头中悄悄替换其余部分。

因此,一致性不能靠一张正面头像或一个 Seed。它是一条从身份合同、参考资产、静态关键帧、运动生成、逐帧审查到回锚修复的控制链。

第一步:写身份合同

把角色信息分成四层,避免把可变状态误当成身份:

层级 典型内容 变化规则
身份不变量 脸型、骨相、年龄区间、眼距、鼻唇关系、体态 未经角色重设计不得变化
长期造型 发型、妆面、标志性配饰 按剧情阶段批准新版本
场景状态 服装、伤痕、湿度、污渍、疲劳 由连续性账本驱动
镜头表演 表情、视线、姿态、口型、动作相位 随镜头任务变化

身份合同要同时写正向特征和禁止漂移项。例如,与其只写“清冷年轻女性”,不如记录脸部比例、眼型、下颌轮廓、年龄范围、妆容边界,以及“不增加成熟感、不改变眼距、不变成尖下巴”。

第二步:建立可生产的参考板

角色参考板至少覆盖正面、左右 3/4、左右侧面、全身比例与中性光。再增加故事实际需要的表情包络:克制、怀疑、恐惧、愤怒、哭泣、说话和极端角度。缺少的角度会在生产时被模型即兴补全。

每个镜头只装载最小相关参考集。正面近景不需要十张互相冲突的造型图;右侧 3/4 哭泣镜头应优先读取同角度身份锚、当前服装和接近的情绪参考。

第三步:先静态归锚,再生成运动

先批准关键帧中的身份、构图、服装和道具,再把它作为图生视频起点。文本直出视频会同时求解人物、空间、构图与运动,任何一个变量失败都可能迫使整镜重来。

视频阶段要限制动作复杂度和时长。一次生成只承担清楚的动作意图,并保留头尾编辑把手。长时间说话、遮挡后重现、快速转身和极端表情是高漂移任务,应拆镜或安排局部修复。

第四步:测量漂移,而不是凭感觉争论

身份审查至少抽取首帧、中间帧、末帧和风险帧,分别检查:

把结果按镜头、模型、角度和动作类型记录。连续几个批次的漂移率上升,意味着参考包、模型版本或提示词编译器已经变化,不是某位操作员“运气不好”。

第五步:按错误范围选择修复层级

  1. 只错了手、耳环或道具:局部重绘或合成。
  2. 单帧身份对、运动中漂移:保留关键帧,降低运动幅度、缩短时长或换视频路线。
  3. 静态帧已经不对:回到身份参考与关键帧,不要继续视频重试。
  4. 多个角度持续失败:补做角色角度格或更换身份控制能力更合适的模型。
  5. 角色设计本身难以稳定:在资产锁定阶段简化发型、纹理、配饰或极端轮廓。

人物一致性的本质不是消灭所有变化,而是让身份不变量稳定、剧情状态按规则变化、表演变化仍然属于同一个人

常见问题

固定 Seed 能保证人物一致吗?

不能。Seed 只在特定模型、版本与参数组合下提供有限复现性,无法替代身份参考、角度覆盖、状态控制和回锚机制。

参考图是不是越多越好?

不是。每个镜头只应装载与角度、表情、服装和动作有关的最小参考集;冲突或冗余参考会稀释身份特征。

什么时候应该合成,而不是继续重生成?

当主体身份已经正确、错误集中在手、道具、文字或局部背景时,局部修复或分层合成通常比整镜重抽更稳定。