第 59 章 自动评测与人机协作

第十一部 Agentic 制片系统与自动化

第 59 章 自动评测与人机协作#

本章目录
59.1 评测分层、测试套件与证据界面59.2 人类判断、漂移控制与运行流程59.3 清单实例、阈值与黄金评测集59.4 责任边界、失败案例与成本校准59.5 评测器治理、发布决定与红队测试

59.1 评测分层、测试套件与证据界面#

自动化先检查确定事实。

自动检查擅长 Schema、ID、缺失文件、引用、时间重叠、黑帧、静音、字幕溢出、响度、峰值、分辨率、哈希和一部分相似度。它不应假装知道哭戏是否动人。

评测分三层。

确定性规则直接通过/失败;统计模型提供异常候选;人类判断审美、表演、幽默、情绪、伦理和商业取舍。界面必须显示结论属于哪一层。

自动测试套件。

项目验证:Schema、稳定 ID、资产引用、合法状态;画面:黑帧、冻结、尺寸、字幕安全区、脸部相似候选;声音:缺轨、响度、峰值、同步;业务:卡点与下一集偿还是否存在;权利:关键资产是否有记录。

置信度和证据。

异常模型输出置信度、参考版本和可视证据,不自动删除素材。低置信度进入抽样,高置信度阻断候选仍需规则或人确认。

审片界面。

同时展示成片、时间码、Shot/Beat、预期状态、参考资产、问题、修复工位和前后镜。审核员无需在多个文件夹寻找上下文。

59.2 人类判断、漂移控制与运行流程#

人类判断权。

人类负责选故事承诺、人物魅力、表演、卡点诚实、品牌适配、法律解释和停止项目。系统提供比较、成本和证据,不能用单一模型分数替代责任。

评测漂移。

自动评测模型更新也要回归。保存已人工标注的通过/失败集,监测误报和漏报。评测器不能在无通知下改变发布门槛。

SOP。

第一步,列可确定规则。第二步,为软问题建立异常提示而非裁决。第三步,保存参考与证据。第四步,设计带上下文的审片界面。第五步,人工决定并回写标签。第六步,用标签评估评测器。第七步,版本变化跑回归。

故障树。

**症状:自动评分高但成片差。**把审美与商业判断伪装成确定指标。恢复人类审批。

**症状:审核员忽略警告。**误报过多且无证据。调整阈值并按风险排序。

**症状:同一素材今天过明天不过。**评测器版本漂移。锁版本和回归集。

检查表、练习与交付物。

检查规则与模型是否区分;异常是否有证据;人类权责是否明确;评测器是否版本化;误报漏报是否测量;审片决定是否回写。

练习一:把二十项 QC 分成规则、异常模型和人类判断。练习二:设计一屏审片信息。练习三:建立评测回归集。

本章交付物:Automated Test Suite、Evaluation Registry、Review UI Spec、Human Decision Log、Evaluator Regression Report。

59.3 清单实例、阈值与黄金评测集#

自动检查清单实例。

E001 进入 Release Gate 前,确定性检查验证:19个 Shot ID 均在 Storyboard;时间线无重叠或黑洞;所有 GEN_* 源文件存在且哈希一致;字幕未超安全区;音频不缺轨;P0/P1 计数为零;授权书图形字段与 Evidence Ledger 相同;音乐、字体和声音均有 Rights ID。

异常检测随后标记:S11 林薇脸部相似度低于同角度基线;S18 与 S17 平均亮度差异常;字幕 S14 阅读速度偏高。这三项不是自动失败。审核员查看前后镜,确认 S11 是表情变化可接受,S18 是屏幕亮起的剧情事件,S14 确实需拆成两屏。

误报、漏报与阈值。

评测器至少统计 precision、recall 与按严重度的漏报。连续性工具若为了不漏变脸而把一半镜头都报警,会使审核员产生警报疲劳;若只报最明显错误,又可能漏掉逐镜累积漂移。

不同 Shot Class 使用不同阈值。英雄脸部近景严格,背景远景只检查轮廓;证明物字段使用确定性像素/文本核验,不与普通背景文字同门槛。

黄金评测集。

建立人工标注的 golden_eval_set:明确通过、明确失败、边界案例和豁免案例。每项保存参考、问题类别、严重度和判定理由。评测器升级必须重跑,比较新增误报、漏报和处理时间。

评测集包含故意制作的错误:痣镜像、伤口换手、时间倒退、音乐授权缺失、字幕挡文件、付款后未偿还。只用自然错误会漏掉低频高风险问题。

审片界面实例。

审核员看到当前画面、前后各两镜、参考角色、预期/观察状态、模型置信度、正常速度与逐帧切换。点击“P1 道具换手”后,界面自动建议返回 Continuity/Keyframe,并显示受影响下游。

人类可以确认、降级、豁免或改根因,但必须写一句理由。理由进入训练与评测数据,下一次同类问题可以更准确排序。

主动学习而非自动扩大权力。

系统优先把低置信度、高影响和新型问题送人审。积累足够标注后可改善异常排序,但不能因为准确率上升就自行获得发布批准权。权力变化需要新的治理决定和回归证据。

59.4 责任边界、失败案例与成本校准#

人机责任表。

机器确认文件、格式、引用和测量;机器提示相似度、漂移和异常;人判断魅力、喜剧、伦理、表演、卡点诚实和商业停止。法务判断不能由模型摘要取代,模型只能整理待核问题和来源。

失败案例:评分绑架创作。

如果团队要求“每镜情绪强度≥4、每15秒反转”,模型会制造持续夸张和无意义转折。指标必须是诊断,不是创作目标。人类可批准低强度长停顿,只要其服务场景;系统记录豁免原因,而非强迫改成平均模板。

抽样策略。

稳定低风险批次可减少逐项人工审核,但首镜、英雄近景、卡点、权利、关键文字和新模型路线始终全审。抽样发现严重问题时扩大到整个批次并追溯共同输入。抽样比例由历史缺陷率和影响调整,不以省人力为唯一目标。

评测对象必须绑定闸门。

同一个指标在不同阶段含义不同。关键帧身份相似度用于阻止错误进入视频;动态阶段要检查首中末漂移;粗剪阶段还要判断相邻镜头是否被观众感知为同一人。不能用一个全局“人物一致性 87 分”替代三道具体闸门。

评测记录包含工件类型、版本、参考、阈值来源和允许动作。未达到关键帧阈值可以重做静态;粗剪才发现同类错误,则应追溯存量范围,而不是只标当前时间码。

校准、基准率与成本。

判断评测器前先知道缺陷基准率。若一千个镜头只有十个身份错误,评测器报出五十个警告、命中八个,看似召回率高,却会制造四十二次人工复核。不同严重度要计算漏报成本和误报成本,选择不同阈值。

P0/P1 允许更多误报以降低漏报;P3 美化问题应提高精度,避免淹没审核员。每次阈值调整记录人工分钟变化,而不只看离线准确率。

59.5 评测器治理、发布决定与红队测试#

多评测器不等于多数表决。

视觉相似度、规则验证、视觉语言模型和人类可能得出不同结论。系统保存各自证据,不用简单平均分。规则发现授权书金额错误时,即使两个审美模型都给高分,也必须阻断;模型提示脸部漂移而人类确认是合理表情,则记录边界样本。

高影响冲突进入人审,低影响冲突按预设优先级处理。评测器之间长期不一致时,应检查参考、Shot Class 和阈值,而不是不断增加新的裁判模型。

发布决策不由综合分数决定。

综合分数适合排序审片优先级,不适合发布。一个作品故事、画面和声音平均 95 分,只要音乐权利缺失仍不能发布;十个轻微 P3 也不应与一个错误金额相互抵消。

Release Gate 使用阻断规则、必要证据和人工签字。评测系统负责把证据准备完整、把异常排序清楚、把历史类似问题呈现出来,最终责任仍属于发布负责人。

评测器注册表与适用声明。

每个评测器登记输入类型、输出定义、训练或规则来源、适用 Shot Class、已知盲区、阈值版本、校准集和所有者。一个在正面近景表现良好的身份相似模型,不得默认用于侧脸、遮挡和远景。结果必须显示“不可判定”,而不是在不适用条件下给出伪精确分数。

评测器升级与 Prompt 一样走回归和灰度。新版本若降低误报却漏掉 P1,不能仅凭平均准确率上线。历史 RC 保留当时评测器版本,审计时不以新模型重写旧决定。

人类评审一致性与仲裁。

抽取一小部分样本由两名评审独立判断,计算分歧并讨论规则边界。目标不是让审美完全一致,而是校准阻断事实、严重度和证据要求。身份是否同一人、文字是否正确、许可是否存在应高度一致;表演魅力可以保留导演判断。

高影响分歧进入仲裁,仲裁者看到原始证据但不先看到谁支持哪方,降低权威偏见。最终决定、理由和边界样本进入 Golden Evaluation Set,供后续人机共同校准。

评测系统也要接受红队测试。

主动构造能骗过评测器的样本:脸部结构错误但颜色相似、授权书金额只错一位、音乐权利缺失但画面完美、字幕被平台 UI 部分遮挡、角色知识提前却对白自然。测试系统是否会被高综合分掩盖阻断错误。

还要测试对创作例外的容忍:故意长停顿、主观失焦、梦境越轴和沉默卡点。评测器应提示偏离并请求解释,而不是自动改回模板。安全评测既要抓住伪装错误,也要允许经过批准的艺术选择。