第七部 图像、视频、表演与合成生成
第 34 章 模型能力评测与生产选型#
本章目录
34.1 不按演示片选择生产模型#
厂商演示展示最优样本,项目需要的是普通镜头的稳定产出。选型应回答:本剧镜头中有多少单人、双人、手部、文字、低光、口型和动作;每类模型的通过率、平均尝试数、修复时间和权利条件是什么。
最强模型不一定承担所有镜头。稳定静态、角色身份、视频动作、口型和超分可以由不同工具完成,前提是色彩和资产接口可统一。
34.2 建立项目测试集#
测试集来自真实 Shot Ledger,而非随意风景。至少包含:主角正面/侧面/哭泣、双人对话、手持文件、可编辑屏幕、室内反打、低光、走动、简单接触、长衣料、群体背景、口型和镜头运动。
每类选一个常规镜头和一个压力镜头。所有候选模型使用同一输入资产、目标和尝试预算。
34.3 分开评测静态与动态#
静态看身份、构图、手、文字空间、材质和光线;动态看身份保持、运动因果、首末帧、相机稳定、遮挡恢复和可剪长度。不能用一张好图推断视频能力。
支持首尾帧、多参考、区域控制或口型,不代表实际质量;每项功能都在项目镜头上验证。
34.4 通过率与可用秒#
镜头通过率 = 达到当前闸门的候选数 / 总尝试数
每个可用秒成本 =(生成费 + 人工筛选 + 修复 + 重试)/ 最终可用秒数
记录“看起来不错但不可剪”的失败。五秒视频只有中间两秒稳定,成本应按两秒计算。
34.5 评分矩阵#
model_test:
model_route: VIDEO_ROUTE_A
shot_class: single_character_micro_action
attempts: 20
pass: 13
usable_seconds: 41
scores:
identity: 4.4
motion: 4.1
camera: 3.8
hands: 3.6
editability: 4.2
labor_minutes: 95
commercial_rights: verified
best_use: 单人2-4秒微动作
avoid: 双人接触、运动中文字
34.6 路由而非赢家通吃#
建立 Shot Class 到生产路线的映射:静态文件插入走图形合成;单人微动作走身份稳定视频模型;群演宽景走低细节路线;复杂法术走基础动作加特效合成;长对白走短口型与画外覆盖。
总控按镜头风险、预算和截止时间路由,不让创作者每次临时选工具。
34.7 版本回归#
模型更新可能改善运动、破坏脸或颜色。任何版本变化都跑固定回归集,与当前生产版本比较。新版本通过后只影响新任务;进行中镜头是否迁移需单独决定。
记录模型、版本、参数、区域、日期和账号许可。无法复现的结果不能成为可靠生产基线。
34.8 权利、隐私和可用性#
选型同时检查商用权利、上传资产处理、保存期限、地区、生成标识和服务稳定。涉及客户肖像或未公开 IP 时,数据条款可能直接阻断云端路线。
准备替代供应商和中间格式,避免项目状态被某个平台项目文件锁死。
34.9 测试必须控制变量#
模型测试最容易犯的错误,是给不同候选路线不同程度的帮助:路线 A 使用精修参考图,路线 B 使用临时截图;A 允许十次重试,B 只试三次;A 由熟悉工具的人操作,B 由第一次使用的人操作。最后得到的不是模型差异,而是输入质量、操作者经验和预算差异。
一轮正式比较必须冻结七项条件:输入资产版本、目标时长、画幅和分辨率、允许的尝试数、人工干预上限、通过标准、评审人。若某个工具必须使用特殊输入才能发挥能力,应建立独立的“最佳实践路线”,但必须把制作这些输入的工时计入总成本。
评审采用盲测更可靠。候选先隐藏模型和操作者,只显示 Shot ID、目标、版本和结果。第一轮判断是否可用,第二轮才分析路线。否则团队很容易因为品牌偏好、价格预期或某次惊艳经历改变标准。
通过标准必须在生成前写下。例如单人近景的阻断项可以是:身份评分低于 4/5、主眼方向错误、嘴部无故说话、手部结构错误持续超过 4 帧、可用连续区间不足 1.8 秒。评完再决定标准,会把“我喜欢这个镜头”误写成“模型通过了测试”。
34.10 用风险分层决定测试规模#
不是所有镜头都值得同等评测。可以按后果分成三层:
- A 层是英雄镜头、付费卡点、角色首次亮相和关键证据特写。失败会直接伤害故事或转化,测试样本多,要求保留完整生成记录。
- B 层是普通对话、反应和动作连接。它们占数量最多,重点看稳定通过率和人工吞吐。
- C 层是环境、过场、背影和可被素材替代的功能镜头。重点看速度、价格与替换弹性。
假设一季有 480 个镜头,其中 A 层 48 个、B 层 312 个、C 层 120 个。路线选择不能只追求 A 层的最高质量。B 层每镜多出十分钟人工,就会增加 52 小时;而 A 层多花二十分钟,只增加 16 小时。模型评测必须同时回答“最好的镜头怎么做”和“数量最大的镜头怎么做”。
34.11 Production Route Card#
通过评测后,不只发布一个模型名称,而要签发可执行的路线卡:
route_id: ROUTE_SINGLE_REACTION_V03
applies_to:
shot_classes: [single_closeup_reaction, silent_insert]
risk_tier: [A, B]
required_inputs:
- approved_keyframe
- identity_reference_set
- state_in
default_settings:
generated_duration: 4s
target_usable_duration: 1.8-2.8s
camera_motion: locked_or_micro_push
attempt_policy:
first_batch: 4
hard_cap: 10
human_review_after: 4
pass_gates:
identity_min: 4.2
continuous_usable_seconds_min: 1.8
fallbacks:
- simplify_to_breath_and_eyeline
- cut_to_over_shoulder
- use_still_alive_frame
owner: generation_supervisor
approved_at: 2026-07-05
路线卡的价值在于减少临场猜测。它说明适用范围、必要输入、默认参数、尝试政策、通过闸门和降级方案。新模型出现时,不需要推翻工作流,只需让它挑战某张路线卡,并跑同一回归集。
34.12 影子生产与迁移规则#
离线测试通过,不代表立即切换正在生产的整季。先挑一小批尚未交付的真实镜头做影子生产:旧路线照常完成,新路线在不影响排期的情况下并行生成。比较的不只是画质,还包括排队时间、上传失败、审核速度、导出格式、颜色变化、元数据完整度和返修响应。
迁移应设置明确条件,例如连续两批 B 层镜头通过率至少提高 15%,每可用秒总成本下降 10%,身份阻断缺陷不增加,并且备用路线已验证。不能因为单个英雄镜头更漂亮,就在一季中途让所有普通镜头改变质感。
已经锁定剪辑的镜头原则上不迁移。角色外貌、颗粒、运动节奏发生明显变化时,新路线从场景边界、集边界或季边界启用,并在变更记录中注明。工具升级不是纯技术事件,它也是视觉连续性事件。
34.13 《逆光收购》的路线决策#
项目测试发现,路线 A 在林筠单人近景上身份稳定,但双人递文件时手和纸张通过率只有 20%;路线 B 的脸略软,却能更稳定地完成中景走位;精确文件文字在两条路线中都失败。因此团队没有选“总冠军”,而是把任务拆开:林筠反应近景走 A,双人中景走 B,递交动作拆成起手、对方反应和授权书插入,文字由批准图形资产合成。
原分镜要求林筠边走进会议室、边打开授权书、边说十二字台词。压力测试连续失败后,导演没有继续更换提示词,而是把它改为四镜:门口停步、众人回头、文件落桌、林筠短句。改写后单镜通过率提高,剪辑节奏也更有权力感。模型评测在这里不是采购动作,而是反向塑造可生产的导演语言。
34.14 选型 SOP#
第一步,统计 Shot Class。第二步,从真实分镜抽测试集。第三步,为每模型限定同等尝试预算。第四步,分别评静态与动态。第五步,记录通过率、可用秒和人工工时。第六步,验证权利和隐私。第七步,建立镜头路由,不追求单一赢家。第八步,保存基线和回归集。第九步,小批生产后复核真实成本。
34.15 故障树#
**症状:演示惊艳,项目失败率高。**测试集不代表本剧镜头。重建真实 Shot Class。
**症状:单次价格低,总成本高。**忽略重试和修复工时。计算可用秒成本。
**症状:新版本上线后人物漂移。**没有回归测试。冻结生产版本并比较固定镜头。
**症状:团队每镜争论工具。**没有路由矩阵。按镜头类型预设首选和备选。
34.16 检查表、练习与交付物#
检查测试是否来自真实项目;静态动态是否分开;失败是否记录;是否计算可用秒;权利是否核验;版本是否可复现;是否有备选路线;模型更新是否回归。
练习一:从 E001 抽取十二镜测试集。练习二:比较两条路线的可用秒成本。练习三:为六类镜头建立首选和备选。练习四:设计模型版本回归表。
本章交付物:Model Test Set、Evaluation Matrix、Shot Routing Table、Cost Benchmark、Rights Review、Regression Suite、Fallback Plan。
34.17 评测单位必须是生产任务,而不是提示词演示#
测试集按 Shot Class 组织:主角正面口型、侧脸反应、双人关系、手与道具、文字屏幕、低光、动作交接和群体。每项使用真实资产、目标时长和验收标准,记录从请求到批准的完整成本。模型能生成漂亮首帧但运动通过率低,不适合承担视频路线。
评测报告至少包含一次通过率、平均尝试、可用秒比例、人工修复分钟、延迟、价格、失败分布和权利限制。单次样例不用于排名;同一任务在不同时间和版本重复,观察稳定性。
34.18 路由表需要主路线、备路线和退出条件#
每类镜头选 Primary、Fallback 与 Manual Route,并写明触发条件。正面口型可走模型 A,复杂手部使用静态合成,环境远景使用模型 B;不存在一个“全剧最佳模型”。
route_card:
shot_class: two_person_prop_handoff
primary: layered_keyframe_plus_short_motion
fallback: reaction_insert_and_sound_bridge
manual: hand_plate_composite
stop_primary_after: 3_failed_attempts
blockers: [identity_swap, prop_ownership_error]
退出条件防止团队因沉没成本无限重试。备路线在生产前验证,而不是主服务故障时才第一次尝试。
34.19 供应商迁移的等价性与差异利用#
迁移不要求新模型像素复制旧模型,而要求身份、状态、镜头功能和风格基线兼容。固定回归包比较关键指标,再决定哪些已锁批次保持旧路线、哪些新批次采用新路线。
新模型的差异也可以利用:它更擅长环境运动,就只接管环境镜头;不擅长口型则保留旧服务。迁移日志保存模型版本、参数、条款和切换批次,使历史 RC 可解释。
研究依据说明#
工具能力与价格快速变化,因此本章不绑定单一产品。稳定方法是以项目镜头和真实失败成本持续评测。