第十六部 工程实施与制作基础设施
第 83 章 模型与供应商选型:按镜头能力采购,不按排行榜采购#
模型选型不是寻找一个“最强模型”承包全剧。不同镜头对身份、动作、文字、镜头运动、口型、速度、成本和权利有不同要求。工程目标是建立能力路由,使每个任务落到经过验证的稳定区间,并能在供应商变化时安全迁移。
83.1 从任务风险建立选型基准#
先建任务分类,不先建供应商表。
《逆光收购》把镜头分为九类:单人静态近景、单人说话、双人反打、多人同框、道具接触、角色移动、环境建立、图形屏幕、特效合成。声音另分对白、长旁白、歌唱、音乐主题、音乐延展、拟音和降噪。
task_profile:
id: video_two_person_prop_handoff
required:
identity_count: 2
prop_state_transition: exact
start_end_frame_control: true
duration_s: 2_4
commercial_rights: required
preferred:
camera_motion: subtle_push
deterministic_seed: useful_not_required
forbidden:
generated_readable_contract_text: true
acceptance_set: eval_handoff_v05
只有任务定义稳定,供应商结果才可比较。用同一段“美女总裁走进会议室”的提示测所有模型,只能比较审美第一印象,无法支持生产路由。
评测集必须来自真实风险。
选取 24 个代表镜头:主角正侧脸、说话、强背光、双人遮挡、文件交接、雨中移动、玻璃反射、手机屏幕和长镜头。每个样本有冻结输入、验收维度、人工黄金判断和失败标签。评测集分公开基准与项目私有集,后者防止团队只针对测试调参。
模型升级时运行相同输入,但不要求像素相同。比较叙事状态、身份、动作、可剪性、成本和耗时。新版本整体更漂亮却使文件交接通过率下降,不能全局替换。
83.2 从盲评结果形成模型路由#
供应商能力卡。
provider_capability:
provider_id: provider_video_a
model_version: model_2026_06
validated_tasks:
single_closeup: {pass_rate: 0.91, median_cost_usd: 3.2}
two_person_handoff: {pass_rate: 0.58, median_cost_usd: 8.7}
environment_motion: {pass_rate: 0.88, median_cost_usd: 2.9}
unsupported: [exact_text, three_person_contact]
operational:
p95_latency_s: 168
rate_limit: 20_per_minute
idempotency: false
rights_profile: rights_provider_a_2026_06
last_validated_at: 2026-07-05
通过率必须写样本量和置信区间。只有三个样本全过不能写 100%。成本使用“批准秒成本”,不是单次调用价格。
盲评与成对比较。
评审界面隐藏供应商和参数,随机左右顺序。先判 blocker,再做成对偏好;不让综合美学分掩盖状态错误。身份、动作和事实为门槛,门槛内再比较表演、构图和质感。
至少两名评审独立判断,分歧进入仲裁。若一个模型总在视觉总监处得高分、连续性主管处失败,问题不是“谁更懂”,而是指标权重和使用场景不同。
路由策略。
低风险环境镜可走成本优先路由;主角近景走身份优先;文件交接先使用最稳定模型并自动生成保险覆盖;紧急补镜可走低延迟但需要额外人工闸门。路由器输出推荐和理由,不自行批准最终 take。
routing_decision:
task_id: sh_e004_032
selected_provider: provider_video_b
policy: identity_first_closeup
evidence: {identity_pass_rate: 0.94, latency_within_deadline: true}
fallback_order: [provider_video_a, composite_still_motion]
requires_human_gate: true
83.3 把商务条款纳入可用性设计#
供应商条款也是能力。
记录输入是否用于训练、输出商业权利、肖像与声音限制、数据地域、删除机制、保留期限、事故通知和条款版本。视觉能力通过但权利不适合项目的模型,路由结果仍为不可用。
条款变化触发影响分析:哪些未发布资产由该模型生成、是否需要重新授权、后续派生是否允许。不能把法务审查留到整季完成后。
迁移与降级。
每类任务至少准备一个叙事降级路线:视频模型不可用时用关键帧轻运动;精确口型失败时转反应镜与画外音;多人接触失败时拆分覆盖。降级声明牺牲什么,不应静默降低质量。
迁移先跑评测集,再做一场完整预演,最后小批量灰度。模型改变会影响提示、参考权重、时长、色彩和成本,不能只换 API 名称。
83.4 选型验收与委员会演练#
故障树。
排行榜高但项目失败:测试任务不代表真实镜头;调用便宜但总成本高:批准率低或人工修复高;升级后脸更稳但剪辑更难:运动和 handles 未纳入验收;备用模型无法接管:上下文与输出被供应商格式锁死;权利风险突然出现:条款版本没有进入依赖图。
SOP、检查表与交付物。
定义任务分类;建立私有评测集;运行盲评;计算批准秒成本;制作能力卡;加入权利与运营指标;写路由和降级;做迁移演练;每月或重大版本后重测。
- 选型样本来自项目真实风险。
- 门槛指标与审美偏好分开。
- 成本包含失败、人工和等待。
- 条款与模型版本一起锁定。
- 每个关键任务有可解释回退。
练习:比较三个候选服务在 12 个镜头任务上的表现,交付 task_taxonomy.yaml、evaluation_set/、provider_cards/、pairwise_results.csv、routing_policy.yaml、migration_report.md。
选型委员会演练。
让视觉、连续性、制片、法务和工程分别提交一票,但投票前必须写自己的否决条件。视觉可以偏好表演,连续性可因状态错误否决,法务可因用途条款阻断,制片关注批准秒成本,工程关注稳定性和可观测性。最终不是多数票,而是先通过所有硬门槛,再在可行方案中权衡。
演练中故意加入一个画面最漂亮、条款却禁止某类商业投放的供应商,以及一个单次价格最低、失败率却最高的供应商。若团队仍按印象选中,说明能力卡没有真正参与决策。会议纪要应保存被拒原因、适用任务和重新评估条件,避免三个月后换人又从头争论。
能力路由通过验收的证据,是同一批任务可根据规则重复得到可解释选择,且人工推翻时留下原因;不是路由器碰巧推荐了评委喜欢的模型。
验收结果还要由不参与采购的人复核原始样本与计算口径。