第十二部 素材投放、发行与数据迭代
第 61 章 测试设计和指标诊断#
本章目录
61.1 指标诊断、实验单位与真实 ROI#
指标是漏斗中的症状。
曝光到点击、三秒、有效播放、完播、下一集、卡点、付费和回收,每一步回答不同问题。不能用播放量证明利润,也不能用 CTR 证明故事。
实验单位。
明确人群、平台、时间、素材、落地版本、卡点和预算。随机或尽量控制其他变量。样本不足时只记录方向,不宣布规律。
Metrics Ledger。
experiment:
id: EXP_HOOK_001
hypothesis: 证明反转优于血缘秘密
variants: [AD_PROOF_A, AD_IDENTITY_B]
controlled: [audience, bid, destination, duration]
primary_metric: qualified_view_rate
guardrails: [E001_completion, E002_start]
decision_rule: 预先定义
指标组合。
低 CTR 看首帧和承诺;高 CTR 低三秒看入口兑现;三秒好完播差看中段节奏;完播高下一集低看集尾问题;追更高付费低看卡点、价格或链路;付费高后续留存低看偿还。
ROI 与真实成本。
收入减投放、平台、制作、失败生成、人工和授权,才是项目回报。热度和充值流水不能代替利润。
61.2 评论证据、决策规则与运行流程#
评论编码。
评论按理解、站队、预测、催更、逻辑质疑、画面投诉、付费抱怨和更新需求编码,关联时间和版本。不要追逐一条高赞意见。
提前写决策规则。
实验前规定成功、继续收集、停止和异常处理,避免看到结果后挑指标解释。平台波动和小样本要保留不确定性。
SOP。
第一步,写可反驳假设。第二步,选主指标和保护指标。第三步,控制变量。第四步,设预算与停止。第五步,检查数据链路。第六步,运行并记录版本。第七步,结合评论和正片数据诊断。第八步,只做证据支持的下一步。
故障树。
**症状:点击好但不赚钱。**优化了上层指标,忽略卡点、成本和回收。
**症状:每次结论都不同。**样本、入口和版本未控制。重建实验记录。
**症状:团队只看平均值。**不同钩子吸引不同人群。按素材家族和后续行为分层。
检查表、练习与交付物。
检查假设是否可反驳;主/保护指标是否预先选定;变量是否可解释;数据是否贯通;成本是否完整;不确定性是否保留;评论是否编码。
练习一:为两类钩子写实验。练习二:诊断四种漏斗组合。练习三:计算含人工与失败生成的 ROI。
本章交付物:Experiment Plan、Metrics Ledger、Decision Rules、Funnel Diagnosis、Comment Coding、ROI Report。
61.3 指标定义、样本不确定性与数据质量#
指标定义必须固定。
“三秒留存”分母是开始播放、有效曝光还是点击用户,会导致不同结果。每个指标记录公式、事件名、窗口、去重规则、时区和数据源。平台原生数据与自有支付数据使用共同实验 ID 对接。
metric_definition:
name: E001_completion
numerator: unique_users_reaching_95_percent
denominator: unique_users_starting_E001
window: 24h_after_click
exclusions: [internal_test, duplicate_device_events]
指标定义变更后不能直接与历史连续画图,需标记断点或重算。
虚构实验例子。
假设证明版 A 与身份版 B 使用同一受众、预算和正片。A 的 CTR 较低,但三秒、E001完播和E002进入更高;B 点击更强,却在正片前十秒快速流失。结论不是“证明版一定最好”,而是 B 吸引的身份幻想未在落地首段足够兑现。
下一步有两个可区分实验:将 B 落地改为身份授权更快出现;或保留原落地,只调整 B 的承诺。不能同时改广告和正片后宣布原因。
归因窗口和跨设备。
用户可能点击后晚些付费,或在另一设备观看。选择窗口会改变 ROI。记录直接点击、观看辅助和再营销归因,避免把同一转化重复算给多条素材。
平台黑箱数据无法完全验证时,报告限制,不伪造精确归因。用趋势和可控实验做下一步决定。
样本与不确定性。
没有一个适用于所有项目的固定样本量。基线、差异大小、波动和决策成本共同决定。高成本扩产需要更强证据,低成本淘汰明显失败可更快。
报告区间与样本,不只报小数点百分比。样本不足时状态是 inconclusive,不是强行选赢家。连续偷看数据并在高点停止会放大假阳性,需预先规定检查节奏。
数据质量检查。
投放前测试事件:曝光、点击、播放开始、三秒、完播、下一集、卡点、支付成功、退款。检查丢失、重复、时区、版本和机器人流量。事件链断裂时暂停商业结论。
一次平台更新可能改变自动播放或指标定义。异常突变先查埋点和流量结构,再解释为内容变化。
61.4 诊断分层、实验冲突与事件字典#
完整 ROI。
贡献利润 = 收入
- 媒体费用
- 平台与支付费用
- 退款
- 正片与素材生产摊销
- 生成失败和人工修复
- 授权、客服与基础设施
规模预测还要考虑素材疲劳、边际流量变贵和后续集生产。小样本正 ROI 不代表预算放大后线性增长。
诊断矩阵。
高点击低完播先查承诺错配、首镜和中段;低点击高完播说明正片可能好但素材弱;高完播低卡点转化查积累、价格与支付摩擦;高付费低后续留存查偿还;各层均好但利润差查投放价格、退款和制作成本。
任何指标异常至少提出两个竞争解释和一个能区分它们的实验。
分层与异质性。
平均结果可能隐藏相反用户。按新老用户、素材家族、设备、地区、付费历史和入口分层,但分层必须预先有业务理由,不能在几十个切片中寻找偶然赢家。
某素材总体略差,却在“已看过前三集”的再营销人群有效,应调整投放位置而非淘汰。报告同时显示各层样本与不确定性。
实验冲突。
同一人同时进入多个素材和价格实验会污染结果。实验登记表管理互斥组、优先级和冷却期。紧急平台改动或大促造成外部冲击时,标记数据窗口,不把环境变化归因内容。
事件字典先于仪表盘。
在画图之前,逐个定义曝光、点击、播放开始、有效三秒、95% 完播、下一集开始、付费页打开、支付成功、退款和第七日留存事件。每个事件记录触发条件、去重键、用户匿名 ID、Creative ID、Episode Version、时间戳、平台和 Schema 版本。
event_definition:
event: episode_complete
fires_when: playhead_reaches_95_percent
dedupe: user_id + episode_id + episode_version + 24h
required_dimensions: [creative_id, destination_id, platform, locale]
late_arrival_window: 48h
owner: analytics
缺少 episode_version,重剪前后数据会混合;缺少 creative_id,无法知道哪种承诺带来高质量用户;缺少退款,则高充值可能掩盖不满意。
61.5 指标治理、因果估计与停止纪律#
主指标、保护指标和诊断指标。
主指标决定实验;保护指标防止局部优化伤害整体;诊断指标帮助解释。证明版与身份版比较时,主指标可以是 E002 进入率,保护指标是付款后第三集留存与退款,CTR、三秒和评论则用于诊断。
每个实验只允许一个主决定指标,否则结果出现一好一坏时团队会事后挑选。保护指标可以阻止胜出,例如身份版 E002 进入更高,但付费后留存显著下降,不能直接放量。
决策备忘录。
实验结束不只输出图表,而要写一页 Decision Memo:假设、版本、样本、数据质量、主结果、区间、保护指标、竞争解释、决定、下一实验和禁止推论。禁止推论用于防止结论膨胀,例如“证明版在本次冷启动人群胜出”不能写成“所有市场都喜欢专业复仇”。
decision:
status: directional_win
winner: AD_PROOF_A
evidence: E002_start_up, refund_unchanged
uncertainty: sample_small_in_returning_users
next: test_first_frame_within_proof_family
do_not_infer: identity_family_is_globally_invalid
《逆光收购》的漏斗诊断演练。
虚构结果:证明版 CTR 1.8%、E001 完播 61%、E002 进入 44%;身份版 CTR 2.6%、E001 完播 39%、E002 进入 21%。身份版不是“更好的素材”,而是更强点击、更弱匹配。下一步应固定身份承诺,测试更快的身份确认落地;若仍低,才降低该家族预算。
同时,证明版在 25–34 岁组表现稳定,在 45 岁以上组点击较低但付费更高。预算分配应考虑贡献利润,不以全体 CTR 排名。所有数字均是教学虚构值,真实项目必须使用自己的基线和不确定性。
用因果图定义真正要估计的效果。
投放平台、受众、时间、竞价、素材和落地版本同时变化,简单比较两组平均值容易误判。实验前画最小因果图,明确处理变量、结果、混杂因素、中介和保护指标。例如素材影响点击,点击选择又影响进入正片的人群,不能把点击后留存差异全部归因于正片。
随机分配优先;无法随机时记录分配机制,并谨慎使用分层、匹配或时间对照。任何统计方法都不能补救缺失版本和错误事件。书中不提供万能显著性阈值,真实项目应由具备实验经验的人根据风险、样本和业务成本设计。
留出组、长期效应与蚕食。
短期 CTR 胜出可能只是吸引了本来会自然观看的人,或从另一个素材家族搬走转化。保留小比例基准组,观察增量进入、付费、退款和长期留存;预算足够时评估素材之间的受众蚕食。
长期指标不必阻塞所有快速决策。用分层闸门:首日数据可淘汰明显错配,数日数据决定有限放量,更长窗口验证贡献利润和留存。每个阶段只做其证据能支持的决定。
顺序实验与提前停止纪律。
持续查看数据并在第一次领先时停止,会夸大胜者。实验计划预先规定最小样本、检查窗口、胜出、无效、风险和停止条件。确需顺序决策时使用适当方法并保存每次查看记录,不在后台偷偷重复比较。
商业上可因 P0/P1、退款异常或平台风险提前停;因结果不喜欢而换主指标则不允许。停止后仍输出 Decision Memo,说明提前停止原因和哪些推论不能做。