Skip to content
Charles Shao
Go back

创意 A/B 测试与有效性度量:从假设到增量

views

心理学配色文案视觉构图 每一篇都落到一句话:别信直觉,用数据校准DCO 更是把”哪版更好”变成了核心问题。那问题来了——怎么科学地验证一个创意到底有没有用? 这一篇就是整个系列的方法论收口:从提出假设到量出真实增量。

这是 创意设计与合规系列 的第六篇,是前面所有”创意直觉”的检验关口,往后接收官的 地区政策与合规

TL;DR

Table of contents

Open Table of contents

1. 实验闭环:从假设到迭代

好的创意测试不是”上两版看哪个数据好看”,而是一个有纪律的闭环。

创意实验闭环流程:提出假设(改什么·为何)→ 随机分流(A/B 同期)→ 收集数据(达样本量)→ 显著性判定(别过早看)→ 决策/迭代(采用·再试),末端有一条虚线回到起点,标注『把赢家变成下一轮的基线』 一次只改一个变量,样本量先估、跑够再看;赢家成为下一轮基线,持续迭代。

一次只改一个变量:这样赢了才知道是谁的功劳。若要同时测多个要素,用多变量测试(MVT) 或因子设计,但要意识到组合会让所需样本量急剧上升,且需检查要素间交互效应——这也是 DCO 组合爆炸难以逐一验证的原因。

2. 样本量与显著性:在噪声里辨别真信号

同样两版素材,跑 100 次曝光的”20% vs 22%“几乎没有意义,跑 100 万次才可能是真差异。原因是转化本身是随机的,观测值总带噪声。

样本量与显著性示意:横轴为转化率观测值,两条钟形曲线——蓝色『A 对照』在偏左、绿色『B 实验』在偏右,两峰有部分重叠区域;说明样本越大分布越窄、两峰越分得开则差异越可能真实 分布越窄(样本越大)、两峰越分得开,观测到的差异越可能是真实而非偶然噪声。

判定时看三样,缺一不可:

  1. 效应量(effect size):两组差多少。差异方向对但幅度极小,往往没有业务意义。
  2. 不确定性:置信区间是否跨过 0(跨 0 = 可能没差别);或 p 值是否小于预设显著性水平(常用 0.05);贝叶斯视角则看”B 优于 A 的后验概率”。
  3. 业务显著性:统计显著 ≠ 值得做。涨 0.1% 却要重做整套素材、增加维护成本,可能不划算。

样本量算一遍:一条常用的经验公式是每组 n ≈ 16·p(1−p) / δ²(约对应 5% 显著性、80% 检验力)。设基线转化率 p = 2%、想检出到 2.2%(绝对差 δ = 0.2 个百分点):n ≈ 16 × 0.02 × 0.98 / 0.002² ≈ 78,000 次/组,两组合计约 15.6 万次曝光。想检出更小的差异,样本量按 δ² 反比暴涨——差异减半,样本量就翻两番。所以第一步永远是先估样本量,再决定这个实验值不值得跑、要跑多久。

两个最常见的坑:

3. 指标阶梯:代理指标会骗人

选错指标,实验做得再规范也会把你带沟里。指标有一条从”快而浅”到”慢而真”的阶梯。

指标阶梯图:自上而下五级——曝光/可见曝光(被看到了吗 viewability)、CTR 点击率(钩子有没有吸引点击·代理)、CVR 转化率(点了之后有没有转化)、ROAS/CPA(花的钱换回多少·结果)、品牌 Lift/增量(对比空白组的真实增量),每级用向下箭头连接 越往上越接近真实生意价值,但也越慢、越难归因;别只优化”点得爽”的代理指标。

警惕只优化代理指标:CTR、点赞这类指标快、好看、易优化,但它们只是通往价值的路标,不是价值本身。把 KPI 定在代理指标上,团队就会不自觉地去”优化点得爽”,而不是”优化赚到钱”。

4. 有效性的金标准:增量,而非相关

最隐蔽的错误是把相关当因果。“看过这条广告的人转化率更高”——听起来是广告有效,但很可能是选择偏差:本来就更可能买的人,才更可能去点广告。广告可能只是”抢功”。

要量出创意/广告的真实增量(incrementality),得有一个”没看到广告”的对照组:

这与 DCO 的探索-利用、推荐排序 的线上实验一脉相承:能做随机对照,就别用事后相关下因果结论。

5. 三方视角看度量

度量口径是三方博弈最集中的地方——同一场投放,算法不同,“有效”与否可以天差地别。用 心理学篇 §1 的三方视角 看:

角色在乎什么度量诉求常见冲突
广告主真实 ROI、别浪费预算增量口径、去除选择偏差只看归来的漂亮数字 → 被代理指标误导
媒体 / 平台可信、可复核的效果统一口径、第三方可验证自证自评”既当运动员又当裁判”
用户实验合乎伦理、不被伤害不做有害的 A/B、尊重隐私拿用户做”暗黑模式”实验 → 伦理越界

6. 常见误解 ↔ 正解

常见误解正解
上两版看哪个数据高就行先写可证伪假设、随机分流、跑够样本再判定
一次多改几处更高效一次一变量;多变量要用 MVT 并查交互,样本量激增
看到显著就可以停偷看抬高假阳性;预先定样本量与停止规则
CTR 高就是好创意CTR 是代理,标题党能骗点击;要看 CVR/ROAS/增量
看过广告的人转化高=广告有效可能是选择偏差;用 holdout/Ghost Ads 量增量
统计显著就该采用还要业务显著:涨幅是否值得成本与维护

7. 收尾:一个反直觉的教训

经济学家 Randall Lewis 与 Justin Rao 分析了 25 个大规模真实广告实验,得出一个让业界不安的结论:很多广告的真实回报,小到用观察数据几乎测不出来(“The Unfavorable Economics of Measuring the Returns to Advertising”, QJE 2015)。他们发现 ROI 的置信区间中位数宽达 100 多个百分点、个体销售的变异系数常高达 10;要把广告效果测准,实验动辄需要上千万人·周的样本。原因正是本文反复强调的——转化的自然波动(噪声)常常大于广告带来的那点增量,而”看过广告的人转化更高”里又混着大量选择偏差。

这件事的教训不是”广告没用”,而是三条硬道理:

好的度量,目的不是”证明广告有用”,而是诚实地量出它到底有多有用——哪怕答案不好看。这份诚实,也是下一关的底色:创意再好、验证再严谨,投出去之前还得过最后一道门——各地区的广告政策与合规,整个系列的收官,也是所有创意的底线。

参考文献 / 延伸阅读


创意设计与合规系列 · 建议按序阅读

  1. 用户心理学与行为哲学——懂人
  2. 创意配色——用色
  3. 文案与排版——用字
  4. 视觉构图与动态创意——构图与动
  5. DCO 动态创意优化与创意疲劳——规模化
  6. 创意 A/B 测试与有效性度量(本篇)——用数据验证
  7. 地区政策与合规——守边界

完整阅读路径见系列页


views
Share this post on:

Previous Post
多路召回融合 RRF:只看排名不看分数,一招破解「各路分数没法比」
Next Post
双塔召回:为什么它是过去 10 年工业界召回的绝对主力