增量测试
编辑词条增量测试通过可比对照估计营销活动额外带来的转化或价值。介绍用户与地区测试、增量计算、iROAS、实验设计、结果不确定性,以及与A/B测试和归因的关系。
目录 · 7 个章节
增量测试是通过对照设计,估计某项营销活动相对于没有该活动时额外带来的结果,英文为 Incrementality Testing。它关注的是因果影响,例如广告额外带来多少购买、销售金额或有效线索,而不只是有多少转化被归因到广告。这里讨论的是营销测量中的增量测试,与软件集成测试中的同名术语不同。
增量测试为什么需要对照
顾客在点击广告后购买,不代表这次购买完全由广告创造。顾客可能本来就准备购买,也可能受到自然搜索、品牌知名度、邮件、促销或其他渠道影响。归因报表按照规则将已有转化分配给触点,增量测试则尝试估计:如果没有被测试的活动,原本会发生多少结果。
这个“没有活动时的结果”无法与同一个顾客在同一时刻的真实结果同时观察,因此需要建立可比对照。常见做法是预先将符合条件的人群随机分为测试组与保留对照组,测试组按方案接受营销,对照组不接受被测试的营销,再比较统一观察范围内的结果。
不能在活动结束后直接把实际看到广告的人与没看到广告的人比较,就称为可靠增量实验。广告是否展示可能受到购买意愿、平台分发、活跃程度和竞价机会影响,两群人本来就可能不同。有效设计需要明确分组、投放抑制和分析规则,尽量避免由触达选择造成的偏差。
常见的增量测试方式
用户保留测试以用户或其他稳定人群单位进行分组。例如,在允许营销的目标客户中保留一组不接受某次邮件或广告,将其与测试组比较。对照组仍可能自然购买,也可能接触其他未被测试的渠道;因此,“没有被测试活动”不等于“完全没有任何营销”。
地区测试以不重叠地区为单位,比较接受投放变化的地区与对照地区。地区在原有销售、季节、客群和趋势方面可能不同,需要采用合适的分配、匹配或基线调整方法。不能任意选择两个城市,再直接把销售额差额全部解释为广告影响。
也可以对活动强度、渠道组合或某项促销进行增量比较,但结论必须对应实际处理。例如,“增加这部分预算相对于维持原预算”的测试,回答的是追加投入的影响,不等于整个渠道相对于完全停投的影响。
Google Ads的Conversion Lift提供基于用户和基于地区的测量方式,TikTok也提供Conversion Lift Study。平台工具的资格、可用广告类型、数据要求和结果字段有各自规则,并非所有账号都能直接创建,也不应沿用旧文章中的功能范围作为当前说明。
怎样计算和理解增量
在简化的等规模随机分组例子中,假设测试组和对照组各有10,000名用户,以“期间至少购买一次的用户”为指标。测试组有300名购买,对照组有250名购买,则购买比例分别为3%和2.5%,差异为0.5个百分点,相对提升为20%。按对照比例估计,测试组原本预期约有250名购买,观察到的额外购买用户约为50名。
这一结果是实验估计,不是说能准确指出哪50个人一定因广告购买,也不能把测试组全部300名购买都算成增量。实际结论还需结合不确定性、分组执行和数据质量,不能只凭差值就确认因果。
组别人数不同,应按相应规模和测量方法归一化,不能直接相减转化总数。多次购买形成的订单数、去重购买人数、购买金额与线索数也不是同一个指标,必须在测试前确定。地区研究常采用更复杂的基线和统计方法,其结果不宜套用上述简化人数计算。
相对提升通常表示增量相对于对照基线的比例,绝对比例差通常用百分点表达;不同平台对“Absolute Lift”等字段的命名可能不同,应查看平台定义,而不是仅凭英文标签判断单位。对照结果为0时,相对提升不能按普通除法计算。
增量成本和增量广告回报
增量获客成本或增量转化成本,关注为额外转化付出的成本;增量广告支出回报率iROAS,关注额外转化价值与相应测试支出的关系。例如,若按某一用户研究的支出口径花费10,000元,估计额外产生20,000元购买价值,则iROAS为2。它与用归因销售金额计算的普通ROAS不同。
分母必须与实验设计对应。有些用户研究使用被测试广告的总支出,比较投入变化的地区研究则可以使用增量支出。Google的地区测量中,增量成本表示实验期间测试与对照的支出差异。不能将一个研究的增量价值与另一个范围的广告费用组合计算。
iROAS大于1也不直接等于盈利。购买价值中仍包含商品成本,业务还可能承担配送、支付、优惠、退货和客服成本。若要判断预算是否值得增加,应结合贡献利润、回款和退货后的价值,而不是把销售收入当作利润。
测试开始前需要明确什么
首先定义要回答的问题,例如某次老客邮件是否增加复购、再营销广告是否带来额外订单,或某地区增加预算是否增加销售。明确被测试活动、对照处理、主要结果、观察期和分析单位,避免结果出来后不断更换指标寻找漂亮结论。
其次核对两组是否在库存、价格、配送、促销和数据采集方面可比。若只有测试地区有货,或对照组同时失去优惠资格,结果可能混入库存与价格影响。其他渠道不必全部关闭,但需要理解它们与测试活动的关系,并尽量保持执行稳定。
还要检查组间串扰。对照用户若通过另一批投放接触了同一被测试活动,或某人以不同设备和身份进入两组,会改变实际处理差异。测试某个广告系列时,对照组仍可能看到账号内其他广告,结果反映的是该系列在其他营销继续运行时的额外影响。
样本规模、转化频率、期望检测的效果和测试时长共同影响结果精度。不能规定所有店铺都测试7天或保留同一比例的人群。购买周期较长时,应考虑转化延迟和测试结束后的适当观察,而不是在投放停止当天立即判定没有效果。
没有显著提升怎样解释
“没有检测到显著提升”不等于“已经证明增量为零”。它可能表示真实效果较小,也可能是样本不足、波动较大、执行污染或测量遗漏。应区分数据不足、估计接近零、区间较宽和较明确的负向结果,结合置信区间或平台采用的概率统计方法判断。
一个正向点估计也不保证实际提升稳定存在。结果区间很宽时,商业决策应考虑不确定性;不宜每天查看结果,一出现正值就提前结束,再将其作为最终胜出结论。不同平台统计方法和展示标准也不完全相同,不能套用一个统一显著性门槛。
实验结果只适用于测试所覆盖的人群、时间、预算、素材和市场条件。小预算测试表现较好,不代表放大十倍预算仍保持同样iROAS;节日、竞争、价格和饱和度变化后,也可能需要重新评估。
与A/B测试、归因和营销组合模型的关系
A/B测试是比较不同处理的实验方法,增量测试可以采用A/B式随机设计;两者并非互相排斥。比较两份广告素材,通常回答哪个版本更有效;广告投放与保留对照比较,才能回答相应广告相对于未投放是否带来额外结果。若两个版本都投放,无法仅凭版本差异估计整个广告渠道的总增量。
归因适合日常观察转化路径和优化投放,增量实验用于验证特定活动的额外贡献,营销组合模型则可以结合较长时间的销售与投入数据分析不同因素。它们可以互相补充,但实验不能自动消除所有测量问题,模型预测也不能冒充一次已经完成的对照实验。
参考资料:Google Conversion Lift概述;Google地区增量指标说明;Google用户增量研究设置说明;TikTok Conversion Lift Study说明。
免责声明:本词条由作者根据公开资料整理,仅供信息参考。内容可能随时间变化,请以最新官方信息为准。文中观点不代表ESG跨境电商立场。如有错误或涉嫌侵权,请联系我们。
市场合作:shichangbu@eservicesgroup.com


