要识别样本污染,先别急着比较两组的平均指标,而是确认“同一类访客是否真的进了不同版本”。如果分流按地域、设备、登录状态或缓存命中来切分,那么版本差异和人群差异会混在一起,后续任何结论都不可靠。一个可执行的动作是:在检测前给每个版本打上稳定的分组标记,并同时记录分流依据;若分流依据本身与转化强相关,就应把分析改成同人群内比较,或先修正分流规则再取样。
样本污染不等于数据脏,而是分组不再随机或不再同质。假设一个内容站做标题测试:A版给未登录访客,B版给登录访客。表面看B版停留更久,但登录用户本来就更熟悉站点,停留长与标题无关。此时“版本效果”被“用户身份”替代,属于典型污染。
判断线索有三类:分流规则是否依赖用户属性;两组的人群构成是否明显不同;同一访客是否会跨版本。只要其中一项成立,就不能把组间差值直接归因于版本。更稳妥的做法是先做同人群分层,例如只比较未登录访客中的A与B,再看差异是否仍然存在。
假设某工具站改版导航,想检测新版是否降低跳出。分流规则写成“新访客进新版,老访客进旧版”。一周后新版跳出率更低。这个结果不能直接采纳,因为新老访客的行为基线不同。
这个流程的关键动作是“先分层再比较”,它的结果直接决定是继续验证还是回退分流规则,而不是继续堆数据。
能帮助暴露污染的,是分组前的基线指标:新老访客比例、设备分布、来源渠道构成、登录比例。如果这些在两组间差异明显,污染嫌疑就高。相反,跳出率、停留时长、转化率这些结果指标,即使组间不同,也不能单独证明版本有效,因为它们同时受人群和版本影响。
还要注意口径差异:站内统计、第三方估算与搜索引擎报告对“访客”和“会话”的定义可能不同。某一口径下样本归零或骤降,也可能来自埋点变更、过滤规则调整或缓存策略变化,而不是版本本身。把口径差异当成版本效果,是另一种污染。
个别样本成立、规模化后失效,常见原因是小样本里人群恰好同质,放大后混入异质人群。此时不能照搬小样本结论,应写明适用条件:仅在“未登录、自然搜索来源、移动设备”这类子集中成立,超出该边界就需重新验证。
可以这样记录边界:先写清分流依据和排除条件,再写清结论只覆盖哪类访客。若无法保证随机分配,就应把结论降级为“相关观察”,而不是“版本导致”。这样后续无论继续扩量还是回退,都有可核查的依据。
下次做网站SEO检测时,可先执行三步:确认分流是否随机且互斥;对比两组的人群基线;只在同层内比较结果指标。若分流本身与转化相关,先修正规则再取样。这样得到的差异才更可能来自版本,而不是访客构成。