先给结论:当同一批访客被随机分到A/B两个页面版本,而你要用热搜词分析判断哪个版本更好时,样本污染通常不是“数据脏了”,而是分流本身把不同意图的访客混进了同一组。识别它的关键动作是:在分析前按“来源意图”拆开流量,看两组的热搜词构成是否已经不同。如果不同,先别比较转化率,先决定保留、改写还是退出这次分流。
分流实验最常见的污染,是入口把不同搜索意图的人随机分到了两边。假设你用一个热搜词分析工具,把落地页A和B各分50%流量。表面看两组人数接近,但如果A组里“价格对比”类搜索词占比明显更高,B组里“使用方法”类搜索词占比更高,那两组从一开始就不是同一类人。
这时转化率差异可能来自意图差异,而不是版本差异。可核查的证据链是:同一时间窗内,分别导出两组的热搜词列表,按意图归类,比较各类占比。如果占比差异大到足以解释转化差异,这次分流就不适合直接下结论。
识别出污染后,不是一律重做。要看污染发生在哪一层。
假设某页面做A/B测试,站内统计显示A组转化率比B组高。你先不急着归因于版本,而是做三步核查:
这个例子里,数字只用于说明比较方法,不代表真实项目结果。关键是:先证明两组的热搜词构成是否可比,再决定是否继续比较转化。
第三方估算流量、搜索引擎报告和站内统计的口径并不相同。热搜词分析里看到的词,可能来自站内搜索框,也可能来自外部搜索落地,还可能是平台推荐带来的泛流量。如果两组混用了不同口径的数据,污染会被放大。
实际操作中,至少要做到:同一实验内只使用同一口径的热搜词数据;如果必须跨口径,先标注来源,再决定是否纳入比较。某个词请求量归零,不一定说明该意图消失,也可能是采集范围变化或入口调整,这些都需要排除。
识别样本污染的最终动作,是把“是否继续这次分流”变成一个可执行判断:先按来源意图分层,看两组是否可比;可比则保留并继续,不可比但能改写则改写实验;无法剥离则退出,改用其他方式验证版本差异。这样做的结果,会直接影响你下一步是继续优化页面,还是先修正分流设计。