用跨境AI工具做A/B测试的时候,对照组和测试组到底该怎么分才公平,我总怕分不好结论全是假的?

用跨境AI工具做A/B测试的时候,对照组和测试组到底该怎么分才公平,我总怕分不好结论全是假的?
12 人浏览|1 人回答

跨境AI工具的A/B测试,公平的前提是两组除了被测变量以外全都一样。分组上要满足三个同:同一投放位置、同一预算、同一时间段。做不到同一时间,至少保证两组覆盖的日期结构一致,别让一组只跑到周末。操作上把预算按五五分,或者七三分给现有版本和新版本,倾斜比例测试期不要中途调整,一调就破坏了可比性。量化基准上,单组曝光门槛主图位置至少一千次,信息流至少两千次,达不到门槛的对比只能叫观察不能叫测试。判断标准分目标,测点击率两版可以同时全量铺,测转化成本建议小流量慢跑,因为转化数据波动大,快跑容易误判。底层原因是系统在一开始会把流量倾斜给历史表现好的版本,新版本天生吃亏,所以前三天数据要单独剔除。验证方法是对调两组工具素材的位置再跑一轮,对调后反转的就别下结论了。分组时还要注意流量池的层级,同一广告组内的版本才具有可比性,跨组比会混入定向差异。预算分配上尽量用平台自带的均分功能,人工分配的偏差有时比素材本身的差异还大,这也是很多测试白做的原因。