推荐系统中的A/B测试,谁能详细说下思路
@刘泽军 谢邀
前面两个回答,一个是从推荐系统方面阐述,A/B测试的分析并不到位,另外一个分析A/B测试,现在我来综合回答一下这个问题。
A/B测试应用控制变量的思想,除了要对照的产品方案之外,要求其他的环境因素完全一致,也就是说对于样本间的分流,要尽可能使用户的组成成分完全一样,例如所使用的设备类型、新老用户占比等等。然后获取到不同的产品方案所产生的用户行为数据进行对照,选出表现更佳的产品方案。
推荐系统对于内容类产品至关重要。在我看来关键要素有以下几点:
1、控制变量。横向来看,如上文所说,需要保证样本成分一致;纵向来看,对于同一个用户,每次使用产品时都应该被展示同一个推荐算法,这样ta的行为数据才有参考意义。
2、用户行为。A/B测试最终的落脚点在于选出优胜版本,那么就需要清晰的定义何为优胜版本——某些关键数据表现更佳。尤其是推荐算法这样的产品核心点来说,最直接的表现例如点击率、转化率,长远一些的影响例如留存率,甚至最终的成单率等都有可能会受到影响。因此每次进行A/B测试之前都需要有一个明确的计划;有时候统计的数据并不是越全面越好,根据吆喝科技服务过的用户经验,甚至可能会出现明明点击率获得了提升,最终的成单率却下降的现象。因此更重要的是提前明确自己关注的核心点,定义好哪项数据作为优胜版本的判定依据。
3、数据可信度。近几年数据决策的概念越来越普及,不少开发者也建立了全面的数据体系。然而A/B测试对于数据依然有特别的要求——根据统计学要求,样本要满足一定的体量才能够避免偶然性的产生。A/B测试属于先验,也就是预判产品可能产生的影响,因此需要预判足够准确。根据吆喝科技服务过的客户经验,至少需要样本日活达到1000以上才能产出足够可信的结论;日活跃高,数据收敛速度越快。
以上均为理论层面,在实际实践中,实现成本可能会高于想象。尤其是对于样本的选择。
此前开发者比较常见的简易方法是使用不同的渠道对比测试,这样做的好处是成本极低,只需要打两个不同的app包分别投放到两个市场渠道,然后对比数据;坏处也十分明显,就是无法控制样本组成,有可能两个渠道的用户质量差别很大,这样得出的结论几乎是不可信的。
同样,某个渠道的用户不能代表所有用户,有可能在单个渠道上获得数据提升,推广到全渠道上却没有效果,甚至会产生反效果。
然而要达到令人满意的效果,就不得不考虑自建服务端控制分流的系统,通过自己的服务端脚本来控制每台设备要展示哪一种试验版本。可想而知实现成本颇高,除了开发量之外,还要消耗大量的api请求。
对于ios应用来说,受到市场审核的制约,很难在产品中设置开关,发版的周期更长,甚至上一版还没来得及上架下一版就要发布了。
除此之外,能否保证同一台设备每次都能够展示同一个版本、如何判断用户到底有没有受到试验方案的影响、如何灵活的随时调整样本数量等等,越是考虑到这些细节问题,就越会发现实现成本几乎高到不可行。
然而,这并不是说科学的A/B测试无路可走,目前市场上已经出现了一批专为产品迭代中的A/B测试服务的企业,例如吆喝科技,完美解决了样本分流的痛点:核心的分流算法可以保证样本间的一致性,并且规避了自建分流系统的成本,只需要集成SDK调用若干api即可。
■网友
什么是 A/B 测试? - Mil Max 的回答
http://AppAdhoc.com:吆喝科技开发的在线AB测试平台,用数据帮助开发者优化产品,是国内唯一同时支持前端(Web/H5、iOS、Android)及后端(Node.js、PHP、Java)AB测试服务的专业Saas平台。
平台特色:线上灰度发布、多维度数据统计分析、定向测试等等。
【推荐系统中的A/B测试,谁能详细说下思路】 通过AB测试来优化产品的方法在海外已经被广泛应用,现在这种代表先进生产力的方法如同GitHub、Docker、APM一样也正在逐渐被国内广大开发团队所接纳。AppAdhoc优化平台能够帮助用户提高产品的设计、研发、运营和营销的效率,降低产品决策风险,同时也能够帮助用户用数据优化移动广告,让流量的变现价值更大。
推荐阅读
- 吉林丰满鱼道系统就绪静待松花江鱼类洄游产卵
- 鄂温克冬季马赛-30℃极寒开赛:寒冬中的火热派对
- 大雪@大雪腌肉 适当进补 今日大雪
- 银行系统的研发岗(程序员)是不是很难进(校招)推广到国企的研发岗(程序员)呢
- |电商事业中的“闪光少年”
- 5.1声道片源对于没有5.1硬件系统的用户来说有意义吗
- 汽车知识|月薪5000元,推荐4款车型,可全款可分期,既有质量又有面子
- 环球车讯网|【帮你选车】简单粗暴 前后双电机+四驱 三款纯电SUV推荐
- |徐州市出台《关于优化创新创业生态系统 提升区域科技创新活力的实施意见》及实施细则
- 学图像处理有哪些不错的书推荐
