arXiv来源发表:
离线评测能不能直接上线:先看历次改动的评测增益能否预测线上增益,183次标题实验里合并关系太弱,全部转A/B
导语
离线评测要单独决定一次改动能否上线,需要的不是评测与人工判断是否一致,而是同类改动中评测增益能否预测线上增益;在Upworthy档案的183次独立改动上,两侧测量都很精确,合并后的这一关系仍然很弱,示例门控把每一次改动都送去A/B测试。
正文
一次改动能否只凭离线评测上线,取决于同类改动里评测增益与线上增益之间的关系,而不是评测本身是否可信。 此前的验证只问评测与人工标签是否一致,或评测能否把不同系统排出与人类偏好相同的顺序,这两类证据都不涉及改动前后的增益。 在Upworthy研究档案的183次独立改动上,评测与线上结果两侧的测量都很精确,合并后的评测增益与线上增益关系仍然很弱。
把每次改动当成一次试验,用历史改动记录估计评测增益对线上增益的预测关系,再据此给出上线、终止或送A/B测试的判定。 历史记录里的评测增益和线上增益都带抽样噪声,直接算相关会被噪声压平,需要先减去各次改动报告的组内测量方差,再恢复改动之间的协方差。 在示例配置下,拟合出的上线阈值超出评测增益可能达到的最大值,因此没有改动被判为上线,全部进入A/B测试。
接下来
下一步可以在自己团队的改动日志上按预先固定的类别重跑这条流程,看评测增益对线上增益的预测关系是否稳定,并据此决定哪些改动可以免于线上实验。需要保留随机审计实验的团队,可以只把本该直接上线的一小部分改动送去A/B测试,用这部分标签检验上线区域的关系是否仍然成立。
公开示例的合并关系很弱,按类样本又只有9到27次改动,因此这次演示既不能确立也不能排除某一类别内的关系。评测目标与线上结果不一致、评测者对不同实验臂准确度不同、以及上线后上线区域不再产生结果标签,都会影响这条关系能否被观测到,值得在采用前逐项确认。
