arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

亚马逊让AI智能体预演A/B测试,校准后误差降低约77倍

arXiv 2608.02345 cs.AI · cs.CL · stat.AP

亚马逊研究人员用AI智能体模拟营销A/B测试,并拿67项历史实验验证预测结果。未经校准的系统能判断部分效果方向,方向重合度为0.70,但会系统性高估改版带来的影响。

经过两阶段校准后,扣除不可消除的测量噪声,平方预测误差降低约77倍。研究团队把这套方法称为模拟随机对照试验,目标是上线前筛掉较差方案,真实用户实验仍负责最终判断。

AI智能体模拟A/B测试的抽样与预筛流程

论文图1:分层抽样减少模拟成本,智能体信号用于决定哪些方案值得进入真实实验。

每个智能体同时看对照版和实验版

系统为智能体提供用户行为画像、实验背景和处理方案,再让行为模型预测结果。框架不绑定某一种模型,通用基础模型或经过微调的专用模型都可作为模拟引擎。

常规A/B测试让一个用户只进入一组。论文采用被试内设计,让同一个智能体分别接触对照版和实验版,再比较两次响应。由于个体差异被抵消,标准误差缩小约2.4倍,同等精度所需的智能体样本也更少。

模拟实验的基线指标与评测表

论文结果页:基线评测同时检查方向、效应大小和预测误差。

原始模型最大的问题是把效果说大了

67项历史营销实验提供了真实处理效应,可以直接检查模拟结果。现成基础模型并非毫无信号:正负方向的判断明显高于随机水平,但估计值偏大。如果直接依据原始预测分配真实流量,团队可能把普通改动误判成高收益方案。

校准分成两步。第一步用实验前数据修正智能体对用户活跃度的判断,第二步再校正处理效应。训练校准器只使用实验前可以获得的信息,避免偷看真实实验结果。

两阶段校准前后的处理效应估计

论文图3:红色为校准前估计,蓝色为校准后估计,预测幅度明显收敛。

77倍改善不等于能停掉线上实验

误差降低约77倍的分母是去除不可约噪声后的平方预测误差,不能理解成准确率提高77倍。校准依赖历史数据与相似实验环境,新产品、新人群或行为机制变化后,修正关系可能失效。

论文给出的合理用途是预筛:先用低成本模拟比较大量创意,再把更有希望的少数方案交给真实流量。AI智能体目前没有替代用户,验证框架反而把模型偏差单独列为一层误差,要求实验者持续用真实结果检查它。

参考资料

https://arxiv.org/abs/2608.02345

https://www.aiagentbehavior.com/