Scaling Automatic Research Agents via World Models
通过世界模型扩展自动研究智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。
大厂专区
通过世界模型扩展自动研究智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。
SynthAVE:通过大语言模型领域验证实现电子商务的可扩展合成标注
机构 * Amazon(亚马逊)
AI总结 研究针对电子商务属性提取微调大语言模型需大量标注数据、人工标注成本高的问题,提出SynthAVE基准及多LLM领域框架,通过多数投票验证合成标注,实现经济高效且质量与人工审核相当的大规模属性值提取验证。
CrowdMath: 众包数学研究讨论数据集
机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) ; San Jose State University(圣何塞州立大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Dartmouth College(达特茅斯学院) ; Amazon AGI(亚马逊人工智能研究院)
AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。
Comments 16 pages, 4 figures; Accepted to EMNLP 2026 Findings
QUBRIC:为超越可验证奖励的强化学习协同设计查询与评分标准
机构 * Amazon(亚马逊) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 针对基于评分标准的强化学习中查询分布固定导致的评分标准质量瓶颈,提出QUBRIC框架,通过协同设计查询与评分标准,利用教师关键点、对比生成和可学习性过滤,在ArenaHard上取得+5.5点提升,并泛化到法律、道德和叙事推理任务。
Comments Published in EMNLP 2026
诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准
机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) ; Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) ; Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)
AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。
Comments 24 pages, 6 figures. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark
DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试
机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) ; Amazon Berlin(亚马逊柏林)
AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。
Comments Accepted to EMNLP Findings
PA3: 通过链式推理实现政策感知的智能体对齐
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) ; Amazon Alexa AI(亚马逊Alexa AI)
AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。
Comments Accepted to EMNLP 2026 (main)
SPARK:基于过程的奖励机制用于无参考强化学习
机构 * Amazon AGI(亚马逊人工智能实验室) ; UCLA(大学)
AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。