arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-09-01 至 2026-09-01 共收录 8
2608.12564 2026-09-01 cs.LG 版本更新

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07469 2026-09-01 cs.CL cs.AI 版本更新

SynthAVE: Scalable Synthetic Labeling for E-Commerce with LLM-Arena Validation

SynthAVE:通过大语言模型领域验证实现电子商务的可扩展合成标注

Andrea Scarinci, Virginia Negri, Brayan Impata, Suleiman Khan, Victor Martinez, Marcello Federico

机构 * Amazon(亚马逊)

AI总结 研究针对电子商务属性提取微调大语言模型需大量标注数据、人工标注成本高的问题,提出SynthAVE基准及多LLM领域框架,通过多数投票验证合成标注,实现经济高效且质量与人工审核相当的大规模属性值提取验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06526 2026-09-01 cs.AI cs.LG 版本更新

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath: 众包数学研究讨论数据集

Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) San Jose State University(圣何塞州立大学) Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院) Amazon AGI(亚马逊人工智能研究院)

AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。

Comments 16 pages, 4 figures; Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03968 2026-09-01 cs.CL cs.AI 版本更新

QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

QUBRIC:为超越可验证奖励的强化学习协同设计查询与评分标准

Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang

机构 * Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对基于评分标准的强化学习中查询分布固定导致的评分标准质量瓶颈,提出QUBRIC框架,通过协同设计查询与评分标准,利用教师关键点、对比生成和可学习性过滤,在ArenaHard上取得+5.5点提升,并泛化到法律、道德和叙事推理任务。

Comments Published in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01456 2026-09-01 cs.LG cs.CL cs.GT 版本更新

Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准

Hamidreza Hasani Balyani, Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Arshia Gharagozlou

机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)

AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。

Comments 24 pages, 6 figures. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-09-01 cs.CL cs.AI 版本更新

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-09-01 cs.CL cs.AI cs.LG 版本更新

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03244 2026-09-01 cs.LG cs.AI cs.CL 版本更新

ScalePRM: Training Process Reward Models by Scaling Verification Compute Without Ground Truth

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏