arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-06-09 至 2026-06-09 共收录 13
2606.09078 2026-06-09 cs.LG 新提交

The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning

过程奖励模型的隐藏偏见:PRISM用于奖励正确推理

Aakriti Agrawal, Souradip Chakraborty, Armin Saghafian, Nihal Sharma, Rizal Fathony, Nam H Nguyen, C. Bayan Bruss, Amrit Singh Bedi, Furong Huang

机构 * University of Maryland(马里兰大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

AI总结 针对过程奖励模型因训练数据不平衡导致的虚假高评分偏见,提出PRISM框架,通过对比步骤级比较和前瞻策略生成的难负样本,结合难度感知课程学习优化,显著降低假阳性率并提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08446 2026-06-09 cs.LG cs.AI 新提交

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout

Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram Galstyan, Haizhong Zheng, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Intel(英特尔) Amazon AGI(亚马逊AGI)

AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07995 2026-06-09 cs.CL 新提交

Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR

客户代理:通过工具增强代理和RLVR克服超长购物轨迹中的上下文限制

Hongye Liu, Rongmei Lin, Anurag Kashyap, Hejie Cui, Ricardo Henao, Besnik Fetahu, Bing Yin

机构 * Amazon(亚马逊) Duke University(杜克大学)

AI总结 提出ShopTrajQA基准和客户代理框架,利用RLVR训练代理通过代码解释器自主检索解析外部轨迹文件,突破LLM上下文窗口限制,在超长购物轨迹推理中取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07934 2026-06-09 cs.RO 新提交

X-OP: Cross-Morphology Whole-Body Teleoperation via MPC Retargeting

X-OP: 基于MPC重定向的跨形态全身遥操作

Jen-Wei Wang, Sarthak Kaingade, Andrea Tagliabue, Nicholas Morozovsky

机构 * Amazon(亚马逊) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种基于单个XR设备的层次化全身遥操作框架,通过MPC重定向联合优化操作者意图与机器人动态可行性,无需针对特定机器人重新训练策略,在仿真和实物实验中显著提升任务成功率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07910 2026-06-09 cs.LG 新提交

CAAL: Contextual Bandits based Online Hand-Craft Active Learning Strategy Selection

CAAL: 基于上下文赌博机的在线手工主动学习策略选择

Shao-An Yin, Jiacong Li, Tianpei Xie, Cecile Levasseur, Wojciech Kowalinski, Nicola Elia

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校) Amazon(亚马逊)

AI总结 提出CAAL框架,利用上下文信息和奖励预测动态选择主动学习策略,在公共数据集上优于现有基线方法。

Comments 8 pages, 5 figures, Accepted to the NYRL 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07893 2026-06-09 cs.CL 新提交

Beyond Individual Personas: Aligning Synthetic Dialogue to Population-Level Behavior Distributions

超越个体角色:将合成对话对齐到群体层面的行为分布

Xinyi Liu, Rinat Khaziev, Hooshang Nayyeri, Emine Yilmaz, Charith Peris, Hari Thadakamalla

机构 * Amazon(亚马逊) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University College London(伦敦大学学院)

AI总结 提出GroupPersona框架,通过将参考语料库的行为分布转化为生成控制,使合成对话语料库在群体层面与参考分布对齐,在12个行为属性上Jensen-Shannon散度降低24.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07778 2026-06-09 cs.CL 新提交

Unlocking Latent Value: Taxonomy-Guided Recovery of High-Performing Data from Low-Tier Web Corpora

解锁潜在价值:基于分类法从低层级网络语料库中恢复高性能数据

Neeraj Varshney, Sanket Lokegaonkar, Nasser Zalmout, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

AI总结 提出一种分类驱动框架,通过引入时效性和文化特异性两个新维度,结合两阶段过滤方法,从低质量网络数据中恢复高性能子集,在推理和编码任务上显著超越未过滤的高质量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07587 2026-06-09 cs.LG 新提交

The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers

路由平台:理解并突破LLM路由器的准确性极限

Yifan Lu, Qiyue Zhang, Shenrun Zhang, Zhibo Yu, Zhuang Wang, Hanjie Chen, Jiarong Xing

机构 * Rice University(莱斯大学) Amazon(亚马逊)

AI总结 研究发现多种LLM路由方法存在“路由平台”现象,即准确性趋同且远低于理想路由器,主要原因是可预测性瓶颈;通过增大训练数据、更强编码器和端到端微调可突破平台。

Comments 23 Pages, 12 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06895 2026-06-09 cs.CR cs.AI cs.CY cs.ET 交叉投稿

Blockchain Infrastructure for Intelligent Cyber--Physical--Social Systems:Post-Quantum Security, Interoperability, and Trustworthy Data Economies in the Era of Embodied AI

面向智能信息-物理-社会系统的区块链基础设施:具身AI时代的后量子安全、互操作性与可信数据经济

Song Guo, Huawei Huang, Dongping Liu, Aoyu Zhang, Luyao Zhang

机构 * Hong Kong University of Science and Technology(香港理工大学) Sun Yat-sen University(中山大学) Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

AI总结 本教程探讨区块链作为协调层,融合后量子密码学与具身AI,实现可扩展、可信的数据经济与跨组织治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01637 2026-06-09 cs.CL cs.AI 版本更新

Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity

误导比纠正更容易:LLM 从众中的有害与有益修正

Jiaming Qu, Lucheng Fu, Yibo Hu

机构 * Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院) Illinois Institute of Technology(伊利诺伊理工学院)

AI总结 通过控制实验,研究大语言模型在多智能体系统中面对同伴答案时的从众行为,发现同伴一致意见更容易误导原本正确的模型,而权威标签使模型更倾向于选择被认可的答案,且通用推理干预无法可靠地减少有害修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01060 2026-06-09 cs.CL cs.AI cs.LG 版本更新

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') IIIT Delhi, India(德里印度理工学院) Amazon, USA(美国亚马逊) Meta, USA(美国Meta) Apple, USA(美国苹果)

AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26703 2026-06-09 econ.TH cs.GT cs.LG stat.ML 版本更新

Proper Calibeating

Proper Calibeating

Dean P. Foster, Sergiu Hart

机构 * Department of Statistics, Wharton, University of Pennsylvania, Philadelphia, and Amazon, New York(统计系、沃顿商学院、宾夕法尼亚大学费城分校,以及纽约亚马逊公司) Institute of Mathematics, Department of Economics, and Federmann Center for the Study of Rationality, The Hebrew University of Jerusalem(数学研究所、经济系、理性研究基金会,以色列希伯来大学)

AI总结 本文将经典校准预测和calibeating概念扩展到真确评分规则,定义proper-calibration和proper-calibeating,证明校准蕴含proper-calibration而calibeating不一定蕴含proper-calibeating,展示如何保证proper-calibeating和proper-multicalibeating,并证明proper-calibration与不确定性决策中对预测最佳回应时通用无遗憾的等价性。

Comments v2: Updated section 6 "Decision Making Under Uncertainty"

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18856 2026-06-09 cs.LG cs.CL cs.IT math.IT 版本更新

SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference

SPHERICAL KV: 角度域注意力与率失真保持用于高效长上下文推理

Anay Chauhan, Gurucharan Marthi Krishna Kumar, Arion Das, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

机构 * Synopsys McGill University(麦吉尔大学) IIIT Ranchi(印度理工学院拉奇) Amazon(亚马逊) Meta Apple(苹果) Pragya Lab, BITS Pilani Goa(普拉基亚实验室, BITS 拉贾斯坦)

AI总结 提出Spherical KV方法,通过角度域注意力(ADA)和率失真保持(RDR)机制,在长上下文推理中减少KV缓存占用并保持解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏