arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-06-01 至 2026-06-01 共收录 12
2605.31254 2026-06-01 cs.AI

Formalizing and falsifying causal pathways of rare events

罕见事件因果路径的形式化与证伪

Anahita Haghighat, Dominik Janzing

机构 * Amazon Research(亚马逊研究)

AI总结 本文在结构方程模型中罕见事件根因分析的形式化基础上,提出因果路径的形式定义并讨论其可检验含义,引入罕见事件因果路径的抽象以桥接简单因果解释与详细因果建模。

Comments accepted for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31145 2026-06-01 cs.CV cs.AI cs.LG

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

FOCUS: 通过视觉支持约束和策略优化强制上下文目标定位

Mohammed Asad Karim, Vinay Kumar Verma

机构 * Amazon, Seattle, USA(亚马逊(美国西雅图))

AI总结 提出一种两阶段训练框架,通过优化支持框与查询图像间的上下文注意力并结合GRPO强化学习,实现无类别监督的类别无关上下文目标定位,7B模型性能超越72B模型。

Comments Accepted at ICML 2026. * Equal Contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30936 2026-06-01 cs.LG math.OC stat.ML

Local linear convergence of gradient methods for overparameterized Gaussian mixtures

过参数化高斯混合模型梯度方法的局部线性收敛性

Jingxing Wang, Vasileios Charisopoulos, Maryam Fazel

机构 * Electrical & Computer Engineering, University of Washington(华盛顿大学电气与计算机工程系) National Institute for Theory and Mathematics in Biology(生物理论与数学国家研究所) Amazon, Inc.(亚马逊公司)

AI总结 针对过参数化高斯混合模型,提出一种交替使用短梯度步和长Polyak步的方法,实现局部线性收敛速率,克服了过参数化导致的慢收敛问题。

Comments 45 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30854 2026-06-01 cs.MA cs.AI

Safe Equilibrium Policy Optimization for Strategic Agent Policies

面向策略型智能体的安全均衡策略优化

Karthika Arumugam, Kiran Kumar Manku, Amit Dhanda

机构 * Amazon, USA(亚马逊公司)

AI总结 提出Safe Equilibrium Policy Optimization (SEPO)方法,通过惩罚可剥削性、共谋风险和外部性成本,优化语言模型在多智能体博弈中的策略安全性。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30842 2026-06-01 cs.LG

CoMem: Context Management with A Decoupled Long-Context Model

CoMem: 基于解耦长上下文模型的上下文管理

Yuwei Zhang, Chengyu Dong, Shuowei Jin, Changlong Yu, Hejie Cui, Hongye Jin, Xinyang Zhang, Hamed Bonab, Colin Lockard, Jianshu Chen, Zhenyu Shi, Jingbo Shang, Xian Li, Bing Yin

机构 * Halıcıoğlu Data Science Institute, University of California, San Diego(哈里卡卢斯数据科学研究所,加州大学圣地亚哥分校) Amazon(亚马逊)

AI总结 提出CoMem框架,通过将记忆管理与智能体工作流解耦并采用k步偏移异步流水线,利用奖励驱动训练策略,在SWE-Bench-Verified上实现1.4倍延迟改进且保持大部分性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30803 2026-06-01 cs.AI

PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

PReMISE:作为LLM评判者测量规范的政策评分标准

Swastik Roy, Rajkumar Pujari, Tharindu Kumarage, Charith Peris, Rahul Gupta, Anna Rumshisky, Pradeep Natarajan, Venkatesh Saligrama

机构 * Amazon AGI(亚马逊人工智能研究院)

AI总结 提出PReMISE框架,从人类偏好数据中发现政策级评分标准集,并从结构充分性、可靠性、偏好拟合和对抗鲁棒性四个维度审计评分标准,通过偏好排名选择和可靠性约束修复操作提升评判准确性并降低可被利用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30621 2026-06-01 cs.AI

Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents

利用更新并非利用收益:解构自演化LLM智能体中的演化能力

Minhua Lin, Juncheng Wu, Zijun Wang, Zhan Shi, Yisi Sang, Bing He, Zewen Liu, Tianxin Wei, Zongyu Wu, Zhiwei Zhang, Dakuo Wang, Xiang Zhang, Benoit Dumoulin, Cihang Xie, Yuyin Zhou, Suhang Wang, Hanqing Lu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) UC Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) Emory University(埃默里大学) UIUC(伊利诺伊大学香槟分校) Northeastern University(东北大学)

AI总结 本文通过分析LLM智能体在外部框架(提示、技能、记忆和工具)上的自演化能力,发现框架更新能力与基础能力无关,而框架收益能力与基础能力呈非单调关系,中等能力模型受益最大。

Comments 24 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26502 2026-06-01 cs.LG physics.optics

PRISM: Position-encoded Regressive Inverse Spectral Model for Multilayer Thin-Film Design

PRISM:用于多层薄膜设计的位置编码回归逆光谱模型

Runtian Wang, Renhao Xue, Baige Chen, Hao Wu

机构 * Independent Researcher(独立研究者) Work does not relate to position at Amazon(与亚马逊职位无关的工作)

AI总结 提出PRISM,一种解码器仅自回归变压器,通过联合预测离散材料选择和连续厚度回归,解决多层薄膜光学涂层设计的逆问题,相比其他变压器基线MAE降低50%以上,参数仅为其五分之一。

Comments 8 pages, 3 figures, Proceedings of the AI4Physics Workshop at the 43rd International Conference on Machine Learning (AI4Physics@ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26396 2026-06-01 cs.AI cs.CL cs.LG

Advancing Creative Physical Intelligence in Large Multimodal Models

推进大型多模态模型中的创造性物理智能

Cheng Qian, Hyeonjeong Ha, Jiayu Liu, Jeonghwan Kim, Emre Can Acikgoz, Bingxuan Li, Kunlun Zhu, Jiateng Liu, Aditi Tiwari, Zhenhailong Wang, Xiusi Chen, Mahdi Namazifar, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Amazon(亚马逊)

AI总结 针对大型多模态模型在开放式环境中缺乏基于视觉的创造性工具使用能力的问题,提出MM-CreativityBench基准和基于偏好学习的具身对齐方法,显著提升实体选择并减少幻觉。

Comments 51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16165 2026-06-01 cs.LG cs.AI

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体

Jiangweizhi Peng, Yuanxin Liu, Ruida Zhou, Charles Fleming, Zhaoran Wang, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota Northwestern University Amazon AGI Texas A\&M University Cisco Research

AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16682 2026-06-01 cs.CV

SAW-Bench: Learning Situated Awareness in the Real World

SAW-Bench:在现实世界中学习情境感知

Chuhan Li, Rilyn Han, Joy Hsu, Yongyuan Liang, Rajiv Dhawan, Jiajun Wu, Ming-Hsuan Yang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学学院市分校) Amazon(亚马逊) University of California, Merced(加州大学默塞德分校)

AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16187 2026-06-01 cs.SE cs.LG

MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair

MatchFixAgent: 语言无关的自主仓库级代码翻译验证与修复

Ali Reza Ibrahimzada, Brandon Paulsen, Reyhaneh Jabbarvand, Joey Dodds, Daniel Kroening

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Amazon, Arlington, VA, USA(亚马逊公司,阿灵顿,弗吉尼亚州,美国) University of Oxford, Oxford, UK(牛津大学,牛津,英国)

AI总结 提出基于大语言模型的多智能体框架MatchFixAgent,实现语言无关的仓库级代码翻译等价性验证与修复,在验证覆盖率和修复成功率上显著优于现有方法。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏