arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Amazon(亚马逊)

2026-05-19 至 2026-05-19 共收录 16
2605.18648 2026-05-19 cs.LG cs.AI cs.CL

An Assessment of Human vs. Model Uncertainty in Soft-Label Learning and Calibration

对软标签学习和校准中人类与模型不确定性的评估

Maja Pavlovic, Silviu Paun, Massimo Poesio

机构 * Queen Mary University London(伦敦女王玛丽大学) Amazon(亚马逊) University of Utrecht(乌得勒支大学)

AI总结 本文通过对比人类和模型标签在软标签学习中的效果,发现人类标签不仅提升了模型准确性,还通过正则化作用改善了模型在困难样本上的校准和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11654 2026-05-19 cs.LG cs.AI cs.MA

Convergence of Multiagent Learning Systems for Traffic control

多智能体学习系统在交通控制中的收敛性

Sayambhu Sen, Shalabh Bhatnagar

机构 * Amazon Alexa(亚马逊Alexa) Indian Institute of Science(印度科学研究院)

AI总结 本文研究了多智能体强化学习在交通信号控制中的收敛性问题,通过随机逼近方法分析学习动态,并证明了在特定条件下该算法能够收敛。

Comments 14 pages 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07288 2026-05-19 cs.LG cs.AI

Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization

通过深度行为批评稳定化实现非策略模仿学习

Sayambhu Sen, Shalabh Bhatnagar

机构 * Amazon Alexa(亚马逊Alexa) Indian Institute of Science(印度科学研究院)

AI总结 本文提出一种结合非策略学习的对抗模仿学习算法,通过双Q网络稳定化和价值学习(无需奖励函数推断)来提高样本效率,从而更高效地匹配专家行为。

Comments 14 pages and 4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15588 2026-05-19 cs.LG

Memory-Efficient Differentially Private Training with Gradient Random Projection

内存高效的差分隐私训练与梯度随机投影

Alex Mulrooney, Devansh Gupta, James Flemings, Huanyu Zhang, Murali Annavaram, Meisam Razaviyayn, Xinwei Zhang

机构 * University of Delaware(德克萨斯大学) University of Southern California(南加州大学) Meta Amazon(亚马逊)

AI总结 本文提出DP-GRAPE方法,通过随机高斯矩阵替代SVD子空间,减少内存使用并保持与一阶DP方法相当的效用,同时消除了昂贵的SVD计算需求,显著提升内存效率和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17762 2026-05-19 cs.AI

Surface-Form Neural Sparse Retrieval: Robust Fuzzy Matching for Industrial Music Search

表面形式神经稀疏检索:面向工业音乐搜索的鲁棒模糊匹配

Paul Greyson, Zhichao Geng, Wei Zhang, Yang Yang

机构 * Amazon(亚马逊)

AI总结 本文提出了一种鲁棒的神经稀疏检索系统,通过改进的稀疏检索架构和领域特定的子词分词策略,提升了工业音乐搜索中对拼写错误、转置和发音变异的鲁棒性,实现了更高的召回率和更低的延迟。

Comments accepted at SIGIR 2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10236 2026-05-19 cs.LG cs.AI

When Does Non-Uniform Replay Matter in Reinforcement Learning?

在强化学习中非均匀回放何时起作用?

Michal Korniak, Mikołaj Czarnecki, Yarden As, Piotr Miłoś, Pieter Abbeel, Michal Nauman

机构 * ETH Zurich(苏黎世联邦理工学院) University of Warsaw(华沙大学) UC Berkeley(伯克利加州大学) Amazon FAR(亚马逊FAR)

AI总结 本文研究了非均匀回放在强化学习中的有效性,发现回放体积、预期近期性和回放分布熵是决定因素,并提出了一种简单有效的截断几何回放策略以提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01658 2026-05-19 cs.AI

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

CORAL:迈向自主多智能体进化以实现开放性发现

Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu Hong, Kaichen Zhou, Chonghe Jiang, Minwei Kong, Jiacheng Zhu, Xuan Jiang, Sirui Li, Cathy Wu, Bryan Kian Hsiang Low, Jinhua Zhao, Paul Pu Liang

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) MiniMax McGill(麦吉尔大学) Stanford(斯坦福大学) SambaNova Meta Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Amazon(亚马逊) Microsoft(微软)

AI总结 本文提出CORAL框架,通过自主多智能体进化方法,实现了在开放性问题上的发现,展示了智能体自主性和多智能体进化对提升开放性发现的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16252 2026-05-19 cs.LG cs.CL

WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale

WEBSERV: 一个全栈且适合强化学习的网页环境,用于大规模训练网页代理

Yuxuan Lu, Ziyi Wang, Jing Huang, Hui Liu, Jiri Gesi, Yan Han, Shihan Fu, Tianqi Zheng, Xianfeng Tang, Chen Luo, Yisi Sang, Jin Lai, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊)

AI总结 本文提出WebServ,一个全栈且适合强化学习的网页环境,用于大规模训练网页代理。该环境在服务器端使用Incus容器减少启动延迟和存储需求,浏览器端提供自动化的观察和动作接口,以及可靠的执行后端。实验表明,WebServ在WebArena-Lite上实现了最先进的单提示结果,并在强化学习训练中超越了现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03879 2026-05-19 cs.SE cs.AI

Adversarial Agent Collaboration for Correctness Improvements of C to Safe Rust Translation

对抗性代理协作提升C到安全Rust翻译的正确性

Tianyu Li, Ruishi Li, Bo Wang, Brandon Paulsen, Umang Mathur, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出ACToR框架,通过对抗性搜索发现翻译与C源码分歧的输入,利用这些输入驱动后续优化,提升C到Rust翻译的正确性,实验表明其在多个真实世界工具中达到90%以上的测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17177 2026-05-19 math.OC cs.LG math.ST stat.ML stat.TH

High-dimensional Limit of SGD for Diagonal Linear Networks

SGD在对角线线性网络中的高维极限

Begoña García Malaxechebarría, Courtney Paquette, Maryam Fazel, Dmitriy Drusvyatskiy

机构 * University of Washington(华盛顿大学) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) University of Washington & Amazon Inc.(华盛顿大学与亚马逊公司) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了在高维情况下,SGD在对角线线性网络中的行为,通过推导随机微分方程来近似SGD的动力学,并推导了描述迭代状态和可观测统计量时间演化的偏微分方程,最终证明了在合适参数化下,SGD动态具有全局良好定义并以指数速度收敛到零风险。

Comments 91 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16873 2026-05-19 cs.CV

HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

HAD:面向3D重建的幻觉感知扩散先验

Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues

机构 * Amazon AWS(亚马逊AWS) Clemson University(克莱姆森大学)

AI总结 本文提出HAD,一种面向3D重建的幻觉感知扩散先验,通过利用预训练在大规模3D数据上的馈送式新视角合成(NVS)网络的多视角推理能力,估计增强图像的像素级幻觉分数图,从而在逐步3D重建过程中选择性地屏蔽不可靠像素,减少幻觉伪影,提升3D重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13900 2026-05-19 cs.MA cs.LG

Ready from Day 1: Population-Aware Coordination for Large-Scale Constrained Multi-Agent Systems

从第一天开始:面向大规模约束多智能体系统的群体感知协调

Angel Wang, Dominique Perrault-Joncas, Alvaro Maggiar, Carson Eisenach, Dean Foster

机构 * Amazon(亚马逊)

AI总结 本文提出群体感知协调接口,通过学习的原Dual映射,在迭代循环中查询,以实现大规模多智能体系统的协调,减少预测误差和容量违规。

Comments 30 pages, 16 figures. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13877 2026-05-19 cs.NE cs.AI

ARES-LSHADE: Autoresearch-Enhanced LSHADE with Memetic Polish for the GNBG Benchmark

ARES-LSHADE:基于自研增强的LSHADE与膜etic精修的GNBG基准测试

Abdullah Naeem, Md Wasi Ul kabir, Manish Bhatt, Ayon Dey, Anav Katwal, Md Tamjidul Hoque

机构 * University of New Orleans(新奥尔良大学) Amazon(亚马逊)

AI总结 本文提出ARES-LSHADE,通过自研循环和膜etic精修改进LSHADE,针对GNBG基准测试实现510/744胜率,达到机器精度,揭示LLM研究循环与基准完整性之间的张力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12243 2026-05-19 cs.RO

HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies

HandelBot:通过快速适应灵巧机器人策略实现真实世界钢琴演奏

Amber Xie, Haozhi Qi, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室)

AI总结 本文提出HandelBot框架,结合仿真策略和快速适应,通过两阶段流程实现高精度双手钢琴演奏,实验表明其在真实环境中的表现优于直接仿真部署。

Comments Website: https://amberxie88.github.io/handelbot

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03403 2026-05-19 cs.LG cs.AI

Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training

超越正确性:通过RL训练和谐过程与结果奖励

Chenlu Ye, Zhou Yu, Ziji Zhang, Hao Chen, Narayanan Sadagopan, Jing Huang, Tong Zhang, Anurag Beniwal

机构 * Amazon(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出PROF方法,通过过程一致性过滤提升推理质量和最终答案准确性,减少对强PRM的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19470 2026-05-19 cs.LG cs.AI

Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL

自适应分层扰动:统一LLM RL中的非策略修正

Chenlu Ye, Xuanchang Zhang, Yifan Hao, Zhou Yu, Ziji Zhang, Abhinav Gullapalli, Hao Chen, Jing Huang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 本文提出自适应分层扰动(ALP),通过在更新过程中向每一层的输入隐藏状态注入可控噪声,缓解策略退化和训练-推理不匹配问题,提升训练稳定性与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏