arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-07-20 至 2026-07-20 共收录 4
2607.15610 2026-07-20 cs.CL cs.AI cs.LG 新提交

Process Reward Informed Tree Rollout for Effective Multi-Turn RL

用于有效多轮强化学习的过程奖励引导树展开

Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang

机构 * UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) MIT Alumni(麻省理工学院校友)

AI总结 研究多轮强化学习中有效探索问题,提出过程评分器引导的自适应树展开框架PATR,利用过程反馈评分轨迹、选择性分支等,在FrozenLake和SWE - Bench实验中提升性能,是可扩展多轮强化学习的有效策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11734 2026-07-20 cs.RO cs.CV cs.GR cs.LG 版本更新

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

神经执行器:用于机器人动力学和外力感知的神经驱动建模

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Jacob, Chao Liu, Peter Yichen Chen, Yuri Ivanov, Wojciech Matusik

机构 * MIT(麻省理工学院) Amazon(亚马逊)

AI总结 研究针对低成本平台执行器动力学致模拟到现实误差问题,提出NeuralActuator模型,能联合预测多种内容,引入NAD数据集,通过可微模拟训练,经多平台实验验证其在电机状态估计等方面有应用价值。

Comments RSS 2026. Outstanding Systems Paper Award. Project Page: https://people.csail.mit.edu/frankzydou/projects/NeuralActuator/index.html Code: https://github.com/Frank-ZY-Dou/Dynamics-Modeling/tree/main/NeuralActuator

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18468 2026-07-20 cs.LG cs.CV 版本更新

SloMo-Fast: Slow-Momentum and Fast-Adaptive Teachers for Source-Free Continual Test-Time Adaptation

SloMo-Fast:用于无源持续测试时自适应的慢动量和快速自适应教师

Md Akil Raihan Iftee, Mir Sazzat Hossain, Rakibul Hasan Rajib, Tariq Iqbal, Md Mofijul Islam, M Ashraful Amin, Amin Ahsan Ali, AKM Mahbubur Rahman

机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) University of Central Florida, USA(佛罗里达中央大学,美国) University of Virginia, USA(弗吉尼亚大学,美国) Amazon GenAI, USA(亚马逊生成人工智能,美国)

AI总结 研究针对持续测试时自适应中现有方法的问题,提出SloMo-Fast无源双教师框架,含慢教师保留长期知识、快教师快速适应新域,实验表明该框架在多种CTTA设置中优于现有方法,能有效适应和泛化。

Comments 42 pages, 38 tables, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04147 2026-07-20 cs.RO cs.AI cs.LG 版本更新

SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training

SLAC:通过无监督模拟预训练实现安全高效的真实机器人强化学习

Jiaheng Hu, Peter Stone, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Sony AI(索尼人工智能) Amazon Robotics(亚马逊机器人技术)

AI总结 研究旨在解决高自由度机器人强化学习难题,提出SLAC方法,利用低保真模拟器预训练潜在动作空间,通过定制无监督方法训练并用于新型离策略算法,在双手移动操纵任务中达领先性能,高效学习复杂任务。

Comments Preliminary version at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏