arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-11-25 至 2025-11-25 共收录 8 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 8 篇

2511.17869 2025-11-25 cs.LG 80%

The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems

霍克鲁斯:用于检测和缓解具身AI系统中奖励黑客行为的可解释任务分解

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)伯克利大学) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :embodied AI(title,abstract);分类 cs.LG;robotic(comments)

AI总结 本研究提出MITD方法,通过可解释性任务分解有效检测和缓解具身AI系统中的奖励黑客行为,实验表明分解深度可显著降低奖励黑客频率。

Comments Accepted to the NeurIPS (Mexico City) 2025 Workshop on Embodied and Safe-Assured Robotic Systems (E-SARS). Thanks to Aman Chadha

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18878 2025-11-25 cs.RO cs.AI 79%

Accelerating Reinforcement Learning via Error-Related Human Brain Signals

通过误差相关的人脑信号加速强化学习

Suzie Kim, Hye-Bin Shin, Hyo-Jeong Jang

机构 * Dept. of Artificial Intelligence Korea University Seoul, Republic of Korea(人工智能系韩国大学首尔共和国)

专题命中 模仿学习与强化学习 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 通过整合误差相关的人脑信号,加速复杂机器人操作中的强化学习,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18606 2025-11-25 cs.RO cs.LG 62%

How to Train Your Latent Control Barrier Function: Smooth Safety Filtering Under Hard-to-Model Constraints

如何训练您的潜在控制障碍函数:在难以建模的约束下实现平滑的安全过滤

Kensuke Nakamura, Arun L. Bishop, Steven Man, Aaron M. Johnson, Zachary Manchester, Andrea Bajcsy

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出LatentCBF方法,通过梯度惩罚和价值训练解决潜在空间中不兼容价值函数的问题,实现平滑安全过滤并提升任务完成率。

Comments 3 figures, 10 tables, 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19217 2025-11-25 cs.CV 57%

ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment

ReAlign:通过步感知奖励引导对齐实现文本到动作生成

Wanjiang Weng, Xiaofeng Tan, Junbo Wang, Guo-Sen Xie, Pan Zhou, Hongsong Wang

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV

AI总结 ReAlign通过步感知奖励模型和引导策略提升文本到动作生成的对齐和质量。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18243 2025-11-25 cs.RO 57%

Dreaming Falcon: Physics-Informed Model-Based Reinforcement Learning for Quadcopters

梦之鹰:用于四旋翼的物理引导模型基强化学习

Eashan Vytla, Bhavanishankar Kalavakolanu, Andrew Perrault, Matthew McCrink

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出一种基于物理引导的世界模型方法,用于改进四旋翼的强化学习性能,通过物理模型预测力矩和状态展开,提升动态环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15046 2025-11-25 cs.AI 57%

Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision

基于文本的决策代理:从自然语言监督中进行离线元强化学习

Shilin Zhang, Zican Hu, Wenhao Wu, Xinyi Xie, Jianxiang Tang, Chunlin Chen, Daoyi Dong, Yu Cheng, Zhenhong Sun, Zhi Wang

机构 * Nanjing University(南京大学) University of Technology Sydney(悉尼大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学) University of New South Wales(新南威尔士大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出T2DA,通过自然语言监督实现离线元强化学习,利用文本-决策预训练提升零样本泛化能力。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17653 2025-11-25 math.GM 50%

MARL-CC: A Mathematical Framework forMulti-Agent Reinforcement Learning in ConnectedAutonomous Vehicles: Addressing Nonlinearity,Partial Observability, and Credit Assignment forOptimal Control

MARL-CC:多智能体强化学习在连接自动驾驶车辆中的数学框架:解决非线性、部分可观测性和信用分配以实现最优控制

Mazyar Taghavi, Javad Vahidi

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 MARL-CC提出了一种统一的数学框架,通过整合微分几何控制、贝叶斯推断和夏普利值信用分配,解决多智能体强化学习中的非线性、部分可观测性和信用分配问题,提升收敛速度和协同效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12145 2025-11-25 physics.optics 50%

LLM4Laser: Large Language Models Automate the Design of Lasers

LLM4Laser: 利用大语言模型自动化激光器设计

Renjie Li, Ceyao Zhang, Sixuan Mao, Xiyuan Zhou, Feng Yin, Sergios Theodoridis, Zhaoyu Zhang

专题命中 模仿学习与强化学习 :robotics(abstract)

AI总结 本文提出利用大语言模型实现激光器设计自动化,通过对话生成仿真和强化学习代码,实现从概念到算法的全流程自动化设计。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏