arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2604.15289 2026-04-17 cs.RO 57%

Abstract Sim2Real through Approximate Information States

通过近似信息状态实现抽象sim2real

Yunfu Deng, Yuhao Li, Josiah P. Hanna

机构 * Prediction and Action Lab (PAL)(预测与行动实验室) University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文研究了在抽象模拟器中通过强化学习训练政策并成功迁移到现实世界的问题,提出了一种利用真实任务数据修正抽象模拟器动力学的方法,实现了sim2sim和sim2real的政策迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15201 2026-04-17 cs.LG 57%

RL-STPA: Adapting System-Theoretic Hazard Analysis for Safety-Critical Reinforcement Learning

RL-STPA:将系统理论危害分析适应于安全关键强化学习

Steven A. Senczyszyn, Timothy C. Havens, Nathaniel Rice, Jason E. Summers, Benjamin D. Werner, Benjamin J. Schumeg

机构 * Michigan Technological University(密歇根技术大学) ARiA DEVCOM

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出RL-STPA框架,通过分层子任务分解、覆盖引导扰动测试和迭代检查点,系统分析强化学习中的安全风险,提升安全关键应用的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04282 2026-04-15 cs.AI 57%

Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling

合成POMDPs挑战记忆增强型RL:内存需求结构建模

Yongyi Wang, Lingfeng Li, Bozhou Chen, Ang Li, Hanyu Liu, Qirui Zheng, Xionghui Yang, Wenxin Li

机构 * School of Computer Science, Peking University, Beijing 100871, China(北京大学计算机学院,北京100871,中国)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出定制化的POMDP环境设计,通过理论框架、线性动力学和奖励再分配方法,构建具有预定义内存需求结构的环境,以评估记忆增强型RL的挑战与性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52148-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 57%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10429 2026-04-14 cs.AI 57%

Safety Guarantees in Zero-Shot Reinforcement Learning for Cascade Dynamical Systems

在级联动力系统中零样本强化学习的安全保障

Shima Rabiei, Sandipan Mishra, Santiago Paternain

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文研究了级联动力系统中零样本安全保证问题,提出在简化模型上训练安全RL策略,并通过低层控制器跟踪RL策略的参考信号,理论分析了安全概率与内状态跟踪质量的关系。

Comments 8 pages, 2 figures; submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11019 2026-04-14 cs.LG 57%

Relative Entropy Pathwise Policy Optimization

相对熵路径策略优化

Claas Voelcker, Axel Brunnbauer, Marcel Hussing, Michal Nauman, Pieter Abbeel, Eric Eaton, Radu Grosu, Amir-massoud Farahmand, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) TU Wien(维也纳工业大学) University of Pennsylvania(宾夕法尼亚大学) University of Warsaw(华沙大学) UC Berkeley(加州大学伯克利分校) Polytechnique Montréal(蒙特利尔综合理工学院) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出REPPO算法,通过路径策略梯度结合在线学习,提升训练稳定性与效率,展现优越的样本效率和内存表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09499 2026-04-13 cs.RO 57%

Physics-Informed Reinforcement Learning of Spatial Density Velocity Potentials for Map-Free Racing

基于空间密度速度势的物理引导强化学习用于无地图赛车

Shathushan Sivashangaran, Apoorva Khairnar, Sepideh Gohari, Vihaan Dutta, Azim Eskandarian

机构 * Autonomous Robots and Vehicles Laboratory, College of Engineering, Virginia Commonwealth University(弗吉尼亚联邦大学工程学院自主机器人与车辆实验室) Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工学院机械工程系) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种物理引导的强化学习方法,通过参数化非线性车辆动力学,利用深度神经网络实现时间最优和超车赛车控制,显著提升无地图赛车性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21872 2026-04-10 cs.AI 57%

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06949 2026-04-09 cs.RO 57%

Learning-Based Strategy for Composite Robot Assembly Skill Adaptation

基于学习的复合机器人装配技能适应策略

Khalil Abuibaid, Aleksandr Sidorenko, Achim Wagner, Martin Ruskowski

机构 * Chair of Machine Tools and Control System, RPTU University Kaiserslautern-Landau(机床与控制系统系,凯撒斯劳滕-兰道大学) Innovative Factory Systems, German Institute of Artificial Intelligence(创新工厂系统,德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于残差强化学习的复合机器人装配技能适应方法,通过显式预置、后置和不变条件实现模块化和可重用性,提升工业机器人在接触密集任务中的安全性和样本效率。

Comments Accepted at RAAD 2026 (Springer). 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06268 2026-04-09 cs.LG 57%

RAGEN-2: Reasoning Collapse in Agentic RL

RAGEN-2:代理强化学习中的推理崩溃

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者) Imperial College London(伦敦帝国学院) Oxford University(牛津大学) University of Washington(华盛顿大学) Microsoft(微软) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22844 2026-04-08 cs.AI 57%

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal

PhySe-RPO:物理与语义引导的相对策略优化用于基于扩散的手术烟雾去除

Zining Fang, Cheng Xue, Chunhui Liu, Bin Xu, Ming Chen, Xiaowei Hu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 本文提出PhySe-RPO框架,通过物理和语义引导的相对策略优化,解决手术烟雾去除中配对监督不足的问题,实现物理一致、语义忠实且临床可解释的扩散修复。

Comments 12 pages,7figures,published to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05765 2026-04-08 cs.AI 57%

RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training

RL-VLA$^3$:一种灵活且异步的强化学习框架用于VLA训练

Haoran Sun, Yongjian Guo, Zhong Guan, Shuai Di, Xiaodong Bai, Jing Long, Tianyun Zhao, Mingxi Luo, Hongke Zhao, Likang Wu, Xiaotie Deng, Xu Chu, Xi Xiao, Sheng Wen, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Tsinghua University(清华大学) Tianjin University(天津大学) JDT AI Infra(京东科技AI基础设施) Swinburne University of Technology(斯威本科技大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本文提出RL-VLA$^3$,一种异步强化学习框架,通过动态批调度和灵活环境分片策略,提升VLA训练效率,实验显示其在8至256GPU上均取得85.2%的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04618 2026-04-07 cs.RO 57%

Biologically Inspired Event-Based Perception and Sample-Efficient Learning for High-Speed Table Tennis Robots

生物启发的事件感知与高效学习方法用于高速乒乓球机器人

Ziqi Wang, Jingyue Zhao, Xun Xiao, Jichao Yang, Yaohua Wang, Shi Xu, Lei Wang, Huadong Dai

机构 * National University of Defence Technology(国防科技大学) Defense Innovation Institute, AMS(军事科学院国防科技创新研究院) Qiyuan Lab(启元实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出生物启发的高速乒乓球机器人方法,结合事件感知与高效学习,通过异步感知和稀疏数据实现高效检测与决策,提升目标返回精度35.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13920 2026-04-07 cs.LG 57%

Causal Process Models: Reframing Dynamic Causal Graph Discovery as a Reinforcement Learning Problem

因果过程模型:将动态因果图发现重新表述为强化学习问题

Turan Orujlu, Christian Gumbsch, Martin V. Butz, Charley M Wu

机构 * University of Tübingen(图宾根大学) MPI for Biological Cybernetics(马克斯·普朗克生物控制论研究所) University of Amsterdam(阿姆斯特丹大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出因果过程模型,通过将动态因果图构建视为多智能体强化学习问题,实现了从视觉观测中学习稀疏时间变化因果图,提升可解释性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03023 2026-04-06 cs.RO 57%

Behavior-Constrained Reinforcement Learning with Receding-Horizon Credit Assignment for High-Performance Control

具有递推地 horizon 信用分配的行为约束强化学习

Siwei Ju, Jan Tauberschmidt, Oleg Arenz, Peter van Vliet, Jan Peters

机构 * TU Darmstadt(达姆施塔特工业大学) Porsche AG(保时捷股份公司) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种行为约束强化学习框架,通过递推地 horizon 预测机制和参考轨迹条件化策略,实现超越演示并保持专家行为一致的高性能控制策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02348 2026-04-06 cs.LG 57%

Contextual Intelligence The Next Leap for Reinforcement Learning

情境智能:强化学习的下一步

André Biedenkapp

机构 * Albert-Ludwigs-Universität(弗莱堡大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出情境智能的新框架,通过区分环境驱动和代理驱动因素,探索异构情境学习、多时间尺度建模和抽象高层情境整合,以提升强化学习的泛化能力与现实应用效率。

Comments Accepted to AAMAS 2025 (Blue Sky Ideas Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01064 2026-04-02 cs.RO 57%

BAT: Balancing Agility and Stability via Online Policy Switching for Long-Horizon Whole-Body Humanoid Control

BAT:通过在线策略切换平衡敏捷性与稳定性以实现长周期全身人形控制

Donghoon Baek, Sang-Hun Kim, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院) Samsung Research(三星研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出BAT框架,通过在线策略切换平衡敏捷性与稳定性,实现长周期全身人形控制,实验表明其在多样任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00391 2026-04-02 cs.RO cs.SY eess.SY 57%

Behavioral Score Diffusion: Model-Free Trajectory Planning via Kernel-Based Score Estimation from Data

行为得分扩散:通过核基得分估计实现无模型轨迹规划

Shihao Li, Jiachen Li, Jiamin Xu, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出行为得分扩散(BSD),通过核加权估计直接从轨迹数据中计算扩散得分函数,无需学习模型或动力学模型,在停车场景中实现高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27751 2026-03-31 cs.AI 57%

SkyNet: Belief-Aware Planning for Partially-Observable Stochastic Games

SkyNet:基于信念的规划用于部分可观测随机博弈

Adam Haile

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 SkyNet通过引入自我条件辅助头,改进了MuZero在部分可观测随机博弈中的规划能力,其在Skyjo游戏中实现了显著的胜率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26467 2026-03-30 cs.RO 57%

Addressing Ambiguity in Imitation Learning through Product of Experts based Negative Feedback

通过专家产品负反馈解决模仿学习中的歧义

John Bateman, Andy M. Tyrrell, Jihong Zhu

机构 * University of York(约克大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种利用次优示范解决歧义任务的系统,通过自身失败学习,显著提升成功率,优于传统正反馈模仿学习,且在效能和效率上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24931 2026-03-27 cs.RO 57%

COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems

COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统

Yifeng Zhang, Jieming Chen, Tingguang Zhou, Tanishq Duhan, Jianghong Dong, Yuhong Cao, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24930 2026-03-27 cs.RO 57%

CROSS: A Mixture-of-Experts Reinforcement Learning Framework for Generalizable Large-Scale Traffic Signal Control

CROSS: 一种用于通用大规模交通信号控制的专家混合强化学习框架

Xibei Chen, Yifeng Zhang, Yuxiang Xiao, Mingfeng Fan, Maonan Wang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出CROSS框架,通过预测对比聚类和场景自适应MoE模块,提升交通信号控制的泛化能力,实验显示其在SUMO模拟器上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23278 2026-03-25 cs.RO 57%

Learning Multi-Agent Local Collision-Avoidance for Collaborative Carrying tasks with Coupled Quadrupedal Robots

学习多智能体局部避障以实现协作搬运任务 with 耦合四足机器人

Francesca Bray, Simone Tolomei, Andrei Cramariuc, Cesar Cadena, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(埃因斯坦理工大学机器人系统实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于强化学习的策略,使两台连接物体的四足机器人在未知环境中自主避障,无需预设路径或地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04932 2026-03-25 cs.RO 57%

Integrated cooperative localization of heterogeneous measurement swarm: A unified data-driven method

异质测量群的集成协作定位:一种统一的数据驱动方法

Kunrui Ze, Wei Wang, Guibin Sun, Jiaqi Yan, Kexin Liu, Jinhu Lü

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Zhongguancun Laboratory(中关村实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种统一的数据驱动方法,用于解决异质机器人系统中协作定位问题,通过改进的相对定位估计和分布式姿态耦合策略,在弱连接有向拓扑中实现高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24313 2026-03-24 cs.RO 57%

Learning to Sample: Reinforcement Learning-Guided Sampling for Autonomous Vehicle Motion Planning

学习采样:强化学习引导的自主车辆运动规划采样

Korbinian Moller, Roland Stroop, Mattia Piccinini, Alexander Langmann, Johannes Betz

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO

AI总结 本文提出一种结合强化学习的采样方法,用于提升自动驾驶车辆在复杂城市环境中的运动规划效率与可靠性。

Comments 8 pages, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20575 2026-03-24 cs.RO physics.space-ph 57%

Current state of the multi-agent multi-view experimental and digital twin rendezvous (MMEDR-Autonomous) framework

多智能体多视角实验与数字孪生会合(MMEDR-自主)框架的当前状态

Logan Banker, Michael Wozniak, Mohanad Alameer, Smriti Nandan Paul, David Meisinger, Grant Baer, Trevor Hunting, Ryan Dunham, Jay Kamdar

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) Missouri University of Science and Technology(密苏里科技大学) Purdue University(普渡大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出MMEDR-自主框架,结合学习型光学导航网络、强化学习引导方法和硬件在环测试台,旨在提升空间任务的自主性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20538 2026-03-24 cs.LG stat.ML 57%

Understanding Behavior Cloning with Action Quantization

通过动作量化理解行为克隆

Haoqun Cao, Tengyang Xie

机构 * Department of Computer Sciences, University of Wisconsin–Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文研究行为克隆中动作量化的影响,分析量化误差传播与统计样本复杂度的相互作用,证明量化行为克隆在稳定动态和概率光滑性条件下可达到最优样本复杂度,提出基于模型的增强方法以改进误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO 57%

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18784 2026-03-20 cs.RO 57%

ViTac-Tracing: Visual-Tactile Imitation Learning of Deformable Object Tracing

ViTac-Tracing:变形物体追踪的视觉-触觉模仿学习

Yongqiang Zhao, Haining Luo, Yupeng Wang, Emmanouil Spyrakos Papastavridis, Yiannis Demiris, Shan Luo

机构 * Robot Perception Laboratory, Department of Engineering, King’s College London(机器人感知实验室,工程系,伦敦国王学院) Personal Robotics Laboratory, Department of Electrical and Electronic Engineering, Imperial College London(个人机器人实验室,电子与电气工程系,伦敦帝国学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种视觉-触觉模仿学习方法,实现变形物体的一维和二维追踪。通过局部和全局视角结合视觉与触觉感知,提升细粒度调整并优化任务进度,实验表明在多种变形物体上达到80%和65%的成功率。

Comments The paper has been accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 57%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏