arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 247 篇

2604.03540 2026-04-22 cs.RO 57%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01860 2026-04-03 cs.RO 57%

Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning

后验优化与截断目标:在生成策略学习中平衡效率与稳定性

Yuhui Chen, Haoran Li, Zhennan Jiang, Yuxing Qin, Yuxuan Wan, Weiheng Liu, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机学院前沿计算研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO

AI总结 本文提出POCO框架,通过后验推断方法改进策略,结合离线到在线范式,提升生成模型在机器人操控中的稳定性和效率,实验证明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 57%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO 57%

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16407 2026-03-24 cs.RO 57%

LAOF: Robust Latent Action Learning with Optical Flow Constraints

LAOF:基于光流约束的鲁棒潜在动作学习

Xizhou Bu, Jiexi Lyu, Fulei Sun, Ruichen Yang, Zhiqiang Ma, Wei Li

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 动作表示与策略 :embodied foundation model(abstract);分类 cs.RO

AI总结 本文提出LAOF方法,通过利用光流作为动作驱动信号,学习鲁棒的潜在动作表示,以应对动作无关的干扰。实验表明,LAOF在下游模仿学习和强化学习任务中表现优异,尤其在标注稀缺条件下效果显著。

Comments CVPR 2026; Project page: https://github.com/XizoB/LAOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20538 2026-03-24 cs.LG stat.ML 57%

Understanding Behavior Cloning with Action Quantization

通过动作量化理解行为克隆

Haoqun Cao, Tengyang Xie

机构 * Department of Computer Sciences, University of Wisconsin–Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.LG

AI总结 本文研究行为克隆中动作量化的影响,分析量化误差传播与统计样本复杂度的相互作用,证明量化行为克隆在稳定动态和概率光滑性条件下可达到最优样本复杂度,提出基于模型的增强方法以改进误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15169 2026-03-17 cs.RO 57%

ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation

ForceVLA2:利用力-位置控制与力感知实现接触密集 manipulation

Yang Li, Zhaxizhuoma, Hongru Jiang, Junjie Xia, Hongquan Zhang, Jinda Du, Yunsong Zhou, Jia Zeng, Ce Hao, Jieji Ren, Qiaojun Yu, Cewu Lu, Yu Qiao, Jiangmiao Pang

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 ForceVLA2通过力感知和混合力-位置控制提升接触密集 manipulation的稳定性与精度,实验显示其在五类任务中成功率提升48%和35%。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08019 2026-03-10 cs.RO 57%

Vector Field Augmented Differentiable Policy Learning for Vision-Based Drone Racing

基于向量场的可微政策学习用于基于视觉的无人机赛车

Yang Su, Feng Yu, Yu Hu, Xinze Niu, Linzuo Zhang, Fangyu Sun, Danping Zou

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 本文提出DiffRacing框架,通过整合向量场和可微损失提升无人机赛车的样本效率与飞行性能。

Comments 8 pages, 7 figures, RAL 2026 March

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06905 2026-03-03 cs.RO 57%

ULC: A Unified and Fine-Grained Controller for Humanoid Loco-Manipulation

ULC:一种用于人形机器人运动-操作的统一且细粒度控制器

Wandong Sun, Luying Feng, Baoshi Cao, Yang Liu, Yaochu Jin, Zongwu Xie

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人与系统国家重点实验室,哈尔滨工业大学) School of Engineering, Westlake University(工程学院,西湖大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 ULC通过统一策略实现人形机器人运动-操作的高精度与鲁棒性,结合多种关键技术提升整体协调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10915 2026-02-16 cs.CR cs.AI 57%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14388 2026-02-09 cs.AI 57%

Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control

Hi-Agent:用于移动设备控制的分层视觉语言代理

Zhe Wu, Hongjin Lu, Junliang Xing, Changhao Zhang, Yuxuan Li, Yin Zhu, Yuhao Yang, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Jun Wang, Yuanchun Shi

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 Hi-Agent通过分层结构和前瞻性优势函数,实现移动设备控制的高效训练和高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06819 2026-02-09 cs.RO 57%

CRISP -- Compliant ROS2 Controllers for Learning-Based Manipulation Policies and Teleoperation

CRISP -- 用于基于学习的操控策略和遥控的兼容ROS2控制器

Daniel San José Pro, Oliver Hausdörfer, Ralf Römer, Maximilian Dösch, Martin Schuck, Angela P. Schoellig

机构 * Technical University of Munich(慕尼黑技术大学) TUM School of Computation, Information and Technology(TUM计算、信息与技术学院) Department of Computer Engineering(计算机工程系) Learning Systems and Robotics Lab(学习系统与机器人实验室) TUM Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑技术大学机器人与人工智能研究所(MIRMI))

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 CRISP是一种用于ROS2的轻量级控制器,支持基于学习的操控策略和遥控,提供统一的数据收集和策略执行管道,降低应用难度。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03538 2025-12-04 cs.RO 57%

AdaPower: Specializing World Foundation Models for Predictive Manipulation

AdaPower: 为预测操纵专门化世界基础模型

Yuhang Huang, Shilong Zou, Jiazhao Zhang, Xinwang Liu, Ruizhen Hu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO

AI总结 AdaPower通过时空测试时间训练和记忆持久性机制,将通用世界基础模型转化为专门模型,提升机器人任务成功率41%

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20231 2025-10-24 cs.RO 57%

NODA-MMH: Certified Learning-Aided Nonlinear Control for Magnetically-Actuated Swarm Experiment Toward On-Orbit Proof

Yuta Takahashi, Atsuki Ochi, Yoichi Tomioka, Shin-Ichiro Sakai

机构 * Graduate Student of Mechanical Engineering, Institute of Science Tokyo(东京科学研究所机械工程研究生) Researcher and Engineer of Satellite R&D Division, Interstellar Technologies Inc.(Interstellar Technologies Inc.卫星研发部门研究员和工程师) Senior Associate Professor of Computer Science and Engineering, University of Aizu(宇智大学计算机科学与工程高级副教授) Professor of Spacecraft Engineering, Institute of Space and Astronautical Science(空间与航天科学研究所航天工程教授)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

Comments Accepted for presentation at the 2025 International Conference on Space Robotics (iSpaRo 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06207 2025-10-16 cs.RO 57%

EmbodiedCoder: Parameterized Embodied Mobile Manipulation via Modern Coding Model

Zefu Lin, Rongxu Cui, Chen Hanning, Xiangyu Wang, Junjia Xu, Xiaojuan Jin, Chen Wenbo, Hui Zhou, Lue Fan, Wenling Li, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) New Laboratory of Pattern Recognition (NLPR)(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Beihang University(北航) Chinese University of Hong Kong(香港大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

Comments Demo Page: https://embodiedcoder.github.io/EmbodiedCoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06266 2025-10-01 cs.RO 57%

ADPro: a Test-time Adaptive Diffusion Policy via Manifold-constrained Denoising and Task-aware Initialization for Robotic Manipulation

Zezeng Li, Rui Yang, Ruochen Chen, ZhongXuan Luo, Liming Chen

机构 * École Centrale de Lyon(里昂中央理工大学) Dalian University of Technology(大连理工大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24020 2025-09-30 cs.CV 57%

Hazy Pedestrian Trajectory Prediction via Physical Priors and Graph-Mamba

Jian Chen, Zhuoran Zheng, Han Hu, Guijuan Zhang, Dianjie Lu, Liang Li, Chen Lyu

机构 * Shandong Normal University(山东师范大学) Sun Yat-sen University(中山大学) Shandong Jiaotong University(山东交通大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17850 2025-09-23 cs.RO 57%

SocialTraj: Two-Stage Socially-Aware Trajectory Prediction for Autonomous Driving via Conditional Diffusion Model

Xiao Zhou, Zengqi Peng, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17230 2025-09-09 cs.CV 57%

4D Visual Pre-training for Robot Learning

Chengkai Hou, Yanjie Ze, Yankai Fu, Zeyu Gao, Songbo Hu, Yue Yu, Shanghang Zhang, Huazhe Xu

机构 * Peking University(北京大学) Tsinghua University(清华大学) Shanghai Qizhi Institute(上海启智研究院) CASIA(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19569 2025-08-28 cs.AI 57%

Skill-based Explanations for Serendipitous Course Recommendation

Hung Chau, Run Yu, Zachary Pardos, Peter Brusilovsky

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05059 2025-08-15 cs.LG 57%

MIAT: Maneuver-Intention-Aware Transformer for Spatio-Temporal Trajectory Prediction

Chandra Raskoti, Iftekharul Islam, Xuan Wang, Weizi Li

机构 * Min H. Kao Department of Electrical Engineering and Computer Science at University of Tennessee, Knoxville, TN, USA(田纳西大学电气工程与计算机科学系) Department of Electrical and Computer Engineering at George Mason University(乔治·马歇尔大学电气与计算机工程系)

专题命中 动作表示与策略 :action model(abstract);分类 cs.LG

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05331 2025-07-09 cs.RO 57%

A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation

TRI LBM Team, Jose Barreiros, Andrew Beaulieu, Aditya Bhat, Rick Cory, Eric Cousineau, Hongkai Dai, Ching-Hsin Fang, Kunimatsu Hashimoto, Muhammad Zubair Irshad, Masha Itkina, Naveen Kuppuswamy, Kuan-Hui Lee, Katherine Liu, Dale McConachie, Ian McMahon, Haruki Nishimura, Calder Phillips-Grafflin, Charles Richter, Paarth Shah, Krishnan Srinivasan, Blake Wulfe, Chen Xu, Mengchao Zhang, Alex Alspach, Maya Angeles, Kushal Arora, Vitor Campagnolo Guizilini, Alejandro Castro, Dian Chen, Ting-Sheng Chu, Sam Creasey, Sean Curtis, Richard Denitto, Emma Dixon, Eric Dusel, Matthew Ferreira, Aimee Goncalves, Grant Gould, Damrong Guoy, Swati Gupta, Xuchen Han, Kyle Hatch, Brendan Hathaway, Allison Henry, Hillel Hochsztein, Phoebe Horgan, Shun Iwase, Donovon Jackson, Siddharth Karamcheti, Sedrick Keh, Joseph Masterjohn, Jean Mercat, Patrick Miller, Paul Mitiguy, Tony Nguyen, Jeremy Nimmer, Yuki Noguchi, Reko Ong, Aykut Onol, Owen Pfannenstiehl, Richard Poyner, Leticia Priebe Mendes Rocha, Gordon Richardson, Christopher Rodriguez, Derick Seale, Michael Sherman, Mariah Smith-Jones, David Tago, Pavel Tokmakov, Matthew Tran, Basile Van Hoorick, Igor Vasiljevic, Sergey Zakharov, Mark Zolotas, Rares Ambrus, Kerri Fetzer-Borelli, Benjamin Burchfiel, Hadas Kress-Gazit, Siyuan Feng, Stacie Ford, Russ Tedrake

机构 * TRI LBM Team(TRI LBM团队)

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13761 2025-06-17 cs.RO 57%

Prompting with the Future: Open-World Model Predictive Control with Interactive Digital Twins

Chuanruo Ning, Kuan Fang, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学)

专题命中 动作表示与策略 :language-conditioned robot(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04867 2025-04-24 cs.CV 57%

HandDiffuse: Generative Controllers for Two-Hand Interactions via Diffusion Models

Pei Lin, Sihang Xu, Hongdi Yang, Yiran Liu, Xin Chen, Jingya Wang, Jingyi Yu, Lan Xu

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02774 2025-01-07 cs.LG 57%

Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes

Zijian Wang, Bin Wang, Mingwen Shao, Hongbo Dou, Boxiang Tao

机构 * China University of Petroleum(East China)(中国石油大学(华东))

专题命中 动作表示与策略 :action model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20118 2024-10-29 cs.RO cs.SY eess.SY 57%

Assistance-Seeking in Human-Supervised Autonomy: Role of Trust and Secondary Task Engagement (Extended Version)

Dong Hae Mangalindan, Vaibhav Srivastava

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13124 2024-10-18 cs.RO 57%

Just Add Force for Contact-Rich Robot Policies

William Xie, Stefan Caldararu, Nikolaus Correll

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10052 2024-03-18 cs.CV 57%

T4P: Test-Time Training of Trajectory Prediction via Masked Autoencoder and Actor-specific Token Memory

Daehee Park, Jaeseok Jeong, Sung-Hoon Yoon, Jaewoo Jeong, Kuk-Jin Yoon

专题命中 动作表示与策略 :action model(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00141 2024-03-04 cs.CL cs.AI 57%

EROS: Entity-Driven Controlled Policy Document Summarization

Joykirat Singh, Sehban Fazili, Rohan Jain, Md Shad Akhtar

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

Comments Accepted in LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08499 2023-12-13 cs.RO 57%

A Control Approach for Human-Robot Ergonomic Payload Lifting

Lorenzo Rapetti, Carlotta Sartore, Mohamed Elobaid, Yeshasvi Tirupachuri, Francesco Draicchio, Tomohiro Kawakami, Takahide Yoshiike, Daniele Pucci

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏