arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 584 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 584 篇

2605.13403 2026-05-14 cs.RO cs.CV 73%

RotVLA: Rotational Latent Action for Vision-Language-Action Model

RotVLA: 旋转的潜在动作用于视觉-语言-动作模型

Qiwei Li, Xicheng Gong, Xinghang Li, Peiyan Li, Quanyun Zhou, Hangjun Ye, Jiahuan Zhou, Yadong Mu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Xiaomi Robotics(小米机器人) CASIA

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06339 2026-05-13 cs.RO cs.AI 73%

Action Hallucination in Generative Vision-Language-Action Models

生成视觉-语言-动作模型中的动作幻觉

Harold Soh, Eugene Lim

机构 * Department of Computer Science, School of Computing(计算机科学系,计算系) Smart Systems Institute(智能系统研究所)

专题命中 机器人基础模型 :robotics(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 研究分析生成视觉-语言-动作模型中动作幻觉的根源,揭示拓扑、精度和地平线三类障碍对动作生成的影响,提出改进模型可靠性和可信度的方法。

Comments 24 pages; updated setup with minor changes to proofs. changed template

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10126 2026-05-12 cs.RO cs.AI 73%

AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models

AR-VLA:面向视觉-语言-动作模型的真自回归动作专家

Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov, Yuanqi Yao, Sombit Dey, Giuliano Albanese, Renaud Detry, Luc Van Gool, Danda Paudel

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(库勒恩大学,机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(库勒恩大学,电气工程系,语音和图像处理研究单位)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 AR-VLA提出了一种自回归动作专家,通过长时记忆保持上下文,解决快控与慢思的频率不匹配问题,实现高效预训练和模块化集成,提升动作生成的时空一致性。

Comments RSS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 73%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03956 2026-04-24 cs.CV cs.AI 73%

VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models

VLA-Forget:面向具身基础模型的视觉-语言-动作去学习

Ravi Ranjan, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出VLA-Forget框架,通过结合感知选择性编辑与层选择性推理去学习,提升去学习效果,保留感知特性和推理能力,减少量化恢复。

Comments 18 pages, 9 figures, Accepted to ACL-2026, KnowFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14732 2026-04-21 cs.RO cs.LG 73%

World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

世界价值-动作模型:面向视觉-语言-动作系统的隐式规划

Runze Li, Hongyin Zhang, Junxi Jin, Qixin Zeng, Zifeng Zhuang, Yiqi Tang, Shangke Lyu, Donglin Wang

机构 * Westlake University(西湖大学) Nanjing University Suzhou Campus(南京大学苏州校区)

专题命中 机器人基础模型 :embodied agent(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出World-Value-Action模型,通过隐式规划提升视觉-语言-动作系统在长时域决策中的性能,通过学习潜在表示和价值函数实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14178 2026-04-17 cs.RO cs.AI 73%

Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion

迈向无需微调的VLA部署:通过具身进化扩散实现即插即用的推理时VLA策略引导

Zhuo Li, Junjia Liu, Zhipeng Dong, Tao Teng, Quentin Rouxel, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong(协作与多功能机器人实验室,T-Stone机器人研究所,香港中文大学,香港) Φ \Phi -Institute for Physical Human Intelligence(物理人机智能研究所) Center for Embodied Artificial Intelligence and Computer Vision, Shenzhen Loop Area Institute, Shenzhen, China(具身人工智能与计算机视觉中心,深圳环园研究院,深圳,中国) Department of Advanced Robotics, Istituto Italiano di Tecnologia, Genoa, Italy(先进机器人系,意大利理工学院,热那亚,意大利)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出VLA-Pilot方法,通过即插即用的策略引导实现无需微调的零样本部署,提升预训练VLA在不同任务和机器人平台上的表现。

Comments 9 pages, 8 figures, submitted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05656 2026-04-08 cs.CV cs.AI 73%

SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation

SnapFlow:通过渐进式自我蒸馏实现流匹配视觉-语言-动作模型的一步动作生成

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * Jilin University(吉林大学) Chongqing University(重庆大学) University of Liverpool(利物浦大学) GenY

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 SnapFlow通过渐进式自我蒸馏将多步去噪压缩为单步前向传递,提升流匹配VLA模型的效率,减少延迟并提高成功率。

Comments 10 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19131 2026-03-20 cs.LG cs.RO 73%

From Inference Efficiency to Embodied Efficiency: Revisiting Efficiency Metrics for Vision-Language-Action Models

从推理效率到具身效率:重新审视视觉-语言-动作模型的效率指标

Zhuofan Li, Hongkun Yang, Zhenyang Chen, Yangxuan Chen, Yingyan, Lin, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港理工大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人基础模型 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文重新审视视觉-语言-动作模型的效率指标,发现传统参数、FLOPs或token解码吞吐量无法反映机器人平台的实际表现,提出具身效率指标如任务完成时间、轨迹平滑度等,揭示传统方法在具身效率上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18953 2026-03-17 cs.RO cs.AI 73%

Eva-VLA: Evaluating Vision-Language-Action Models' Robustness Under Real-World Physical Variations

Eva-VLA:评估视觉-语言-动作模型在现实物理变化下的鲁棒性

Hanqing Liu, Shouwei Ruan, Jiahuan Long, Junqi Wu, Jiacheng Hou, Huili Tang, Tingsong Jiang, Weien Zhou, Wen Yao

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Eva-VLA框架,通过将不可控物理变化转化为连续优化问题,系统评估VLA模型的鲁棒性,发现OpenVLA在三种物理变化下的平均失败率超过90%,并验证了对抗训练提升模型鲁棒性的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02271 2026-03-04 cs.PF cs.AI cs.AR cs.RO 73%

Characterizing VLA Models: Identifying the Action Generation Bottleneck for Edge AI Architectures

表征VLA模型:识别边缘AI架构中的动作生成瓶颈

Manoj Vishwanathan, Suvinay Subramanian, Anand Raghunathan

机构 * Google, Mountain View, CA(谷歌,山景城,加利福尼亚) Purdue University, West Lafayette, IN(普渡大学,沃斯堡,印第安纳)

专题命中 机器人基础模型 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了VLA模型在边缘AI中的动作生成瓶颈,通过分析发现动作生成阶段占端到端延迟的75%,并探讨了扩展至100B参数模型的硬件需求及未来技术路径。

Comments 3 Pages 4 Figures for Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 73%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02310 2026-02-26 cs.RO cs.CV 73%

PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding

PD-VLA:通过并行解码加速集成动作分块的视觉-语言-动作模型

Wenxuan Song, Jiayi Chen, Pengxiang Ding, Han Zhao, Wei Zhao, Zhide Zhong, Zongyuan Ge, Zhijun Li, Donglin Wang, Jun Ma, Lujia Wang, Haoang Li

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 PD-VLA通过并行解码框架提升视觉-语言-动作模型在动作分块中的效率与性能

Comments Accepted by IROS 2025, updated results on LIBERO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10556 2026-02-17 cs.RO cs.AI 73%

LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer

LAP:语言-动作预训练实现零样本跨躯体迁移

Lihan Zha, Asher J. Hancock, Mingtong Zhang, Tenny Yin, Yixuan Huang, Dhruv Shah, Allen Z. Ren, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。

Comments Project website: https://lap-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14058 2026-02-16 cs.RO cs.CV 73%

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11832 2026-02-13 cs.CV cs.RO 73%

JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

视频预测嵌入对于VLA模型是必要的

Shangchen Miao, Ningya Feng, Jialong Wu, Ye Lin, Xu He, Dong Li, Mingsheng Long

机构 * Tsinghua University(清华大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 JEPA-VLA通过引入视频预训练的预测嵌入,提升VLA模型在机器人任务中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03782 2026-02-04 cs.CV cs.RO 73%

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

QVLA:视觉-语言-动作模型量化中并非所有通道都平等

Yuhao Xu, Yantai Yang, Zhenyang Fan, Yufan Liu, Yuming Li, Bing Li, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(自动化实验室,人工智能学院,上海交通大学) Anyverse Dynamics State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Terminal Technology Department, Alipay, Ant Group(终端技术部,蚂蚁集团)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 QVLA提出了一种动作导向的量化框架,通过按通道分配比特数来优化视觉-语言-动作模型的压缩,实现了更高的性能和效率。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01158 2026-02-03 cs.CV cs.RO 73%

Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs

通过恢复损坏的视觉输入来提高视觉-语言-动作模型的鲁棒性

Daniel Yezid Guarnizo Orjuela, Leonardo Scappatura, Veronica Di Gennaro, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering(电子信息与生物工程系)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出CRT模块,通过对抗训练恢复损坏的视觉输入,提升VLA模型在现实环境中的鲁棒性与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20966 2026-01-30 cs.RO cs.AI 73%

Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends

VLA模型后训练与人类运动学习的类比:进展、挑战与趋势

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duan, Fu-Chao Xie, Wen-Kai Wang, Si-Cheng Wang, Ling-Yun Li, Tian Tu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文从人类运动学习角度综述了VLA模型后训练的进展、挑战与趋势,提出四类后训练方法并探讨了其在机器人操作中的应用与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20276 2025-12-24 cs.AI cs.RO 73%

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14666 2025-12-17 cs.RO cs.CV 73%

EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

EVOLVE-VLA: 通过环境反馈进行测试时训练以实现视觉-语言-动作模型

Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * Show Lab National University of Singapore(新加坡国立大学Show实验室)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 EVOLVE-VLA通过环境反馈实现测试时训练,使视觉-语言-动作模型能持续适应,提升任务性能并实现跨任务泛化。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11921 2025-12-16 cs.RO cs.AI 73%

Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control

迈向可及的物理AI:基于LoRA的VLA模型在现实机器人控制中的微调

Abdullah Yahya Abdullah Omaisan, Ibrahim Sheikh Mohamed

机构 * Independent Researchers(独立研究者)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于LoRA的VLA模型微调方法,使大规模VLA模型能在消费级GPU上高效运行,实现在低成本机器人平台上的现实部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03724 2025-12-09 cs.CV cs.RO 73%

PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA: 通过姿态条件化锚点注意力增强动作生成

Ziwen Li, Xin Wang, Hanlue Zhang, Runnan Chen, Runqi Lin, Xiao He, Han Huang, Yandong Guo, Fakhri Karray, Tongliang Liu, Mingming Gong

机构 * MBZUAI AI2 Robotics The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 PosA-VLA通过姿态条件化锚点注意力机制提升动作生成的精度和效率,适用于多样化的机器人任务和复杂环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12211 2025-11-14 cs.RO cs.AI 73%

Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search

Cyrus Neary, Omar G. Younis, Artur Kuramshin, Ozgur Aslan, Glen Berseth

机构 * Mila — Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19012 2025-11-11 cs.RO cs.AI 73%

Pure Vision Language Action (VLA) Models: A Comprehensive Survey

Dapeng Zhang, Jing Sun, Chenghui Hu, Xiaoyan Wu, Zhenlong Yuan, Rui Zhou, Fei Shen, Qingguo Zhou

机构 * Lanzhou University, China(兰州大学) National University of Singapore, Singapore(新加坡国立大学) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09937 2025-10-31 cs.RO cs.AI 73%

SAFE: Multitask Failure Detection for Vision-Language-Action Models

Qiao Gu, Yuanliang Ju, Shengxiang Sun, Igor Gilitschenski, Haruki Nishimura, Masha Itkina, Florian Shkurti

机构 * University of Toronto(多伦多大学) UofT Robotics Institute(UofT机器人研究所) Vector Institute(向量研究所) Toyota Research Institute(丰田研究院)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

Comments NeurIPS 2025 camera ready. Project Page: https://vla-safe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22199 2025-09-30 cs.RO cs.AI 73%

MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training

Haoyun Li, Ivan Zhang, Runqi Ouyang, Xiaofeng Wang, Zheng Zhu, Zhiqin Yang, Zhentao Zhang, Boyuan Wang, Chaojun Ni, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhenbo Song, Xingang Wang

机构 * GigaAI CASIA NJUST(南京工业大学) Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00328 2025-09-03 cs.RO cs.LG 73%

Mechanistic interpretability for steering vision-language-action models

Bear Häon, Kaylene Stocking, Ian Chuang, Claire Tomlin

专题命中 机器人基础模型 :robotics(abstract);embodied agent(abstract);分类 cs.RO、cs.LG

Comments CoRL 2025. Project website: https://vla-mech-interp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05450 2025-04-15 cs.RO cs.AI 73%

ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy

Yuhui Chen, Shuai Tian, Shugao Liu, Yingting Zhou, Haoran Li, Dongbin Zhao

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09246 2024-09-09 cs.RO cs.LG 73%

OpenVLA: An Open-Source Vision-Language-Action Model

Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, Chelsea Finn

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.LG

Comments Website: https://openvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏