arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9209 篇

2605.25829 2026-05-26 cs.RO cs.AI 87%

OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation

OASIS: 通过SE(3)轨迹预测实现机器人操作中的观测-动作空间对齐

Xinzhe Chen, Sihua Ren, Liqi Huang, Haowen Sun, Mingyang Li, Xingyu Chen, Zeyang Liu, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 提出OASIS视觉运动策略,通过SE(3)末端执行器轨迹预测对齐中间表示与动作空间,在仿真和真实实验中优于VLA和WAM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12978 2026-05-19 cs.RO cs.AI 87%

Learning Native Continuation for Action Chunking Flow Policies

学习原生延续以实现动作分块流策略

Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

机构 * Spirit AI

专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本文提出Legato方法,通过训练时的延续技术改进动作分块流基于VLA策略,减少动作边界不连续性和伪多模态切换,提升轨迹平滑度和任务完成效率。

Comments Accepted by Robotics: Science and Systems 2026 (RSS 2026). Project page: https://lyfeng001.github.io/Legato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06339 2026-05-13 cs.RO cs.AI 87%

Action Hallucination in Generative Vision-Language-Action Models

生成视觉-语言-动作模型中的动作幻觉

Harold Soh, Eugene Lim

机构 * Department of Computer Science, School of Computing(计算机科学系,计算系) Smart Systems Institute(智能系统研究所)

专题命中 VLA模型 :vision-language-action(title);action model(title);robot foundation model(abstract);分类 cs.RO、cs.AI

AI总结 研究分析生成视觉-语言-动作模型中动作幻觉的根源,揭示拓扑、精度和地平线三类障碍对动作生成的影响,提出改进模型可靠性和可信度的方法。

Comments 24 pages; updated setup with minor changes to proofs. changed template

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24584 2026-03-26 cs.CV cs.RO 87%

TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models

目标无关引导:用于视觉-语言-动作模型中稳定对象中心推断的指导

Jiaying Zhou, Zhihao Zhan, Ruifeng Zhai, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TAG目标无关引导,通过对比原始观察和物体擦除观察下的策略预测差异,减少干扰和外观偏差,提升视觉-语言-动作模型在复杂场景中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19236 2026-02-02 cs.RO cs.CV 87%

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

MemoryVLA: 视觉-语言-动作模型中用于机器人操作的感知-认知记忆

Hao Shi, Bin Xie, Yingfei Liu, Lin Sun, Fengrong Liu, Tiancai Wang, Erjin Zhou, Haoqiang Fan, Xiangyu Zhang, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) Dexmal MEGVII Technology(MEGVII技术) Tianjin University(天津大学) Harbin Institute of Technology(哈尔滨工业大学) StepFun

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 MemoryVLA通过结合感知与认知记忆机制,提升机器人操作中长时间跨度任务的性能,实现对时间依赖任务的高效处理。

Comments ICLR 2026 | The project is available at https://shihao1895.github.io/MemoryVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13626 2025-12-29 cs.RO cs.CL cs.CV 87%

LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models

LIBERO-Plus:视觉-语言-动作模型的深入鲁棒性分析

Senyu Fei, Siyin Wang, Junhao Shi, Zihao Dai, Jikun Cai, Pengfang Qian, Li Ji, Xinzhe He, Shiduo Zhang, Zhaoye Fei, Jinlan Fu, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 LIBERO-Plus研究了视觉-语言-动作模型在七个维度上的鲁棒性,发现模型对摄像机视角和机器人初始状态等扰动极度敏感,但对语言指令变化不敏感,挑战了高基准分数代表真正能力的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14659 2025-11-19 cs.RO cs.AI 87%

NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards

Chia-Yu Hung, Navonil Majumder, Haoyuan Deng, Liu Renhang, Yankang Ang, Amir Zadeh, Chuan Li, Dorien Herremans, Ziwei Wang, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Lambda Labs(Lambda实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.AI

Comments https://declare-lab.github.io/nora-1.5

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11298 2025-11-17 cs.RO cs.AI 87%

Experiences from Benchmarking Vision-Language-Action Models for Robotic Manipulation

Yihao Zhang, Yuankai Qi, Xi Zheng

机构 * Macquarie University(麦考瑞大学)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18183 2025-09-24 cs.CV cs.AI 87%

VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation

Jinyue Bian, Zhaoxing Zhang, Zhengyu Liang, Shiwei Zheng, Shengtao Zhang, Rong Shen, Chen Yang, Anzhou Hou

机构 * China, Beijing, Li Auto Inc.(中国北京李自动公司)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09747 2025-01-17 cs.RO cs.LG 87%

FAST: Efficient Action Tokenization for Vision-Language-Action Models

Karl Pertsch, Kyle Stachowicz, Brian Ichter, Danny Driess, Suraj Nair, Quan Vuong, Oier Mees, Chelsea Finn, Sergey Levine

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.LG

Comments Website: https://www.pi.website/research/fast

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22997 2026-07-28 cs.RO cs.AI cs.GR cs.LG 新提交 87%

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline

用于视觉-语言-动作操纵的Real2Sim2Real:基于AMD ROCm的管道

Qing Yang, Xun Wang, Ziguan Wang, Zhenjiang Li, Hongqiang Wang, Dongdong Weng

机构 * AMD AIG Team(AMD人工智能团队) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文针对视觉-语言-动作操纵提出基于AMD ROCm的Real2Sim2Real技术栈,涵盖多硬件计算,由开放软件栈统一。通过四个演示表明无需CUDA锁定生态系统,展示了在多硬件平台上的相关成果,且管道可在特定硬件和平台上原生运行并重现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06595 2026-06-16 astro-ph.HE astro-ph.GA 新提交 87%

VLA Observations Confirm AT 2023mfm as an Off-nuclear Tidal Disruption Event

VLA观测确认AT 2023mfm为核外潮汐瓦解事件

Wenkai Li, Collin T. Christy, Kate D. Alexander, Itai Sfaradi, Xinya Huang, Ning Jiang, Tanmoy Laskar, Andrew Mummery, Noah Franz, Adelle J. Goodwin, Walter W. Golay, Raffaella Margutti, Ryan Chornock, Jiazheng Zhu, Sjoert van Velzen, Yvette Cendes, Wenbin Lu, Jimmy Lynch

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 利用高分辨率VLA射电成像,确认AT 2023mfm为核外潮汐瓦解事件,并揭示其与宿主星系核的偏移,验证了射电成像在识别核外TDE候选体中的有效性。

Comments 4 pages, 1 figure, published in RNAAS

Journal ref Res. Notes AAS 10 (2026) 153

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00229 2026-06-09 cs.RO cs.AI cs.LG 版本更新 87%

Continuous Reasoning for Vision-Language-Action

视觉-语言-动作的连续推理

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

机构 * Airoa

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 针对视觉-语言-动作策略中语言与连续控制粒度不匹配的问题,提出一种可共享、可验证的连续推理方法,通过高斯潜变量接口和自验证目标提升机器人任务成功率。

Comments Project page: https://continuous-reasoning.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO 87%

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 87%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO 87%

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21633 2026-02-26 cs.RO cs.AI cs.CV 87%

Self-Correcting VLA: Online Action Refinement via Sparse World Imagination

自校正视觉-语言-动作模型:通过稀疏世界想象实现在线动作细化

Chenyv Liu, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science(电子科学大学) Advanced Institute of Big Data(大数据高级研究所)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 SC-VLA通过稀疏世界想象实现自校正,提升机器人操作任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 87%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01914 2025-11-05 cs.CV cs.AI cs.RO 87%

iFlyBot-VLA Technical Report

Yuan Zhang, Chenyu Xue, Wenjie Xu, Chao Ji, Jiajia wu, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25616 2025-10-30 cs.LG cs.AI cs.RO 87%

Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization

Nikita Kachaev, Mikhail Kolosov, Daniil Zelezetsky, Alexey K. Kovalev, Aleksandr I. Panov

机构 * Cognitive AI Lab(认知人工智能实验室) Cognitive AI Lab, IAI MIPT(认知人工智能实验室,IAI MIPT)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09032 2025-08-13 cs.CV cs.AI cs.RO 87%

Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding

Maxim A. Patratskiy, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIPT(莫斯科物理技术学院) AIRI(人工智能研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15597 2025-07-22 cs.CV cs.LG cs.RO 87%

Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos

Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02359 2024-11-05 cs.RO cs.AI cs.LG 87%

DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution

Yang Yue, Yulin Wang, Bingyi Kang, Yizeng Han, Shenzhi Wang, Shiji Song, Jiashi Feng, Gao Huang

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 25 pages, 6 figures, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25659 2026-08-27 cs.RO 新提交 86%

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

GaussianDream++:面向机器人操作的高效三维高斯世界建模

Yuqing Jiang, Zijian Zhang, Weitao Zhou, Jiawei Wang, Junjie He, Lei Yang, Haifang Qing, Si Liu, Ding Zhao, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);language-conditioned robot(abstract);分类 cs.RO

AI总结 GaussianDream++ 是一种高效三维高斯世界建模方法,通过在 VLA 骨干中插入世界状态与预测 token,提升机器人操作性能,在 LIBERO、LIBERO-Plus 及真实机器人实验中均取得显著效果且部署高效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-08-27 cs.CV 版本更新 86%

Training-Free Interaction-Aligned Visual Token Pruning for Efficient Embodied Manipulation

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Weibin Li, Haozhe Wang, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.CV

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15139 2026-08-18 cs.RO 新提交 86%

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

StructRL:面向基于流的视觉-语言-动作模型的结构化动作空间探索

Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 StructRL通过将策略随机性重定位至动作空间的三个耦合设计,解决基于流的VLA模型的结构化噪声稀释问题,在模拟与真实任务上提升了探索效率及OOD性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 86%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 VLA模型 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);action model(abstract,abstract_cn);分类 cs.RO

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03563 2026-08-05 cs.RO 新提交 86%

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作

Zhenyang Feng, Unnat Jain

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性

Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 86%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 86%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏