arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9866 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9186 篇

2603.19219 2026-03-20 cs.CV cs.LG 73%

DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding

DriveTok: 3D驾驶场景分词用于统一多视角重建与理解

Dong Zhuo, Wenzhao Zheng, Sicheng Zuo, Siming Yan, Lu Hou, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.LG

AI总结 DriveTok通过3D变形交叉注意力实现高效多视角重建与理解,整合语义、几何与纹理信息,提升多视角分词效率与一致性。

Comments Project Page: https://paryi555.github.io/DriveTok/ Code: https://github.com/paryi555/DriveTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05186 2026-03-19 cs.RO cs.CV 73%

Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

学习感知与行动:面向机器人操作的任务感知虚拟视角探索

Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。

Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15418 2026-03-17 cs.RO cs.AI 73%

MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings

MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型

Shahil Shaik, Aditya Parameshwaran, Anshul Nayak, Jonathon M. Smereka, Yue Wang

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Clemson University(克莱姆斯大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12553 2026-03-16 cs.RO cs.CV 73%

Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation

超越密集未来:世界模型作为机器人操作的结构化规划器

Minghao Jin, Mozheng Liao, Mingfei Han, Zhihui Li, Xiaojun Chang

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11106 2026-03-13 cs.CV cs.RO 73%

RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测

Shijie Zhou, Bin Zhu, Jiarui Yang, Xiangyu Zhao, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Singapore Management University(新加坡国立大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10052 2026-03-12 cs.RO cs.LG 73%

OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies

OmniGuide: 通用引导场用于增强通用机器人策略

Yunzhou Song, Long Le, Yong-Hyun Park, Jie Wang, Junyao Shi, Lingjie Liu, Jiatao Gu, Eric Eaton, Dinesh Jayaraman, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能

Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23162 2026-03-12 cs.RO cs.CV 73%

Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling

Cosmos-H-Surgical: 通过世界建模学习手术机器人策略

Yufan He, Pengfei Guo, Mengya Xu, Zhaoshuo Li, Andriy Myronenko, Dillan Imans, Bingjie Liu, Dongren Yang, Mingxue Gu, Yongnan Ji, Yueming Jin, Ren Zhao, Baiyong Shen, Daguang Xu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Sung Kyun Kwan University(全州大学) Wenzhou Medical University(温州医学院) National University of Singapore(新加坡国立大学) Ruijin Hospital(瑞金医院)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01068 2026-03-11 cs.RO cs.LG 73%

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

制定你的策略!通过测试时的分布级组合改进扩散型或流型机器人策略

Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo

机构 * The University of Hong Kong(香港大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出无需训练的通用策略组合方法,通过测试时分布级组合提升机器人策略性能。

Comments Accepted to ICLR 2026. Project Page: https://sagecao1125.github.io/GPC-Site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI 73%

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01465 2026-03-03 cs.RO cs.AI 73%

Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining

非马尔可夫长时间 horizon 机器人操作 via 关键帧链

Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science and Technology of China(电子科学与技术大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Keyframe-Chaining VLA框架,通过提取和链接关键历史帧,解决长horizon机器人操作中的非马尔可夫依赖问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01441 2026-03-03 cs.CV cs.RO 73%

Unifying Language-Action Understanding and Generation for Autonomous Driving

统一语言-动作理解与生成以实现自动驾驶

Xinyang Wang, Qian Liu, Wenjie Ding, Zhao Yang, Wei Li, Chang Liu, Bailin Li, Kun Zhan, Xianpeng Lang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Li Auto

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 LinkVLA通过统一语言和动作令牌及两步生成方法,提升自动驾驶中语言-动作一致性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00732 2026-03-03 cs.RO cs.CV 73%

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

UniHM: 一体化的视觉语言模型用于统一的灵巧手操作

Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 UniHM通过统一的视觉语言模型实现灵巧手操作,利用开放词汇指令提升泛化能力和物理可行性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22010 2026-02-26 cs.RO cs.CV 73%

World Guidance: World Modeling in Condition Space for Action Generation

世界引导:在条件空间中进行世界建模以生成动作

Yue Su, Sijin Chen, Haixin Shi, Mingyu Liu, Zhengshen Zhang, Ningyuan Huang, Weiheng Zhong, Zhengbang Zhu, Yuxiao Liu, Xihui Liu

机构 * The University of Hong Kong(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 WoG通过在条件空间中建模未来观测,提升视觉-语言-动作模型的动作生成能力与泛化性能。

Comments Project Page: https://selen-suyue.github.io/WoGNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07555 2026-02-10 cs.CV cs.AI 73%

VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation

VISOR:基于语言驱动的对象导航的视觉空间对象推理

Francesco Taioli, Shiping Yang, Sonia Raychaudhuri, Marco Cristani, Unnat Jain, Angel X Chang

机构 * Polytechnic of Turin(都灵理工大学) Simon Fraser University(Simon Fraser大学) University of Verona(威尼斯大学) University of Reykjavik(雷克雅未克大学) University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 VISOR提出了一种紧凑的3B参数VLA智能体,通过显式图像基础推理实现人类般的具身推理,提升对象识别和动作选择的可解释性、泛化能力和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02454 2026-02-03 cs.RO cs.AI 73%

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

World-Gymnast: 在世界模型中用强化学习训练机器人

Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, Sherry Yang

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 World-Gymnast通过在世界模型中进行强化学习微调,有效提升真实机器人性能,比监督学习和软件模拟更具优势。

Comments https://world-gymnast.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00096 2026-02-03 cs.CV cs.AI 73%

Mirage2Matter: A Physically Grounded Gaussian World Model from Video

Mirage2Matter: 从视频构建一个物理基础的高斯世界模型

Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng, Yandong Guo, Runqi Lin, Yuanyuan Wang, Tongliang Liu, Kun Zhang, Mingming Gong

机构 * MBZUAI AI$^2$Robotics(AI²Robotics) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学) The University of Melbourne(墨尔本大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 Mirage2Matter通过视频重建物理基础的世界模型,利用3D高斯点云和生成模型实现高保真具身训练数据生成,提升具身智能的可扩展性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 73%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05580 2026-01-29 cs.AI cs.RO 73%

MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption

MetaVLA:统一的元学习协同训练用于高效的具身适应

Chen Li, Zhantao Yang, Han Zhang, Fangyi Chen, Chenchen Zhu, Anudeepsekhar Bolimera, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Reality Labs, USA(Meta现实实验室(美国))

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 MetaVLA通过统一的元学习协同训练方法,实现高效的具身适应,提升任务泛化能力并降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20276 2025-12-24 cs.AI cs.RO 73%

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18477 2025-12-23 cs.RO cs.CV 73%

STORM: Search-Guided Generative World Models for Robotic Manipulation

STORM:基于搜索的生成世界模型用于机器人操作

Wenjun Lin, Jensen Zhang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 STORM通过结合生成模型与搜索算法,实现了机器人操作中的时空推理,显著提升了任务成功率和环境适应能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02190 2025-12-23 cs.RO cs.LG 73%

cVLA: Towards Efficient Camera-Space VLAs

cVLA:迈向高效的相机空间VLA

Max Argus, Jelena Bratulic, Houman Masnavi, Maxim Velikanov, Nick Heppert, Abhinav Valada, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 cVLA通过利用视觉语言模型在2D图像上的性能,提出了一种高效预测机器人轨迹的VLA方法,具备良好的仿真到现实迁移能力。

Comments 20 pages, 10 figures; CoRL 2025 Workshop on Generalizable Priors for Robot Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12796 2025-12-19 cs.CV cs.AI 73%

DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

DriveVLA-W0:世界模型放大数据扩展定律在自动驾驶中的应用

Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yuqi Wang, Yuntao Chen, Xiaoman Wang, Yasong An, Chufeng Tang, Lu Hou, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(国家工程实验室、自动化研究所、中国科学院(CASIA)) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 DriveVLA-W0通过世界建模预测未来图像,提升自动驾驶中数据扩展定律,实现更高效的驾驶智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07472 2025-12-09 cs.RO cs.LG 73%

Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation

可及场干预:使VLAs在机器人操作中摆脱记忆陷阱

Siyu Xu, Zijian Wang, Yunke Wang, Chenghao Xia, Tao Huang, Chang Xu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) John Hopcropt Center for Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学中心)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出可及场干预(AFI)方法,通过引入3D空间可及场提升VLA在机器人操作中对分布变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19861 2025-12-02 cs.CV cs.RO 73%

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

GigaWorld-0:世界模型作为数据引擎赋能具身AI

GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, Qiuping Deng, Siting Wang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yankai Wang, Yu Cao, Yifan Chang, Yuan Xu, Yun Ye, Yang Wang, Yukun Zhou, Zhengyuan Zhang, Zhehao Dong, Zheng Zhu

机构 * GigaWorld Team(GigaWorld团队)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 GigaWorld-0通过整合视频生成与3D建模技术,构建统一的数据引擎,生成高质量具身交互数据,提升VLA模型在现实任务中的性能。

Comments Project Page: https://giga-world-0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11478 2025-12-01 cs.RO cs.CV 73%

Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective

重新思考机器人操作中记忆状态的演进:以对象为中心的视角

Nhat Chung, Taisei Hanyu, Toan Nguyen, Huy Le, Frederick Bumgarner, Duy Minh Ho Nguyen, Khoa Vo, Kashu Yamazaki, Chase Rainwater, Tung Kieu, Anh Nguyen, Ngan Le

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Embodied-SlotSSM框架,用于解决机器人操作中非马尔可夫推理问题,通过槽位状态空间建模和关系编码器实现时间可扩展的视觉-语言-动作推理。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO 73%

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14499 2025-11-19 cs.CV cs.RO 73%

Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM

Jack Qin, Zhitao Wang, Yinan Zheng, Keyu Chen, Yang Zhou, Yuanxin Zhong, Siyuan Cheng

机构 * Tsinghua University(清华大学) Laboratories, Huawei Technologies(华为技术有限公司2012实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23318 2025-11-17 cs.CV cs.AI 73%

FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning

Jiajun Cao, Qizhe Zhang, Peidong Jia, Xuhui Zhao, Bo Lan, Xiaoan Zhang, Zhuo Li, Xiaobao Wei, Sixiang Chen, Liyun Li, Xianming Liu, Ming Lu, Yang Wang, Shanghang Zhang

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10518 2025-11-14 cs.CV cs.RO 73%

SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation

Wei Li, Renshan Zhang, Rui Shao, Zhijian Fang, Kaiwen Zhou, Zhuotao Tian, Liqiang Nie

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Accepted to AAAI 2026 (Oral), Project Page: https://github.com/JiuTian-VL/SemanticVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06619 2025-11-11 cs.RO cs.AI 73%

How Do VLAs Effectively Inherit from VLMs?

Chuheng Zhang, Rushuai Yang, Xiaoyu Chen, Kaixin Wang, Li Zhao, Yi Chen, Jiang Bian

机构 * Microsoft Research(微软研究院) The Hong Kong University of Science(香港科学大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏