arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-12-01 至 2025-12-01 共收录 16 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 15 篇

2511.22532 2025-12-01 cs.CV cs.AI 88%

CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving

CoT4AD: 一种具有显式推理链的视觉-语言-动作模型用于自动驾驶

Zhaohui Wang, Tengbo Yu, Hao Tang

机构 * Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 CoT4AD通过引入显式推理链提升自动驾驶中的视觉-语言-动作模型的推理能力,实现更精确的因果推理和决策。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23034 2025-12-01 cs.RO 86%

LatBot: Distilling Universal Latent Actions for Vision-Language-Action Models

LatBot: 从大规模物体操作视频中提炼通用潜在动作用于视觉-语言-动作模型

Zuolei Li, Xingyu Gao, Xiaofan Wang, Jianlong Fu

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO

AI总结 LatBot通过整合动作预测和潜在动作分解,提升视觉-语言-动作模型在现实世界和模拟环境中的泛化与迁移能力。

Comments Project Page: https://mm-robot.github.io/distill_latent_action/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22697 2025-12-01 cs.RO cs.CL cs.CV 85%

Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations

通过少样本示范机制性微调视觉-语言-动作模型

Chancharik Mitra, Yusen Luo, Raj Saravanan, Dantong Niu, Anirudh Pai, Jesse Thomason, Trevor Darrell, Abrar Anwar, Deva Ramanan, Roei Herzig

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV

AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19221 2025-12-01 cs.CV cs.RO 84%

Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

Percept-WAM:感知增强的环境感知-行动模型用于鲁棒的端到端自动驾驶

Jianhua Han, Meng Tian, Jiangtong Zhu, Fan He, Huixin Zhang, Sitong Guo, Dechang Zhu, Hao Tang, Pei Xu, Yuze Guo, Minzhe Niu, Haojie Zhu, Qichao Dong, Xuechao Yan, Siyuan Dong, Lu Hou, Qingqiu Huang, Xiaosong Jia, Hang Xu

机构 * Yinwang Intelligent Technology Co. Ltd.(亿网通智能科技有限公司) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 Percept-WAM通过整合2D/3D场景理解能力,提升自动驾驶的感知与行动决策,实现端到端鲁棒性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22780 2025-12-01 cs.RO cs.AI cs.CV 75%

Distracted Robot: How Visual Clutter Undermine Robotic Manipulation

分心的机器人:视觉杂乱如何损害机器人操作

Amir Rasouli, Montgomery Alban, Sajjad Pakdamansavoji, Zhiyuan Li, Zhanguang Zhang, Aaron Wu, Xuan Zhao

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究提出了一种评估协议,从心理学物理角度评估机器人操作在杂乱环境中的性能,发现杂乱度对性能影响显著,且不同策略对杂乱的敏感性不同。

Comments 12 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11478 2025-12-01 cs.RO cs.CV 73%

Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective

重新思考机器人操作中记忆状态的演进:以对象为中心的视角

Nhat Chung, Taisei Hanyu, Toan Nguyen, Huy Le, Frederick Bumgarner, Duy Minh Ho Nguyen, Khoa Vo, Kashu Yamazaki, Chase Rainwater, Tung Kieu, Anh Nguyen, Ngan Le

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Embodied-SlotSSM框架,用于解决机器人操作中非马尔可夫推理问题,通过槽位状态空间建模和关系编码器实现时间可扩展的视觉-语言-动作推理。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO 73%

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22555 2025-12-01 cs.RO 70%

Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention

超越成功:通过及时干预从混合质量数据中精炼优雅的机器人操作

Yanbo Mao, Jianlong Fu, Ruoxuan Zhang, Hongxia Xie, Meibao Yao

机构 * Jilin University(吉林大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出LIBERO-Elegant基准和JITI机制,通过离线校准Q学习训练优雅批评者,提升机器人操作的执行质量与优雅度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02549 2025-12-01 cs.CV cs.RO 62%

MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming

MonoDream:基于全景梦境的单目视觉-语言导航

Shuo Wang, Yongcai Wang, Zhaoxin Fan, Yucheng Wang, Maiyue Chen, Kaihui Wang, Zhizhong Su, Wanting Li, Xudong Cai, Yeying Jin, Deying Li

机构 * Horizon Robotics

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 MonoDream通过轻量级VLA框架和潜在全景梦境任务,提升单目视觉-语言导航的性能,缩小与全景方法的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04966 2025-12-01 cs.SD cs.AI eess.AS 57%

LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning

LAPS-Diff: 一种基于扩散的歌唱语音合成框架,具有语言感知的语调风格引导学习

Sandipan Dhar, Mayank Gupta, Preeti Rao

机构 * Department of Electrical Engineering, Indian Institute of Technology, Bombay.(电子工程系,印度理工学院,博亚姆)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 LAPS-Diff通过语言感知嵌入和语音风格引导学习,提升低资源环境下印地语歌唱语音合成的质量。

Comments 10 pages, 5 figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22894 2025-12-01 nucl-th astro-ph.HE gr-qc 50%

Constraining of Nuclear Matter Equations of State With Rotating Neutron Stars

通过快速旋转中子星约束核物质方程 of State

Hyukjin Kwon, Kazuyuki Sekizawa

专题命中 VLA模型 :action model(abstract)

AI总结 本研究利用KEH方法,基于Gogny型相互作用计算快速旋转中子星的EoS,揭示旋转效应对方程 of State与观测数据对比的重要性。

Comments 4 pages, 2 figures, Proceedings of the 29th International Nuclear Physics Conference (INPC2025), Daejeon, Korea, May 25-30, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06792 2025-12-01 math.NA cs.NA 50%

Fully discrete finite element approximation for the projection method to solve the Chemotaxis-Fluid System

完全离散有限元近似用于求解趋化-流体系统的投影方法

Chenyang Li, Ping Lin, Haibiao Zheng

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种完全离散有限元方法用于求解趋化-流体系统,通过压强校正投影框架实现稳定高效计算,并验证了方法的收敛性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10865 2025-12-01 physics.flu-dyn physics.comp-ph 50%

Simulating fluid-fluid displacement in a soft capillary tube: How compliance delays interfacial instability and bubble pinch-off

在软毛细管中模拟流体-流体置换:柔顺性如何延迟界面不稳定性与气泡破裂

Sthavishtha R. Bhopalam, Ruben Juanes, Hector Gomez

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种计算模型,研究软毛细管中流体置换过程中柔顺性对界面不稳定性及气泡破裂的抑制作用。

Journal ref CMAME 448 (2026) 118430

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22124 2025-12-01 astro-ph.CO astro-ph.GA 50%

Deep insights into Abell 2163: unveiling the treasure trove of ICM plasma physics

对阿贝尔2163的深入洞察:揭示ICM等离子体物理的宝藏

Ramananda Santra, Ruta Kale, Simona Giacintucci, Herve Bourdin, Rashi Jain, Andrea Botteon, Gianfranco Brunetti

专题命中 VLA模型 :VLA(abstract)

AI总结 通过分析阿贝尔2163星系团的无线电晕和X射线数据,揭示了ICM等离子体物理的复杂性,提出磁感应强度与电子密度的关系需重新评估,并发现外围弥散穹顶可能作为种子电子的储备库。

Comments 26 pages (total), 33 figures, 8 tables, 3 appendix (6 figures). Accepted for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17694 2025-12-01 astro-ph.GA 50%

Where do stars explode in the ISM? -- The distribution of dense gas around evolved massive stars in M33

恒星在星际介质中爆炸的位置在哪里?-- M33中演化恒星周围密集气体的分布

Sumit K. Sarbadhicary, Jordan Wagner, Eric W. Koch, Ness Mayker Chen, Adam K. Leroy, Natalia Lahén, Erik Rosolowsky, Kathryn F. Neugent, Chang-Goo Kim, Laura Chomiuk, Julianne J. Dalcanton, Laura A. Lopez, Nickolas M. Pingel, Remy Indebetouw, Thomas G. Williams, Elizabeth Tarantino, Jennifer Donovan Meyer, Evan D. Skillman, Adam Smercina, Amanda A. Kepley, Eric J. Murphy, Jay Strader, Tony Wong, Snežana Stanimirović, Vicente Villanueva, Fabian Walter, Juergen Ott, Jeremy Darling, Julia Roman-Duval, Claire E. Murray

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过分析M33中大质量恒星周围气体分布,发现恒星与气体云存在质量依赖性相关性,为子网格模型提供观测约束。

Comments 34 pages, 14 figures. Accepted to ApJ. The density distributions are available as data behind figures in the journal publication. Please feel free to contact us in the meantime if you would like to use them

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2511.22777 2025-12-01 cs.RO cs.AI 73%

Improving Robotic Manipulation Robustness via NICE Scene Surgery

通过NICE场景手术提升机器人操作的鲁棒性

Sajjad Pakdamansavoji, Mozhgan Pourkeshavarz, Adam Sigal, Zhiyuan Li, Rui Heng Yang, Amir Rasouli

机构 * Huawei Technologies Canada(华为技术加拿大公司)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 NICE通过增强场景上下文减少分布外差距,提升机器人操作在复杂环境中的鲁棒性和安全性。

Comments 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏