arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-01-21 至 2026-01-21 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2507.10672 2026-01-21 cs.RO cs.CV 88%

Vision Language Action Models in Robotic Manipulation: A Systematic Review

视觉语言动作模型在机器人操作中的应用:系统综述

Muhayy Ud Din, Waseem Akram, Lyes Saad Saoud, Jan Rosell, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates(卡利法大学自主机器人系统中心(KUCARS)、卡利法大学、阿拉伯联合酋长国) Institute of Industrial and Control Engineering (IOC), Universitat Politecnica de Catalunya, Spain(工业与控制工程研究所(IOC)、巴塞罗那技术大学、西班牙)

专题命中 VLA模型 :vision language action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了视觉语言动作模型在机器人操作中的应用,分析了102个模型、26个数据集和12个模拟平台,探讨了多模态对齐和可扩展预训练等关键挑战。

Comments submitted to annual review in control

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13876 2026-01-21 cs.CL 88%

Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education

为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估

Unggi Lee, Jahyun Jeong, Sunyoung Shin, Haeun Park, Jeongsu Moon, Youngchang Song, Jaechang Shim, JaeHwan Lee, Yunju Noh, Seungwon Choi, Ahhyun Kim, TaeHyeon Kim, Kyungtae Joo, Taeyeong Kim, Gyeonggeon Lee

机构 * Chosun University(全州大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract)

AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18239 2026-01-21 cs.IR cs.LG 74%

LIME: Link-based user-item Interaction Modeling with decoupled xor attention for Efficient test time scaling

基于解耦异或注意力的链接式用户-物品交互建模

Yunjiang Jiang, Ayush Agarwal, Yang Liu, Bi Xue

机构 * Meta

专题命中 VLA模型 :action model(title);分类 cs.LG

AI总结 LIME通过解耦异或注意力机制,实现了高效推荐系统中计算复杂度的降低,提升了推理速度和用户参与度。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10962 2026-01-21 hep-ex hep-ph 71%

Benchmarking neutrino interaction models via a comparative analysis of kinematic imbalance measurements from the T2K, MicroBooNE and MINERvA experiments

通过T2K、MicroBooNE和MINERvA实验的动量不平衡测量比较分析来评估中微子相互作用模型

Wissal Filali, Laura Munteanu, Stephen Dolan

专题命中 VLA模型 :action model(title)

AI总结 通过比较T2K、MicroBooNE和MINERvA实验的动量不平衡测量,评估中微子相互作用模型的预测,并发现多核子相互作用中A标度的建模问题。

Comments 23 pages, 22 figures. Minor updates to the text to improve clarity. Added references

Journal ref Phys.Rev.D 111 (2025) 3, 032009

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05230 2026-01-21 cs.AI cs.CV 62%

Learning Latent Action World Models In The Wild

在真实世界中学习潜在动作世界模型

Quentin Garrido, Tushar Nagarajan, Basile Terver, Nicolas Ballas, Yann LeCun, Michael Rabbat

机构 * FAIR at Meta(Meta旗下的FAIR) Inria(法国国家信息与自动化研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出在真实世界视频中学习潜在动作世界模型,通过连续受限的潜在动作捕捉复杂动作,解决了环境噪声和缺乏共同具象的挑战,实现了与动作条件基线相似的规划任务性能。

Comments 37 pages, 25 figures; updated references and experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12637 2026-01-21 cs.LG cs.AI q-bio.QM 62%

Topology-Aware Multiscale Mixture of Experts for Efficient Molecular Property Prediction

基于拓扑的多尺度专家混合方法用于高效分子性质预测

Long D. Nguyen, Kelin Xia, Binh P. Nguyen

机构 * School of Mathematics and Statistics(数学与统计学学院) Victoria University of Wellington(威灵顿维多利亚大学) School of Physical and Mathematical Sciences(物理与数学科学学院) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于拓扑的多尺度专家混合方法,通过多尺度交互建模提升3D分子性质预测的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12397 2026-01-21 cs.RO 57%

Learning Diverse Skills for Behavior Models with Mixture of Experts

通过专家混合学习行为模型的多样化技能

Wangtian Shen, Jinming Ma, Mingliang Zhou, Ziyang Meng

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 Di-BM通过专家混合学习方法,提升机器人行为模型在多任务场景下的性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13459 2026-01-21 astro-ph.SR astro-ph.GA 50%

The Relationship between Accretion and Ionised Ejection among Young Stellar Objects in the Coronet Cluster

年轻恒星对象在Coronet星团中吸积与离子化喷射之间的关系

Arpan Ghosh, Roberto Galván-Madrid, Johanan Ramírez-Arellano, Carlos Carrasco-González, Gráinne Costigan, Suzanne Ramsay, Carlo Manara, Jan Forbrich, Hauyu Baobab Liu, Michihiro Takami

专题命中 VLA模型 :VLA(abstract)

AI总结 研究发现年轻恒星对象中吸积与离子化喷射存在次线性相关性,且喷流发射效率随演化增加,支持吸积与喷流的直接联系。

Comments 10 pages, 4 figures, 1 supplementary material containing 2 figures and 1 table. Accepted for publication in MNRAS Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12726 2026-01-21 cond-mat.supr-con cond-mat.str-el 50%

Unusual antiferromagnetic order and fluctuations in RbMn$_{6}$Bi$_{5}$

异常的反铁磁序和涨落 in RbMn$_{6}$Bi$_{5}$

Chao Mu, Long Chen, Jiabin Song, Wei Wu, Gang Wang, Jinguang Cheng, Zheng Li, Jianlin Luo

专题命中 VLA模型 :action model(abstract)

AI总结 RbMn$_{6}$Bi$_{5}$的反铁磁序和涨落揭示了磁序与超导的相互作用,支持局部磁矩有序与电荷重排。

Journal ref Science China Physics, Mechanics & Astronomy 69, 237411(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11672 2026-01-21 cs.SE cs.SY eess.SY 50%

From Everything-is-a-File to Files-Are-All-You-Need: How Unix Philosophy Informs the Design of Agentic AI Systems

从『万物皆文件』到『文件即一切』:Unix哲学如何影响代理AI系统的设计

Deepak Babu Piskala

专题命中 VLA模型 :action model(abstract)

AI总结 本文探讨了Unix哲学中的『万物皆文件』理念如何影响代理AI系统的设计,通过统一文件和代码抽象,提升系统维护性、可审计性和操作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 语言条件控制 1 篇

2408.01147 2026-01-21 cs.RO 70%

Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following

Astra:面向具身指令跟随的高效Transformer架构与对比动态学习

Yueen Ma, Dafeng Chi, Shiguang Wu, Yuecheng Liu, Yuzheng Zhuang, Irwin King

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 语言条件控制 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 Astra通过引入轨迹注意力和对比动态学习目标,提升了具身指令跟随任务中多模态序列处理的效率与准确性。

Comments Accepted to EMNLP 2025 (main). Published version: https://aclanthology.org/2025.emnlp-main.688/ Code available at: https://github.com/yueen-ma/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 2 篇

2601.12993 2026-01-21 cs.RO 70%

Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization

Being-H0.5:面向跨躯体泛化的以人为本的机器人学习规模化

Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond 团队)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Being-H0.5通过以人为本的学习范式和统一动作空间,实现了在不同机器人平台间的跨躯体泛化,结合混合流框架和流形保持门控,达到模拟和现实中的高性能表现。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18793 2026-01-21 cs.RO 70%

Genie Centurion: Accelerating Scalable Real-World Robot Training with Human Rewind-and-Refine Guidance

Genie Centurion:通过人类 rewind-and-refine 指导加速可扩展的现实世界机器人训练

Wenhao Wang, Jianheng Song, Chiming Liu, Jiayao Ma, Siyuan Feng, Jingyuan Wang, Yuxin Jiang, Kylin Chen, Sikang Zhan, Yi Wang, Tong Meng, Modi Shi, Xindong He, Guanghui Ren, Yang Yang, Maoqing Yao

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 Genie Centurion 通过人类 rewind-and-refine 指导提升现实世界机器人训练效率,实现高任务成功率和低成本数据收集

详情

展开后加载摘要…

URL PDF HTML 收藏