arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-12 至 2026-02-12 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2602.09849 2026-02-12 cs.RO 83%

BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation

BagelVLA: 通过交错视觉-语言-动作生成增强长时程操作

Yucheng Hu, Jianke Zhang, Yuanfei Luo, Yanjiang Guo, Xiaoyu Chen, Xinshu Sun, Kun Feng, Qingzhou Lu, Sheng Chen, Yangang Zhang, Wei Li, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 BagelVLA通过整合语言规划、视觉预测和动作生成,提升复杂长时程操作任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10377 2026-02-12 cs.LG cs.CL 70%

Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs

通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律

Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

机构 * AI Lab, The Yangtze River Delta Institution of Automation, Chinese Academy of Sciences(人工智能实验室,长江三角洲自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University College London(伦敦大学学院) Institution of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) The University of Edinburgh(爱丁堡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG

AI总结 本文提出通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律,通过训练170个模型建立架构与训练损失的缩放关系,实现准确度与延迟的直接对应,降低架构选择时间并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 57%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10485 2026-02-12 cs.AI 57%

Abstraction Generation for Generalized Planning with Pretrained Large Language Models

基于预训练大语言模型的通用规划抽象生成

Zhenhe Cui, Huaxiang Xia, Hangjun Shen, Kailun Luo, Yong He, Wei Liang

机构 * Hunan University of Science and Technology(湖南科技大学) Dongguan University of Technology(东莞理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出利用预训练大语言模型生成通用规划的抽象,并通过自动化调试修正抽象,以提升规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15011 2026-02-12 cond-mat.mes-hall physics.app-ph physics.optics 50%

Shaping non-reciprocal caustic spin-wave beams

塑造非互易的光束旋波束

Dinesh Wagle, Daniel Stoeffler, Loic Temdie, Mojtaba Taghipour Kaffash, Vincent Castel, H. Majjad, R. Bernard, Yves Henry, Matthieu Bailleul, M. Benjamin Jungfleisch, Vincent Vlaminck

专题命中 VLA模型 :action model(abstract)

AI总结 利用磁性系统的非互易性,在YIG薄膜中塑造非互易的caustic-like spin wave beams,并通过实验验证其传播特性,为波基计算和磁性器件发展提供新方法。

Journal ref Phys. Rev. B 113 (2026) L060405

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2602.06620 2026-02-12 cs.RO cs.SY eess.SY 70%

Force Generative Imitation Learning: Bridging Position Trajectory and Force Commands through Control Technique

力生成模仿学习:通过控制技术弥合位置轨迹与力命令之间的鸿沟

Hiroshi Sato, Sho Sakaino, Toshiaki Tsuji

机构 * Graduate School of Systems and Information Engineering, University of Tsukuba(东京大学系统与信息工程研究生院) Graduate School of Science and Engineering, Saitama University(埼玉大学科学与工程研究生院) Department of Intelligent Interaction Technologies, Institute of Systems and Information Engineering, University of Tsukuba(东京大学系统与信息工程研究所智能交互技术系)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出一种力生成模型,通过无记忆反馈控制机制提升机器人在未见过位置轨迹下的力命令生成能力,以改善现实任务中的泛化性能。

Comments Accepted for IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2602.10980 2026-02-12 cs.RO 79%

RADAR: Benchmarking Vision-Language-Action Generalization via Real-World Dynamics, Spatial-Physical Intelligence, and Autonomous Evaluation

RADAR:通过现实动态、空间-物理智能和自主评估进行视觉-语言-动作泛化基准测试

Yuhao Chen, Zhihao Zhan, Xiaoxin Lin, Zijian Song, Hao Liu, Qinhan Lyu, Yubo Zu, Xiao Chen, Zhiyuan Liu, Tao Pu, Tianshui Chen, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 部署与泛化 :vision-language-action(title);VLA(abstract);分类 cs.RO

AI总结 RADAR通过现实动态、空间-物理智能和自主评估,系统评估VLA模型在现实环境中的泛化能力,揭示其在物理动态和空间推理上的脆弱性。

Comments 12 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏