arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-12 至 2026-02-12 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2602.09849 2026-02-12 cs.RO 83%

BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation

BagelVLA: 通过交错视觉-语言-动作生成增强长时程操作

Yucheng Hu, Jianke Zhang, Yuanfei Luo, Yanjiang Guo, Xiaoyu Chen, Xinshu Sun, Kun Feng, Qingzhou Lu, Sheng Chen, Yangang Zhang, Wei Li, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 BagelVLA通过整合语言规划、视觉预测和动作生成,提升复杂长时程操作任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10377 2026-02-12 cs.LG cs.CL 70%

Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs

通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律

Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

机构 * AI Lab, The Yangtze River Delta Institution of Automation, Chinese Academy of Sciences(人工智能实验室,长江三角洲自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University College London(伦敦大学学院) Institution of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) The University of Edinburgh(爱丁堡大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG

AI总结 本文提出通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律,通过训练170个模型建立架构与训练损失的缩放关系,实现准确度与延迟的直接对应,降低架构选择时间并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 57%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10485 2026-02-12 cs.AI 57%

Abstraction Generation for Generalized Planning with Pretrained Large Language Models

基于预训练大语言模型的通用规划抽象生成

Zhenhe Cui, Huaxiang Xia, Hangjun Shen, Kailun Luo, Yong He, Wei Liang

机构 * Hunan University of Science and Technology(湖南科技大学) Dongguan University of Technology(东莞理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出利用预训练大语言模型生成通用规划的抽象,并通过自动化调试修正抽象,以提升规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15011 2026-02-12 cond-mat.mes-hall physics.app-ph physics.optics 50%

Shaping non-reciprocal caustic spin-wave beams

塑造非互易的光束旋波束

Dinesh Wagle, Daniel Stoeffler, Loic Temdie, Mojtaba Taghipour Kaffash, Vincent Castel, H. Majjad, R. Bernard, Yves Henry, Matthieu Bailleul, M. Benjamin Jungfleisch, Vincent Vlaminck

专题命中 VLA模型 :action model(abstract)

AI总结 利用磁性系统的非互易性,在YIG薄膜中塑造非互易的caustic-like spin wave beams,并通过实验验证其传播特性,为波基计算和磁性器件发展提供新方法。

Journal ref Phys. Rev. B 113 (2026) L060405

详情

展开后加载摘要…

URL PDF HTML 收藏