arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-25 至 2026-02-25 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2602.20566 2026-02-25 cs.RO cs.CV 88%

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :vision language action(title);action model(title);vision-language-action(abstract);VLA(abstract)

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO 85%

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20715 2026-02-25 cs.RO 83%

IG-RFT: An Interaction-Guided RL Framework for VLA Models in Long-Horizon Robotic Manipulation

IG-RFT: 一种基于交互引导的强化学习框架用于长时域机器人操作中的VLA模型

Zhian Su, Weijie Kong, Haonan Dong, Huixu Dong

机构 * Grasp Laboratory, Mechanical Engineering Department, Zhejiang University(浙江大学机械工程学院抓取实验室) Torch Kernel Co., Ltd.(火炬核科技有限公司)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 IG-RFT通过交互引导强化学习框架提升VLA模型在长时域机器人任务中的性能,实现85%的成功率,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20577 2026-02-25 cs.CV 79%

Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion

高效的端到端自动驾驶:通过掩码视觉-语言-动作扩散

Jiaru Zhang, Manav Gagvani, Can Cui, Juntong Peng, Ruqi Zhang, Ziran Wang

机构 * Institute for Physical Artificial Intelligence (IPAI), Purdue University(物理人工智能研究所(IPAI)、普渡大学) College of Engineering, Purdue University(工程学院、普渡大学) Department of Computer Science, Purdue University(计算机科学系、普渡大学)

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.CV

AI总结 MVLAD-AD通过掩码视觉-语言-动作扩散模型,提升自动驾驶的效率与规划精度,实现高效且可解释的端到端自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20230 2026-02-25 astro-ph.HE 78%

High Resolution VLA Radio Observations of the Boomerang Pulsar Wind Nebula

高分辨率VLBA射电观测的Boomerang脉冲星风云

Paul C. W. Lai, Chi-Yung Ng, Shumeng Zhang

专题命中 VLA模型 :VLA(title,abstract)

AI总结 利用VLBA高分辨率观测,发现Boomerang脉冲星风云中新的小尺度结构,并通过偏振测量推断磁场强度。

Comments 11 pages, 6 figures, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21161 2026-02-25 cs.RO 70%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20905 2026-02-25 quant-ph 50%

Enhancing low-temperature quantum thermometry and magnetometry via quadratic interactions in optomechanical-like systems

通过光学机械类系统中的二次相互作用增强低温量子温度计和磁计

Asghar Ullah, Özgür E. Müstecaplıoğlu

专题命中 VLA模型 :action model(abstract)

AI总结 该研究通过光学机械类系统中的二次相互作用,提升低温下量子温度计和磁计的灵敏度,发现中等耦合和强耦合条件下产生压缩和非高斯特性,从而在弱场和低温区域实现灵敏度的显著增强。

Comments 14 pages, 9 figures; comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏