arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-11 至 2026-02-11 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2602.10109 2026-02-11 cs.RO 88%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09657 2026-02-11 cs.RO 88%

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

AutoFly:面向野外无人机自主导航的视觉-语言-动作模型

Xiaolou Sun, Wufei Si, Wenhui Ni, Yuntian Li, Dongming Wu, Fei Xie, Runwei Guan, He-Yang Xu, Henghui Ding, Yuan Wu, Yutao Yue, Yongming Huang, Hui Xiong

机构 * Southeast University(东南大学) Purple Mountain Labs(紫金山实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。

Comments Acceped by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09722 2026-02-11 cs.RO 83%

Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization

重新思考视觉-语言-动作模型的扩展:对齐、混合与正则化

Ye Wang, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Haoqi Yuan, Chaoyi Xu, Haiweng Xu, Yicheng Feng, Mingyang Yu, Zhiyu Kang, Zongqing Lu, Qin Jin

机构 * Renmin University of China(中国人民大学) BeingBeyond Peking University(北京大学)

专题命中 VLA模型 :action model(title);vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本研究重新审视视觉-语言-动作模型的扩展问题,探讨了对齐、混合与正则化在机器人控制中的关键作用,挑战了传统假设并提供实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09553 2026-02-11 astro-ph.EP astro-ph.IM 71%

A Narrowband Technosignature Search Toward the Hycean Candidate K2-18b Using the VLA and MeerKAT

针对海洋候选行星K2-18b的窄带技术签名搜索:使用VLBA和MeerKAT

C. D. Tremblay, S. Chaudhary, Megan G. Li, Sofia Z. Sheikh, T. Myburgh, D. Czech, D. E. MacMahon, P. B. Demorest, R. A. Donnachie, A. P. V. Siemion, V. Gajjar, M. Lebofsky, K. Wandia, K. I. Perez., Nikku Madhusudhan

专题命中 VLA模型 :VLA(title)

AI总结 针对K2-18b的窄带技术签名搜索,利用VLBA和MeerKAT进行多时段观测,未发现信号,为海洋行星候选人的技术签名研究提供了首个干涉约束。

Comments 18 pages, Accepted by AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10093 2026-02-11 cs.RO 70%

UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking

UniVTAC:一种用于视觉-触觉操作数据生成、学习和评估的统一仿真平台

Baijun Chen, Weijie Wan, Tianxing Chen, Xianda Guo, Congsheng Xu, Yuanyang Qi, Haojie Zhang, Longyan Wu, Tianling Xu, Zixuan Li, Yizhe Wu, Rui Li, Xiaokang Yang, Ping Luo, Wei Sui, Yao Mu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) D-Robotics ViTai Robotics The University of Hong Kong(香港大学) Nanjing University(南京大学) Shenzhen University(深圳大学) Wuhan University(武汉大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 UniVTAC提出了一种统一的视觉-触觉数据生成平台,通过训练触觉中心的编码器和基准任务提升机器人操作的成功率。

Comments Website: https://univtac.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 70%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09765 2026-02-11 cs.RO 70%

NavDreamer: Video Models as Zero-Shot 3D Navigators

NavDreamer: 视频模型作为零样本三维导航器

Xijie Huang, Weiqi Gai, Tianyue Wu, Congyu Wang, Zhiyang Liu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。

Comments Work in the progress. 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12729 2026-02-11 astro-ph.HE 50%

The Multi-Wavelength Context of Delayed Radio Emission in TDEs: Evidence for Accretion-Driven Outflows

TDEs中延迟无线电发射的多波长背景:证据表明吸积驱动的喷流

Kate D. Alexander, Raffaella Margutti, Sebastian Gomez, Michael Stroh, Ryan Chornock, Tanmoy Laskar, Y. Cendes, Edo Berger, Tarraneh Eftekhari, Noah Franz, Aprajita Hajela, B. D. Metzger, Giacomo Terreran, Michael Bietenholz, Collin Christy, Fabio de Colle, S. Komossa, Matt Nicholl, Enrico Ramirez-Ruiz, Richard Saxton, Genevieve Schroeder, Peter K. G. Williams, William Wu

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过多波长观测揭示TDEs中延迟无线电发射可能由吸积驱动喷流引起,并探讨其对SMBH吸积流状态变化及喷流普遍性的影响。

Comments 35 pages, 5 figures, 8 tables. Accepted to ApJ; text updated to match accepted version. All data used in this analysis will be made publicly available at https://otter.idies.jhu.edu/ upon article publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01632 2026-02-11 nucl-ex 50%

Incomplete fusion in $^{193}$Ir($^{12}$C, x)$^{205}$Bi reaction at $E_{lab}$ $\approx$ 5-7 AMeV

$^{193}$Ir($^{12}$C, x)$^{205}$Bi反应在$E_{lab}$≈5-7 AMeV时的不完全融合

Amanjot, Priyanka, Subham Kumar, Rupinderjeet Kaur, Malika Kaushik, Manoj Kumar Sharma, Yashraj Jangid, Pushpendra P. Singh

专题命中 VLA模型 :action model(abstract)

AI总结 研究了$^{193}$Ir($^{12}$C, x)$^{205}$Bi反应在5-7 AMeV能量下的不完全融合现象,发现其分数随能量和入射通道参数增加,且弹体结构对融合过程有关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏