arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-01-06 至 2026-01-06 共收录 6 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2512.22615 2026-01-06 cs.CV cs.CL 92%

Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

Dream-VL & Dream-VLA: 基于扩散语言模型的开放视觉语言和视觉语言-动作模型

Jiacheng Ye, Shansan Gong, Jiahui Gao, Junming Fan, Shuang Wu, Wei Bi, Haoli Bai, Lifeng Shang, Lingpeng Kong

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.CV

AI总结 基于扩散语言模型构建的Dream-VL和Dream-VLA在视觉语言和视觉语言-动作任务中表现出色,实现了领先的性能。

Comments Add real-world experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO 88%

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01196 2026-01-06 cs.RO 57%

EduSim-LLM: An Educational Platform Integrating Large Language Models and Robotic Simulation for Beginners

EduSim-LLM: 一个整合大语言模型和机器人模拟的教育平台,用于初学者

Shenqi Lu, Liangwei Zhang

机构 * Hangzhou Dianzi University Information Engineering College(杭州电子科技大学信息工程学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 EduSim-LLM通过整合大语言模型与机器人模拟,实现自然语言到机器人行为的转换,提升初学者在人机交互和多机器人协作中的控制与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09744 2026-01-06 astro-ph.HE 50%

No Sign of a Magnetar Remnant Following the Kilonova-Producing Long GRB 211211A $\sim 1.7~$Years Later

在长持续GRB 211211A发生约1.7年后未发现磁星残骸的迹象

Genevieve Schroeder, Ben Margalit, Brian D. Metzger, Wen-fai Fong, Benjamin P. Gompertz, Kate D. Alexander, Edo Berger, Tanmoy Laskar, Gavin P. Lamb, Andrew Levan, Charles D. Kilpatrick, Jillian C. Rastinejad

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过观测GRB 211211A在1.7年后未发现磁星残骸的无线电信号,限制了残骸能量沉积到喷射物中的上限,并探讨了千新星余晖的可能抑制时间。

Comments 15 pages, 4 figures, Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23055 2026-01-06 cs.HC cs.SE 50%

Reimagining the Traditional Flight Computer: E6BJA as a Modern, Multi-Platform Tool for Flight Calculations and Training

重新构想传统飞行计算机:E6BJA作为现代多平台工具用于飞行计算和训练

Jamie J. Alnasir

专题命中 VLA模型 :action model(abstract)

AI总结 E6BJA是一款多平台飞行计算工具,通过增强建模能力和更准确的大气计算,提升飞行计划和训练的准确性与教育价值。

Comments Pre-print v2. 27 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 部署与泛化 1 篇

2601.01618 2026-01-06 cs.RO 70%

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

动作草图生成器:通过视觉草图实现从推理到动作的长周期机器人操作

Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Qiongyu Zhang, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 动作草图生成器通过视觉草图实现从推理到动作的长周期机器人操作,结合视觉-语言-动作框架提升任务执行的鲁棒性和可解释性。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏