arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-01-06 至 2026-01-06 共收录 5 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2512.22615 2026-01-06 cs.CV cs.CL 92%

Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone

Dream-VL & Dream-VLA: 基于扩散语言模型的开放视觉语言和视觉语言-动作模型

Jiacheng Ye, Shansan Gong, Jiahui Gao, Junming Fan, Shuang Wu, Wei Bi, Haoli Bai, Lifeng Shang, Lingpeng Kong

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title,abstract);分类 cs.CV

AI总结 基于扩散语言模型构建的Dream-VL和Dream-VLA在视觉语言和视觉语言-动作任务中表现出色,实现了领先的性能。

Comments Add real-world experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO 88%

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01196 2026-01-06 cs.RO 57%

EduSim-LLM: An Educational Platform Integrating Large Language Models and Robotic Simulation for Beginners

EduSim-LLM: 一个整合大语言模型和机器人模拟的教育平台,用于初学者

Shenqi Lu, Liangwei Zhang

机构 * Hangzhou Dianzi University Information Engineering College(杭州电子科技大学信息工程学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 EduSim-LLM通过整合大语言模型与机器人模拟,实现自然语言到机器人行为的转换,提升初学者在人机交互和多机器人协作中的控制与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09744 2026-01-06 astro-ph.HE 50%

No Sign of a Magnetar Remnant Following the Kilonova-Producing Long GRB 211211A $\sim 1.7~$Years Later

在长持续GRB 211211A发生约1.7年后未发现磁星残骸的迹象

Genevieve Schroeder, Ben Margalit, Brian D. Metzger, Wen-fai Fong, Benjamin P. Gompertz, Kate D. Alexander, Edo Berger, Tanmoy Laskar, Gavin P. Lamb, Andrew Levan, Charles D. Kilpatrick, Jillian C. Rastinejad

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过观测GRB 211211A在1.7年后未发现磁星残骸的无线电信号,限制了残骸能量沉积到喷射物中的上限,并探讨了千新星余晖的可能抑制时间。

Comments 15 pages, 4 figures, Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23055 2026-01-06 cs.HC cs.SE 50%

Reimagining the Traditional Flight Computer: E6BJA as a Modern, Multi-Platform Tool for Flight Calculations and Training

重新构想传统飞行计算机:E6BJA作为现代多平台工具用于飞行计算和训练

Jamie J. Alnasir

专题命中 VLA模型 :action model(abstract)

AI总结 E6BJA是一款多平台飞行计算工具,通过增强建模能力和更准确的大气计算,提升飞行计划和训练的准确性与教育价值。

Comments Pre-print v2. 27 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏