arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-19 至 2026-02-19 共收录 8 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 87%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 84%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15882 2026-02-19 cs.RO cs.AI 81%

FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution

FUTURE-VLA:在实时执行下统一轨迹预测

Jingjing Fan, Yushan Liu, Shoujie Li, Botao Ren, Siyuan Li, Xiao-Ping Zhang, Wenbo Ding, Zhidong Deng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08822 2026-02-19 cs.RO cs.AI 79%

FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency

FreqPolicy: 通过频率一致性实现高效的基于流的视觉-运动策略

Yifei Su, Ning Liu, Dong Chen, Zhen Zhao, Kun Wu, Meng Li, Zhiyuan Xu, Zhengping Che, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) NLPR, MAIS, Institute of Automation of Chinese Academy of Sciences(神经语言处理实验室、人工智能研究所、中国科学院自动化研究所)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 FreqPolicy通过频率一致性约束提升基于流的视觉-运动策略的效率与质量,实现高效、高质量的动作生成。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16710 2026-02-19 cs.RO 70%

EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data

EgoScale:利用多样化的视点人类数据进行规模化灵巧操作

Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, Trevor Darrell, Furong Huang, Yuke Zhu, Danfei Xu, Linxi Fan

机构 * NVIDIA University of California, Berkeley(加州大学伯克利分校) University of Maryland(马里兰大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO

AI总结 EgoScale通过大规模视点人类数据训练视觉语言动作模型,实现高效的灵巧操作转移,提升机器人任务成功率54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15836 2026-02-19 cs.RO cs.AI 62%

EdgeNav-QE: QLoRA Quantization and Dynamic Early Exit for LAM-based Navigation on Edge Devices

EdgeNav-QE: QLoRA量化与动态提前退出用于边缘设备上的基于LAM的导航

Mengyun Liu, Shanshan Huang, Jianan Jiang

机构 * Guangzhou University(广州大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

AI总结 EdgeNav-QE通过QLoRA量化和动态提前退出机制优化LAMs在边缘设备上的实时导航性能,显著降低延迟和内存占用,同时保持高导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16109 2026-02-19 cs.CR cs.AI cs.CE 57%

Federated Graph AGI for Cross-Border Insider Threat Intelligence in Government Financial Schemes

联邦图式AGI用于政府金融方案跨境内部威胁情报

Srikumar Nayak, James Walmesley

机构 * Incedo Inc.(Incedo公司) Indian Institute of Technology(印度理工学院) University of Kent(肯特大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 FedGraph-AGI通过整合AGI推理与联邦图学习,实现了隐私保护下的跨境内部威胁检测,准确率高达92.3%。

Comments 35 Pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16676 2026-02-19 astro-ph.SR 50%

Orbital Motions of Binaries in Orion South

Orion南方向双星的轨道运动

Luis A. Zapata, Luis F. Rodríguez

专题命中 VLA模型 :VLA(abstract)

AI总结 通过高分辨率观测,研究了Orion南方向三个紧密双星系统的轨道运动,发现其天空平面内分离度变化,估计总质量在1-2个太阳质量范围内,并确定尘埃-恒星质量比与Class 0原恒星一致。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏