arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-05 至 2026-02-05 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2512.22208 2026-02-05 cs.CL cs.CV cs.LG 81%

Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA

开源多模态Moxin模型:Moxin-VLM和Moxin-VLA

Pu Zhao, Arash Akbari, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei(未来通信) AIBAO LLC

专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03973 2026-02-05 cs.RO cs.CV 79%

VLS: Steering Pretrained Robot Policies via Vision-Language Models

VLS:通过视觉-语言模型引导预训练的机器人策略

Shuo Liu, Ishneet Sukhvinder Singh, Yiqing Xu, Jiafei Duan, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 VLS通过视觉-语言模型在推理时引导预训练机器人策略,实现无需训练的适应,提升在不同环境下的表现。

Comments 11 Pages, Project page: https://vision-language-steering.github.io/webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04184 2026-02-05 cs.CV cs.AI cs.LG cs.RO 75%

Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models

基于视觉-语言-动作模型的自动驾驶场景响应式人机协同运动规划的自然语言指令

Angel Martinez-Sanchez, Parthib Roy, Ross Greer

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 GUI与屏幕智能体 :VLM(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究利用视觉-语言-动作模型,通过指令条件规划提升自动驾驶的鲁棒性和轨迹对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏