arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-18 至 2026-02-18 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2602.15724 2026-02-18 cs.CV cs.AI 62%

Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation

学习高效视觉-语言导航中的可导航候选检索

Shutian Gu, Chengkai Huang, Ruoyu Wang, Lina Yao

机构 * University of New South Wales, Sydney, Australia(新南威尔士大学) Macquarie University, Sydney, Australia(麦考瑞大学) Data61, CSIRO, Sydney, Australia(Data61, CSIRO) The School of Computer Science(计算机科学学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出检索增强框架,通过指令级示例检索和候选剪枝提升LLM在视觉-语言导航中的效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15397 2026-02-18 cs.RO cs.AI 57%

ActionCodec: What Makes for Good Action Tokenizers

ActionCodec:什么使好的动作分词器成为可能

Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出ActionCodec,通过信息论原则提升动作分词性能,实现无需机器人预训练的VLA模型新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15400 2026-02-18 cs.RO 50%

One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation

一个引导所有代理:通过显式世界表示增强多模态大语言模型用于视觉-语言导航

Zerui Li, Hongpei Zheng, Fangguo Zhao, Aidan Chan, Jian Zhou, Sihao Lin, Shijie Li, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 通过显式世界表示增强多模态大语言模型,实现视觉-语言导航的解耦框架,提升导航性能与现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏