arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-21 至 2026-01-21 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2601.12742 2026-01-21 cs.RO cs.AI 83%

AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation

AirHunt: 通过融合视觉语言模型语义与连续规划实现高效空中物体导航

Xuecheng Chen, Zongzhuo Liu, Jianfa Ma, Bang Du, Tiantian Zhang, Xueqian Wang, Boyu Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Physics, Southern University of Science and Technology(南方科技大学物理系)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 AirHunt通过融合视觉语言模型语义与连续规划,实现高效空中物体导航,提升开放集物体定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12479 2026-01-21 cs.RO 67%

Language-Based Swarm Perception: Decentralized Person Re-Identification via Natural Language Descriptions

基于语言的群体感知:通过自然语言描述实现去中心化的人员重识别

Miquel Kegeleirs, Lorenzo Garattoni, Gianpiero Francesca, Mauro Birattari

机构 * IRIDIA, Université libre de Bruxelles(IRIDIA,布鲁塞尔自由大学) Toyota Motor Europe(丰田欧洲 motors)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种基于自然语言的去中心化人员重识别方法,通过视觉-语言模型生成文本描述,实现群体协作识别与可解释性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14091 2026-01-21 cs.RO cs.AI 57%

Zero-shot adaptable task planning for autonomous construction robots: a comparative study of lightweight single and multi-AI agent systems

零样本适应性任务规划用于自主建造机器人:轻量级单 agent 和多 agent 系统的比较研究

Hossein Naderi, Alireza Shojaei, Lifu Huang, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 本研究通过比较轻量级单 agent 和多 agent 系统,探索了零样本适应性任务规划在自主建造机器人中的应用,展示了四 agent 团队在效率和成本上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11631 2026-01-21 cs.CV 57%

Compress to Focus: Efficient Coordinate Compression for Policy Optimization in Multi-Turn GUI Agents

压缩以聚焦:面向多轮GUI代理的高效坐标压缩政策优化

Yurun Song, Jiong Yin, Rongjunchen Zhang, Ian G. Harris

机构 * HiThink Research(HiThink研究院) University of California, Irvine(加州大学尔湾分校) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出CCPO框架,通过坐标感知空间压缩和基于距离的优势函数,实现多轮GUI代理的高效政策优化,达到SOTA性能并显著提升压缩效率与训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏