arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-29 至 2025-12-29 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 4 篇

2512.22009 2025-12-29 cs.CV 77%

iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

iSHIFT: 轻量级慢-快 GUI 代理与自适应感知

Sarthak Mehrotra, Sairam V C Rebbapragada, Mani Hemanth Reddy Bonthu, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买) Indian Institute of Technology, Hyderabad(印度理工学院,海得拉巴)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 iSHIFT是一种轻量级GUI代理,通过慢-快混合推理和灵活标记实现高效与精确的视觉交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18033 2025-12-29 cs.RO cs.AI 74%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(title);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22047 2025-12-29 cs.CV 57%

MAI-UI Technical Report: Real-World Centric Foundation GUI Agents

MAI-UI 技术报告:以现实为中心的基础 GUI 代理

Hanzhang Zhou, Xu Zhang, Panrong Tong, Jianan Zhang, Liangyu Chen, Quyu Kong, Chenglin Cai, Chen Liu, Yue Wang, Jingren Zhou, Steven Hoi

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 MAI-UI 提出了一种基于现实的 GUI 代理框架,通过自演化数据管道、设备-云协作系统和在线 RL 框架,实现了 GUI 地基和移动导航的突破性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21722 2025-12-29 cs.RO 50%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏