arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-10 至 2025-12-10 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2512.08529 2025-12-10 cs.CV 79%

MVP: Multiple View Prediction Improves GUI Grounding

MVP: 多视角预测改进 GUI 定位

Yunzhu Zhang, Zeyu Pan, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV

AI总结 MVP 通过多视角预测方法提升 GUI 定位的稳定性与准确性,显著提高多个模型的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 73%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO 67%

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏