arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-18 至 2025-09-18 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2408.11824 2025-09-18 cs.HC cs.AI 70%

AppAgent v2: Advanced Agent for Flexible Mobile Interactions

Yanda Li, Chi Zhang, Wenjia Jiang, Wanqi Yang, Bin Fu, Pei Cheng, Xin Chen, Ling Chen, Yunchao Wei

机构 * University of Technology Sydney(悉尼技术大学) Tencent(腾讯) Beijing Jiaotong University(北京交通大学) Westlake University(西湖大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11417 2025-09-18 cs.RO cs.AI cs.CV cs.LG 67%

Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations

Shresth Grover, Akshay Gopalkrishnan, Bo Ai, Henrik I. Christensen, Hao Su, Xuanlin Li

机构 * UC San Diego(圣迭戈大学) Hillbot

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project Page: https://gen-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12129 2025-09-18 cs.RO 50%

Embodied Navigation Foundation Model

Jiazhao Zhang, Anqi Li, Yunpeng Qi, Minghan Li, Jiahang Liu, Shaoan Wang, Haoran Liu, Gengze Zhou, Yuze Wu, Xingxing Li, Yuxin Fan, Wenjun Li, Zhibo Chen, Fei Gao, Qi Wu, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot USTC(中国科学技术大学) BAAI(百度人工智能研究院) University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Differential Robotics Project(差分机器人项目)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments Project Page: https://pku-epic.github.io/NavFoM-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏