arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1586 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1586 篇

2507.19478 2025-07-28 cs.CV cs.CL 57%

MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents

Xuehui Wang, Zhenyu Wu, JingJing Xie, Zichen Ding, Bowen Yang, Zehao Li, Zhaoyang Liu, Qingyun Li, Xuan Dong, Zhe Chen, Weiyun Wang, Xiangyu Zhao, Jixuan Chen, Haodong Duan, Tianbao Xie, Chenyu Yang, Shiqian Su, Yue Yu, Yuan Huang, Yiqian Liu, Xiao Zhang, Yanting Zhang, Xiangyu Yue, Weijie Su, Xizhou Zhu, Wei Shen, Jifeng Dai, Wenhai Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Xiamen University(厦门大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Nanjing University(南京大学) Fudan University(复旦大学) University of Hong Kong(香港大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15174 2025-07-22 cs.LG 57%

Joint-Local Grounded Action Transformation for Sim-to-Real Transfer in Multi-Agent Traffic Control

Justin Turnau, Longchao Da, Khoa Vo, Ferdous Al Rafi, Shreyas Bachiraju, Tiejin Chen, Hua Wei

机构 * ASU(亚利桑那州立大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.LG

Comments This paper was accepted to RLC/RLJ 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09617 2025-07-15 cs.AI cs.RO 57%

Bridging Bots: from Perception to Action via Multimodal-LMs and Knowledge Graphs

Margherita Martorana, Francesca Urgese, Mark Adamik, Ilaria Tiddi

机构 * Vrije Universiteit Amsterdam(范·艾克大学阿姆斯特丹)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07663 2025-07-11 cs.CV 57%

MolCLIP: A Molecular-Auxiliary CLIP Framework for Identifying Drug Mechanism of Action Based on Time-Lapsed Mitochondrial Images

Fengqian Pang, Chunyue Lei, Hongfei Zhao, Chenghao Liu, Zhiqiang Xing, Huafeng Wang, Chuyang Ye

专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02747 2025-07-04 cs.CV cs.RO 57%

DexVLG: Dexterous Vision-Language-Grasp Model at Scale

Jiawei He, Danshi Li, Xinqiang Yu, Zekun Qi, Wenyao Zhang, Jiayi Chen, Zhaoxiang Zhang, Zhizheng Zhang, Li Yi, He Wang

机构 * Institution1(机构1) Institution2(机构2)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11818 2025-07-03 cs.RO cs.AI 57%

Embodied Instruction Following in Unknown Environments

Zhenyu Wu, Ziwei Wang, Xiuwei Xu, Hang Yin, Yinan Liang, Angyuan Ma, Jiwen Lu, Haibin Yan

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University(清华大学自动化学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments Project Page: https://gary3410.github.io/eif_unknown/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07217 2025-07-01 cs.AI 57%

BIMgent: Towards Autonomous Building Modeling via Computer-use Agents

Zihan Deng, Changyu Du, Stavros Nousias, André Borrmann

机构 * Chair of Computing in Civil and Building Engineering, Technical University of Munich, Germany(土木与建筑工程计算系,慕尼黑技术大学) TUM Georg Nemetschek Institute, Munich, Germany(慕尼黑技术大学Georg Nemetschek研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments ICML 2025 Workshop on Computer Use Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22056 2025-06-30 cs.AI 57%

Universal Retrieval for Multimodal Trajectory Modeling

Xuan Zhang, Ziyan Jiang, Rui Meng, Yifei Leng, Zhenbang Xiao, Zora Zhiruo Wang, Yanyi Shang, Dehan Kong

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Comments 18 pages, 3 figures, accepted by Workshop on Computer-use Agents @ ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17221 2025-06-26 cs.CV 57%

VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning

Zhangyang Qi, Zhixiong Zhang, Yizhou Yu, Jiaqi Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments project page: vlnr1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19884 2025-06-26 cs.OS cs.AI cs.PF cs.SE 57%

MNN-AECS: Energy Optimization for LLM Decoding on Mobile Devices via Adaptive Core Selection

Zhengxiang Huang, Chaoyue Niu, Zhaode Wang, Jiarui Xue, Hanming Zhang, Yugang Wang, Zewei Xin, Xiaotang Jiang, Chengfei Lv, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19850 2025-06-25 cs.CV cs.RO 57%

Unified Vision-Language-Action Model

Yuqi Wang, Xinghang Li, Wenxuan Wang, Junbo Zhang, Yingyan Li, Yuntao Chen, Xinlong Wang, Zhaoxiang Zhang

机构 * CASIA(中国科学院自动化研究所) BAAI(阿里巴巴人工智能研究院) THU(清华大学) HKISI(香港理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17746 2025-06-24 cs.CV 57%

PhysID: Physics-based Interactive Dynamics from a Single-view Image

Sourabh Vasant Gothe, Ayon Chattopadhyay, Gunturi Venkata Sai Phani Kiran, Pratik, Vibhav Agarwal, Jayesh Rajkumar Vachhani, Sourav Ghosh, Parameswaranath VM, Barath Raj KR

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Published in 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Project page: https://physid.github.io/

Journal ref 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Hyderabad, India, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04217 2025-06-24 cs.RO cs.AI 57%

OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis

Junting Chen, Haotian Liang, Lingxiao Du, Weiyun Wang, Mengkang Hu, Yao Mu, Wenhai Wang, Jifeng Dai, Ping Luo, Wenqi Shao, Lin Shao

机构 * Shanghai AI Laboratory(上海人工智能实验室) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Shanghai Jiaotong University(上海交通大学) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

Comments 9 pages of main content, 19 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10387 2025-06-13 cs.AI 57%

Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills

Yuquan Xie, Zaijing Li, Rui Shao, Gongwei Chen, Kaiwen Zhou, Yinchuan Li, Dongmei Jiang, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

Comments 20 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20279 2025-06-10 cs.CL cs.AI cs.CR 57%

sudo rm -rf agentic_security

Sejin Lee, Jian Kim, Haon Park, Ashkan Yousefpour, Sangyoon Yu, Min Song

机构 * Aim Intelligence Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

Comments Accepted ACL 2025 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06630 2025-06-10 cs.RO cs.AI 57%

Active Test-time Vision-Language Navigation

Heeju Ko, Sungjune Kim, Gyeongrok Oh, Jeongyoon Yoon, Honglak Lee, Sujin Jang, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) University of Michigan(密歇根大学) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Korea Advanced Institute of Science & Technology(韩国先进科学技术研究所)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02327 2025-06-04 cs.CV 57%

Medical World Model: Generative Simulation of Tumor Evolution for Treatment Planning

Yijun Yang, Zhao-Yang Wang, Qiuping Liu, Shuwen Sun, Kang Wang, Rama Chellappa, Zongwei Zhou, Alan Yuille, Lei Zhu, Yu-Dong Zhang, Jieneng Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Johns Hopkins University(约翰霍普金斯大学) The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) University of California, San Francisco(加州大学旧金山分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19901 2025-06-04 cs.CV 57%

Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM

Peng Liu, Xiaoming Ren, Fengkai Liu, Qingsong Xie, Quanlong Zheng, Yanhao Zhang, Haonan Lu, Yujiu Yang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01844 2025-06-03 cs.LG cs.RO 57%

SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics

Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, Simon Alibert, Matthieu Cord, Thomas Wolf, Remi Cadene

机构 * Hugging Face Sorbonne University(索邦大学) École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

Comments 24 pages. Code and assets: https://github.com/huggingface/lerobot

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09306 2025-06-03 cs.CV 57%

Keypoint-Integrated Instruction-Following Data Generation for Enhanced Human Pose and Action Understanding in Multimodal Models

Dewen Zhang, Wangpeng An, Hayaru Shouno

机构 * Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications(信息学院、信息与工程研究生院、电通通信大学)

专题命中 GUI与屏幕智能体 :LLaVA(abstract);分类 cs.CV

Comments Accepted at the International Conference on Advanced Concepts for Intelligent Vision Systems (ACIVS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01014 2025-06-02 cs.CV 57%

AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction

Junhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hong Kong(香港城市大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Project released at: https://howe125.github.io/AnimeGamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23757 2025-05-30 cs.CV 57%

Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models

Haohan Chi, Huan-ang Gao, Ziming Liu, Jianing Liu, Chenyu Liu, Jinwei Li, Kaisen Yang, Yangcheng Yu, Zeda Wang, Wenyi Li, Leichen Wang, Xingtao Hu, Hao Sun, Hang Zhao, Hao Zhao

机构 * AIR, Tsinghua University(清华大學人工智能研究院) Bosch Research(博世研究) IIIS, Tsinghua University(清华大學人工智能研究院)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

Comments Project page: https://github.com/ahydchh/Impromptu-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04999 2025-05-30 cs.RO cs.LG 57%

DynaMem: Online Dynamic Spatio-Semantic Memory for Open World Mobile Manipulation

Peiqi Liu, Zhanqiu Guo, Mohit Warke, Soumith Chintala, Chris Paxton, Nur Muhammad Mahi Shafiullah, Lerrel Pinto

机构 * New York University(纽约大学) Meta Inc.(Meta公司) Hello Robot Inc.(Hello Robot公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

Comments Website: https://dynamem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18719 2025-05-27 cs.RO cs.AI 57%

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning

Guanxing Lu, Wenkai Guo, Chubin Zhang, Yuheng Zhou, Haonan Jiang, Zifeng Gao, Yansong Tang, Ziwei Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13825 2025-05-27 cs.AI cs.CL 57%

AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents

Ke Yang, Yao Liu, Sapana Chaudhary, Rasool Fakoor, Pratik Chaudhari, George Karypis, Huzefa Rangwala

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03644 2025-05-23 cs.CV 57%

DongbaMIE: A Multimodal Information Extraction Dataset for Evaluating Semantic Understanding of Dongba Pictograms

Xiaojun Bi, Shuo Li, Junyao Xing, Ziyue Wang, Fuwen Luo, Weizheng Qiao, Lu Han, Ziwei Sun, Peng Li, Yang Liu

机构 * College of Information and Engineering, Minzu University of China(中国民族大学信息与工程学院) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(教育部民族语言智能分析与安全治理重点实验室) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Our dataset can be obtained from: https://github.com/thinklis/DongbaMIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02982 2025-05-21 cs.AI 57%

MobileA3gent: Training Mobile GUI Agents Using Decentralized Self-Sourced Data from Diverse Users

Wenhao Wang, Mengying Yuan, Zijie Yu, Guangyi Liu, Rui Ye, Tian Jin, Siheng Chen, Yanfeng Wang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Multi-Agent Governance & Intelligence Crew (MAGIC)(多智能体治理与智能团队(MAGIC))

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17140 2025-05-20 cs.AI 57%

AXIS: Efficient Human-Agent-Computer Interaction with API-First LLM-Based Agents

Junting Lu, Zhiyang Zhang, Fangkai Yang, Jue Zhang, Lu Wang, Chao Du, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft(微软)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15830 2025-05-20 cs.RO cs.AI 57%

SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model

Delin Qu, Haoming Song, Qizhi Chen, Yuanqi Yao, Xinyi Ye, Yan Ding, Zhigang Wang, JiaYuan Gu, Bin Zhao, Dong Wang, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学) Northwestern Polytechnical University(西北工业大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

Journal ref Robotics: Science and Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13002 2025-05-19 cs.RO cs.AI 57%

Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features

Makram Chahine, Alex Quach, Alaa Maalouf, Tsun-Hsuan Wang, Daniela Rus

机构 * CSAIL, MIT(MIT计算机科学与人工智能实验室)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏