arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-29 至 2025-09-29 共收录 55 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2505.21969 2025-09-29 cs.RO cs.AI 70%

DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation

Tianjun Gu, Linfeng Li, Xuhong Wang, Chenghua Gong, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21279 2025-09-29 cs.AI 70%

XBOUND: Exploring Capability Boundaries of Device-Control Agents at the State Level

Shaoqing Zhang, Kehai Chen, Zhuosheng Zhang, Rumei Li, Rongxiang Weng, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05667 2025-09-29 cs.CV cs.AI 62%

DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models

Yuhan Hao, Zhengning Li, Lei Sun, Weilong Wang, Naixin Yi, Sheng Song, Caihong Qin, Mofan Zhou, Yifei Zhan, Xianpeng Lang

机构 * Li Auto Inc.

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Benchmark: https://huggingface.co/datasets/LiAuto-DriveAction/drive-action

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22137 2025-09-29 cs.AI cs.HC cs.MA cs.RO 57%

Log2Plan: An Adaptive GUI Automation Framework Integrated with Task Mining Approach

Seoyoung Lee, Seonbin Yoon, Seongbeen Lee, Hyesoo Kim, Joo Yong Sim

机构 * Sookmyung Women's University(首尔女子大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22937 2025-09-29 cs.HC 50%

GamerAstra: Supporting 2D Non-Twitch Video Games for Blind and Low-Vision Players through a Multi-Agent Framework

Tianrun Qiu, Changxin Chen, Sizhe Cheng, Xuyang Liu, Xumeng Wang, Zhicong Lu, Yuxin Ma

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments 17 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 8 篇

2505.15130 2025-09-29 cs.LG 79%

Few-Shot Adversarial Low-Rank Fine-Tuning of Vision-Language Models

Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21400 2025-09-29 cs.CR 78%

SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models

Xiyu Zeng, Siyuan Liang, Liming Lu, Haotian Zhu, Enguang Liu, Jisheng Dang, Yongbin Zhou, Shuchao Pang

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18053 2025-09-29 cs.CR cs.CL 78%

Resource Consumption Red-Teaming for Large Vision-Language Models

Haoran Gao, Yuanhe Zhang, Zhenhong Zhou, Lei Jiang, Fanyu Meng, Yujia Xiao, Li Sun, Kun Wang, Yang Liu, Junlan Feng

机构 * China Mobile Research Institute(中国移动研究院) Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) North China Electric Power University(华北电力大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21997 2025-09-29 cs.CV 70%

Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21360 2025-09-29 cs.CV cs.AI 62%

Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models

Xingkai Peng, Jun Jiang, Meng Tong, Shuai Li, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22356 2025-09-29 cs.RO cs.CV 57%

RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation

Enguang Liu, Siyuan Liang, Liming Lu, Xiyu Zeng, Xiaochun Cao, Aishan Liu, Shuchao Pang

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11029 2025-09-29 cs.LG 57%

Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere

Li Ju, Max Andersson, Stina Fredriksson, Edward Glöckner, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学) Science for Life Laboratory, Uppsala University(生命科学实验室,乌普萨拉大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22486 2025-09-29 cs.IR cs.CR 50%

Your RAG is Unfair: Exposing Fairness Vulnerabilities in Retrieval-Augmented Generation via Backdoor Attacks

Gaurav Bagwe, Saket S. Chaturvedi, Xiaolong Ma, Xiaoyong Yuan, Kuang-Ching Wang, Lan Zhang

专题命中 幻觉与鲁棒性 :grounding(abstract)

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 9 篇

2509.21358 2025-09-29 cs.CV cs.AI 84%

MDF-MLLM: Deep Fusion Through Cross-Modal Feature Alignment for Contextually Aware Fundoscopic Image Classification

Jason Jordan, Mohammadreza Akbari Lor, Peter Koulen, Mei-Ling Shyu, Shu-Ching Chen

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Word count: 5157, Table count: 2, Figure count: 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11360 2025-09-29 cs.CV cs.CL 83%

GeoDANO: Geometric VLM with Domain Agnostic Vision Encoder

Seunghyuk Cho, Zhenyue Qin, Yang Liu, Youngbin Choi, Seungbeom Lee, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Australian National University(澳大利亚国立大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted to EMNLP-Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22524 2025-09-29 cs.CV 79%

Color Names in Vision-Language Models

Alexandra Gomez-Villa, Pablo Hernández-Cámara, Muhammad Atif Butt, Valero Laparra, Jesus Malo, Javier Vazquez-Corral

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19375 2025-09-29 cs.LG cs.AI cs.CL cs.CV cs.HC 78%

DOTA: Distributional Test-Time Adaptation of Vision-Language Models

Zongbo Han, Jialong Yang, Guangyu Wang, Junfan Li, Qianli Xu, Mike Zheng Shou, Changqing Zhang

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) Institute for Infocomm Research, A*STAR(信息通信研究机构,A*STAR) Show Lab, National University of Singapore(新加坡国立大学Show实验室) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22195 2025-09-29 cs.RO 75%

Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting

Asher J. Hancock, Xindi Wu, Lihan Zha, Olga Russakovsky, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22647 2025-09-29 cs.CV cs.AI cs.CL 73%

CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning

Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Cloud(阿里巴巴云)

专题命中 VLM训练与架构 :vision-language model(abstract);visual language model(abstract);分类 cs.CV、cs.AI

Comments Code is available at https://github.com/InternLM/CapRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22261 2025-09-29 cs.AI cs.CL 70%

InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning

Guanghao Zhu, Zhitian Hou, Zeyu Liu, Zhijie Sang, Congkai Xie, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21351 2025-09-29 cs.CV cs.AI cs.CL 62%

Random Direct Preference Optimization for Radiography Report Generation

Valentin Samokhin, Boris Shirokikh, Mikhail Goncharov, Dmitriy Umerenkov, Maksim Bobrin, Ivan Oseledets, Dmitry Dylov, Mikhail Belyaev

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究院) Skolkovo Institute of Science and Technology(斯克罗夫学院) Institute for Information Transmission Problems(信息传输问题研究所)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22570 2025-09-29 cs.AI 57%

UniMIC: Token-Based Multimodal Interactive Coding for Human-AI Collaboration

Qi Mao, Tinghan Yang, Jiahao Li, Bin Li, Libiao Jin, Yan Lu

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) Communication University of China(中国传媒大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 3 篇

2509.22447 2025-09-29 cs.AI cs.NE 79%

Guiding Evolution of Artificial Life Using Vision-Language Models

Nikhil Baid, Hannah Erlebach, Paul Hellegouarch, Frederico Wieser

机构 * University College London(伦敦大学学院) Institut Pasteur(巴斯德研究院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

Comments 9 pages, 6 figures. Accepted for publication in the Proceedings of the Artificial Life Conference 2025 (MIT Press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21980 2025-09-29 cs.CV 57%

Resolving Ambiguity in Gaze-Facilitated Visual Assistant Interaction Paradigm

Zeyu Wang, Baiyu Chen, Kun Yan, Hongjing Piao, Hao Xue, Flora D. Salim, Yuanchun Shi, Yuntao Wang

机构 * Key Laboratory of Pervasive Computing, Tsinghua University(清华大学普适计算重点实验室) The University of New South Wales(新南威尔士大学) SKLSDE Lab, Beihang University(北航SKLSDE实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15472 2025-09-29 cs.CV 57%

Efficient Multimodal Dataset Distillation via Generative Models

Zhenghao Zhao, Haoxuan Wang, Junyi Wu, Yuzhang Shang, Gaowen Liu, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Central Florida(中央佛罗里达大学) Cisco Research(思科研究)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏