arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-08 至 2025-09-08 共收录 23 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2509.04502 2025-09-08 cs.CL cs.AI 79%

VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples

Qixin Sun, Ziqin Wang, Hengyuan Zhao, Yilin Li, Kaiyou Song, Linjiang Huang, Xiaolin Hu, Qingpei Guo, Si Liu

专题命中 视觉问答 :multimodal large language model(title);visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4 篇

2507.00008 2025-09-08 cs.AI cs.CV cs.HC 88%

DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning

Hang Wu, Hongkai Chen, Yujun Cai, Chang Liu, Qingwen Ye, Ming-Hsuan Yang, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视觉推理 :grounding(title,abstract);visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04772 2025-09-08 cs.CV cs.AI 81%

FloodVision: Urban Flood Depth Estimation Using Foundation Vision-Language Models and Domain Knowledge Graph

Zhangding Liu, Neda Mohammadi, John E. Taylor

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06020 2025-09-08 cs.AI cs.CV 62%

ArtRAG: Retrieval-Augmented Generation with Structured Context for Visual Art Understanding

Shuai Wang, Ivona Najdenkoska, Hongyi Zhu, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) College of Business(商学院) Economics, University of Johannesburg(经济系,约翰内斯堡大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04834 2025-09-08 cs.CV 57%

TemporalFlowViz: Parameter-Aware Visual Analytics for Interpreting Scramjet Combustion Evolution

Yifei Jia, Shiyu Cheng, Yu Dong, Guan Li, Dong Tian, Ruixiao Peng, Xuyi Lu, Yu Wang, Wei Yao, Guihua Shan

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 10 篇

2509.04908 2025-09-08 cs.AI cs.CL cs.CV cs.HC 86%

SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing

Hongyi Jing, Jiafu Chen, Chen Rao, Ziqiang Dang, Jiajie Teng, Tianyi Chu, Juncheng Mo, Shuo Fang, Huaizhong Lin, Rui Lv, Chenguang Ma, Lei Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04758 2025-09-08 cs.CV 83%

Dynamic Group Detection using VLM-augmented Temporal Groupness Graph

Kaname Yokoyama, Chihiro Nakatani, Norimichi Ukita

机构 * Toyota Technological Institute(丰田技术研究所)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 10 pages, Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04833 2025-09-08 cs.CV cs.AI 81%

PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination

Ming Dai, Wenxuan Cheng, Jiedong Zhuang, Jiang-jiang Liu, Hongshen Zhao, Zhenhua Feng, Wankou Yang

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) Baidu VIS(百度视觉) Jiangnan University(江南大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03025 2025-09-08 cs.CV cs.AI 81%

Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens

Sohee Kim, Soohyun Ryu, Joonhyung Park, Eunho Yang

机构 * KAIST AI(韩国科学技术院人工智能研究所) AITRICS(人工智能与机器人技术研究所在线)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05154 2025-09-08 eess.IV cs.CV 79%

VLSM-Ensemble: Ensembling CLIP-based Vision-Language Models for Enhanced Medical Image Segmentation

Julia Dietlmeier, Oluwabukola Grace Adegboro, Vayangi Ganepola, Claudia Mazo, Noel E. O'Connor

机构 * Insight Research Ireland Centre for Data Analytics, DCU, Dublin, Ireland(爱尔兰洞察研究爱尔兰数据分析中心,都柏林大学,都柏林) Research Ireland Centre for Research Training in Machine Learning, DCU, Dublin, Ireland(爱尔兰研究爱尔兰机器学习研究培训中心,都柏林大学,都柏林) School of Computing, Dublin City University, Dublin, Ireland(计算学院,都柏林城市大学,都柏林)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Medical Imaging with Deep Learning (MIDL 2025) short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04676 2025-09-08 cs.AI cs.HC 79%

An Approach to Grounding AI Model Evaluations in Human-derived Criteria

Sasha Mitts

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 4 figures, 6 pages, presented at CHI 2025 Workshop on Human-AI Interaction for Augmented Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04918 2025-09-08 physics.hist-ph 71%

Holistic Versus Fragmented Multiverses: Empirical Access via Causal and Grounding Signatures

Baptiste Le Bihan

专题命中 视觉定位与Grounding :grounding(title)

Comments Chapter draft for the Blackwell Companion to the Philosophy and the Multiverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04894 2025-09-08 cs.CV cs.LG 62%

SynGen-Vision: Synthetic Data Generation for training industrial vision models

Alpana Dubey, Suma Mani Kuriakose, Nitish Bhardwaj

机构 * Accenture Labs(埃森哲实验室)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05112 2025-09-08 cs.SE cs.AI 57%

GenAI-based test case generation and execution in SDV platform

Denesa Zyberaj, Lukasz Mazur, Nenad Petrovic, Pankhuri Verma, Pascal Hirmer, Dirk Slama, Xiangwei Cheng, Alois Knoll

机构 * Mercedes-Benz AG, Germany(梅赛德斯-奔驰集团,德国) Technical University of Munich, Germany(慕尼黑技术大学,德国) Ferdinand-Steinbeis-Institut der Steinbeis-Stiftung, Germany(施坦贝格基金会费尔迪南-斯坦贝格研究所,德国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17422 2025-09-08 cs.RO cs.CV 57%

Multimodal LLM Guided Exploration and Active Mapping using Fisher Information

Wen Jiang, Boshu Lei, Katrina Ashton, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) Archimedes, Athena RC(阿基米德、阿提卡RC)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 3 篇

2506.13205 2025-09-08 cs.CR cs.AI 83%

Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents

Xuan Wang, Siyuan Liang, Zhe Liu, Yi Yu, Aishan Liu, Yuliang Lu, Xitong Gao, Ee-Chien Chang

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00388 2025-09-08 cs.RO 78%

Find Everything: A General Vision Language Model Approach to Multi-Object Search

Daniel Choi, Angus Fung, Haitong Wang, Aaron Hao Tan

专题命中 GUI与屏幕智能体 :vision language model(title,abstract)

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02544 2025-09-08 cs.CL 67%

Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions

Xinbei Ma, Yiting Wang, Yao Yao, Tongxin Yuan, Aston Zhang, Zhuosheng Zhang, Hai Zhao

机构 * School of Computer Science(计算机学院) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering(智能交互与认知工程重点实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(Web3可信数据流通与治理上海市重点实验室) GenAI, Meta(Meta GenAI)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 3 篇

2509.05000 2025-09-08 cs.CV 79%

Dual-Domain Perspective on Degradation-Aware Fusion: A VLM-Guided Robust Infrared and Visible Image Fusion Framework

Tianpei Zhang, Jufeng Zhao, Yiming Zhu, Guangmang Cui

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20309 2025-09-08 cs.CV 70%

Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs

Zitian Wang, Yue Liao, Kang Rong, Fengyun Rao, Yibo Yang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(国立新加坡大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11813 2025-09-08 cs.CV 57%

SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs

Yuanyang Yin, Yaqi Zhao, Yajie Zhang, Yuanxing Zhang, Ke Lin, Jiahao Wang, Xin Tao, Pengfei Wan, Wentao Zhang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 2 篇

2509.04480 2025-09-08 cs.CL cs.LG 79%

Discrete Prompt Tuning via Recursive Utilization of Black-box Multimodal Large Language Model for Personalized Visual Emotion Recognition

Ryo Takahashi, Naoki Saito, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

机构 * Graduate School of Information Science(信息科学研究生学校) Technology, Hokkaido University, Sapporo 060-0814, Japan(技术,北海道大学,札幌060-0814,日本) Office of Institutional Research, Hokkaido University, Sapporo 060-0808, Japan(机构研究办公室,北海道大学,札幌060-0808,日本) Faculty of Information Science(信息科学学院)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.LG

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04757 2025-09-08 cs.CV cs.AI 62%

MCANet: A Multi-Scale Class-Specific Attention Network for Multi-Label Post-Hurricane Damage Assessment using UAV Imagery

Zhangding Liu, Neda Mohammadi, John E. Taylor

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏