arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-19 至 2025-09-19 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2509.14886 2025-09-19 cs.CL cs.AI 79%

A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation

Ye Shen, Junying Wang, Farong Wen, Yijin Guo, Qi Jia, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 视觉问答 :MLLM(title,abstract);分类 cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14267 2025-09-19 cs.CL cs.AI cs.IT math.IT 57%

Graph-Enhanced Retrieval-Augmented Question Answering for E-Commerce Customer Support

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13835 2025-09-19 cs.CL 50%

RAcQUEt: Unveiling the Dangers of Overlooked Referential Ambiguity in Visual LLMs

Alberto Testoni, Barbara Plank, Raquel Fernández

机构 * Amsterdam UMC, Department of Medical Informatics(阿姆斯特丹大学医学中心,医学信息学系) Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML)) Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2502.18042 2025-09-19 cs.CV cs.AI 84%

VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion

Pei Liu, Haipeng Liu, Haichao Liu, Xin Liu, Jinxin Ni, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Li Auto Inc.(Li汽车公司) the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15154 2025-09-19 cs.CV 70%

MedFact-R1: Towards Factual Medical Reasoning via Pseudo-Label Augmentation

Gengliang Li, Rongyu Chen, Bin Li, Linlin Yang, Guodong Ding

机构 * Baosight(博思特) NUS(新加坡国立大学) SIAT(深圳先进技术研究院) CUC(中国科学技术大学) Microsoft(微软) ANU(澳大利亚国立大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15132 2025-09-19 cs.CY cs.CV 70%

From Pixels to Urban Policy-Intelligence: Recovering Legacy Effects of Redlining with a Multimodal LLM

Anthony Howell, Nancy Wu, Sharmistha Bagchi, Yushim Kim, Chayn Sun

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14746 2025-09-19 cs.CV cs.IR 70%

Chain-of-Thought Re-ranking for Image Retrieval Tasks

Shangrong Wu, Yanghong Zhou, Yang Chen, Feng Zhang, P. Y. Mok

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15217 2025-09-19 cs.AI cs.CV cs.LG 67%

Generalizable Geometric Image Caption Synthesis

Yue Xin, Wenyuan Wang, Rui Pan, Ruida Wang, Howard Meng, Renjie Pi, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Rutgers University(罗格斯大学) NVIDIA

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14666 2025-09-19 cs.SD cs.AI cs.CL 57%

Spatial Audio Motion Understanding and Reasoning

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07917 2025-09-19 cs.RO 50%

MolmoAct: Action Reasoning Models that can Reason in Space

Jason Lee, Jiafei Duan, Haoquan Fang, Yuquan Deng, Shuo Liu, Boyang Li, Bohan Fang, Jieyu Zhang, Yi Ru Wang, Sangho Lee, Winson Han, Wilbert Pumacay, Angelica Wu, Rose Hendrix, Karen Farley, Eli VanderBilt, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉推理 :grounding(abstract)

Comments Updated GR00T result to N1.5

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 3 篇

2509.15178 2025-09-19 cs.CV 87%

Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding

Zaiquan Yang, Yuhao Liu, Gerhard Hancke, Rynson W. H. Lau

专题命中 视觉定位与Grounding :grounding(title,abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)

Journal ref NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14985 2025-09-19 cs.CV 57%

PRISM: Product Retrieval In Shopping Carts using Hybrid Matching

Arda Kabadayi, Senem Velipasalar, Jiajing Chen

机构 * Syracuse University(苏塞克斯大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14623 2025-09-19 cs.SE cs.AI cs.PL cs.SY eess.SY 57%

Automating Modelica Module Generation Using Large Language Models: A Case Study on Building Control Description Language

Hanlong Wan, Xing Lu, Yan Chen, Karthik Devaprasad, Laura Hinkle

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments This is the pre-peer-review version of a journal paper; the repo is available at: https://github.com/pnnl/prompt2control

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2502.17651 2025-09-19 cs.CV cs.AI cs.CL 73%

METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling

Bingxuan Li, Yiwei Wang, Jiuxiang Gu, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Merced(加州大学默塞德分校) Adobe Research(Adobe研究)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2509.14889 2025-09-19 cs.RO 67%

CollabVLA: Self-Reflective Vision-Language-Action Model Dreaming Together with Human

Nan Sun, Yongchang Li, Chenxu Wang, Huiying Li, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)

Comments 8 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06937 2025-09-19 cs.RO 67%

Handle Object Navigation as Weighted Traveling Repairman Problem

Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

机构 * Centre for Advanced Robotics Technology Innovation (CARTIN), School of Electrical and Electronic Engineering, Nanyang Technological University(先进机器人技术创新中心(CARTIN)、电子与电气工程学院、南洋理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2505.23024 2025-09-19 cs.LG 83%

An Empirical Study of Federated Prompt Learning for Vision Language Model

Zhihao Wang, Wenke Huang, Tian Chen, Zekun Shi, Guancheng Wan, Yu Qiao, Bin Yang, Jian Wang, Bing Li, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Laboratory, China(中关村实验室)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15226 2025-09-19 cs.CV 79%

Calibration-Aware Prompt Learning for Medical Vision-Language Models

Abhishek Basu, Fahad Shamshad, Ashshak Sharifdeen, Karthik Nandakumar, Muhammad Haris Khan

机构 * Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(计算机视觉系,Mohamed bin Zayed人工智能大学) Department of Computer Science and Engineering, Michigan State University (MSU)(计算机科学与工程系,密歇根州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted in BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14571 2025-09-19 cs.HC cs.AI cs.LG 76%

VisMoDAl: Visual Analytics for Evaluating and Improving Corruption Robustness of Vision-Language Models

Huanchen Wang, Wencheng Zhang, Zhiqiang Wang, Zhicong Lu, Yuxin Ma

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) George Mason University(乔治·马歇尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI、cs.LG

Comments 11 pages, 7 figures, 1 table, accepted to IEEE VIS 2025 (IEEE Transactions on Visualization and Computer Graphics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14446 2025-09-19 q-bio.NC 50%

Mouse vs. AI: A Neuroethological Benchmark for Visual Robustness and Neural Alignment

Marius Schneider, Joe Canzano, Jing Peng, Yuchen Hou, Spencer LaVere Smith, Michael Beyeler

专题命中 幻觉与鲁棒性 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2406.14596 2025-09-19 cs.CV cs.AI cs.LG 85%

VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought

Gabriel Sarch, Lawrence Jang, Michael J. Tarr, William W. Cohen, Kenneth Marino, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project website: https://ical-learning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15076 2025-09-19 cs.LG cs.CV 84%

Forecasting and Visualizing Air Quality from Sky Images with Vision-Language Models

Mohammad Saleh Vahdatpour, Maryam Eyvazi, Yanqing Zhang

机构 * Georgia State University(佐治亚州立大学) Savannah College of Art and Design(萨凡纳艺术与设计学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Published at ICCVW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09808 2025-09-19 cs.CV cs.AI 84%

Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis

Chenjun Li, Laurin Lux, Alexander H. Berger, Martin J. Menten, Mert R. Sabuncu, Johannes C. Paetzold

机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔·康奈尔医学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14735 2025-09-19 cs.CL 82%

Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM

Chenkun Tan, Pengyu Wang, Shaojun Zhou, Botian Jiang, Zhaowei Li, Dong Zhang, Xinghao Wang, Yaqian Zhou, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14982 2025-09-19 cs.CV cs.CL 57%

Large Multi-modal Models Can Interpret Features in Large Multi-modal Models

Kaichen Zhang, Yifei Shen, Bo Li, Ziwei Liu

机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) LMMs-Lab Team(多模态模型实验室团队) Microsoft Research Asia(微软亚洲研究院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 2 篇

2509.15211 2025-09-19 cs.CL 50%

What's the Best Way to Retrieve Slides? A Comparative Study of Multimodal, Caption-Based, and Hybrid Retrieval Techniques

Petros Stylianos Giouroukis, Dimitris Dimitriadis, Dimitrios Papadopoulos, Zhenwen Shao, Grigorios Tsoumakas

机构 * Aristotle University of Thessaloniki(亚里士多德大学)

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14171 2025-09-19 cs.CL 50%

AssoCiAm: A Benchmark for Evaluating Association Thinking while Circumventing Ambiguity

Yifan Liu, Wenkuan Zhao, Shanshan Zhong, Jinghui Qin, Mingfu Liang, Zhongzhan Huang, Wushao Wen

机构 * Sun Yat-sen University(中山大学) Guangdong University of Technology(广东工业大学) Northwestern University(西北大学)

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted by EMNLP 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏