arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-10 至 2025-11-10 共收录 23 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2506.22900 2025-11-10 cs.CV cs.CL 85%

MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering

Mai A. Shaaban, Tausifa Jan Saleem, Vijay Ram Papineni, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Mathematics and Computer Science, Faculty of Science, Alexandria University(亚历山大大学数学与计算机科学系) Sheikh Shakhbout Medical City(谢赫·沙赫布OUT医疗城)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04727 2025-11-10 cs.CV cs.AI cs.LG 75%

IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs

Ali Faraz, Akash, Shaharukh Khan, Raja Kolla, Akshat Patidar, Suranjan Goswami, Abhinav Ravi, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI OLA Electric

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16470 2025-11-10 cs.IR cs.CL cs.CV 70%

Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering

Kuicai Dong, Yujing Chang, Shijie Huang, Yasheng Wang, Ruiming Tang, Yong Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉问答 :VLM(abstract);visual question answering(abstract);分类 cs.CV

Comments Paper accepted to NeurIPS 2025 DB

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 1 篇

2511.05491 2025-11-10 cs.CV 57%

Visual Spatial Tuning

Rui Yang, Ziyu Zhu, Yanwei Li, Jingjia Huang, Shen Yan, Siyuan Zhou, Zhe Liu, Xiangtai Li, Shuangye Li, Wenqian Wang, Yi Lin, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 7 篇

2511.04976 2025-11-10 cs.RO 85%

iFlyBot-VLM Technical Report

Xin Nie, Zhiyuan Cheng, Yuan Zhang, Chao Ji, Jiajia Wu, Yuhan Zhang, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06980 2025-11-10 cs.CL 67%

Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings

Jonghyun Lee, Dojun Park, Jiwoo Lee, Hoekeon Choi, Sung-Eun Lee

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

Comments Published in IEEE Access

Journal ref IEEE Access, vol. 13, pp. 176751-176769, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16227 2025-11-10 cs.CL cs.AI 57%

What Can String Probability Tell Us About Grammaticality?

Jennifer Hu, Ethan Gotlieb Wilcox, Siyuan Song, Kyle Mahowald, Roger P. Levy

机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学自然与人工智能研究 institute)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17902 2025-11-10 cs.CV cs.CL 57%

TRACE: Textual Relevance Augmentation and Contextual Encoding for Multimodal Hate Detection

Girish A. Koushik, Helen Treharne, Aditya Joshi, Diptesh Kanojia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to Special Track on AI for Social Impact (AISI) at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14245 2025-11-10 cs.CV cs.CL 57%

Towards Explainable Fake Image Detection with Multi-Modal Large Language Models

Yikun Ji, Yan Hong, Jiahui Zhan, Haoxing Chen, jun lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025; 14 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01083 2025-11-10 cs.RO cs.AI 57%

Affordance-based Robot Manipulation with Flow Matching

Fan Zhang, Michael Gienger

机构 * Honda Research Institute EU(本田欧洲研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05383 2025-11-10 cs.CE 50%

Connectomics Informed by Large Language Models

Elinor Thompson, Tiantian He, Anna Schroder, Ahmed Abdulaal, Alec Sargood, Sonja Soskic, Henry F. J. Tregidgo, Daniel C. Alexander

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 35 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2509.05718 2025-11-10 cs.HC 82%

Do Vision-Language Models See Visualizations Like Humans? Alignment in Chart Categorization

Péter Ferenc Gyarmati, Manfred Klaffenböck, Laura Koesten, Torsten Möller

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)

Comments 2 pages, 2 figures. Accepted submission to the poster track of IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08828 2025-11-10 cs.IR cs.AI cs.CL cs.CV 62%

MMDocIR: Benchmarking Multimodal Retrieval for Long Documents

Kuicai Dong, Yujing Chang, Xin Deik Goh, Dexun Li, Ruiming Tang, Yong Liu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV、cs.AI

Comments Paper accepted to EMNLP-2025(Main)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 5 篇

2511.04690 2025-11-10 cs.MM cs.CL 67%

Automatización de Informes Geotécnicos para Macizos Rocosos con IA

Christofer Valencia, Alexis Llumigusín, Silvia Alvarez, Abrahan Arias, Christian Mejia-Escobar

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract)

Comments 17 pages, in Spanish language

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03299 2025-11-10 cs.LG cs.CL cs.CV 62%

GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Haohan Wang

机构 * School of Information Sciences University of Illinois at Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) Independent Researcher, Starc Institute(Starc研究所独立研究者) Computer Science and Engineering HKUST(HKUST计算机科学与工程学院) Computer Science Lapis Labs University of Illinois Urbana-Champaign(计算机科学Lapis Labs伊利诺伊大学厄巴纳-香槟分校) School of Information Sciences University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.LG

Comments 28 papges

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04247 2025-11-10 cs.MM cs.AI cs.IR 57%

On the Brittleness of CLIP Text Encoders

Allie Tran, Luca Rossetto

机构 * Dublin City University(都柏林城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04835 2025-11-10 cs.RO 50%

Conformalized Non-uniform Sampling Strategies for Accelerated Sampling-based Motion Planning

Shubham Natraj, Bruno Sinopoli, Yiannis Kantaros

机构 * Department of Electrical and Systems Engineering, Washington University in St. Louis(电气与系统工程系,华盛顿大学圣路易斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11350 2025-11-10 cs.RO 50%

Search-TTA: A Multimodal Test-Time Adaptation Framework for Visual Search in the Wild

Derek Ming Siang Tan, Shailesh, Boyang Liu, Alok Raj, Qi Xuan Ang, Weiheng Dai, Tanishq Duhan, Jimmy Chiun, Yuhong Cao, Florian Shkurti, Guillaume Sartoretti

专题命中 幻觉与鲁棒性 :vision language model(abstract)

Comments Accepted for presentation at CORL 2025. Code, models, and data are available at https://search-tta.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 5 篇

2410.02615 2025-11-10 cs.LG 83%

ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models

Duy M. H. Nguyen, Nghiem T. Diep, Trung Q. Nguyen, Hoang-Bao Le, Tai Nguyen, Tien Nguyen, TrungTin Nguyen, Nhat Ho, Pengtao Xie, Roger Wattenhofer, James Zou, Daniel Sonntag, Mathias Niepert

机构 * German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心) Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校) University of Stuttgart(斯图加特大学) University Medical Center Gottingen(哥廷根大学医学中心) Max Planck Institute for Multidisciplinary Sciences(马克斯·普朗克多学科科学研究所) ARC Centre of Excellence for the Mathematical Analysis of Cellular Systems(细胞系统数学分析卓越中心) School of Mathematical Sciences, Queensland University of Technology(昆士兰科技大学数学科学学院) University of Oldenburg(奥尔登堡大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California San Diego(加州大学圣地亚哥分校) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract);grounding(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04948 2025-11-10 cs.CV cs.AI 81%

A benchmark multimodal oro-dental dataset for large vision-language models

Haoxin Lv, Ijazul Haq, Jin Du, Jiaxin Ma, Binnian Zhu, Xiaobing Dang, Chaoan Liang, Ruxu Du, Yingjie Zhang, Muhammad Saqib

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15418 2025-11-10 cs.CL cs.AI 70%

Fine-Tuning MedGemma for Clinical Captioning to Enhance Multimodal RAG over Malaysia CPGs

Lee Qi Zun, Mohamad Zulhilmi Bin Abdul Halim, Goh Man Fye

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05325 2025-11-10 cs.LG 57%

Turning Adversaries into Allies: Reversing Typographic Attacks for Multimodal E-Commerce Product Retrieval

Janet Jenq, Hongda Shen

机构 * PitchBook USA(PitchBook美国公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05057 2025-11-10 cs.CV 57%

Role-SynthCLIP: A Role Play Driven Diverse Synthetic Data Approach

Yuanxiang Huangfu, Chaochao Wang, Weilei Wang

机构 * PatSnap Co., LTD.(PatSnap公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏