arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-10 至 2025-09-10 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2509.07846 2025-09-10 cs.AI 57%

Aligning LLMs for the Classroom with Knowledge-Based Retrieval -- A Comparative RAG Study

Amay Jain, Liu Cui, Si Chen

机构 * Student(学生) Downingtown STEM Academy Department of Computer Science(计算机科学系) West Chester University of Pennsylvania(宾夕法尼亚州韦斯特切斯特大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17471 2025-09-10 cs.CL 50%

FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain

Suifeng Zhao, Zhuoran Jin, Sujian Li, Jun Gao

机构 * Key Laboratory of High Confidence Software Technologies, CS, Peking University, China(北京大学高可信软件技术重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Sciences, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 视觉问答 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 3 篇

2412.01370 2025-09-10 cs.CV cs.CL 77%

Understanding Museum Exhibits using Vision-Language Reasoning

Ada-Astrid Balauca, Sanjana Garai, Stefan Balauca, Rasesh Udayakumar Shetty, Naitik Agrawal, Dhwanil Subhashbhai Shah, Yuqian Fu, Xi Wang, Kristina Toutanova, Danda Pani Paudel, Luc Van Gool

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Indian Institute of Technology, Varanasi (IIT BHU)(印度瓦拉纳西理工学院(IIT BHU)) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17180 2025-09-10 cs.AI cs.CV cs.LG 67%

MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes

Nilay Pande, Sahiti Yerramilli, Jayant Sravan Tamarapalli, Rynaa Grover

机构 * Waymo Google(谷歌)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12312 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Visuospatial Cognitive Assistant

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 31 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 6 篇

2506.23903 2025-09-10 cs.CV cs.AI 90%

Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models

Hamza Rasaee, Taha Koleilat, Hassan Rivaz

机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures, 7 tables

Journal ref IEEE Transactions on Ultrasonics, Ferroelectrics, and Frequency Control, Sept. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00785 2025-09-10 cs.AI cs.CV cs.LG 75%

GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning

Sahiti Yerramilli, Nilay Pande, Rynaa Grover, Jayant Sravan Tamarapalli

机构 * Google(谷歌) Waymo

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02074 2025-09-10 cs.CV cs.AI 62%

Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20670 2025-09-10 cs.CV cs.MM 57%

"Humor, Art, or Misinformation?": A Multimodal Dataset for Intent-Aware Synthetic Image Detection

Anastasios Skoularikis, Stefanos-Iordanis Papadopoulos, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Department of Electrical & Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,阿基米德大学塞萨洛尼基分校) Information Technology Institute, Centre for Research & Technology Hellas(信息科技研究所,希腊研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06401 2025-09-10 cs.DL cs.AI cs.CL cs.IR 57%

A Systematic Literature Review of Retrieval-Augmented Generation: Techniques, Metrics, and Challenges

Andrew Brown, Muhammad Roman, Barry Devereux

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 58 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10781 2025-09-10 cs.CV 57%

Large-scale Pre-training for Grounded Video Caption Generation

Evangelos Kazakos, Cordelia Schmid, Josef Sivic

机构 * Czech Institute of Informatics, Robotics and Cybernetics at the Czech Technical University in Prague(捷克信息技术、机器人与自动化研究所(捷克技术大学)) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、法国高等师范学校、法国国家科学研究中心、巴黎-萨克勒大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted at ICCV 2025. Erratum: An earlier version reported ablations (Table 6 & Fig. 6) with pre-training on a 50k subset of HowToGround1M + fine-tuning on iGround. In the ICCV camera-ready, Table 6 already used the full dataset, but Fig. 6 and a sentence in the text were mistakenly left on 50k. All now use the full HowToGround1M

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2509.07473 2025-09-10 cs.AI 79%

SheetDesigner: MLLM-Powered Spreadsheet Layout Generation with Rule-Based and Vision-Based Reflection

Qin Chen, Yuanyi Ren, Xiaojun Ma, Mugeng Liu, Han Shi, Dongmei Zhang

机构 * Peking University(北京大学) Microsoft(微软)

专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07666 2025-09-10 cs.CL cs.IR 67%

MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval

Xixi Wu, Yanchao Tan, Nan Hou, Ruiyang Zhang, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Fuzhou University(福州大学) University of Macau(澳门大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

Comments EMNLP Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2509.07488 2025-09-10 cs.CV cs.AI 76%

Fine-Tuning Vision-Language Models for Visual Navigation Assistance

Xiao Li, Bharat Gandhi, Ming Zhan, Mohit Nehra, Zhicheng Zhang, Yuchen Sun, Meijia Song, Naisheng Zhang, Xi Wang

机构 * University of Florida, Gainesville, FL, USA(佛罗里达大学) University of Minnesota, Minneapolis, MN, USA(明尼苏达大学) New York University, New York, NY, USA(纽约大学)

专题命中 GUI与屏幕智能体 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07334 2025-09-10 cs.HC 50%

SpecifyUI: Supporting Iterative UI Design Intent Expression through Structured Specifications and Generative AI

Yunnong Chen, Chengwei Shi, Liuqing Chen

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 1 篇

2509.06992 2025-09-10 cs.CV 79%

FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models

Kun Zhai, Siheng Chen, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University, Shanghai, China(复旦大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments ACM MM25

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 8 篇

2506.18407 2025-09-10 cs.GR cs.CV 83%

IntuiTF: MLLM-Guided Transfer Function Optimization for Direct Volume Rendering

Yiyao Wang, Bo Pan, Ke Wang, Han Liu, Jinyuan Mao, Yuxin Liu, Minfeng Zhu, Xiuqi Huang, Weifeng Chen, Bo Zhang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Laboratory of Art and Archaeology Image (Zhejiang University), Ministry of Education, China(浙江大学艺术与考古图像实验室(教育部,中国)) Zhejiang University of Finance&Economics(浙江财经大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12363 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 80%

Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 26 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06994 2025-09-10 cs.CV cs.CL 77%

VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality

Srihari Bandraupalli, Anupam Purwar

机构 * Sprinklr

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04378 2025-09-10 cs.CV 70%

Aesthetic Image Captioning with Saliency Enhanced MLLMs

Yilin Tao, Jiashui Huang, Huaze Xu, Ling Shao

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00700 2025-09-10 cs.CV 70%

Prompt the Unseen: Evaluating Visual-Language Alignment Beyond Supervision

Raehyuk Jung, Seungjun Yu, Hyunjung Shim

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Link to publicly available codes is added

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11505 2025-09-10 cs.CV 70%

MSCPT: Few-shot Whole Slide Image Classification with Multi-scale and Context-focused Prompt Tuning

Minghao Han, Linhao Qu, Dingkang Yang, Xukun Zhang, Xiaoying Wang, Lihua Zhang

机构 * Academy for Engineering and Technology, Fudan University(工程与技术学院,复旦大学) Fudan University(复旦大学) Zhongshan Hospital, Fudan University(复旦大学中山医院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE TMI for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20454 2025-09-10 cs.LG cs.CL 70%

CoMMIT: Coordinated Multimodal Instruction Tuning

Xintong Li, Junda Wu, Tong Yu, Yu Wang, Xiang Chen, Jiuxiang Gu, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织的数据61)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07436 2025-09-10 eess.SP 67%

SA-OOSC: A Multimodal LLM-Distilled Semantic Communication Framework for Enhanced Coding Efficiency with Scenario Understanding

Feifan Zhang, Yuyang Du, Yifan Xiang, Xiaoyan Liu, Soung Chang Liew

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 2 篇

2508.06585 2025-09-10 cs.AI cs.CV 62%

CountQA: How Well Do MLLMs Count in the Wild?

Jayant Sravan Tamarapalli, Rynaa Grover, Nilay Pande, Sahiti Yerramilli

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10090 2025-09-10 cs.CV 57%

InteractPro: A Unified Framework for Motion-Aware Image Composition

Weijing Tao, Xiaofeng Yang, Miaomiao Cui, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏