arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-15 至 2025-09-15 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2504.04323 2025-09-15 cs.CV 77%

MedM-VL: What Makes a Good Medical LVLM?

Yiming Shi, Shaoshuai Yang, Xun Zhu, Haoyu Wang, Xiangling Fu, Miao Li, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 视觉问答 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07879 2025-09-15 cs.IR cs.AI cs.CV 62%

OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval

Wei Yang, Jingjing Fu, Rui Wang, Jinyu Wang, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 4 篇

2509.09732 2025-09-15 cs.CV 70%

Decomposing Visual Classification: Assessing Tree-Based Reasoning in VLMs

Sary Elmansoury, Islam Mesabah, Gerrit Großmann, Peter Neigel, Raj Bhalwankar, Daniel Kondermann, Sebastian J. Vollmer

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10059 2025-09-15 cs.CV cs.AI 62%

Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration

Yue Zhou, Litong Feng, Mengcheng Lan, Xue Yang, Qingyun Li, Yiping Ke, Xue Jiang, Wayne Zhang

机构 * Department of Physics, J.K. Institute of Science(J.K.科学研究院物理系) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09730 2025-09-15 cs.CV cs.AI 62%

MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance

Kaikai Zhao, Zhaoxiang Liu, Peng Wang, Xin Wang, Zhicheng Ma, Yajun Xu, Wenjing Zhang, Yibing Nan, Kai Wang, Shiguo Lian

机构 * organization= Data Science \& Artificial Intelligence Research Institute, China Unicom , city= Beijing , postcode= 100033 , country= PR China

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments accepted by Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09790 2025-09-15 cs.AI 57%

How well can LLMs provide planning feedback in grounded environments?

Yuxuan Li, Victor Zhong

机构 * David R. Cheriton School of Computer Science University of Waterloo(大卫·R·切里顿计算机科学学院滑铁卢大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2503.16365 2025-09-15 cs.CV cs.AI 84%

JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse

Muyao Li, Zihao Wang, Kaichen He, Xiaojian Ma, Yitao Liang

机构 * Peking University(北京大学) BIGAI(大疆创新)

专题命中 视觉定位与Grounding :vision language model(title);visual language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08336 2025-09-15 cs.CV 83%

Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving

Runwei Guan, Jianan Liu, Ningwei Ouyang, Shaofeng Liang, Daizong Liu, Xiaolou Sun, Lianqing Zheng, Ming Xu, Yutao Yue, Guoqiang Mao, Hui Xiong

机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)人工智能研究所) Mononai AI, Sweden(蒙诺人工智能) College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Automation, Southeast University(东南大学自动化学院) College of Science and Engineering, James Cook University(詹姆斯库克大学科学与工程学院) School of Transportation, Southeast University(东南大学交通运输学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10278 2025-09-15 cs.CV 79%

Detecting Text Manipulation in Images using Vision Language Models

Vidit Vidit, Pavel Korshunov, Amir Mohammadi, Christophe Ecabert, Ketan Kotwal, Sébastien Marcel

机构 * IDIAP Research Institute(IDIAP研究 institute)

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

Comments Accepted in Synthetic Realities and Biometric Security Workshop BMVC-2025. For paper page see https://www.idiap.ch/paper/textvlmdet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04191 2025-09-15 cs.CV cs.RO 70%

GROVE: A Generalized Reward for Learning Open-Vocabulary Physical Skill

Jieming Cui, Tengyu Liu, Ziyu Meng, Jiale Yu, Ran Song, Wei Zhang, Yixin Zhu, Siyuan Huang

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13776 2025-09-15 cs.CL cs.AI 57%

Aggregation Artifacts in Subjective Tasks Collapse Large Language Models' Posteriors

Georgios Chochlakis, Alexandros Potamianos, Kristina Lerman, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) National Technical University of Athens(雅典国立技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 16 pages, 12 figures, 3 tables

Journal ref Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pages 5513-5528, Albuquerque, New Mexico, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2509.09731 2025-09-15 cs.CL 78%

Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning

Haiyang Yu, Yuchuan Wu, Fan Shi, Lei Liao, Jinghui Lu, Xiaodong Ge, Han Wang, Minghan Zhuo, Xuecheng Wu, Xiang Fei, Hao Feng, Guozhi Tang, An-Lan Wang, Hanshen Zhu, Yangfan He, Quanhuan Liang, Liyuan Meng, Chao Feng, Can Huang, Jingqun Tang, Bin Li

专题命中 文档图表理解 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09722 2025-09-15 cs.CV cs.CL cs.LG 76%

Improving MLLM Historical Record Extraction with Test-Time Image

Taylor Archibald, Tony Martinez

机构 * Brigham Young University

专题命中 文档图表理解 :MLLM(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 1 篇

2412.19087 2025-09-15 cs.CV cs.CL cs.LG 81%

MoPD: Mixture-of-Prompts Distillation for Vision-Language Models

Yang Chen, Shuai Fu, Yu Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) School of Mathematical and Computer Sciences, University of Adelaide(数学与计算机科学学院,阿德莱德大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 6 篇

2509.10344 2025-09-15 cs.CV cs.AI cs.LG 75%

GLAM: Geometry-Guided Local Alignment for Multi-View VLP in Mammography

Yuexi Du, Lihui Chen, Nicha C. Dvornek

机构 * Department of Biomedical Engineering(生物医学工程系) Department of Radiology & Biomedical Imaging(放射科与生物医学成像系) Yale University(耶鲁大学)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09955 2025-09-15 cs.LG cs.AI cs.CV eess.IV 75%

Adaptive Token Merging for Efficient Transformer Semantic Communication at the Edge

Omar Erak, Omar Alhussein, Hatem Abou-Zeid, Mehdi Bennis, Sami Muhaidat

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Khalifa University(卡里马大学)

专题命中 VLM训练与架构 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Submitted to IEEE Journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10260 2025-09-15 cs.CV 70%

MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation

Jia Wang, Jie Hu, Xiaoqi Ma, Hanghang Ma, Yanbing Zeng, Xiaoming Wei

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07531 2025-09-15 cs.AI eess.SP 70%

QuantX: A Framework for Hardware-Aware Quantization of Generative AI Workloads

Muhammad Ahmad, Khurram Mazher, Saqib Akram, Ahmad Tameem, Saad Bin Nasir

机构 * xEngineers Inc.(10xEngineers公司)

专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08858 2025-09-15 cs.CY cs.LG 57%

Decentralising LLM Alignment: A Case for Context, Pluralism, and Participation

Oriane Peter, Kate Devlin

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

Comments Accepted at AIES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10899 2025-09-15 cs.LG 57%

A Dataset for Distilling Knowledge Priors from Literature for Therapeutic Design

Haydn Thomas Jones, Natalie Maus, Josh Magnus Ludan, Maggie Ziyu Huan, Jiaming Liang, Marcelo Der Torossian Torres, Jiatao Liang, Zachary Ives, Yoseph Barash, Cesar de la Fuente-Nunez, Jacob R. Gardner, Mark Yatskar

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 2 篇

2502.09507 2025-09-15 cs.LG cs.CV 62%

When and How Does CLIP Enable Domain and Compositional Generalization?

Elias Kempf, Simon Schrodi, Max Argus, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11829 2025-09-15 cs.CL cs.AI 57%

Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation

Julia Kreutzer, Eleftheria Briakou, Sweta Agrawal, Marzieh Fadaee, Kocmi Tom

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏