arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-05 至 2025-08-05 共收录 68 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2508.02645 2025-08-05 cs.CV 85%

Evaluating Variance in Visual Question Answering Benchmarks

Nikitha SR

机构 * Media and Data Science Research Lab, Adobe(媒体与数据科学研究实验室,Adobe)

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted in ICCV 2025 Workshop on What's Next in Multimodal Foundational Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12441 2025-08-05 cs.CV cs.LG 84%

Describe Anything Model for Visual Question Answering on Text-rich Images

Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu

机构 * AI VIETNAM Lab(AI越南实验室) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northwestern University(西北大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01546 2025-08-05 cs.CV 70%

E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation

Zeyu Xu, Junkang Zhang, Qiang Wang, Yi Liu

机构 * Zeyu Xu(作者) Junkang Zhang(作者) Qiang Wang(作者) Yi Liu(作者)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01274 2025-08-05 cs.AI cs.CL 70%

Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan

Jui-Ming Yao, Bing-Cheng Xie, Sheng-Wei Peng, Hao-Yuan Chen, He-Rong Zheng, Bing-Jia Tan, Peter Shaojui Wang, Shun-Feng Su

机构 * National Taiwan University of Science and Technology(台湾科技大学) University of London(伦敦大学) National Taiwan University(台湾大学)

专题命中 视觉问答 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06271 2025-08-05 cs.CV 70%

SplatTalk: 3D VQA with Gaussian Splatting

Anh Thai, Songyou Peng, Kyle Genova, Leonidas Guibas, Thomas Funkhouser

机构 * Georgia Institute of Technology(佐治亚理工学院) Google DeepMind(谷歌DeepMind)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02082 2025-08-05 cs.CV 57%

S-RRG-Bench: Structured Radiology Report Generation with Fine-Grained Evaluation Framework

Yingshu Li, Yunyi Liu, Zhanyu Wang, Xinyu Liang, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) University of Wollongong(沃林戈大学) University of Adelaide(阿德莱德大学) First Clinical Medical College, Guangzhou University of Chinese Medicine(广州中医药大学第一临床学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 6 篇

2503.12937 2025-08-05 cs.AI cs.CL cs.CV cs.LG 78%

R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization

Jingyi Zhang, Jiaxing Huang, Huanjin Yao, Shunyu Liu, Xikun Zhang, Shijian Lu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18661 2025-08-05 cs.CV cs.RO 77%

Eyes Will Shut: A Vision-Based Next GPS Location Prediction Model by Reinforcement Learning from Visual Map Feed Back

Ruixing Zhang, Yang Zhang, Tongyu Zhu, Leilei Sun, Weifeng Lv

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01016 2025-08-05 eess.IV cs.CV 74%

Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks

Gustav Müller-Franzes, Debora Jutz, Jakob Nikolas Kather, Christiane Kuhl, Sven Nebelung, Daniel Truhn

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02134 2025-08-05 cs.CV 70%

Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference

Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) OPPO AI Center(OPPO人工智能中心) Research Institute(研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10011 2025-08-05 cs.RO 67%

KeyMPs: One-Shot Vision-Language Guided Motion Generation by Sequencing DMPs for Occlusion-Rich Tasks

Edgar Anarossi, Yuhwan Kwon, Hirotaka Tahara, Shohei Tanaka, Keisuke Shirai, Masashi Hamaya, Cristian C. Beltran-Hernandez, Atsushi Hashimoto, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology(信息科学系,科学技术研究生学校,科学技术研究所) Department of Electrical and Electronic Engineering, Faculty of Engineering Science, Kansai University(电气电子工程系,工学科学大学) Department of Electronics, Kobe City College of Technology(电子系,神户市立技术学院) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

Comments Published in IEEE Access, Jul 14 2025

Journal ref IEEE Access, vol. 13, pp. 125420-125441, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01715 2025-08-05 cs.RO 50%

Towards Zero-Shot Terrain Traversability Estimation: Challenges and Opportunities

Ida Germann, Mark O. Mints, Peer Neubert

机构 * Intelligent Autonomous Systems Group, Institute of Computational Visualisitics, University of Koblenz(智能自主系统组,计算可视化研究所,科隆大学)

专题命中 视觉推理 :vision-language model(abstract)

Comments Accepted and presented at the 1st German Robotics Conference (GRC); March 13-15, 2025, Nuremberg, Germany https://ras.papercept.net/conferences/conferences/GRC25/program/GRC25_ContentListWeb_3.html#sada_48

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 16 篇

2508.01008 2025-08-05 cs.CV 85%

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation

Cihang Peng, Qiming Hou, Zhong Ren, Kun Zhou

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15542 2025-08-05 cs.CV 83%

HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(国立新加坡大学) University of Mississippi(密苏里大学) ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务(AICS))

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01723 2025-08-05 cs.RO 82%

OpenMap: Instruction Grounding via Open-Vocabulary Visual-Language Mapping

Danyang Li, Zenghui Yang, Guangpeng Qi, Songtao Pang, Guangyong Shang, Qiang Ma, Zheng Yang

机构 * School of Software, Tsinghua University(清华大学软件学院) School of computer science and engineering, Central South University(中南大学计算机科学与工程学院) Inspur Yunzhou Industrial Internet Co., Ltd(Inspur Yunzhou工业互联网有限公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract)

Comments ACM MM '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02479 2025-08-05 cs.CV 79%

Fine-grained Multiple Supervisory Network for Multi-modal Manipulation Detecting and Grounding

Xinquan Yu, Wei Lu, Xiangyang Luo

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01699 2025-08-05 cs.CV 79%

TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding

Zuhao Yang, Yingchen Yu, Yunqing Zhao, Shijian Lu, Song Bai

机构 * Nanyang Technological University(南洋理工大学) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01402 2025-08-05 cs.CV 79%

ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models

Chuangchuang Tan, Jinglu Wang, Xiang Ming, Renshuai Tao, Yunchao Wei, Yao Zhao, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01408 2025-08-05 cs.CY 78%

Artificial Intelligence and Misinformation in Art: Can Vision Language Models Judge the Hand or the Machine Behind the Canvas?

Tarian Fu, Javier Conde, Gonzalo Martínez, Pedro Reviriego, Elena Merino-Gómez, Fernando Moral

专题命中 视觉定位与Grounding :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06493 2025-08-05 stat.AP 78%

Near-real-time ship grounding damage assessment using Bayesian networks

Dimitris G. Georgiadis, Manolis S. Samuelides, Daniel Straub

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments Preprint submitted to Elsevier journal

Journal ref Ocean Engineering 339 (2025) 122132

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01921 2025-08-05 cs.CV 77%

InspectVLM: Unified in Theory, Unreliable in Practice

Conor Wallace, Isaac Corley, Jonathan Lwowski

机构 * Zeitview

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

Comments Accepted to 2025 ICCV VISION Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18937 2025-08-05 cs.CV cs.CL 70%

Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description

Mahmoud Ahmed, Junjie Fei, Jian Ding, Eslam Mohamed Bakr, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡斯特大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01932 2025-08-05 cs.CV cs.AI 62%

Proactive Disentangled Modeling of Trigger-Object Pairings for Backdoor Defense

Kyle Stein, Andrew A. Mahyari, Guillermo Francia, Eman El-Sheikh

机构 * Department of Intelligent Systems and Robotics, University of West Florida(智能系统与机器人系,西佛罗里达大学) Florida Institute For Human and Machine Cognition (IHMC)(佛罗里达人类与机器认知研究所) Center for Cybersecurity, University of West Florida(网络安全中心,西佛罗里达大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Journal ref Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01338 2025-08-05 cs.CV cs.AI 62%

Weakly-Supervised Image Forgery Localization via Vision-Language Collaborative Reasoning Framework

Ziqi Sheng, Junyan Wu, Wei Lu, Jiantao Zhou

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04154 2025-08-05 cs.CV cs.AI 62%

CA-W3D: Leveraging Context-Aware Knowledge for Weakly Supervised Monocular 3D Detection

Chupeng Liu, Runkai Zhao, Weidong Cai

机构 * School of Computer Science, Faculty of Engineering, The University of Sydney(计算机科学学院,工程学院,悉尼大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02405 2025-08-05 cs.RO cs.CV 57%

Improving Generalization of Language-Conditioned Robot Manipulation

Chenglin Cui, Chaoran Zhu, Changjae Oh, Andrea Cavallaro

机构 * Centre for Intelligent Sensing, Queen Mary University of London(智能传感中心,伦敦女王玛丽大学) Idiap Research Institute and École Polytechnique Fédérale de Lausanne(Idiap研究机构和日内瓦联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 7 pages,18 figures,2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01150 2025-08-05 cs.CV 57%

OpenGS-Fusion: Open-Vocabulary Dense Mapping with Hybrid 3D Gaussian Splatting for Refined Object-Level Understanding

Dianyi Yang, Xihan Wang, Yu Gao, Shiyang Liu, Bohan Ren, Yufeng Yue, Yi Yang

机构 * School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院,北京理工大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments IROS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07234 2025-08-05 math.AG 50%

Spectral Fingerprints of Algebraic Cycles: A Hodge-Theoretic Approach to the Hodge Conjecture and Special L-Values

Bita Hajebi, Pooya Hajebi

专题命中 视觉定位与Grounding :grounding(abstract)

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 3 篇

2508.01387 2025-08-05 cs.CV cs.AI 84%

Video-based Vehicle Surveillance in the Wild: License Plate, Make, and Model Recognition with Self Reflective Vision-Language Models

Pouya Parsa, Keya Li, Kara M. Kockelman, Seongjin Choi

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11435 2025-08-05 cs.CV 70%

GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts

Junwen He, Yifan Wang, Lijun Wang, Huchuan Lu, Jun-Yan He, Chenyang Li, Hanyuan Chen, Jin-Peng Lan, Bin Luo, Yifeng Geng

机构 * Dalian University of Technology(大连理工大学) Alibaba Group(阿里巴巴集团)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏