arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-14 至 2025-08-14 共收录 37 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2507.17659 2025-08-14 cs.CV 83%

See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering

Junjie Wang, Yunhan Tang, Yijie Wang, Zhihao Yuan, Huan Wang, Yangfan He, Bin Li

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments We are withdrawing this preprint because it is undergoing a major revision and restructuring. We feel that the current version does not convey our core contributions and methodology with sufficient clarity and accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09945 2025-08-14 cs.CL cs.AI cs.CV 62%

VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models

Lingjie Jiang, Shaohan Huang, Xun Wu, Yixia Li, Dongdong Zhang, Furu Wei

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08224 2025-08-14 cs.CL cs.AI 57%

Capabilities of GPT-5 on Multimodal Medical Reasoning

Shansong Wang, Mingzhe Hu, Qiang Li, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments Corrected some typos

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2410.00318 2025-08-14 cs.AI q-bio.NC 79%

Probing Mechanical Reasoning in Large Vision Language Models

Haoran Sun, Qingying Gao, Haiyun Lyu, Dezhi Luo, Yijiang Li, Hokin Deng

机构 * Johns Hopkins University(约翰霍普金斯大学) University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.AI

Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06220 2025-08-14 cs.CL cs.AI 70%

InfoCausalQA:Can Models Perform Non-explicit Causal Reasoning Based on Infographic?

Keummin Ka, Junhyeong Park, Jaehyun Jeon, Youngjae Yu

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17609 2025-08-14 cs.AI 57%

Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving

Zixian Guo, Ming Liu, Qilong Wang, Zhilong Ji, Jinfeng Bai, Lei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学) Tomorrow Advancing Life(明天进步生命) Pazhou Lab, Guangzhou(广州琶洲实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09804 2025-08-14 cs.CL 50%

BigCharts-R1: Enhanced Chart Reasoning with Visual Reinforcement Finetuning

Ahmed Masry, Abhay Puri, Masoud Hashemi, Juan A. Rodriguez, Megh Thakkar, Khyati Mahajan, Vikas Yadav, Sathwik Tejaswi Madhusudhan, Alexandre Piché, Dzmitry Bahdanau, Christopher Pal, David Vazquez, Enamul Hoque, Perouz Taslakian, Sai Rajeswar, Spandana Gella

专题命中 视觉推理 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09641 2025-08-14 cs.CE 50%

VisFinEval: A Scenario-Driven Chinese Multimodal Benchmark for Holistic Financial Understanding

Zhaowei Liu, Xin Guo, Haotian Xia, Lingfeng Zeng, Fangqi Lou, Jinyi Niu, Mengping Li, Qi Qi, Jiahuan Li, Wei Zhang, Yinglong Wang, Weige Cai, Weining Shen, Liwen Zhang

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 8 篇

2507.00669 2025-08-14 cs.LG cs.AI cs.CV cs.RO 82%

Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding

Duc Cao-Dinh, Khai Le-Duc, Anh Dao, Bach Phan Tat, Chris Ngo, Duy M. H. Nguyen, Nguyen X. Khanh, Thanh Nguyen-Tang

机构 * Hanyang University(汉阳大学) University of Toronto(多伦多大学) University Health Network(大学健康网络) Knovel Engineering Lab(Knovel工程实验室) Michigan State University(密歇根州立大学) KU Leuven(鲁汶大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校) University of Stuttgart(斯图加特大学) UC Berkeley(伯克利大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

Comments Preprint, 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06564 2025-08-14 cs.CV 74%

Grounding Emotion Recognition with Visual Prototypes: VEGA -- Revisiting CLIP in MERC

Guanyu Hu, Dimitrios Kollias, Xinyu Yang

机构 * Xi'an Jiaotong University(西安交通大学) Queen Mary University of London(伦敦女王玛丽大学) Center for Multimodal AI(多模态人工智能中心) Digital Environment Research Institute(数字环境研究院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

Comments accepted for publication at ACM Multimedia (ACM MM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09715 2025-08-14 cs.CV cs.LG 62%

NEURAL: Attention-Guided Pruning for Unified Multimodal Resource-Constrained Clinical Evaluation

Devvrat Joshi, Islem Rekik

机构 * BASIRA Lab, Imperial-X (I-X) and Department of Computing, Imperial College London(BASIRA实验室、Imperial-X(I-X)及帝国理工学院计算机系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14153 2025-08-14 cs.CV cs.AI cs.CL 62%

Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions

Lucas Möller, Pascal Tilli, Ngoc Thang Vu, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18923 2025-08-14 cs.CV 57%

Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models

Meng Cao, Pengfei Hu, Yingyao Wang, Jihao Gu, Haoran Tang, Haoze Zhao, Chen Wang, Jiahua Dong, Wangbo Yu, Ge Zhang, Jun Song, Xiang Li, Bo Zheng, Ian Reid, Xiaodan Liang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09566 2025-08-14 cs.CV 57%

A Chain of Diagnosis Framework for Accurate and Explainable Radiology Report Generation

Haibo Jin, Haoxuan Che, Sunan He, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to IEEE TMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09293 2025-08-14 cs.CY cs.AI 57%

Ethical Medical Image Synthesis

Weina Jin, Ashish Sinha, Kumar Abhishek, Ghassan Hamarneh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09245 2025-08-14 cs.CV 57%

Beyond Blanket Masking: Examining Granularity for Privacy Protection in Images Captured by Blind and Low Vision Users

Jeffri Murrugarra-LLerena, Haoran Niu, K. Suzanne Barber, Hal Daumé, Yang Trista Cao, Paola Cascante-Bonilla

机构 * Stony Brook University(石溪大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland(马里兰大学)

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2508.09716 2025-08-14 cs.CL 78%

The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 文档图表理解 :vision-language model(title,abstract)

Comments Accepted to IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09450 2025-08-14 cs.CL 67%

From Charts to Fair Narratives: Uncovering and Mitigating Geo-Economic Biases in Chart-to-Text

Ridwan Mahbub, Mohammed Saidul Islam, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Mizanur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University, Canada(约克大学,加拿大) University of Alberta, Canada(阿尔伯塔大学,加拿大) Dialpad Inc., Canada(Dialpad公司,加拿大) RBC, Canada(RBC,加拿大) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Salesforce AI, USA(Salesforce AI,美国)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2508.09789 2025-08-14 cs.IR cs.CV 83%

Describe What You See with Multimodal Large Language Models to Enhance Video Recommendations

Marco De Nadai, Andreas Damianou, Mounia Lalmas

机构 * Spotify Denmark(Spotify丹麦分公司) Spotify United Kingdom(Spotify英国分公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09071 2025-08-14 cs.RO 67%

GeoVLA: Empowering 3D Representations in Vision-Language-Action Models

Lin Sun, Bin Xie, Yingfei Liu, Hao Shi, Tiancai Wang, Jiale Cao

机构 * Tianjin University(天津大学) Dexmal Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

Comments The project is visible at https://linsun449.github.io/GeoVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 7 篇

2410.19925 2025-08-14 cs.CL cs.CV cs.LG 84%

Improving Multimodal Large Language Models Using Continual Learning

Shikhar Srivastava, Md Yousuf Harun, Robik Shrestha, Christopher Kanan

机构 * University of Rochester(罗切斯特大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments CoLLAs 2025 and Scalable Continual Learning for Lifelong Foundation Models, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22398 2025-08-14 cs.CV 84%

On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations

Jordan Vice, Naveed Akhtar, Yansong Gao, Richard Hartley, Ajmal Mian

机构 * University of Western Australia(西澳大学) University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Keywords: Vision-Language Models, Frequency-Domain Perturbations, Adversarial Robustness, Image Authenticity, Reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05148 2025-08-14 cs.RO cs.AI 83%

Chemist Eye: A Visual Language Model-Powered System for Safety Monitoring and Robot Decision-Making in Self-Driving Laboratories

Francisco Munguia-Galeano, Zhengxue Zhou, Satheeshkumar Veeramani, Hatem Fakhruldeen, Louis Longley, Rob Clowes, Andrew I. Cooper

机构 * Cooper Group, Department of Chemistry, University of Liverpool(Cooper集团,化学系,利物浦大学)

专题命中 幻觉与鲁棒性 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09230 2025-08-14 cs.MA cs.AI 83%

Cowpox: Towards the Immunity of VLM-based Multi-Agent Systems

Yutong Wu, Jie Zhang, Yiming Li, Chao Zhang, Qing Guo, Nils Lukas, Tianwei Zhang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore, Singapore.(南洋理工大学计算机与数据科学学院) CFAR and IHPC, Agency for Science, Technology and Research, Singapore.(科技研究局) Network and Information Security Lab, Tsinghua University, Beijing, China.(清华大学网络与信息安全部门) Mohamed bin Zayed University of Artificial Intelligence, Masdar City, Abu Dhabi(马斯达尔城人工智能大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09218 2025-08-14 cs.CV cs.AI 81%

Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity

Zuoou Li, Weitong Zhang, Jingyuan Wang, Shuyuan Zhang, Wenjia Bai, Bernhard Kainz, Mengyun Qiao

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09500 2025-08-14 cs.CV 79%

Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations

Yiwen Liang, Hui Chen, Yizhe Xiong, Zihan Zhou, Mengyao Lyu, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at the 33rd ACM International Conference on Multimedia(ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03012 2025-08-14 cs.AI cs.CL cs.CV 62%

Analyzing Finetuning Representation Shift for Multimodal LLMs Steering

Pegah Khayatan, Mustafa Shukor, Jayneel Parekh, Arnaud Dapogny, Matthieu Cord

机构 * ISIR, Sorbonne Université(ISIR,索邦大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025. The first three authors contributed equally. Project page and code: https://pegah- kh.github.io/projects/lmm-finetuning-analysis-and-steering/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 8 篇

2508.09225 2025-08-14 eess.IV cs.AI cs.CV 84%

AMRG: Extend Vision Language Models for Automatic Mammography Report Generation

Nak-Jun Sung, Donghyun Lee, Bo Hwa Choi, Chae Jung Park

机构 * Research Institute, National Cancer Center Korea(韩国国家癌症中心研究所) Department of Radiology, National Cancer Center Korea(韩国国家癌症中心放射科)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17619 2025-08-14 cs.CV 83%

CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment

Bo Wang, De-Xing Huang, Xiao-Hu Zhou, Mei-Jiang Gui, Nu-Fang Xiao, Jian-Long Hao, Ming-Yuan Liu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University of Science and Technology(湖南科技大学) Shanxi University of Finance and Economics(山西财经大学) Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Camera ready version for ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19860 2025-08-14 cs.CV 83%

CoherenDream: Boosting Holistic Text Coherence in 3D Generation via Multimodal Large Language Models Feedback

Chenhan Jiang, Yihan Zeng, Dit-Yan Yeung

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏