arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2508.01016 2025-08-05 eess.IV cs.CV 74%

Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks

Gustav Müller-Franzes, Debora Jutz, Jakob Nikolas Kather, Christiane Kuhl, Sven Nebelung, Daniel Truhn

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11001 2025-07-16 cs.RO cs.CV 74%

Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation

Yanbo Wang, Zipeng Fang, Lei Zhao, Weidong Chen

专题命中 视觉推理 :MLLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23120 2025-07-01 cs.CV 74%

Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation

Zhenhua Ning, Zhuotao Tian, Shaoshuai Shi, Guangming Lu, Daojing He, Wenjie Pei, Li Jiang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12958 2025-06-23 cs.LG 74%

Domain Specific Benchmarks for Evaluating Multimodal Large Language Models

Khizar Anjum, Muhammad Arbab Arshad, Kadhim Hayawi, Efstathios Polyzos, Asadullah Tariq, Mohamed Adel Serhani, Laiba Batool, Brady Lund, Nishith Reddy Mannuru, Ravi Varma Kumar Bevara, Taslim Mahbub, Muhammad Zeeshan Akram, Sakib Shahriar

机构 * Rutgers University(罗切斯特大学) Iowa State University(爱荷华州立大学) Zayed University(扎耶德大学) United Arab Emirates University(阿拉伯联合酋长国大学) University of Sharjah(沙迦大学) University of North Texas(北德克萨斯大学) George Washington University(乔治·华盛顿大学) University of Louisville(路易斯维尔大学) University of Guelph(圭尔夫大学)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05098 2025-06-04 cs.RO cs.CL cs.CV cs.ET 74%

X-Driver: Explainable Autonomous Driving with Vision-Language Models

Wei Liu, Jiyuan Zhang, Binxiong Zheng, Yufeng Hu, Yingzhan Lin, Zengfeng Zeng

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Baidu Inc.(百度公司)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16770 2025-05-26 cs.CV 74%

RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs

Meng-Hao Guo, Xuanyu Chu, Qianrui Yang, Zhe-Han Mo, Yiqing Shen, Pei-lin Li, Xinjie Lin, Jinnian Zhang, Xin-Sheng Chen, Yi Zhang, Kiyohiro Nakayama, Zhengyang Geng, Houwen Peng, Han Hu, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan X(腾讯文英实验室) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12293 2025-05-16 cs.SE cs.LG 74%

Unified Modeling Language Code Generation from Diagram Images Using Multimodal Large Language Models

Averi Bates, Ryan Vavricka, Shane Carleton, Ruosi Shao, Chongle Pan

专题命中 视觉推理 :multimodal large language model(title);分类 cs.LG

Comments Published in the Journal of Machine Learning with Applications, Author Contributions: Averi Bates: Methodology, Development, Analysis, Data Curation, Drafting, Review. Ryan Vavricka: Data Curation, Development, Review. Shane Carleton: Supervision, Funding. Ruosi Shao: Review. Chongle Pan: Supervision, Review

Journal ref Mach. Learn. Appl. 20 (2025) 100660

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02018 2025-05-06 cs.CV 74%

R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation

Meng-Hao Guo, Jiajun Xu, Yi Zhang, Jiaxi Song, Haoyang Peng, Yi-Xuan Deng, Xinzhi Dong, Kiyohiro Nakayama, Zhengyang Geng, Chen Wang, Bolin Ni, Guo-Wei Yang, Yongming Rao, Houwen Peng, Han Hu, Gordon Wetzstein, Shi-min Hu

专题命中 视觉推理 :MLLM(title);分类 cs.CV

Comments 18pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24110 2025-04-01 cs.AI cs.CL 74%

Grounding Agent Reasoning in Image Schemas: A Neurosymbolic Approach to Embodied Cognition

François Olivier, Zied Bouraoui

专题命中 视觉推理 :grounding(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16734 2025-03-24 cs.AI cs.IR 74%

Towards Agentic Recommender Systems in the Era of Multimodal Large Language Models

Chengkai Huang, Junda Wu, Yu Xia, Zixu Yu, Ruhan Wang, Tong Yu, Ruiyi Zhang, Ryan A. Rossi, Branislav Kveton, Dongruo Zhou, Julian McAuley, Lina Yao

专题命中 视觉推理 :multimodal large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16537 2025-03-24 cs.CL cs.CV 74%

Do Multimodal Large Language Models Understand Welding?

Grigorii Khvatskii, Yong Suk Lee, Corey Angst, Maria Gibbs, Robert Landers, Nitesh V. Chawla

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14607 2025-03-20 cs.CV 74%

Can Large Vision Language Models Read Maps Like a Human?

Shuo Xing, Zezhou Sun, Shuangyu Xie, Kaiyuan Chen, Yanjia Huang, Yuping Wang, Jiachen Li, Dezhen Song, Zhengzhong Tu

专题命中 视觉推理 :vision language model(title);分类 cs.CV

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10639 2025-03-14 cs.CV 74%

GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing

Rongyao Fang, Chengqi Duan, Kun Wang, Linjiang Huang, Hao Li, Shilin Yan, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Xihui Liu, Hongsheng Li

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV

Comments Dataset and models are released in https://github.com/rongyaofang/GoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15147 2025-02-25 cs.AI cs.HC 74%

A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models

Zhongzhan Huang, Shanshan Zhong, Pan Zhou, Shanghua Gao, Marinka Zitnik, Liang Lin

专题命中 视觉推理 :multimodal large language model(title);分类 cs.AI

Comments Accepted by TPAMI. arXiv admin note: text overlap with arXiv:2312.02439

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14922 2025-02-24 cs.CL cs.AI 74%

SIFT: Grounding LLM Reasoning in Contexts via Stickers

Zihao Zeng, Xuyao Huang, Boxiu Li, Zhijie Deng

专题命中 视觉推理 :grounding(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15950 2024-12-03 cs.AI 74%

Atari-GPT: Benchmarking Multimodal Large Language Models as Low-Level Policies in Atari Games

Nicholas R. Waytowich, Devin White, MD Sunbeam, Vinicius G. Goecks

专题命中 视觉推理 :multimodal large language model(title);分类 cs.AI

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10740 2024-11-12 cs.CV 74%

FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models

Zhikai Zhang, Yitang Li, Haofeng Huang, Mingxian Lin, Li Yi

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18925 2024-10-24 cs.CL cs.CV 74%

Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding

Jiwan Chung, Sungjae Lee, Minseo Kim, Seungju Han, Ashkan Yousefpour, Jack Hessel, Youngjae Yu

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

Comments 12 pages, 6 figures. Accepted as main paper in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16093 2024-08-09 cs.LG 74%

Visual cognition in multimodal large language models

Luca M. Schulze Buschoff, Elif Akata, Matthias Bethge, Eric Schulz

专题命中 视觉推理 :multimodal large language model(title);分类 cs.LG

Comments Updated manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01682 2024-08-06 cs.CL cs.CV 74%

Multi-Frame Vision-Language Model for Long-form Reasoning in Driver Behavior Analysis

Hiroshi Takato, Hiroshi Tsutsui, Komei Soda, Hidetaka Kamigaito

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

Comments On-going work

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13382 2024-07-19 cs.LG 74%

Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols

Gertjan Burghouts, Fieke Hillerström, Erwin Walraven, Michael van Bekkum, Frank Ruis, Joris Sijs, Jelle van Mil, Judith Dijk

专题命中 视觉推理 :visual reasoning(title);分类 cs.LG

Comments 12 pages

Journal ref International Conference on Pattern Recognition and Artificial Intelligence (ICPRAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18839 2024-06-28 cs.AI 74%

Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA

Elham J. Barezi, Parisa Kordjamshidi

专题命中 视觉推理 :visual reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15543 2023-11-28 cs.CV 74%

Beyond Pixels: Exploring Human-Readable SVG Generation for Simple Images with Vision Language Models

Tong Zhang, Haoyang Liu, Peiyan Zhang, Yuxuan Cheng, Haohan Wang

专题命中 视觉推理 :vision language model(title);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11990 2022-09-27 cs.CV 74%

Deep Neural Networks for Visual Reasoning

Thao Minh Le

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.12271 2019-07-30 cs.CV 74%

V-PROM: A Benchmark for Visual Reasoning Using Visual Progressive Matrices

Damien Teney, Peng Wang, Jiewei Cao, Lingqiao Liu, Chunhua Shen, Anton van den Hengel

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.05574 2019-01-18 cs.LG cs.HC 74%

Visual Reasoning of Feature Attribution with Deep Recurrent Neural Networks

Chuan Wang, Takeshi Onishi, Keiichi Nemoto, Kwan-Liu Ma

专题命中 视觉推理 :visual reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.06157 2018-09-21 cs.CV 74%

Object Level Visual Reasoning in Videos

Fabien Baradel, Natalia Neverova, Christian Wolf, Julien Mille, Greg Mori

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV

Comments Accepted at ECCV 2018 - long version (16 pages + ref)

Journal ref ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17151 2026-08-19 cs.CV cs.LG 新提交 73%

Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport

基于区域级组织推理与非平衡最优传输的淋巴细胞模拟修正

Xiang Li, Yuqi Wang, Casey C. Heirman, Jihye Heo, Kyle J. Lafata

机构 * Duke University(杜克大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对细胞模拟导致的病理细胞分类歧义问题,提出Loki-OT方法,结合区域级组织推理与非平衡最优传输,在TCGA-BRCA队列上取得更优性能。

Comments 13 pages, 3 figures. Accepted to the MICCAI 2026 COMPAYL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09508 2026-08-19 cs.CV cs.AI 版本更新 73%

VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning

VISOR: 通过迭代搜索和超视距推理实现基于视觉检索的增强生成

Yucheng Shen, Jiulong Wu, Jizhou Huang, Dawei Yin, Lingyong Yan, Min Cao

机构 * Soochow University(苏州大学) Baidu Inc.(百度公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 VISOR通过结构化证据空间和动态轨迹机制解决多步推理中的视觉证据稀疏和搜索漂移问题,实现高效长视距视觉推理。

Comments Accepted by ACM Multimedia 2026 (MM '26). 8 pages, 3 figures. Code: https://github.com/syc1336/VISOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15006 2026-08-18 cs.CV cs.AI cs.MM 新提交 73%

MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems

MetaReason:通过编辑元信息实现精确的交错多模态推理以解决几何问题

Penghao Yin, Haomin Wang, Qihong Tang, Xiaoye Qu, Hongjie Zhang, Xiao-Ping Zhang

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出MetaReason框架,构建TutorGeo与ExamGeo数据集,结合监督微调与强化学习,实现几何问题的精确交错多模态推理,性能优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏