arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2506.16755 2025-06-23 cs.CL cs.AI 57%

Language-Informed Synthesis of Rational Agent Models for Grounded Theory-of-Mind Reasoning On-The-Fly

Lance Ying, Ryan Truong, Katherine M. Collins, Cedegao E. Zhang, Megan Wei, Tyler Brooke-Wilson, Tan Zhi-Xuan, Lionel Wong, Joshua B. Tenenbaum

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Brown University(布朗大学) Yale University(耶鲁大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

Comments 5 figures, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09149 2025-06-23 cs.CV cs.MM 57%

Memory-enhanced Retrieval Augmentation for Long Video Understanding

Huaying Yuan, Zheng Liu, Minghao Qin, Hongjin Qian, Yan Shu, Zhicheng Dou, Ji-Rong Wen, Nicu Sebe

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光华学院人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Trento(特伦托大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13102 2025-06-17 cs.CL cs.AI cs.CY 57%

Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs

Gyutaek Oh, Seoyeon Kim, Sangjoon Park, Byung-Hoon Kim

机构 * Department of Biomedical Systems Informatics, Yonsei University College of Medicine(生物医学系统信息学系,延世大学医学院) Yonsei University College of Medicine(延世大学医学院) Department of Radiation Oncology, Yonsei University College of Medicine(放射肿瘤学系,延世大学医学院) Department of Biomedical Systems Informatics and the Department of Psychiatry, Yonsei University College of Medicine(生物医学系统信息学系和精神病学系,延世大学医学院) Institute for Innovation in Digital Healthcare, Yonsei University(数字医疗创新研究所,延世大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12538 2025-06-17 cs.CL cs.AI 57%

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking

Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng, Jinfeng Xu, Jinze Li, Zhenzhe Ying, Weiqiang Wang, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) University College London(伦敦大学学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11737 2025-06-16 cs.CV cs.CL cs.MM 57%

Quizzard@INOVA Challenge 2025 -- Track A: Plug-and-Play Technique in Interleaved Multi-Image Model

Dinh Viet Cuong, Hoang-Bao Le, An Pham Ngoc Nguyen, Liting Zhou, Cathal Gurrin

机构 * School of Computing, Dublin City University(都柏林城市大学计算机学院) ADAPT Centre(ADAPT中心)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11114 2025-06-16 cs.CL cs.AI 57%

KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations

Junyu Liu, Kaiqi Yan, Tianyang Wang, Qian Niu, Momoko Nagai-Tanima, Tomoki Aoyama

机构 * Kyoto University(京都大学) The Hong Kong University of Science and Technology(香港科技大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The University of Tokyo(东京大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 9pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08700 2025-06-12 cs.CL cs.CV 57%

ClimateViz: A Benchmark for Statistical Reasoning and Fact Verification on Scientific Charts

Ruiran Su, Jiasheng Si, Zhijiang Guo, Janet B. Pierrehumbert

机构 * University of Oxford(牛津大学) Qilu University of Technology(Shandong Academy of Sciences)(齐鲁工业大学(山东科学院)) Hong Kong University of Science and Technology(香港科学大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学大学(广州))

专题命中 视觉推理 :InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16033 2025-06-12 cs.CL cs.AI 57%

Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models

Qianqi Yan, Yue Fan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) eBay(eBay公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20024 2025-06-11 cs.CV 57%

SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning

Wufei Ma, Yu-Cheng Chou, Qihao Liu, Xingrui Wang, Celso de Melo, Jianwen Xie, Alan Yuille

机构 * DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室) Lambda Inc(Lambda公司)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Project page: https://spatial-reasoner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07643 2025-06-10 cs.CV 57%

Synthetic Visual Genome

Jae Sung Park, Zixian Ma, Linjie Li, Chenhao Zheng, Cheng-Yu Hsieh, Ximing Lu, Khyathi Chandu, Quan Kong, Norimasa Kobori, Ali Farhadi, Yejin Choi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能艾伦研究所) Stanford University(斯坦福大学) Woven by Toyota(丰田编织)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07418 2025-06-10 cs.AI 57%

Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests

Arnau Igualde Sáez, Lamyae Rhomrasi, Yusef Ahsini, Ricardo Vinuesa, Sergio Hoyas, Jose P. García Sabater, Marius J. Fullana i Alfonso, J. Alberto Conejero

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06218 2025-06-09 cs.CV 57%

STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving

Christian Fruhwirth-Reisinger, Dušan Malić, Wei Lin, David Schinagl, Samuel Schulter, Horst Possegger

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Dataset: https://huggingface.co/datasets/ivc-lrp/STSBench, Code: https://github.com/LRP-IVC/STSBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05331 2025-06-06 cs.CV 57%

MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning

Xinyan Chen, Renrui Zhang, Dongzhi Jiang, Aojun Zhou, Shilin Yan, Weifeng Lin, Hongsheng Li

机构 * CUHK MMLab(香港大学MMLab)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Code is released at https://github.com/xinyan-cxy/MINT-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04633 2025-06-06 cs.CV 57%

Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations

Linjie Li, Mahtab Bigverdi, Jiawei Gu, Zixian Ma, Yinuo Yang, Ziang Li, Yejin Choi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Sun Yat-sen University(中山大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments STARE is available at https://github.com/STARE-bench/STARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24875 2025-06-06 cs.CV cs.CL 57%

ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL

Yu Zhang, Yunqi Li, Yifan Yang, Rui Wang, Yuqing Yang, Dai Qi, Jianmin Bao, Dongdong Chen, Chong Luo, Lili Qiu

机构 * ShanghaiTech University(上海科技大学) Microsoft Corporation(微软公司) Fudan University(复旦大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05237 2025-06-05 cs.CL cs.CV 57%

MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale

Jarvis Guo, Tuney Zheng, Yuelin Bai, Bo Li, Yubo Wang, King Zhu, Yizhi Li, Graham Neubig, Wenhu Chen, Xiang Yue

机构 * Carnegie Mellon University(卡内基梅隆大学) M-A-P Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The University of Manchester(曼彻斯特大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01795 2025-06-03 cs.CV 57%

R2SM: Referring and Reasoning for Selective Masks

Yu-Lin Shih, Wei-En Tai, Cheng Sun, Yu-Chiang Frank Wang, Hwann-Tzong Chen

机构 * National Tsing Hua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01676 2025-06-03 cs.AI 57%

K12Vista: Exploring the Boundaries of MLLMs in K-12 Education

Chong Li, Chenglin Zhu, Tao Zhang, Mingan Lin, Zenan Zhou, Jian Xie

机构 * Baichuan Inc(百川公司) Peking University(北京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00855 2025-06-03 cs.AI 57%

MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book

Sau Lai Yip, Sunan He, Yuxiang Nie, Shu Pui Chan, Yilin Ye, Sum Ying Lam, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology(化学与生物工程系,香港科学与技术大学) Division of Life Science, The Hong Kong University of Science and Technology(生命科学系,香港科学与技术大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments For data and code, see: https://huggingface.co/datasets/slyipae1/MedBookVQA and https://github.com/slyipae1/MedBookVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07089 2025-06-03 cs.CV cs.CL 57%

OmniCaptioner: One Captioner to Rule Them All

Yiting Lu, Jiakang Yuan, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Tianshuo Peng, Shufei Zhang, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Peng Gao, Bo Zhang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments More visualizations on Homepage: https://alpha-innovator.github.io/OmniCaptioner-project-page and Official code: https://github.com/Alpha-Innovator/OmniCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18147 2025-06-03 cs.CV 57%

PHT-CAD: Efficient CAD Parametric Primitive Analysis with Progressive Hierarchical Tuning

Ke Niu, Yuwen Chen, Haiyang Yu, Zhuofan Chen, Xianghui Que, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17451 2025-06-03 cs.CV cs.CL 57%

VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Lei Li, Yuancheng Wei, Zhihui Xie, Xuqing Yang, Yifan Song, Peiyi Wang, Chenxin An, Tianyu Liu, Sujian Li, Bill Yuchen Lin, Lingpeng Kong, Qi Liu

机构 * HKU(香港大学) SCUT(华南理工大学) SJTU(上海交通大学) PKU(北京大学) Allen AI(AllenAI)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready Version. Project page: https://vl-rewardbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23922 2025-06-02 cs.CV cs.CL 57%

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo Zang, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Ni Jiahui, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang, Shiwen Ni, Xiaojie Jin

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23727 2025-05-30 cs.CV cs.MM 57%

PixelThink: Towards Efficient Chain-of-Pixel Reasoning

Song Wang, Gongfan Fang, Lingdong Kong, Xiangtai Li, Jianyun Xu, Sheng Yang, Qiang Li, Jianke Zhu, Xinchao Wang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) AD Lab, CaiNiao Inc., Alibaba Group(阿里集团 Cainiao 事业部实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://PixelThink.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23130 2025-05-30 cs.CV 57%

PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents

Haoyu Chen, Keda Tao, Yizao Wang, Xinlei Wang, Lei Zhu, Jinjin Gu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) The University of Sydney(悉尼大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03708 2025-05-30 cs.CL cs.AI stat.ML 57%

Toward universal steering and monitoring of AI models

Daniel Beaglehole, Adityanarayanan Radhakrishnan, Enric Boix-Adserà, Mikhail Belkin

机构 * Computer Science and Engineering(计算机科学与工程) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) UC San Diego(圣地亚哥大学) Harvard SEAS(哈佛大学工程与应用科学学院) MIT Mathematics(MIT数学系) Halıcıoğlu Data Science Institute(Halıcıoğlu数据科学研究所) Harvard CMSA(哈佛大学计算机科学与应用数学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20971 2025-05-28 cs.CL cs.AI 57%

Reason-Align-Respond: Aligning LLM Reasoning with Knowledge Graphs for KGQA

Xiangqing Shen, Fanfan Wang, Rui Xia

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology, China(计算机科学与工程学院,南京理工大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20777 2025-05-28 cs.CV 57%

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Zhehan Kan, Yanlin Liu, Kun Yin, Xinghua Jiang, Xin Li, Haoyu Cao, Yinsong Liu, Deqiang Jiang, Xing Sun, Qingmin Liao, Wenming Yang

机构 * Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20672 2025-05-28 cs.AI 57%

GIFARC: Synthetic Dataset for Leveraging Human-Intuitive Analogies to Elevate AI Reasoning

Woochang Sim, Hyunseok Ryu, Kyungmin Choi, Sungwon Han, Sundong Kim

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20256 2025-05-27 cs.CV 57%

Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration

Hao Zhong, Muzhi Zhu, Zongze Du, Zheng Huang, Canyu Zhao, Mingyu Liu, Wen Wang, Hao Chen, Chunhua Shen

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments Project page: https://aim-uofa.github.io/OmniR1

详情

展开后加载摘要…

URL PDF HTML 收藏