arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2508.18179 2025-08-26 cs.AI cs.CV 81%

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models

Zhenwei Tang, Difan Jiao, Blair Yang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18684 2025-08-18 cs.CV cs.AI cs.RO 81%

SORT3D: Spatial Object-centric Reasoning Toolbox for Zero-Shot 3D Grounding Using Large Language Models

Nader Zantout, Haochen Zhang, Pujith Kachana, Jinkai Qiu, Guofei Chen, Ji Zhang, Wenshan Wang

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉推理 :grounding(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 6 figures, published in IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15485 2025-08-15 cs.CV cs.AI cs.CL 81%

CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting

Atin Pothiraj, Elias Stengel-Eskin, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23382 2025-08-01 cs.CL cs.AI cs.CV 81%

MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models

Yiyan Ji, Haoran Chen, Qiguang Chen, Chengyue Wu, Libo Qin, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Central South University(中南大学)

专题命中 视觉推理 :multimodal large language model(title);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23956 2025-07-24 cs.CV cs.AI 81%

AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference

Kai Huang, Hao Zou, Bochen Wang, Ye Xi, Zhen Xie, Hao Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11761 2025-07-17 cs.CV cs.AI 81%

Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning

Fan Shi, Bin Li, Xiangyang Xue

机构 * Shanghai Key Laboratory of Intelligent Information Processing, School of Computer Science, Fudan University(上海智能信息处理重点实验室,计算机科学学院,复旦大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21876 2025-06-30 cs.CL cs.AI cs.CV 81%

Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation

Qiyue Gao, Xinyu Pi, Kevin Liu, Junrong Chen, Ruolan Yang, Xinqi Huang, Xinyu Fang, Lu Sun, Gautham Kishore, Bo Ai, Stone Tao, Mengyang Liu, Jiaxi Yang, Chao-Jung Lai, Chuanyang Jin, Jiannan Xiang, Benhao Huang, Zeming Chen, David Danks, Hao Su, Tianmin Shu, Ziqiao Ma, Lianhui Qin, Zhiting Hu

机构 * UC San Diego JHU Cornell Tech EPFL UMich

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09965 2025-06-23 cs.CV cs.AI 81%

Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

Junfei Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团) CUHK MMLab(香港中文大学MMLab) Nanjing University(南京大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19409 2025-06-12 cs.CV cs.CL cs.LG 81%

ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models

Danae Sánchez Villegas, Ingo Ziegler, Desmond Elliott

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

Comments Code, dataset, and checkpoints are publicly available at https://github.com/danaesavi/ImageChain; v2: added human annotation study to validate SimRate

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08927 2025-06-11 cs.CV cs.AI cs.CL 81%

Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions

David Acuna, Ximing Lu, Jaehun Jung, Hyunwoo Kim, Amlan Kar, Sanja Fidler, Yejin Choi

机构 * NVIDIA University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11300 2025-06-10 cs.CL cs.AI cs.CV 81%

CORDIAL: Can Multimodal Large Language Models Effectively Understand Coherence Relationships?

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) National Institute of Technology, Tiruchirappalli(特里奇里帕利学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments To appear at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL), Vienna, Austria, July 2025, https://2025.aclweb.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05883 2025-06-09 cs.CV cs.AI 81%

HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios

Daming Wang, Yuhao Song, Zijian He, Kangliang Chen, Xing Pan, Lu Deng, Weihao Gu

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments WOD Vision-based End-to-End Driving Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04688 2025-06-06 cs.CL cs.AI cs.CV 81%

MMRefine: Unveiling the Obstacles to Robust Refinement in Multimodal Large Language Models

Gio Paik, Geewook Kim, Jinbae Im

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24139 2025-06-04 cs.CV cs.AI 81%

S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation

Yichen Xie, Runsheng Xu, Tong He, Jyh-Jing Hwang, Katie Luo, Jingwei Ji, Hubert Lin, Letian Chen, Yiren Lu, Zhaoqi Leng, Dragomir Anguelov, Mingxing Tan

机构 * UC Berkeley(加州大学伯克利分校) Waymo LLC(Waymo公司) Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2025; Project website: s4-driver.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02096 2025-06-04 cs.LG cs.CL cs.CV 81%

SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis

Zijian Wu, Jinjie Ni, Xiangyan Liu, Zichen Liu, Hang Yan, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20021 2025-05-27 cs.CV cs.AI 81%

Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models

Hyunsik Chae, Seungwoo Yoon, Jaden Park, Chloe Yewon Chun, Yongin Cho, Mu Cai, Yong Jae Lee, Ernest K. Ryu

机构 * Seoul National University(首尔国立大学) UCLA(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 69 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18536 2025-05-27 cs.CL cs.AI cs.CV 81%

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models

Haoyuan Sun, Jiaqi Wu, Bo Xia, Yifu Luo, Yifei Zhao, Kai Qin, Xufei Lv, Tiantian Zhang, Yongzhe Chang, Xueqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04911 2025-05-09 cs.CV cs.AI cs.CL 81%

SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models

Shun Taguchi, Hideki Deguchi, Takumi Hamazaki, Hiroyuki Sakai

机构 * Toyota Central R&D Labs., Inc.(丰田中央研究实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08837 2025-05-09 cs.LG cs.AI 81%

VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, Wenhu Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20199 2025-04-30 cs.CV cs.AI cs.CL 81%

Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains

Juntian Zhang, Chuanqi cheng, Yuhan Liu, Wei Liu, Jian Luan, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06462 2025-04-21 cs.CV cs.LG 81%

VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text

Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted at ICLR 2025. Original paper name: VCR: Visual Caption Restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04447 2025-04-14 cs.AI cs.CV 81%

EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios

Lu Qiu, Yi Chen, Yuying Ge, Yixiao Ge, Ying Shan, Xihui Liu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments Code & data are available at: https://qiulu66.github.io/egoplanbench2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05782 2025-04-09 cs.CV cs.AI 81%

MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models

Pengfei Zhou, Fanrui Zhang, Xiaopeng Peng, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04839 2025-04-08 cs.CV cs.AI cs.CL 81%

Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations

Yanshu Li

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR 2025 Workshop on Reasoning and Planning for LLMs, 25 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02799 2025-04-04 cs.CV cs.AI 81%

Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence

Anita Rau, Mark Endo, Josiah Aklilu, Jaewoo Heo, Khaled Saab, Alberto Paderno, Jeffrey Jopling, F. Christopher Holsinger, Serena Yeung-Levy

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10380 2025-04-02 cs.CV cs.AI cs.CL cs.IR 81%

NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models

Pranshu Pandya, Vatsal Gupta, Agney S Talwarr, Tushar Kataria, Dan Roth, Vivek Gupta

专题命中 视觉推理 :vision language model(title);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 28 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16425 2025-03-27 cs.CV cs.AI cs.RO 81%

TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation

Linqing Zhong, Chen Gao, Zihan Ding, Yue Liao, Huimin Ma, Shifeng Zhang, Xu Zhou, Si Liu

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15886 2025-03-24 cs.CV cs.LG 81%

Enhancing Zero-Shot Image Recognition in Vision-Language Models through Human-like Concept Guidance

Hui Liu, Wenya Wang, Kecheng Chen, Jie Liu, Yibing Liu, Tiexin Qin, Peisong He, Xinghao Jiang, Haoliang Li

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments 21 pages, 7 figures 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01550 2025-03-24 cs.CV cs.AI 81%

SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model

Chunlin Yu, Hanqing Wang, Ye Shi, Haoyang Luo, Sibei Yang, Jingyi Yu, Jingya Wang

专题命中 视觉推理 :multimodal large language model(title);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02172 2025-03-19 cs.CV cs.AI cs.CL 81%

VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning

Xueqing Wu, Yuheng Ding, Bingxuan Li, Pan Lu, Da Yin, Kai-Wei Chang, Nanyun Peng

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025. https://visco-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏