arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2408.08105 2025-05-28 cs.CV cs.AI 62%

Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities

Zhiyuan Li, Heng Wang, Dongnan Liu, Chaoyi Zhang, Ao Ma, Jieting Long, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19195 2025-05-27 cs.AI cs.CV 62%

CardioCoT: Hierarchical Reasoning for Multimodal Survival Analysis

Shaohao Rui, Haoyang Su, Jinyi Xiang, Lian-Ming Wu, Xiaosong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17540 2025-05-26 cs.CV cs.AI 62%

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

Mingrui Wu, Lu Wang, Pu Zhao, Fangkai Yang, Jianjin Zhang, Jianfeng Liu, Yuefeng Zhan, Weihao Han, Hao Sun, Jiayi Ji, Xiaoshuai Sun, Qingwei Lin, Weiwei Deng, Dongmei Zhang, Feng Sun, Qi Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学) Microsoft(微软)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments Code is available at: https://github.com/microsoft/DKI_LLM/tree/main/RePrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16579 2025-05-23 cs.AI cs.CV 62%

Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning

Siqu Ou, Hongcheng Liu, Pingjie Wang, Yusheng Liao, Chuan Xuan, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI lab(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15687 2025-05-22 cs.CV cs.AI 62%

Discovering Pathology Rationale and Token Allocation for Efficient Multimodal Pathology Reasoning

Zhe Xu, Cheng Jin, Yihui Wang, Ziyi Liu, Hao Chen

机构 * Department of Computer Science Engineering(计算机科学与工程系) HKUST(香港科技大学)

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14340 2025-05-21 cs.CV cs.LG 62%

Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey

Seunghyuk Cho, Zhenyue Qin, Yang Liu, Youngbin Choi, Seungbeom Lee, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Australian National University(澳大利亚国立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03981 2025-05-09 cs.AI cs.CL cs.LG 62%

X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains

Qianchu Liu, Sheng Zhang, Guanghui Qin, Timothy Ossowski, Yu Gu, Ying Jin, Sid Kiblawi, Sam Preston, Mu Wei, Paul Vozila, Tristan Naumann, Hoifung Poon

机构 * Microsoft Research(微软研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15362 2025-04-23 cs.CV cs.CL cs.LG 62%

LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception

Yuan-Hong Liao, Sven Elflein, Liu He, Laura Leal-Taixé, Yejin Choi, Sanja Fidler, David Acuna

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 24 pages, 10 figures, in submission. Project page: https://andrewliao11.github.io/LongPerceptualThoughts

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00883 2025-04-16 cs.CV cs.AI 62%

Improved Visual-Spatial Reasoning via R1-Zero-Like Training

Zhenyi Liao, Qingsong Xie, Yanhao Zhang, Zijian Kong, Haonan Lu, Zhenyu Yang, Zhijie Deng

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07956 2025-04-11 cs.CV cs.AI cs.CL 62%

VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning

Yukun Qi, Yiming Zhao, Yu Zeng, Xikun Bao, Wenxuan Huang, Lin Chen, Zehui Chen, Jie Zhao, Zhongang Qi, Feng Zhao

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03953 2025-04-08 cs.CV cs.AI 62%

TGraphX: Tensor-Aware Graph Neural Network for Multi-Dimensional Feature Learning

Arash Sajjadi, Mark Eramian

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Submitted to arXiv. Code repository: https://github.com/arashsajjadi/TGraphX ||| https://git.cs.usask.ca/arash/tgraphx

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03640 2025-04-07 cs.CL cs.AI cs.CV 62%

Bonsai: Interpretable Tree-Adaptive Grounded Reasoning

Kate Sanders, Benjamin Van Durme

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments 9 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23598 2025-04-01 cs.AI cs.CV 62%

GenVP: Generating Visual Puzzles with Contrastive Hierarchical VAEs

Kalliopi Basioti, Pritish Sahu, Qingze Tony Liu, Zihao Xu, Hao Wang, Vladimir Pavlovic

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22152 2025-03-31 cs.CV cs.AI 62%

EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos

Yuxuan Li, Vijay Veerabadran, Michael L. Iuzzolino, Brett D. Roads, Asli Celikyilmaz, Karl Ridgeway

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03562 2025-03-27 cs.CV cs.AI 62%

Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection

Wenqiao Li, Yao Gu, Xintao Chen, Xiaohao Xu, Ming Hu, Xiaonan Huang, Yingna Wu

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR25

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17856 2025-03-21 cs.CV cs.AI 62%

ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting

Shaofei Cai, Zihao Wang, Kewei Lian, Zhancun Mu, Xiaojian Ma, Anji Liu, Yitao Liang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05092 2025-03-19 cs.CV cs.AI cs.CL 62%

Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs

Rohit Saxena, Aryo Pradipta Gema, Pasquale Minervini

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at the ICLR 2025 Workshop on Reasoning and Planning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10970 2025-03-17 cs.AI cs.LG 62%

TxAgent: An AI Agent for Therapeutic Reasoning Across a Universe of Tools

Shanghua Gao, Richard Zhu, Zhenglun Kong, Ayush Noori, Xiaorui Su, Curtis Ginder, Theodoros Tsiligkaridis, Marinka Zitnik

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments Project page: https://zitniklab.hms.harvard.edu/TxAgent TxAgent code: https://github.com/mims-harvard/TxAgent ToolUniverse code: https://github.com/mims-harvard/ToolUniverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07259 2025-03-13 cs.CV cs.AI 62%

Uncovering Hidden Connections: Iterative Search and Reasoning for Video-grounded Dialog

Haoyu Zhang, Meng Liu, Yisen Feng, Yaowei Wang, Weili Guan, Liqiang Nie

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05379 2025-03-11 cs.LG cs.CV 62%

R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning

Jiaxing Zhao, Xihan Wei, Liefeng Bo

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10471 2025-03-11 cs.CV cs.AI 62%

VCA: Video Curious Agent for Long Video Understanding

Zeyuan Yang, Delin Chen, Xueyang Yu, Maohao Shen, Chuang Gan

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05808 2025-03-11 cs.AI cs.LG cs.RO 62%

DriveGen: Towards Infinite Diverse Traffic Scenarios with Large Models

Shenyu Zhang, Jiaguo Tian, Zhengbang Zhu, Shan Huang, Jucheng Yang, Weinan Zhang

专题命中 视觉推理 :visual language model(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13870 2025-02-20 cs.LG cs.AI cs.CL cs.IT math.IT 62%

SPEX: Scaling Feature Interaction Explanations for LLMs

Justin Singh Kang, Landon Butler, Abhineet Agarwal, Yigit Efe Erginbas, Ramtin Pedarsani, Kannan Ramchandran, Bin Yu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11751 2025-02-18 cs.CV cs.AI 62%

Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning

Yuqi Pang, Bowen Yang, Haoqin Tu, Yun Cao, Zeyu Zhang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10458 2025-02-18 cs.LG cs.AI 62%

I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models

Zhenxing Mi, Kuan-Chieh Wang, Guocheng Qian, Hanrong Ye, Runtao Liu, Sergey Tulyakov, Kfir Aberman, Dan Xu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments Project page: https://mizhenxing.github.io/ThinkDiff, 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15208 2025-02-18 cs.CV cs.LG cs.RO 62%

OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving

Shuo Xing, Chengyuan Qian, Yuping Wang, Hongyuan Hua, Kexin Tian, Yang Zhou, Zhengzhong Tu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments The 3rd WACV Workshop on Large Language and Vision Models for Autonomous Driving (LLVM-AD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00626 2025-02-14 cs.CV cs.CR cs.LG 62%

Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks

Maan Qraitem, Nazia Tasnim, Piotr Teterwak, Kate Saenko, Bryan A. Plummer

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07542 2025-01-14 cs.CL cs.CV cs.LG 62%

Imagine while Reasoning in Space: Multimodal Visualization-of-Thought

Chengzu Li, Wenshan Wu, Huanyu Zhang, Yan Xia, Shaoguang Mao, Li Dong, Ivan Vulić, Furu Wei

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 6 figures, 4 tables (27 pages, 10 figures, 16 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11025 2025-01-13 cs.CV cs.AI 62%

From Simple to Professional: A Combinatorial Controllable Image Captioning Agent

Xinran Wang, Muxi Diao, Baoteng Li, Haiwen Zhang, Kongming Liang, Zhanyu Ma

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments A technical report. Project: https://github.com/xin-ran-w/CapAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02765 2025-01-07 cs.CV cs.AI 62%

Visual Large Language Models for Generalized and Specialized Applications

Yifan Li, Zhixin Lai, Wentao Bao, Zhen Tan, Anh Dao, Kewei Sui, Jiayi Shen, Dong Liu, Huan Liu, Yu Kong

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏