arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2507.08104 2025-07-14 cs.MM cs.AI cs.CL cs.CV 62%

VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations

Michael Galarnyk, Veer Kejriwal, Agam Shah, Yash Bhardwaj, Nicholas Meyer, Anand Krishnan, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04289 2025-07-08 cs.CV cs.AI 62%

M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li, Shoujun Zhou, Hongliang Li, Fuxia Yang

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Chinese Academy of Sciences(中国科学院) Air Force Hospital of Southern Theater Command of PLA(中国人民解放军南部战区空军医院) Shenzhen Traditional Chinese Medicine Hospital(深圳中医药医院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02252 2025-07-04 cs.CV cs.AI 62%

SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement

Zeyu Lei, Hongyuan Yu, Jinlin Wu, Zhen Chen

机构 * University of Chinese Academy of Sciences Multimedia Department, Xiaomi Inc Chinese Academy of Sciences, Institute of Automation Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22880 2025-07-01 cs.CV cs.AI 62%

Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder

Dang Jisheng, Wu Xudong, Wang Bimei, Lv Ning, Chen Jiayu, Jingwen Zhao, Yichu liu, Jizhao Liu, Juncheng Li, Teng Wang

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Jinan University(济南大学) South China University of Technology(华南理工大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18867 2025-06-27 cs.CV cs.AI 62%

UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent

Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen, Xiang Zhu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University,Beijing, China(信息科学交叉研究所,清华大学,北京,中国) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院,上海,中国)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14827 2025-06-19 cs.CV cs.AI 62%

DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning

Yifeng Gao, Yifan Ding, Hongyu Su, Juncheng Li, Yunhan Zhao, Lin Luo, Zixing Chen, Li Wang, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07016 2025-06-17 cs.CV cs.AI 62%

MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks

Sanjoy Chowdhury, Mohamed Elmoghany, Yohan Abeysinghe, Junjie Fei, Sayan Nag, Salman Khan, Mohamed Elhoseiny, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学College Park分校) KAUST(卡尔斯兰大学) MBZUAI(马克斯·普朗克人工智能研究所) University of Toronto(多伦多大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments Audio-visual learning, Audio-Visual RAG, Multi-Video Linkage

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10895 2025-06-13 cs.CV cs.AI 62%

AIR: Zero-shot Generative Model Adaptation with Iterative Refinement

Guimeng Liu, Milad Abdollahzadeh, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05384 2025-06-13 cs.CV cs.AI cs.MM 62%

Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment

Zhuoxuan Cai, Jian Zhang, Xinbin Yuan, Peng-Tao Jiang, Wenxiang Chen, Bowen Tang, Lujian Yao, Qiyuan Wang, Jinwen Chen, Bo Li

机构 * Fudan University(复旦大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06479 2025-06-13 cs.CL cs.AI cs.CV 62%

Visually Descriptive Language Model for Vector Graphics Reasoning

Zhenhailong Wang, Joy Hsu, Xingyao Wang, Kuan-Hao Huang, Manling Li, Jiajun Wu, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Texas A&M University(德克萨斯A&M大学) Northwestern University(西北大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Project page: https://mikewangwzhl.github.io/VDLM/

Journal ref TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10128 2025-06-13 cs.CV cs.LG 62%

ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs

Xiyao Wang, Zhengyuan Yang, Chao Feng, Yongyuan Liang, Yuhang Zhou, Xiaoyu Liu, Ziyi Zang, Ming Li, Chung-Ching Lin, Kevin Lin, Linjie Li, Furong Huang, Lijuan Wang

机构 * University of Maryland College Park(马里兰大学学院市分校) Microsoft(微软) University of Michigan(密歇根大学) Cardiff University(卡迪夫大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20490 2025-06-13 cs.CV cs.AI cs.CL 62%

EgoNormia: Benchmarking Physical Social Norm Understanding

MohammadHossein Rezaei, Yicheng Fu, Phil Cuvin, Caleb Ziems, Yanzhe Zhang, Hao Zhu, Diyi Yang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments V4, fixes to title and formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07943 2025-06-12 cs.CV cs.AI 62%

Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations

Yizhen Li, Dell Zhang, Xuelong Li, Yiqing Shen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments This work was submitted without the consent of all co-authors. We request withdrawal until all parties agree

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06275 2025-06-09 cs.CV cs.CL cs.LG 62%

Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding

Emmanouil Zaranis, António Farinhas, Saul Santos, Beatriz Canaverde, Miguel Moura Ramos, Aditya K Surikuchi, André Viveiros, Baohao Liao, Elena Bueno-Benito, Nithin Sivakumaran, Pavlo Vasylenko, Shoubin Yu, Sonal Sannigrahi, Wafaa Mohammed, Ben Peters, Danae Sánchez Villegas, Elias Stengel-Eskin, Giuseppe Attanasio, Jaehong Yoon, Stella Frank, Alessandro Suglia, Chrysoula Zerva, Desmond Elliott, Mariella Dimiccoli, Mohit Bansal, Oswald Lanz, Raffaella Bernardi, Raquel Fernández, Sandro Pezzelle, Vlad Niculae, André F. T. Martins

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05896 2025-06-09 cs.RO cs.AI cs.CV 62%

Object Navigation with Structure-Semantic Reasoning-Based Multi-level Map and Multimodal Decision-Making LLM

Chongshang Yan, Jiaxuan He, Delun Li, Yi Yang, Wenjie Song

机构 * School of Automation(自动化学院) Beijing Institute of Technology(北京理工大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24871 2025-06-06 cs.CV cs.CL cs.LG 62%

MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning

Yiqing Liang, Jielin Qiu, Wenhao Ding, Zuxin Liu, James Tompkin, Mengdi Xu, Mengzhou Xia, Zhengzhong Tu, Laixi Shi, Jiacheng Zhu

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.LG

Comments Project Webpage: https://modomodo-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13427 2025-06-06 cs.AI cs.CV 62%

MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision

Lingxiao Du, Fanqing Meng, Zongkai Liu, Zhixiang Zhou, Ping Luo, Qiaosheng Zhang, Wenqi Shao

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17213 2025-06-06 cs.CV cs.AI 62%

VCD: A Dataset for Visual Commonsense Discovery in Images

Xiangqing Shen, Fanfan Wang, Siwei Wu, Rui Xia

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00698 2025-06-05 cs.AI cs.CV 62%

MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models

Huanqia Cai, Yijun Yang, Winston Hu

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11556 2025-06-03 cs.CV cs.AI cs.CL 62%

StarVector: Generating Scalable Vector Graphics Code from Images and Text

Juan A. Rodriguez, Abhay Puri, Shubham Agarwal, Issam H. Laradji, Pau Rodriguez, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23558 2025-06-02 cs.CV cs.LG 62%

Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information

Xu Chu, Xinrong Chen, Guanyu Wang, Zhijie Tan, Kui Huang, Wenyu Lv, Tong Mo, Weiping Li

机构 * Peking University(北京大学) Baidu Inc.(百度公司)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02673 2025-05-30 cs.LG cs.AI cs.MA 62%

MedRAX: Medical Reasoning Agent for Chest X-ray

Adibvafa Fallahpour, Jun Ma, Alif Munim, Hongwei Lyu, Bo Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 4 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22525 2025-05-29 cs.CV cs.AI cs.CL 62%

Thinking with Generated Images

Ethan Chern, Zhulin Hu, Steffi Chern, Siqi Kou, Jiadi Su, Yan Ma, Zhijie Deng, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) SII Fudan University(复旦大学) Generative AI Research Lab (GAIR)(生成式人工智能研究实验室)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22457 2025-05-29 cs.CV cs.AI cs.CL 62%

Fostering Video Reasoning via Next-Event Prediction

Haonan Wang, Hongfu Liu, Xiangyan Liu, Chao Du, Kenji Kawaguchi, Ye Wang, Tianyu Pang

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21327 2025-05-28 cs.AI cs.CV 62%

MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs

Jiakang Yuan, Tianshuo Peng, Yilei Jiang, Yiting Lu, Renrui Zhang, Kaituo Feng, Chaoyou Fu, Tao Chen, Lei Bai, Bo Zhang, Xiangyu Yue

机构 * Fudan University(复旦大学) MMLab, The Chinese University of Hong Kong(中大香港人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24008 2025-05-28 cs.CV cs.AI 62%

H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding

Qi Wu, Quanlong Zheng, Yanhao Zhang, Junlin Xie, Jinguo Luo, Kuo Wang, Peng Liu, Qingsong Xie, Ru Zhen, Zhenyu Yang, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08105 2025-05-28 cs.CV cs.AI 62%

Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities

Zhiyuan Li, Heng Wang, Dongnan Liu, Chaoyi Zhang, Ao Ma, Jieting Long, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19195 2025-05-27 cs.AI cs.CV 62%

CardioCoT: Hierarchical Reasoning for Multimodal Survival Analysis

Shaohao Rui, Haoyang Su, Jinyi Xiang, Lian-Ming Wu, Xiaosong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17540 2025-05-26 cs.CV cs.AI 62%

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

Mingrui Wu, Lu Wang, Pu Zhao, Fangkai Yang, Jianjin Zhang, Jianfeng Liu, Yuefeng Zhan, Weihao Han, Hao Sun, Jiayi Ji, Xiaoshuai Sun, Qingwei Lin, Weiwei Deng, Dongmei Zhang, Feng Sun, Qi Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学) Microsoft(微软)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments Code is available at: https://github.com/microsoft/DKI_LLM/tree/main/RePrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16579 2025-05-23 cs.AI cs.CV 62%

Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning

Siqu Ou, Hongcheng Liu, Pingjie Wang, Yusheng Liao, Chuan Xuan, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI lab(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏