arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2505.15472 2025-05-23 cs.CL 67%

PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions

Song Dai, Yibo Yan, Jiamin Su, Dongfang Zihao, Yubo Gao, Yonghua Hei, Jungang Li, Junyan Zhang, Sicheng Tao, Zhuoran Gao, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14948 2025-05-22 cs.CV cs.AI cs.LG 67%

Programmatic Video Prediction Using Large Language Models

Hao Tang, Kevin Ellis, Suhas Lohit, Michael J. Jones, Moitreya Chatterjee

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14064 2025-05-21 eess.IV cs.AI cs.CV cs.LG 67%

NOVA: A Benchmark for Anomaly Localization and Clinical Reasoning in Brain MRI

Cosmin I. Bercea, Jun Li, Philipp Raffler, Evamaria O. Riedel, Lena Schmitzer, Angela Kurz, Felix Bitzer, Paula Roßmüller, Julian Canisius, Mirjam L. Beyrle, Che Liu, Wenjia Bai, Bernhard Kainz, Julia A. Schnabel, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) Klinikum Rechts der Isar(莱比锡医院) Helmholtz Center Munich(慕尼黑海德堡中心) FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡弗赖堡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13403 2025-05-20 cs.CL 67%

MR. Judge: Multimodal Reasoner as a Judge

Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiulong Shan, Kieran Liu, Meng Cao

机构 * HKUST(香港科技大学) Apple(苹果公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13376 2025-05-20 cs.RO 67%

Seeing, Saying, Solving: An LLM-to-TL Framework for Cooperative Robots

Dan BW Choe, Sundhar Vinodh Sangeetha, Steven Emanuel, Chih-Yuan Chiu, Samuel Coogan, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Aerospace Engineering(航空航天工程学院) School of Mechanical Engineering(机械工程学院)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15558 2025-05-20 cs.AI cs.CV cs.LG cs.RO 67%

Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning

NVIDIA, :, Alisson Azzolini, Junjie Bai, Hannah Brandon, Jiaxin Cao, Prithvijit Chattopadhyay, Huayu Chen, Jinju Chu, Yin Cui, Jenna Diamond, Yifan Ding, Liang Feng, Francesco Ferroni, Rama Govindaraju, Jinwei Gu, Siddharth Gururani, Imad El Hanafi, Zekun Hao, Jacob Huffman, Jingyi Jin, Brendan Johnson, Rizwan Khan, George Kurian, Elena Lantz, Nayeon Lee, Zhaoshuo Li, Xuan Li, Maosheng Liao, Tsung-Yi Lin, Yen-Chen Lin, Ming-Yu Liu, Xiangyu Lu, Alice Luo, Andrew Mathau, Yun Ni, Lindsey Pavao, Wei Ping, David W. Romero, Misha Smelyanskiy, Shuran Song, Lyne Tchapmi, Andrew Z. Wang, Boxin Wang, Haoxiang Wang, Fangyin Wei, Jiashu Xu, Yao Xu, Dinghao Yang, Xiaodong Yang, Zhuolin Yang, Jingxu Zhang, Xiaohui Zeng, Zhe Zhang

机构 * NVIDIA

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12432 2025-05-20 cs.LG cs.AI cs.CV 67%

Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning

Zirun Guo, Minjie Hong, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09731 2025-05-16 cs.RO 67%

Unfettered Forceful Skill Acquisition with Physical Reasoning and Coordinate Frame Labeling

William Xie, Max Conway, Yutong Zhang, Nikolaus Correll

机构 * University of Colorado at Boulder(科罗拉多大学波德摩尔分校)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05360 2025-05-09 cs.RO 67%

DSDrive: Distilling Large Language Model for Lightweight End-to-End Autonomous Driving with Unified Reasoning and Planning

Wenru Liu, Pei Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10342 2025-05-01 cs.CL 67%

VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge

Yueqi Song, Tianyue Ou, Yibo Kong, Zecheng Li, Graham Neubig, Xiang Yue

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

Comments 56 pages, 43 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12511 2025-04-18 cs.HC cs.AI cs.CV cs.LG 67%

Multimodal LLM Augmented Reasoning for Interpretable Visual Perception Analysis

Shravan Chaudhari, Trilokya Akula, Yoon Kim, Tom Blake

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12256 2025-04-17 cs.CV cs.AI cs.LG 67%

FLIP Reasoning Challenge

Andreas Plesner, Turlan Kuzhagaliyev, Roger Wattenhofer

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published at First Workshop on Open Science for Foundation Models at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09354 2025-04-15 cs.CV cs.AI cs.CL cs.LG q-bio.QM 67%

REMEMBER: Retrieval-based Explainable Multimodal Evidence-guided Modeling for Brain Evaluation and Reasoning in Zero- and Few-shot Neurodegenerative Diagnosis

Duy-Cat Can, Quang-Huy Tang, Huong Ha, Binh T. Nguyen, Oliver Y. Chén

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24376 2025-04-01 cs.CV cs.AI cs.CL cs.LG 67%

Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1

Yi Chen, Yuying Ge, Rui Wang, Yixiao Ge, Lu Qiu, Ying Shan, Xihui Liu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Technical Report (In Progress); Code released at: https://github.com/TencentARC/SEED-Bench-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10889 2025-04-01 cs.CV cs.AI cs.LG 67%

VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment

Darshana Saravanan, Varun Gupta, Darshan Singh, Zeeshan Khan, Vineet Gandhi, Makarand Tapaswi

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to CVPR 2025. Project Page, see https://katha-ai.github.io/projects/velociti

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22020 2025-03-31 cs.CV cs.AI cs.LG cs.RO 67%

CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models

Qingqing Zhao, Yao Lu, Moo Jin Kim, Zipeng Fu, Zhuoyang Zhang, Yecheng Wu, Zhaoshuo Li, Qianli Ma, Song Han, Chelsea Finn, Ankur Handa, Ming-Yu Liu, Donglai Xiang, Gordon Wetzstein, Tsung-Yi Lin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project website: https://cot-vla.github.io/

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21263 2025-03-28 cs.CL 67%

Cultivating Game Sense for Yourself: Making VLMs Gaming Experts

Wenxuan Lu, Jiangyang He, Zhanqiu Zhang, Yiwen Guo, Tianning Zang

专题命中 视觉推理 :vision language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17224 2025-03-24 cs.CV cs.AI cs.LG 67%

Neuro-Symbolic Scene Graph Conditioning for Synthetic Image Dataset Generation

Giacomo Savazzi, Eugenio Lomurno, Cristian Sbrolli, Agnese Chiatti, Matteo Matteucci

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14559 2025-03-20 cs.LG cs.AI cs.CL cs.CV 67%

Squeeze Out Tokens from Sample for Finer-Grained Data Governance

Weixiong Lin, Chen Ju, Haicheng Wang, Shengchao Hu, Shuai Xiao, Mengting Chen, Yuheng Jiao, Mingshuai Yao, Jinsong Lan, Qingwen Liu, Ying Chen

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13399 2025-03-18 cs.CV cs.AI cs.CL cs.LG q-bio.CB 67%

MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research

James Burgess, Jeffrey J Nirschl, Laura Bravo-Sánchez, Alejandro Lozano, Sanket Rajan Gupte, Jesus G. Galaz-Montoya, Yuhui Zhang, Yuchang Su, Disha Bhowmik, Zachary Coman, Sarina M. Hasan, Alexandra Johannesson, William D. Leineweber, Malvika G Nair, Ridhi Yarlagadda, Connor Zuraski, Wah Chiu, Sarah Cohen, Jan N. Hansen, Manuel D Leonetti, Chad Liu, Emma Lundberg, Serena Yeung-Levy

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2025 (Conference on Computer Vision and Pattern Recognition) Project page at https://jmhb0.github.io/microvqa Benchmark at https://huggingface.co/datasets/jmhb/microvqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19488 2025-03-18 cs.CV cs.AI cs.LG 67%

Interleaved-Modal Chain-of-Thought

Jun Gao, Yongqi Li, Ziqiang Cao, Wenjie Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06873 2025-03-12 cs.CV cs.AI cs.LG 67%

Interactive Medical Image Analysis with Concept-based Similarity Reasoning

Ta Duc Huy, Sen Kim Tran, Phan Nguyen, Nguyen Hoang Tran, Tran Bao Sam, Anton van den Hengel, Zhibin Liao, Johan W. Verjans, Minh-Son To, Vu Minh Hieu Phan

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted CVPR2025

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01378 2025-03-04 cs.RO 67%

CognitiveDrone: A VLA Model and Evaluation Benchmark for Real-Time Cognitive Task Solving and Reasoning in UAVs

Artem Lykov, Valerii Serpiva, Muhammad Haris Khan, Oleg Sautenkov, Artyom Myshlyaev, Grik Tadevosyan, Yasheerah Yaqoot, Dzmitry Tsetserukou

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

Comments Paper submitted to the IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10954 2025-02-19 cs.CV cs.AI cs.LG 67%

Learning to Stop Overthinking at Test Time

Hieu Tran Bao, Nguyen Cong Dat, Nguyen Duc Anh, Hoang Thanh-Tung

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04976 2025-02-10 cs.MM 67%

Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark

Han Zhang, Zixiang Meng, Meng Luo, Hong Han, Lizi Liao, Erik Cambria, Hao Fei

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

Comments Accepted by TheWebConf (WWW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14210 2025-01-27 cs.CV cs.AI cs.LG 67%

PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction

Hammad Ayyubi, Xuande Feng, Junzhang Liu, Xudong Lin, Zhecan Wang, Shih-Fu Chang

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08597 2025-01-16 cs.CL 67%

Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning

Julian Perry, Surasakdi Siripong, Thanakorn Phonchai

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19451 2024-12-02 cs.CV cs.AI cs.LG 67%

Learning Visual Abstract Reasoning through Dual-Stream Networks

Kai Zhao, Chang Xu, Bailu Si

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 10 pages, 6 figures

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 38(15), 16979-16988

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07743 2024-11-14 cs.AI cs.CV cs.LG 67%

V-LoL: A Diagnostic Dataset for Visual Logical Learning

Lukas Helff, Wolfgang Stammer, Hikaru Shindo, Devendra Singh Dhami, Kristian Kersting

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20178 2024-11-13 cs.AI cs.CL cs.CV cs.LG 67%

LLMs Can Evolve Continually on Modality for X-Modal Reasoning

Jiazuo Yu, Haomiao Xiong, Lu Zhang, Haiwen Diao, Yunzhi Zhuge, Lanqing Hong, Dong Wang, Huchuan Lu, You He, Long Chen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏