arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2503.23771 2025-04-01 cs.CV 57%

XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?

Fengxiang Wang, Hongzhen Wang, Mingshuo Chen, Di Wang, Yulin Wang, Zonghao Guo, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, Zhiyuan Liu, Maosong Sun

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments It has been accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22208 2025-03-31 cs.SD cs.CV eess.AS 57%

DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos

Yunming Liang, Zihao Chen, Chaofan Ding, Xinhan Di

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21056 2025-03-28 cs.CV eess.IV 57%

Online Reasoning Video Segmentation with Just-in-Time Digital Twins

Yiqing Shen, Bohan Liu, Chenjia Li, Lalithkumar Seenivasan, Mathias Unberath

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19199 2025-03-26 cs.CV 57%

Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces

Chenyangguang Zhang, Alexandros Delitzas, Fangjinhua Wang, Ruida Zhang, Xiangyang Ji, Marc Pollefeys, Francis Engelmann

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17188 2025-03-25 cs.CV cs.CL 57%

Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment

Dongping Chen, Ruoxi Chen, Shu Pu, Zhaoyi Liu, Yanru Wu, Caixi Chen, Benlin Liu, Yue Huang, Yao Wan, Pan Zhou, Ranjay Krishna

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ICLR 2025 as Spotlight. Project homepage: https://interleave-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12605 2025-03-25 cs.CV 57%

Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey

Yaoting Wang, Shengqiong Wu, Yuecheng Zhang, Shuicheng Yan, Ziwei Liu, Jiebo Luo, Hao Fei

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Survey, working under progress; 12 figures, 4 tables, 44 pages; Resource at https://github.com/yaotingwangofficial/Awesome-MCoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13356 2025-03-18 cs.LG 57%

Agents Play Thousands of 3D Video Games

Zhongwen Xu, Xianliang Wang, Siyi Li, Tao Yu, Liang Wang, Qiang Fu, Wei Yang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07927 2025-03-18 cs.AI cs.CL cs.HC 57%

A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications

Pranab Sahoo, Ayush Kumar Singh, Sriparna Saha, Vinija Jain, Samrat Mondal, Aman Chadha

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10247 2025-03-14 cs.CV 57%

Interpretable Image Classification via Non-parametric Part Prototype Learning

Zhijie Zhu, Lei Fan, Maurice Pagnucco, Yang Song

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09241 2025-03-13 cs.AI 57%

In-Context Defense in Computer Agents: An Empirical Study

Pei Yang, Hai Ci, Mike Zheng Shou

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09173 2025-03-13 cs.RO cs.AI 57%

Long-Term Planning Around Humans in Domestic Environments with 3D Scene Graphs

Ermanno Bartoli, Dennis Rotondi, Kai O. Arras, Iolanda Leite

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20666 2025-03-13 cs.RO cs.AI cs.CL 57%

Guide-LLM: An Embodied LLM Agent and Text-Based Topological Map for Robotic Guidance of People with Visual Impairments

Sangmim Song, Sarath Kodagoda, Amal Gunatilake, Marc G. Carmichael, Karthick Thiyagarajan, Jodi Martin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07608 2025-03-11 cs.CV cs.RO 57%

AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning

Bo Jiang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://github.com/hustvl/AlphaDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07485 2025-03-11 cs.CV 57%

Chameleon: Fast-slow Neuro-symbolic Lane Topology Extraction

Zongzheng Zhang, Xinrun Li, Sizhe Zou, Guoxuan Chi, Siqi Li, Xuchong Qiu, Guoliang Wang, Guantian Zheng, Leichen Wang, Hang Zhao, Hao Zhao

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments ICRA 2025, Project Page: https://github.com/XR-Lee/neural-symbolic

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06219 2025-03-11 cs.CV 57%

VLScene: Vision-Language Guidance Distillation for Camera-Based 3D Semantic Scene Completion

Meng Wang, Huilong Pi, Ruihui Li, Yunchuan Qin, Zhuo Tang, Kenli Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accept by AAAI-2025(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14743 2025-03-11 cs.CV 57%

VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding

Ahmad Mahmood, Ashmal Vayani, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08693 2025-03-10 cs.RO cs.LG 57%

Robotic Control via Embodied Chain-of-Thought Reasoning

Michał Zawalski, William Chen, Karl Pertsch, Oier Mees, Chelsea Finn, Sergey Levine

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments Project Website: https://embodied-cot.github.io. Updated funding information

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04034 2025-03-07 cs.CV 57%

GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding

Xihan Wang, Dianyi Yang, Yu Gao, Yufeng Yue, Yi Yang, Mengyin Fu

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02579 2025-03-05 cs.CV 57%

MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical Environments

Ege Özsoy, Chantal Pellegrini, Tobias Czempiel, Felix Tristram, Kun Yuan, David Bani-Harouni, Ulrich Eck, Benjamin Busam, Matthias Keicher, Nassir Navab

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16955 2025-03-04 cs.LG cond-mat.mtrl-sci 57%

Probing the limitations of multimodal language models for chemistry and materials research

Nawaf Alampara, Mara Schilling-Wilhelmi, Martiño Ríos-García, Indrajeet Mandal, Pranav Khetarpal, Hargun Singh Grover, N. M. Anoop Krishnan, Kevin Maik Jablonka

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20850 2025-03-03 cs.CV 57%

VLEER: Vision and Language Embeddings for Explainable Whole Slide Image Representation

Anh Tien Nguyen, Keunho Byeon, Kyungeun Kim, Jin Tae Kwak

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20826 2025-03-03 cs.CV cs.IR 57%

CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval

Zelong Sun, Dong Jing, Zhiwu Lu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19868 2025-02-28 cs.CV 57%

C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation

Yuhao Li, Mirana Claire Angel, Salman Khan, Yu Zhu, Jinqiu Sun, Yanning Zhang, Fahad Shahbaz Khan

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14088 2025-02-21 cs.CV 57%

Regression in EO: Are VLMs Up to the Challenge?

Xizhe Xue, Xiao Xiang Zhu

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11829 2025-02-18 cs.CL cs.AI cs.SE 57%

Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities

Hanbin Wang, Xiaoxuan Zhou, Zhipeng Xu, Keyuan Cheng, Yuxin Zuo, Kai Tian, Jingwei Song, Junting Lu, Wenhui Hu, Xueyang Liu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11775 2025-02-18 cs.CV 57%

video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model

Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun MA, Chao Zhang

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11573 2025-02-18 cs.CL cs.AI 57%

InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning

Congkai Xie, Shuo Cai, Wenjun Wang, Pengxiang Li, Zhijie Sang, Kejing Yang, Yiming Zhang, Zhen Li, Guanghao Zhu, Zeyu Liu, Yang Yu, Yuhang Liu, Su Lu, Baoyi He, Qi Zhou, Xiaotian Han, Jianbo Yuan, Shengyu Zhang, Fei Wu, Hongxia Yang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17809 2025-02-18 cs.CV 57%

An Intelligent Agentic System for Complex Image Restoration Problems

Kaiwen Zhu, Jinjin Gu, Zhiyuan You, Yu Qiao, Chao Dong

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10046 2025-02-17 cs.GR cs.CV 57%

ViRAC: A Vision-Reasoning Agent Head Movement Control Framework in Arbitrary Virtual Environments

Juyeong Hwang, Seong-Eun Hong, Hyeongyeop Kang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01694 2025-02-14 cs.CV 57%

Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation

Yudi Shi, Shangzhe Di, Qirui Chen, Weidi Xie

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏