arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2505.15197 2025-09-29 cs.CV cs.AI cs.GR 62%

Intentional Gesture: Deliver Your Intentions with Gestures for Speech

Pinxin Liu, Haiyang Liu, Luchuan Song, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Tokyo(东京大学) University of Michigan(密歇根大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18282 2025-09-24 cs.RO cs.AI cs.LG 62%

PEEK: Guiding and Minimal Image Representations for Zero-Shot Generalization of Robot Manipulation Policies

Jesse Zhang, Marius Memmel, Kevin Kim, Dieter Fox, Jesse Thomason, Fabio Ramos, Erdem Bıyık, Abhishek Gupta, Anqi Li

机构 * University of Washington(华盛顿大学) NVIDIA(NVIDIA公司) University of Southern California(南加州大学) Allen Institute for AI(人工智能研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16721 2025-09-23 cs.CV cs.AI cs.RO 62%

Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15490 2025-09-22 cs.CV cs.AI 62%

SmolRGPT: Efficient Spatial Reasoning for Warehouse Environments with 600M Parameters

Abdarahmane Traore, Éric Hervet, Andy Couturier

机构 * Embia, Computer Science Department, Faculty of Science, Université de Moncton(Embia计算机科学系,科学学院,蒙特龙大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 3 figures, IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03642 2025-09-22 cs.CV cs.AI 62%

Spatial Understanding from Videos: Structured Prompts Meet Simulation Data

Haoyu Zhang, Meng Liu, Zaijing Li, Haokun Wen, Weili Guan, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025 as a Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10059 2025-09-15 cs.CV cs.AI 62%

Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration

Yue Zhou, Litong Feng, Mengcheng Lan, Xue Yang, Qingyun Li, Yiping Ke, Xue Jiang, Wayne Zhang

机构 * Department of Physics, J.K. Institute of Science(J.K.科学研究院物理系) World Scientific University(世界科学大学) University of Intelligent Studies(智能研究大学) East China Normal University(华东师范大学) Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09730 2025-09-15 cs.CV cs.AI 62%

MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance

Kaikai Zhao, Zhaoxiang Liu, Peng Wang, Xin Wang, Zhicheng Ma, Yajun Xu, Wenjing Zhang, Yibing Nan, Kai Wang, Shiguo Lian

机构 * organization= Data Science \& Artificial Intelligence Research Institute, China Unicom , city= Beijing , postcode= 100033 , country= PR China

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments accepted by Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01106 2025-09-12 cs.AI cs.CV cs.RO 62%

Robix: A Unified Model for Robot Interaction, Reasoning and Planning

Huang Fang, Mengxi Zhang, Heng Dong, Wei Li, Zixuan Wang, Qifeng Zhang, Xueyun Tian, Yucheng Hu, Hang Li

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments Tech report. Project page: https://robix-seed.github.io/robix/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06020 2025-09-08 cs.AI cs.CV 62%

ArtRAG: Retrieval-Augmented Generation with Structured Context for Visual Art Understanding

Shuai Wang, Ivona Najdenkoska, Hongyi Zhu, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) College of Business(商学院) Economics, University of Johannesburg(经济系,约翰内斯堡大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02958 2025-09-04 cs.LO cs.AI cs.LG cs.PL 62%

Lattice Annotated Temporal (LAT) Logic for Non-Markovian Reasoning

Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Dyuman Aditya, Paulo Shakarian, Devendra Parkar, Lahari Pokala, Clark Dorman, Gerardo I. Simari

机构 * Syracuse University Syracuse New York USA Arizona State University Tempe Arizona USA Scientific Systems Company, Inc. Woburn Massachusetts USA Department of Computer Science Engineering, Universidad Nacional del Sur (UNS) \& Institute for Computer Science Syracuse University Arizona State University Scientific Systems Company, Inc.

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00484 2025-09-03 cs.CV cs.AI 62%

VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding

Zhihong Zhang, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xinzhi Wang, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

Comments https://videorewardbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00465 2025-09-03 cs.RO cs.AI cs.CV 62%

Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning

Jiading Fang

机构 * Toyota Technological Institute at Chicago (TTIC)(丰田技术研究所(芝加哥))

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07998 2025-08-28 cs.CL cs.AI cs.CV 62%

PyVision: Agentic Vision with Dynamic Tooling

Shitian Zhao, Haoquan Zhang, Shaoheng Lin, Ming Li, Qilong Wu, Kaipeng Zhang, Chen Wei

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 26 Pages, 10 Figures, Technical report, Fix Typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04633 2025-08-27 cs.CV cs.AI 62%

M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering

Yanshu Li, Yi Cao, Hongyang He, Qisen Cheng, Xiang Fu, Xi Xiao, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) University of Warwick(沃里克大学) Samsung US(三星美国分公司) Boston University(波士顿大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Rutgers University(罗格斯大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments COLM 2025, 30 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09178 2025-08-15 cs.CV cs.AI 62%

IAD-R1: Reinforcing Consistent Reasoning in Industrial Anomaly Detection

Yanhui Li, Yunkang Cao, Chengliang Liu, Yuan Xiong, Xinghui Dong, Chao Huang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00043 2025-08-13 cs.CL cs.AI cs.CV 62%

CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation

Jixuan Leng, Chengsong Huang, Langlin Huang, Bill Yuchen Lin, William W. Cohen, Haohan Wang, Jiaxin Huang

机构 * CMU(卡内基梅隆大学) WUSTL(华盛顿大学) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07909 2025-08-12 cs.CV cs.AI cs.RO 62%

FunGraph: Functionality Aware 3D Scene Graphs for Language-Prompted Scene Interaction

Dennis Rotondi, Fabio Scaparro, Hermann Blum, Kai O. Arras

机构 * Socially Intelligent Robotics Lab, Institute for Artificial Intelligence, University of Stuttgart(社会智能机器人实验室,人工智能研究所,斯图加特大学) Robot Perception and Learning Lab, LAMARR Institute for Machine Learning and Artificial Intelligence, University of Bonn(机器人感知与学习实验室,LAMARR机器学习与人工智能研究所,波恩大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments Paper accepted for IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03722 2025-08-07 cs.CV cs.AI 62%

Multimodal Video Emotion Recognition with Reliable Reasoning Priors

Zhepeng Wang, Yingjian Zhu, Guanghao Dong, Hongzhu Yi, Feng Chen, Xinming Wang, Jun Xie

机构 * Lenovo Research(联想研究院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Institute of Automation, CAS(中国科学院自动化研究所) Macau University of Science and Technology(澳门科学理工学院) School of Computer Science and Technology, UCAS(中国科学院大学计算机科学与技术学院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03958 2025-08-07 cs.IR cs.AI cs.CL cs.LG 62%

A Comparative Study of Specialized LLMs as Dense Retrievers

Hengran Zhang, Keping Bi, Jiafeng Guo

机构 * Key Laboratory of Network Data Science and Technology(网络数据科学与技术重点实验室) Institute of Computing Technology(计算技术研究所) Chinese Academy of Sciences(中国科学院) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) University of Chinese Academy of Science(中国科学院大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by CCIR25 and published by Springer LNCS or LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24025 2025-08-04 cs.CV cs.AI 62%

DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models

Chenbin Pan, Wenbin He, Zhengzhong Tu, Liu Ren

机构 * Bosch Research North America(博世北美研究部) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Texas A&M University(德克萨斯A&M大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06252 2025-08-04 cs.CV cs.AI 62%

Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?

Kun Xiang, Zhili Liu, Zihao Jiang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Haoxiang Fan, Hanhui Li, Weiran Huang, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2411.11930

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13082 2025-07-29 cs.RO cs.AI cs.CV 62%

Free-form language-based robotic reasoning and grasping

Runyu Jiao, Alice Fasoli, Francesco Giuliari, Matteo Bortolon, Sergio Povoli, Guofeng Mei, Yiming Wang, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Trento(特伦托大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to IROS 2025. Project website: https://tev-fbk.github.io/FreeGrasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18678 2025-07-28 cs.CV cs.AI 62%

Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting

Xingyu Miao, Haoran Duan, Quanhao Qian, Jiuniu Wang, Yang Long, Ling Shao, Deli Zhao, Ran Xu, Gongjie Zhang

机构 * Durham University(杜ham大学) DAMO Academy, Alibaba Group(达摩院,阿里集团) Tsinghua University(清华大学) UCAS-Terminus AI Lab(北航-terminate人工智能实验室)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17787 2025-07-25 cs.LG cs.AI 62%

Hyperbolic Deep Learning for Foundation Models: A Survey

Neil He, Hiren Madhu, Ngoc Bui, Menglin Yang, Rex Ying

机构 * Yale University(耶鲁大学) Hong Kong University of Science(香港科学大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments 11 Pages, SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20292 2025-07-25 cs.CV cs.LG 62%

Visual Adaptive Prompting for Compositional Zero-Shot Learning

Kyle Stein, Arash Mahyari, Guillermo Francia, Eman El-Sheikh

机构 * University of West Florida(乌斯托尔大学) Florida Institute for Human and Machine Cognition (IHMC)(佛罗里达人类与机器认知研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15428 2025-07-22 cs.CV cs.AI 62%

EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent

Jiaao Li, Kaiyuan Li, Chen Gao, Yong Li, Xinlei Chen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13314 2025-07-18 cs.CV cs.AI 62%

Revisiting Reliability in the Reasoning-based Pose Estimation Benchmark

Junsu Kim, Naeun Kim, Jaeho Lee, Incheol Park, Dongyoon Han, Seungryul Baek

机构 * UNIST(全南大学) NVIDIA Foundation Models Lab(NVIDIA基础模型实验室) MODULABS NAVER AI Lab(NAVER AI实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments To be presented as a poster at MMFM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06405 2025-07-17 cs.CV cs.AI 62%

Tackling the Abstraction and Reasoning Corpus with Vision Transformers: the Importance of 2D Representation, Positions, and Objects

Wenhao Li, Yudong Xu, Scott Sanner, Elias Boutros Khalil

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Journal ref Transactions on Machine Learning Research (TMLR), 07/2025, https://openreview.net/forum?id=Al72Fp0rCg

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10548 2025-07-15 cs.CV cs.AI cs.CL 62%

EmbRACE-3K: Embodied Reasoning and Action in Complex Environments

Mingxian Lin, Wei Huang, Yitang Li, Chengjie Jiang, Kui Wu, Fangwei Zhong, Shengju Qian, Xin Wang, Xiaojuan Qi

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Project page: https://mxllc.github.io/EmbRACE-3K/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19021 2025-07-15 cs.CV cs.AI 62%

Relation-aware Hierarchical Prompt for Open-vocabulary Scene Graph Generation

Tao Liu, Rongjie Li, Chongyu Wang, Xuming He

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏