arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2503.07485 2025-03-11 cs.CV 57%

Chameleon: Fast-slow Neuro-symbolic Lane Topology Extraction

Zongzheng Zhang, Xinrun Li, Sizhe Zou, Guoxuan Chi, Siqi Li, Xuchong Qiu, Guoliang Wang, Guantian Zheng, Leichen Wang, Hang Zhao, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research, China(博世中国企业研究中心) Institute for Interdisciplinary Information Sciences(IIIS), Tsinghua University(清华大学交叉信息研究院)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments ICRA 2025, Project Page: https://github.com/XR-Lee/neural-symbolic

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06219 2025-03-11 cs.CV 57%

VLScene: Vision-Language Guidance Distillation for Camera-Based 3D Semantic Scene Completion

Meng Wang, Huilong Pi, Ruihui Li, Yunchuan Qin, Zhuo Tang, Kenli Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accept by AAAI-2025(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14743 2025-03-11 cs.CV 57%

VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding

Ahmad Mahmood, Ashmal Vayani, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

机构 * ETH Zurich(苏黎世联邦理工学院) University of Central Florida(中佛罗里达大学) Khalifa University(哈利法大学) Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Australian National University(澳大利亚国立大学) Linköping University(林雪平大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08693 2025-03-10 cs.RO cs.LG 57%

Robotic Control via Embodied Chain-of-Thought Reasoning

Michał Zawalski, William Chen, Karl Pertsch, Oier Mees, Chelsea Finn, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校) University of Warsaw(华沙大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments Project Website: https://embodied-cot.github.io. Updated funding information

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04034 2025-03-07 cs.CV 57%

GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding

Xihan Wang, Dianyi Yang, Yu Gao, Yufeng Yue, Yi Yang, Mengyin Fu

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) National Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统全国重点实验室)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02579 2025-03-05 cs.CV 57%

MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical Environments

Ege Özsoy, Chantal Pellegrini, Tobias Czempiel, Felix Tristram, Kun Yuan, David Bani-Harouni, Ulrich Eck, Benjamin Busam, Matthias Keicher, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16955 2025-03-04 cs.LG cond-mat.mtrl-sci 57%

Probing the limitations of multimodal language models for chemistry and materials research

Nawaf Alampara, Mara Schilling-Wilhelmi, Martiño Ríos-García, Indrajeet Mandal, Pranav Khetarpal, Hargun Singh Grover, N. M. Anoop Krishnan, Kevin Maik Jablonka

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20850 2025-03-03 cs.CV 57%

VLEER: Vision and Language Embeddings for Explainable Whole Slide Image Representation

Anh Tien Nguyen, Keunho Byeon, Kyungeun Kim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(高丽大学电气工程学院) Seegene Medical Foundation(Seegene医学基金会)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20826 2025-03-03 cs.CV cs.IR 57%

CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval

Zelong Sun, Dong Jing, Zhiwu Lu

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19868 2025-02-28 cs.CV 57%

C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation

Yuhao Li, Mirana Claire Angel, Salman Khan, Yu Zhu, Jinqiu Sun, Yanning Zhang, Fahad Shahbaz Khan

机构 * Northwestern Polytechnical University(西北工业大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14088 2025-02-21 cs.CV 57%

Regression in EO: Are VLMs Up to the Challenge?

Xizhe Xue, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11829 2025-02-18 cs.CL cs.AI cs.SE 57%

Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities

Hanbin Wang, Xiaoxuan Zhou, Zhipeng Xu, Keyuan Cheng, Yuxin Zuo, Kai Tian, Jingwei Song, Junting Lu, Wenhui Hu, Xueyang Liu

机构 * Peking University(北京大学) Northeastern University(东北大学) University of Hong Kong(香港大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11775 2025-02-18 cs.CV 57%

video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model

Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun MA, Chao Zhang

机构 * Tsinghua university(清华大学)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11573 2025-02-18 cs.CL cs.AI 57%

InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning

Congkai Xie, Shuo Cai, Wenjun Wang, Pengxiang Li, Zhijie Sang, Kejing Yang, Yiming Zhang, Zhen Li, Guanghao Zhu, Zeyu Liu, Yang Yu, Yuhang Liu, Su Lu, Baoyi He, Qi Zhou, Xiaotian Han, Jianbo Yuan, Shengyu Zhang, Fei Wu, Hongxia Yang

机构 * Reallm Labs(Reallm实验室) The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Harbin Institute of Technology(哈尔滨工业大学) Dalian University of Technology(大连理工大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) TikTok(字节跳动旗下TikTok) Amazon(亚马逊)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17809 2025-02-18 cs.CV 57%

An Intelligent Agentic System for Complex Image Restoration Problems

Kaiwen Zhu, Jinjin Gu, Zhiyuan You, Yu Qiao, Chao Dong

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10046 2025-02-17 cs.GR cs.CV 57%

ViRAC: A Vision-Reasoning Agent Head Movement Control Framework in Arbitrary Virtual Environments

Juyeong Hwang, Seong-Eun Hong, Hyeongyeop Kang

机构 * Kyung Hee University(庆熙大学) Korea University(高丽大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01694 2025-02-14 cs.CV 57%

Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation

Yudi Shi, Shangzhe Di, Qirui Chen, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Coop. Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作媒体创新中心)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06873 2025-02-12 cs.CL cs.AI 57%

Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic Reasoning

Subin Kim, Hoonrae Kim, Heejin Do, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院) Department of Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17427 2025-02-11 cs.CV 57%

Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model

Kuan-Chih Huang, Xiangtai Li, Lu Qi, Shuicheng Yan, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Skywork AI, Singapore(新加坡Skywork AI公司) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to 3DV 2025. Project Page: https://reason3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03971 2025-02-07 cs.CV cs.HC 57%

RWKV-UI: UI Understanding with Enhanced Perception and Reasoning

Jiaxi Yang, Haowen Hou

机构 * Sun Yat-sen University(中山大学) Shenzhen Yuanshi Intelligence Co., Ltd(深圳元石智能有限公司)

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

Comments 10 pages, 5figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05291 2025-02-07 cs.AI 57%

WorkArena++: Towards Compositional Planning and Reasoning-based Common Knowledge Work Tasks

Léo Boisvert, Megh Thakkar, Maxime Gasse, Massimo Caccia, Thibault Le Sellier De Chezelles, Quentin Cappart, Nicolas Chapados, Alexandre Lacoste, Alexandre Drouin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18733 2025-02-03 cs.RO cs.AI 57%

Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation

Yuelei Li, Ge Yan, Annabella Macaluso, Mazeyu Ji, Xueyan Zou, Xiaolong Wang

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13536 2025-01-24 cs.CV cs.CL 57%

ReasVQA: Advancing VideoQA with Imperfect Reasoning Process

Jianxin Liang, Xiaojun Meng, Huishuai Zhang, Yueqian Wang, Jiansheng Wei, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) National Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to main conference at NAACL 2025; 8 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11896 2025-01-23 cs.AI 57%

Systematic Abductive Reasoning via Diverse Relation Representations in Vector-symbolic Architecture

Zhong-Hua Sun, Ru-Yuan Zhang, Zonglei Zhen, Da-Hui Wang, Yong-Jie Li, Xiaohong Wan, Hongzhi You

机构 * School of Life Science and Technology, University of Electronic Science and Technology of China (UESTC)(电子科技大学生命科学与技术学院) Brain Health Institute, National Center for Mental Disorders, Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属精神卫生中心国家精神障碍中心脑健康研究所) State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(北京师范大学认知神经科学与学习国家重点实验室) School of Systems Science, Beijing Normal University(北京师范大学系统科学学院)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10944 2025-01-22 cs.CV 57%

Location-Free Scene Graph Generation

Ege Özsoy, Felix Holm, Mahdi Saleh, Tobias Czempiel, Chantal Pellegrini, Nassir Navab, Benjamin Busam

机构 * Technical University Munich (TUM)(慕尼黑工业大学(TUM))

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05444 2025-01-10 cs.CV 57%

Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark

Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng

机构 * University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) University of Washington(华盛顿大学) Microsoft(微软公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05413 2025-01-10 cs.SD cs.CV cs.GR eess.AS 57%

Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation

Darius Petermann, Mahdi M. Kalayeh

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Netflix(网飞公司)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00358 2025-01-10 cs.CV 57%

Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding

Yue Fan, Xiaojian Ma, Rongpeng Su, Jun Guo, Rujie Wu, Xi Chen, Qing Li

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments project page: https://embodied-videoagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04150 2025-01-09 cs.CV 57%

Benchmarking Large and Small MLLMs

Xuelu Feng, Yunsheng Li, Dongdong Chen, Mei Gao, Mengchen Liu, Junsong Yuan, Chunming Qiao

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06324 2025-01-03 cs.CV 57%

World knowledge-enhanced Reasoning Using Instruction-guided Interactor in Autonomous Driving

Mingliang Zhai, Cheng Li, Zengyuan Guo, Ningrui Yang, Xiameng Qin, Sanyuan Zhao, Junyu Han, Ji Tao, Yuwei Wu, Yunde Jia

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments AAAI 2025. 14 pages. Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏