arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2502.06873 2025-02-12 cs.CL cs.AI 57%

Multimodal Cognitive Reframing Therapy via Multi-hop Psychotherapeutic Reasoning

Subin Kim, Hoonrae Kim, Heejin Do, Gary Geunbae Lee

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

Comments NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17427 2025-02-11 cs.CV 57%

Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model

Kuan-Chih Huang, Xiangtai Li, Lu Qi, Shuicheng Yan, Ming-Hsuan Yang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to 3DV 2025. Project Page: https://reason3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03971 2025-02-07 cs.CV cs.HC 57%

RWKV-UI: UI Understanding with Enhanced Perception and Reasoning

Jiaxi Yang, Haowen Hou

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

Comments 10 pages, 5figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05291 2025-02-07 cs.AI 57%

WorkArena++: Towards Compositional Planning and Reasoning-based Common Knowledge Work Tasks

Léo Boisvert, Megh Thakkar, Maxime Gasse, Massimo Caccia, Thibault Le Sellier De Chezelles, Quentin Cappart, Nicolas Chapados, Alexandre Lacoste, Alexandre Drouin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18733 2025-02-03 cs.RO cs.AI 57%

Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation

Yuelei Li, Ge Yan, Annabella Macaluso, Mazeyu Ji, Xueyan Zou, Xiaolong Wang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13536 2025-01-24 cs.CV cs.CL 57%

ReasVQA: Advancing VideoQA with Imperfect Reasoning Process

Jianxin Liang, Xiaojun Meng, Huishuai Zhang, Yueqian Wang, Jiansheng Wei, Dongyan Zhao

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted to main conference at NAACL 2025; 8 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11896 2025-01-23 cs.AI 57%

Systematic Abductive Reasoning via Diverse Relation Representations in Vector-symbolic Architecture

Zhong-Hua Sun, Ru-Yuan Zhang, Zonglei Zhen, Da-Hui Wang, Yong-Jie Li, Xiaohong Wan, Hongzhi You

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10944 2025-01-22 cs.CV 57%

Location-Free Scene Graph Generation

Ege Özsoy, Felix Holm, Mahdi Saleh, Tobias Czempiel, Chantal Pellegrini, Nassir Navab, Benjamin Busam

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05444 2025-01-10 cs.CV 57%

Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark

Yunzhuo Hao, Jiawei Gu, Huichen Will Wang, Linjie Li, Zhengyuan Yang, Lijuan Wang, Yu Cheng

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05413 2025-01-10 cs.SD cs.CV cs.GR eess.AS 57%

Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation

Darius Petermann, Mahdi M. Kalayeh

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00358 2025-01-10 cs.CV 57%

Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding

Yue Fan, Xiaojian Ma, Rongpeng Su, Jun Guo, Rujie Wu, Xi Chen, Qing Li

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments project page: https://embodied-videoagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04150 2025-01-09 cs.CV 57%

Benchmarking Large and Small MLLMs

Xuelu Feng, Yunsheng Li, Dongdong Chen, Mei Gao, Mengchen Liu, Junsong Yuan, Chunming Qiao

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06324 2025-01-03 cs.CV 57%

World knowledge-enhanced Reasoning Using Instruction-guided Interactor in Autonomous Driving

Mingliang Zhai, Cheng Li, Zengyuan Guo, Ningrui Yang, Xiameng Qin, Sanyuan Zhao, Junyu Han, Ji Tao, Yuwei Wu, Yunde Jia

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments AAAI 2025. 14 pages. Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03094 2024-12-25 cs.AI 57%

A Divide-Align-Conquer Strategy for Program Synthesis

Jonas Witt, Sebastijan Dumančić, Tias Guns, Claus-Christian Carbon

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11077 2024-12-23 cs.CV 57%

Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval

Yuanmin Tang, Xiaoting Qin, Jue Zhang, Jing Yu, Gaopeng Gou, Gang Xiong, Qingwei Ling, Saravan Rajmohan, Dongmei Zhang, Qi Wu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12898 2024-12-18 cs.LG cs.CE cs.CL cs.MA 57%

An Agentic Approach to Automatic Creation of P&ID Diagrams from Natural Language Descriptions

Shreeyash Gowaikar, Srinivasan Iyengar, Sameer Segal, Shivkumar Kalyanaraman

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

Comments Accepted at the AAAI'25 Workshop on AI to Accelerate Science and Engineering (AI2ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11396 2024-12-17 cs.CV 57%

Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes

Antonio Carlos Rivera, Anthony Moore, Steven Robinson

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10719 2024-12-17 cs.CV cs.MM 57%

Benchmarking VLMs' Reasoning About Persuasive Atypical Images

Sina Malakouti, Aysan Aghazadeh, Ashmit Khandelwal, Adriana Kovashka

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09547 2024-12-16 cs.CL cs.AI 57%

Piecing It All Together: Verifying Multi-Hop Multimodal Claims

Haoran Wang, Aman Rangapur, Xiongxiao Xu, Yueqing Liang, Haroon Gharwi, Carl Yang, Kai Shu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18564 2024-12-13 cs.AI cs.CL 57%

Dspy-based Neural-Symbolic Pipeline to Enhance Spatial Reasoning in LLMs

Rong Wang, Kun Sun, Jonas Kuhn

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13499 2024-12-13 cs.CV 57%

R2G: Reasoning to Ground in 3D Scenes

Yixuan Li, Zan Wang, Wei Liang

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03809 2024-12-06 cs.CV 57%

EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM

Quang Nguyen, Truong Vu, Trong-Tung Nguyen, Yuxin Wen, Preston K Robinette, Taylor T Johnson, Tom Goldstein, Anh Tran, Khoi Nguyen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00846 2024-12-03 cs.AI 57%

Improving Multimodal LLMs Ability In Geometry Problem Solving, Reasoning, And Multistep Scoring

Avinash Anand, Raj Jaiswal, Abhishek Dharmadhikari, Atharva Marathe, Harsh Parimal Popat, Harshil Mital, Kritarth Prasad, Rajiv Ratn Shah, Roger Zimmermann

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13730 2024-12-03 cs.AI cs.CL 57%

VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning

Zhihuan Jiang, Zhen Yang, Jinhao Chen, Zhengxiao Du, Weihan Wang, Bin Xu, Jie Tang

专题命中 视觉推理 :visual question answering(abstract);分类 cs.AI

Comments 89 pages, 70 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12272 2024-12-03 cs.AI 57%

Slot State Space Models

Jindong Jiang, Fei Deng, Gautam Singh, Minseung Lee, Sungjin Ahn

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2024; Project page is available at https://slotssms.github.io/ ; Code is available at https://github.com/JindongJiang/SlotSSMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18666 2024-12-02 cs.CV 57%

3D Scene Graph Guided Vision-Language Pre-training

Hao Liu, Yanni Ma, Yan Liu, Haihong Xiao, Ying He

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments 14 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18158 2024-11-28 cs.AI 57%

Abductive Symbolic Solver on Abstraction and Reasoning Corpus

Mintaek Lim, Seokki Lee, Liyew Woletemaryam Abitew, Sundong Kim

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments Presented at IJCAI 2024 LNSAI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17794 2024-11-28 cs.CV 57%

NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?

Jiaxuan Li, Junwen Mo, MinhDuc Vo, Akihiro Sugimoto, Hideki Nakayama

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13697 2024-11-22 cs.CV 57%

Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs

Rui Cao, Yuming Jiang, Michael Schlichtkrull, Andreas Vlachos

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08164 2024-11-14 cs.CV 57%

ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs

Irene Huang, Wei Lin, M. Jehanzeb Mirza, Jacob A. Hansen, Sivan Doveh, Victor Ion Butoi, Roei Herzig, Assaf Arbelle, Hilde Kuehne, Trevor Darrell, Chuang Gan, Aude Oliva, Rogerio Feris, Leonid Karlinsky

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments NeurIPS 2024 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏