arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2312.03661 2024-07-23 cs.CV 57%

Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving

Ming Nie, Renyuan Peng, Chunwei Wang, Xinyue Cai, Jianhua Han, Hang Xu, Li Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10005 2024-07-19 cs.CV cs.CL 57%

Advancing Large Multi-modal Models with Explicit Chain-of-Reasoning and Visual Question Generation

Kohei Uehara, Nabarun Goswami, Hanqin Wang, Toshiaki Baba, Kohtaro Tanaka, Tomohiro Hashimoto, Kai Wang, Rei Ito, Takagi Naoya, Ryo Umagami, Yingyi Wen, Tanachai Anakewat, Tatsuya Harada

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12532 2024-07-18 cs.CL cs.AI 57%

Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models

Xihe Qiu, Haoyu Wang, Xiaoyu Tan, Chao Qu, Yujie Xiong, Yuan Cheng, Yinghui Xu, Wei Chu, Yuan Qi

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05673 2024-07-12 cs.CV 57%

CoReS: Orchestrating the Dance of Reasoning and Segmentation

Xiaoyi Bao, Siyang Sun, Shuailei Ma, Kecheng Zheng, Yuxin Guo, Guosheng Zhao, Yun Zheng, Xingang Wang

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05355 2024-07-09 cs.CV cs.CL 57%

VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool

Yan Wang, Yawen Zeng, Jingsheng Zheng, Xiaofen Xing, Jin Xu, Xiangmin Xu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments ACL 2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19392 2024-07-03 cs.CV 57%

ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos

Jr-Jen Chen, Yu-Chien Liao, Hsi-Che Lin, Yu-Chu Yu, Yen-Chun Chen, Yu-Chiang Frank Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Project page: https://rextime.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05722 2024-06-11 cs.CV 57%

ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition

Sanjoy Kundu, Shubham Trehan, Sathyanarayanan N. Aakur

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Extended abstract of arXiv:2305.16602 for CVPR EgoVis Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04314 2024-06-04 cs.CV 57%

GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives

Zuyao Chen, Jinlin Wu, Zhen Lei, Zhaoxiang Zhang, Changwen Chen

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20834 2024-06-03 cs.CV 57%

Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning

Cheng Tan, Jingxuan Wei, Linzhuang Sun, Zhangyang Gao, Siyuan Li, Bihui Yu, Ruifeng Guo, Stan Z. Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18882 2024-05-30 cs.CV 57%

DecomCAM: Advancing Beyond Saliency Maps through Decomposition and Integration

Yuguang Yang, Runtang Guo, Sheng Wu, Yimi Wang, Linlin Yang, Bo Fan, Jilong Zhong, Juan Zhang, Baochang Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted by Neurocomputing journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16934 2024-05-28 cs.CV 57%

Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR

Zhenyang Li, Yangyang Guo, Kejie Wang, Xiaolin Chen, Liqiang Nie, Mohan Kankanhalli

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16803 2024-05-28 cs.CV 57%

TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing

Xinyu Zhang, Mengxue Kang, Fei Wei, Shuang Xu, Yuhe Liu, Lin Ma

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10316 2024-05-17 cs.CV cs.GR 57%

Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model

Zheng Gu, Shiyuan Yang, Jing Liao, Jing Huo, Yang Gao

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments Project page: https://analogist2d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07784 2024-05-14 cs.CV 57%

Generating Human Motion in 3D Scenes from Text Descriptions

Zhi Cen, Huaijin Pi, Sida Peng, Zehong Shen, Minghui Yang, Shuai Zhu, Hujun Bao, Xiaowei Zhou

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments Project page: https://zju3dv.github.io/text_scene_motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16602 2024-05-06 cs.CV 57%

Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning

Sanjoy Kundu, Shubham Trehan, Sathyanarayanan N. Aakur

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 25 Pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00692 2024-05-02 cs.CV 57%

LISA: Reasoning Segmentation via Large Language Model

Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, Jiaya Jia

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Code, models, and data are available at https://github.com/dvlab-research/LISA

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14705 2024-04-24 cs.CV 57%

Think-Program-reCtify: 3D Situated Reasoning with Large Language Models

Qingrong He, Kejun Lin, Shizhe Chen, Anwen Hu, Qin Jin

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02244 2024-04-16 cs.CV 57%

Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding

Guofeng Mei, Luigi Riz, Yiming Wang, Fabio Poiesi

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09231 2024-04-16 cs.CV 57%

Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms

Diandian Guo, Manxi Lin, Jialun Pei, He Tang, Yueming Jin, Pheng-Ann Heng

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09966 2024-04-16 cs.AI 57%

Towards Generative Abstract Reasoning: Completing Raven's Progressive Matrix via Rule Abstraction and Selection

Fan Shi, Bin Li, Xiangyang Xue

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16822 2024-03-11 cs.CV 57%

EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain

Wei Zhang, Miaoxin Cai, Tong Zhang, Yin Zhuang, Xuerui Mao

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15071 2024-01-30 cs.CV 57%

From GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalities

Chaochao Lu, Chen Qian, Guodong Zheng, Hongxing Fan, Hongzhi Gao, Jie Zhang, Jing Shao, Jingyi Deng, Jinlan Fu, Kexin Huang, Kunchang Li, Lijun Li, Limin Wang, Lu Sheng, Meiqi Chen, Ming Zhang, Qibing Ren, Sirui Chen, Tao Gui, Wanli Ouyang, Yali Wang, Yan Teng, Yaru Wang, Yi Wang, Yinan He, Yingchun Wang, Yixu Wang, Yongting Zhang, Yu Qiao, Yujiong Shen, Yurong Mou, Yuxi Chen, Zaibin Zhang, Zhelun Shi, Zhenfei Yin, Zhipin Wang

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12863 2024-01-24 cs.CL cs.AI 57%

KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning

Debjyoti Mondal, Suraj Modi, Subhadarshi Panda, Rituraj Singh, Godawari Sudhakar Rao

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02675 2024-01-08 cs.NI cs.GT cs.LG 57%

LMaaS: Exploring Pricing Strategy of Large Model as a Service for Communication

Panlong Wu, Qi Liu, Yanjie Dong, Fangxin Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17448 2024-01-01 cs.CV 57%

Tracking with Human-Intent Reasoning

Jiawen Zhu, Zhi-Qi Cheng, Jun-Yan He, Chenyang Li, Bin Luo, Huchuan Lu, Yifeng Geng, Xuansong Xie

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14135 2023-12-27 cs.CV 57%

V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs

Penghao Wu, Saining Xie

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Project page with code: https://vstar-seal.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13335 2023-12-27 cs.CV cs.MM 57%

Multi-modal Large Language Model Enhanced Pseudo 3D Perception Framework for Visual Commonsense Reasoning

Jian Zhu, Hanli Wang, Miaojing Shi

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12241 2023-12-20 cs.CV cs.CL 57%

GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning

Mehran Kazemi, Hamidreza Alvari, Ankit Anand, Jialin Wu, Xi Chen, Radu Soricut

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08912 2023-12-14 cs.CV cs.MM 57%

Delving into Multimodal Prompting for Fine-grained Visual Classification

Xin Jiang, Hao Tang, Junyao Gao, Xiaoyu Du, Shengfeng He, Zechao Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments This paper is accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07132 2023-12-13 cs.CV cs.MM 57%

Image Content Generation with Causal Reasoning

Xiaochuan Li, Baoyu Fan, Runze Zhang, Liang Jin, Di Wang, Zhenhua Guo, Yaqian Zhao, Rengang Li

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

Comments Accepted by the 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024) in December 2023

详情

展开后加载摘要…

URL PDF HTML 收藏