arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2405.07784 2024-05-14 cs.CV 57%

Generating Human Motion in 3D Scenes from Text Descriptions

Zhi Cen, Huaijin Pi, Sida Peng, Zehong Shen, Minghui Yang, Shuai Zhu, Hujun Bao, Xiaowei Zhou

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

Comments Project page: https://zju3dv.github.io/text_scene_motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16602 2024-05-06 cs.CV 57%

Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning

Sanjoy Kundu, Shubham Trehan, Sathyanarayanan N. Aakur

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 25 Pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00692 2024-05-02 cs.CV 57%

LISA: Reasoning Segmentation via Large Language Model

Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, Jiaya Jia

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments Code, models, and data are available at https://github.com/dvlab-research/LISA

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14705 2024-04-24 cs.CV 57%

Think-Program-reCtify: 3D Situated Reasoning with Large Language Models

Qingrong He, Kejun Lin, Shizhe Chen, Anwen Hu, Qin Jin

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02244 2024-04-16 cs.CV 57%

Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding

Guofeng Mei, Luigi Riz, Yiming Wang, Fabio Poiesi

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09231 2024-04-16 cs.CV 57%

Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms

Diandian Guo, Manxi Lin, Jialun Pei, He Tang, Yueming Jin, Pheng-Ann Heng

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09966 2024-04-16 cs.AI 57%

Towards Generative Abstract Reasoning: Completing Raven's Progressive Matrix via Rule Abstraction and Selection

Fan Shi, Bin Li, Xiangyang Xue

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16822 2024-03-11 cs.CV 57%

EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain

Wei Zhang, Miaoxin Cai, Tong Zhang, Yin Zhuang, Xuerui Mao

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15071 2024-01-30 cs.CV 57%

From GPT-4 to Gemini and Beyond: Assessing the Landscape of MLLMs on Generalizability, Trustworthiness and Causality through Four Modalities

Chaochao Lu, Chen Qian, Guodong Zheng, Hongxing Fan, Hongzhi Gao, Jie Zhang, Jing Shao, Jingyi Deng, Jinlan Fu, Kexin Huang, Kunchang Li, Lijun Li, Limin Wang, Lu Sheng, Meiqi Chen, Ming Zhang, Qibing Ren, Sirui Chen, Tao Gui, Wanli Ouyang, Yali Wang, Yan Teng, Yaru Wang, Yi Wang, Yinan He, Yingchun Wang, Yixu Wang, Yongting Zhang, Yu Qiao, Yujiong Shen, Yurong Mou, Yuxi Chen, Zaibin Zhang, Zhelun Shi, Zhenfei Yin, Zhipin Wang

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12863 2024-01-24 cs.CL cs.AI 57%

KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning

Debjyoti Mondal, Suraj Modi, Subhadarshi Panda, Rituraj Singh, Godawari Sudhakar Rao

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02675 2024-01-08 cs.NI cs.GT cs.LG 57%

LMaaS: Exploring Pricing Strategy of Large Model as a Service for Communication

Panlong Wu, Qi Liu, Yanjie Dong, Fangxin Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17448 2024-01-01 cs.CV 57%

Tracking with Human-Intent Reasoning

Jiawen Zhu, Zhi-Qi Cheng, Jun-Yan He, Chenyang Li, Bin Luo, Huchuan Lu, Yifeng Geng, Xuansong Xie

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14135 2023-12-27 cs.CV 57%

V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs

Penghao Wu, Saining Xie

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

Comments Project page with code: https://vstar-seal.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13335 2023-12-27 cs.CV cs.MM 57%

Multi-modal Large Language Model Enhanced Pseudo 3D Perception Framework for Visual Commonsense Reasoning

Jian Zhu, Hanli Wang, Miaojing Shi

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12241 2023-12-20 cs.CV cs.CL 57%

GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning

Mehran Kazemi, Hamidreza Alvari, Ankit Anand, Jialin Wu, Xi Chen, Radu Soricut

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08912 2023-12-14 cs.CV cs.MM 57%

Delving into Multimodal Prompting for Fine-grained Visual Classification

Xin Jiang, Hao Tang, Junyao Gao, Xiaoyu Du, Shengfeng He, Zechao Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments This paper is accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07132 2023-12-13 cs.CV cs.MM 57%

Image Content Generation with Causal Reasoning

Xiaochuan Li, Baoyu Fan, Runze Zhang, Liang Jin, Di Wang, Zhenhua Guo, Yaqian Zhao, Rengang Li

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

Comments Accepted by the 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024) in December 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.01671 2023-12-11 cs.CV 57%

Cognitive Visual Commonsense Reasoning Using Dynamic Working Memory

Xuejiao Tang, Xin Huang, Wenbin Zhang, Travers B. Child, Qiong Hu, Zhen Liu, Ji Zhang

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV

Comments DaWaK 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11567 2023-12-06 cs.CV 57%

InfiMM-Eval: Complex Open-Ended Reasoning Evaluation For Multi-Modal Large Language Models

Xiaotian Han, Quanzeng You, Yongfei Liu, Wentao Chen, Huangjie Zheng, Khalil Mrini, Xudong Lin, Yiqi Wang, Bohan Zhai, Jianbo Yuan, Heng Wang, Hongxia Yang

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18651 2023-12-01 cs.CV 57%

LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning

Sijin Chen, Xin Chen, Chi Zhang, Mingsheng Li, Gang Yu, Hao Fei, Hongyuan Zhu, Jiayuan Fan, Tao Chen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Project Page: https://ll3da.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03689 2023-11-06 cs.CV 57%

COLA: A Benchmark for Compositional Text-to-image Retrieval

Arijit Ray, Filip Radenovic, Abhimanyu Dubey, Bryan A. Plummer, Ranjay Krishna, Kate Saenko

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023. Webpage: https://cs-people.bu.edu/array/research/cola/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01161 2023-11-03 cs.CL cs.AI 57%

Weakly Supervised Semantic Parsing with Execution-based Spurious Program Filtering

Kang-il Lee, Segwang Kim, Kyomin Jung

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20357 2023-11-02 cs.AI cs.MM 57%

Enhancing the Spatial Awareness Capability of Multi-Modal Large Language Model

Yongqiang Zhao, Zhenyu Li, Zhi Jin, Feng Zhang, Haiyan Zhao, Chengfeng Dou, Zhengwei Tao, Xinhai Xu, Donghong Liu

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02260 2023-10-30 cs.CV cs.CL 57%

Learning to reason over visual objects

Shanka Subhra Mondal, Taylor Webb, Jonathan D. Cohen

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16494 2023-10-26 cs.CV 57%

Lang3DSG: Language-based contrastive pre-training for 3D Scene Graph prediction

Sebastian Koch, Pedro Hermosilla, Narunas Vaskevicius, Mirco Colosi, Timo Ropinski

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments 3DV 2024. Project page: https://kochsebastian.com/lang3dsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13812 2023-10-26 cs.CL cs.CV 57%

Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for Improved Vision-Language Compositionality

Harman Singh, Pengchuan Zhang, Qifan Wang, Mengjiao Wang, Wenhan Xiong, Jingfei Du, Yu Chen

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2023 (long paper, main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13186 2023-10-24 cs.CL cs.AI 57%

SCITAB: A Challenging Benchmark for Compositional Reasoning and Claim Verification on Scientific Tables

Xinyuan Lu, Liangming Pan, Qian Liu, Preslav Nakov, Min-Yen Kan

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments Accepted at EMNLP 2023 (main conference, long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10591 2023-10-17 cs.CV 57%

Interpreting and Controlling Vision Foundation Models via Text Explanations

Haozhe Chen, Junfeng Yang, Carl Vondrick, Chengzhi Mao

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16650 2023-09-29 cs.RO cs.CV 57%

ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning

Qiao Gu, Alihusein Kuwajerwala, Sacha Morin, Krishna Murthy Jatavallabhula, Bipasha Sen, Aditya Agarwal, Corban Rivera, William Paul, Kirsty Ellis, Rama Chellappa, Chuang Gan, Celso Miguel de Melo, Joshua B. Tenenbaum, Antonio Torralba, Florian Shkurti, Liam Paull

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

Comments Project page: https://concept-graphs.github.io/ Explainer video: https://youtu.be/mRhNkQwRYnc

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07734 2023-07-18 cs.AI 57%

Abstracting Concept-Changing Rules for Solving Raven's Progressive Matrix Problems

Fan Shi, Bin Li, Xiangyang Xue

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏