arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2412.20631 2025-01-28 cs.CV 70%

Slow Perception: Let's Perceive Geometric Figures Step-by-step

Haoran Wei, Youyang Yin, Yumeng Li, Jia Wang, Liang Zhao, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10207 2025-01-08 cs.LG 70%

Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real World

Rujie Wu, Xiaojian Ma, Zhenliang Zhang, Wei Wang, Qing Li, Song-Chun Zhu, Yizhou Wang

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.LG

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11124 2024-12-24 cs.CV 70%

Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning

Shengqiong Wu, Hao Fei, Liangming Pan, William Yang Wang, Shuicheng Yan, Tat-Seng Chua

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 16 pages, 10 figures, accepted by AAAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10252 2024-11-18 cs.CV 70%

Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning

Jingru Yang, Huan Yu, Yang Jingxin, Chentianye Xu, Yin Biao, Yu Sun, Shengfeng He

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05956 2024-10-29 cs.RO cs.CV 70%

Probing Multimodal LLMs as World Models for Driving

Shiva Sreeram, Tsun-Hsuan Wang, Alaa Maalouf, Guy Rosman, Sertac Karaman, Daniela Rus

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments https://github.com/sreeramsa/DriveSim https://www.youtube.com/watch?v=Fs8jgngOJzU

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12329 2024-10-17 cs.CL cs.AI 70%

Understanding the Role of LLMs in Multimodal Evaluation Benchmarks

Botian Jiang, Lei Li, Xiaonan Li, Zhaowei Li, Xiachong Feng, Lingpeng Kong, Qi Liu, Xipeng Qiu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19934 2024-10-14 cs.CL cs.AI 70%

From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis

Chuanqi Cheng, Jian Guan, Wei Wu, Rui Yan

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07840 2024-10-10 cs.CV cs.CL 70%

Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison

Qian Yang, Weixiang Yan, Aishwarya Agrawal

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18142 2024-09-30 cs.AI cs.MM 70%

A Survey on Multimodal Benchmarks: In the Era of Large AI Models

Lin Li, Guikun Chen, Hanrong Shi, Jun Xiao, Long Chen

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11530 2024-07-23 cs.CV 70%

Efficient Multimodal Learning from Data-centric Perspective

Muyang He, Yexin Liu, Boya Wu, Jianhao Yuan, Yueze Wang, Tiejun Huang, Bo Zhao

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06309 2024-07-10 cs.CY cs.AI 70%

Multimodal Chain-of-Thought Reasoning via ChatGPT to Protect Children from Age-Inappropriate Apps

Chuanbo Hu, Bin Liu, Minglei Yin, Yilu Zhou, Xin Li

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00589 2024-07-04 cs.CV 70%

Merlin:Empowering Multimodal LLMs with Foresight Minds

En Yu, Liang Zhao, Yana Wei, Jinrong Yang, Dongming Wu, Lingyu Kong, Haoran Wei, Tiancai Wang, Zheng Ge, Xiangyu Zhang, Wenbing Tao

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ECCV2024. Project page: https://ahnsun.github.io/merlin

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19693 2024-07-01 cs.RO cs.CV 70%

MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?

Jinming Li, Yichen Zhu, Zhiyuan Xu, Jindong Gu, Minjie Zhu, Xin Liu, Ning Liu, Yaxin Peng, Feifei Feng, Jian Tang

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19995 2024-06-18 cs.CV 70%

Emotional Theory of Mind: Bridging Fast Visual Processing with Slow Linguistic Reasoning

Yasaman Etesam, Özge Nilay Yalçın, Chuxuan Zhang, Angelica Lim

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments This paper has been accepted for oral presentation at ACII 2024. Webpage: https://yasaman-etesam.github.io/Contextual-Emotion-Recognition/ 9 pages(including references), 1 Tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08832 2024-04-26 cs.CV 70%

Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding

Le Zhang, Rabiul Awal, Aishwarya Agrawal

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07449 2024-04-12 cs.CV 70%

Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMs

Kanchana Ranasinghe, Satya Narayan Shukla, Omid Poursaeed, Michael S. Ryoo, Tsung-Yu Lin

专题命中 视觉推理 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00909 2024-04-02 cs.CV 70%

Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning

Rongjie Li, Yu Wu, Xuming He

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06199 2024-03-26 cs.CV cs.CL 70%

Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models

Minjie Zhu, Yichen Zhu, Xin Liu, Ning Liu, Zhiyuan Xu, Chaomin Shen, Yaxin Peng, Zhicai Ou, Feifei Feng, Jian Tang

专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08182 2024-03-12 cs.CV 70%

Zero-Shot Image Harmonization with Generative Model Prior

Jianqi Chen, Yilan Zhang, Zhengxia Zou, Keyan Chen, Zhenwei Shi

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Code Page: https://github.com/WindVChen/Diff-Harmonization. In paper-v2, we introduce multiple new designs for solving previous limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14818 2024-03-06 cs.CL cs.CV 70%

PALO: A Polyglot Large Multimodal Model for 5B People

Muhammad Maaz, Hanoona Rasheed, Abdelrahman Shaker, Salman Khan, Hisham Cholakal, Rao M. Anwer, Tim Baldwin, Michael Felsberg, Fahad S. Khan

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments Technical Report of PALO

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09291 2024-02-27 cs.CV 70%

Vision-by-Language for Training-Free Compositional Image Retrieval

Shyamgopal Karthik, Karsten Roth, Massimiliano Mancini, Zeynep Akata

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04181 2024-02-02 cs.RO cs.CV 70%

Language-Conditioned Robotic Manipulation with Fast and Slow Thinking

Minjie Zhu, Yichen Zhu, Jinming Li, Junjie Wen, Zhiyuan Xu, Zhengping Che, Chaomin Shen, Yaxin Peng, Dong Liu, Feifei Feng, Jian Tang

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments accepted to ICRA2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01598 2023-12-12 cs.CV 70%

Good Questions Help Zero-Shot Image Reasoning

Kaiwen Yang, Tao Shen, Xinmei Tian, Xiubo Geng, Chongyang Tao, Dacheng Tao, Tianyi Zhou

专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02896 2023-12-07 cs.CV 70%

BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models

Rizhao Cai, Zirui Song, Dayan Guan, Zhenhao Chen, Xing Luo, Chenyu Yi, Alex Kot

专题命中 视觉推理 :LLaVA(abstract);visual reasoning(abstract);分类 cs.CV

Comments Code is available at https://github.com/AIFEG/BenchLMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02433 2023-12-06 cs.CV 70%

Lenna: Language Enhanced Reasoning Detection Assistant

Fei Wei, Xinyu Zhang, Ailing Zhang, Bo Zhang, Xiangxiang Chu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12391 2023-11-22 cs.CV 70%

From Wrong To Right: A Recursive Approach Towards Vision-Language Explanation

Jiaxin Ge, Sanjay Subramanian, Trevor Darrell, Boyi Li

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments EMNLP 2023 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02251 2023-11-15 cs.CV cs.RO 70%

Talk2BEV: Language-enhanced Bird's-eye View Maps for Autonomous Driving

Tushar Choudhary, Vikrant Dewangan, Shivam Chandhok, Shubham Priyadarshan, Anushka Jain, Arun K. Singh, Siddharth Srivastava, Krishna Murthy Jatavallabhula, K. Madhava Krishna

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

Comments Project page at https://llmbev.github.io/talk2bev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06553 2023-11-14 cs.CV 70%

Visual Commonsense based Heterogeneous Graph Contrastive Learning

Zongzhao Li, Xiangyu Zhu, Xi Zhang, Zhaoxiang Zhang, Zhen Lei

专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07891 2023-08-16 cs.CV cs.CL 70%

Link-Context Learning for Multimodal LLMs

Yan Tai, Weichen Fan, Zhao Zhang, Feng Zhu, Rui Zhao, Ziwei Liu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12626 2023-07-26 cs.CV 70%

Joint Answering and Explanation for Visual Commonsense Reasoning

Zhenyang Li, Yangyang Guo, Kejie Wang, Yinwei Wei, Liqiang Nie, Mohan Kankanhalli

专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏