arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2312.00093 2024-06-12 cs.CV cs.GR cs.LG 62%

GraphDreamer: Compositional 3D Scene Synthesis from Scene Graphs

Gege Gao, Weiyang Liu, Anpei Chen, Andreas Geiger, Bernhard Schölkopf

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.LG

Comments CVPR 2024 (18 pages, 11 figures, https://graphdreamer.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05604 2024-06-05 cs.CL cs.AI cs.CV cs.CY 62%

REBUS: A Robust Evaluation Benchmark of Understanding Symbols

Andrew Gritsevskiy, Arjun Panickssery, Aaron Kirtland, Derik Kauffman, Hans Gundlach, Irina Gritsevskaya, Joe Cavanagh, Jonathan Chiang, Lydia La Roux, Michelle Hung

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 20 pages, 5 figures. For code, see http://github.com/cvndsh/rebus

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20139 2024-05-31 cs.CL cs.AI cs.LG 62%

GNN-RAG: Graph Neural Retrieval for Large Language Model Reasoning

Costas Mavromatis, George Karypis

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11640 2024-05-21 cs.AI cs.CL cs.CV 62%

Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning

Zishan Gu, Fenglin Liu, Changchang Yin, Ping Zhang

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05872 2024-05-20 cs.CV cs.AI cs.CL 62%

ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models

Kaiwen Zhou, Kwonjoon Lee, Teruhisa Misu, Xin Eric Wang

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09713 2024-05-20 cs.CV cs.AI cs.CL 62%

SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge

Andong Wang, Bo Wu, Sunli Chen, Zhenfang Chen, Haotian Guan, Wei-Ning Lee, Li Erran Li, Chuang Gan

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13591 2024-04-26 cs.CV cs.LG 62%

MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning

Yifan Jiang, Jiarui Zhang, Kexuan Sun, Zhivar Sourati, Kian Ahrabian, Kaixin Ma, Filip Ilievski, Jay Pujara

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06627 2024-04-17 cs.CL cs.CV cs.LG 62%

What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models

Letian Zhang, Xiaotong Zhai, Zhongkai Zhao, Yongshuo Zong, Xin Wen, Bingchen Zhao

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06405 2024-04-12 cs.AI cs.CG cs.CL cs.LG 62%

Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry

Shiven Sinha, Ameya Prabhu, Ponnurangam Kumaraguru, Siddharth Bhat, Matthias Bethge

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments Work in Progress. Released for wider feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05916 2024-04-11 cs.CV cs.AI 62%

GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing

Hao Lu, Xuesong Niu, Jiyao Wang, Yin Wang, Qingyong Hu, Jiaqi Tang, Yuting Zhang, Kaishen Yuan, Bin Huang, Zitong Yu, Dengbo He, Shuiguang Deng, Hao Chen, Yingcong Chen, Shiguang Shan

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11073 2024-03-19 cs.CV cs.AI 62%

Tokensome: Towards a Genetic Vision-Language GPT for Explainable and Cognitive Karyotyping

Haoxi Zhang, Xinxu Zhang, Yuanxin Lin, Maiqi Wang, Yi Lai, Yu Wang, Linfeng Yu, Yufeng Xu, Ran Cheng, Edward Szczerbicki

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16117 2024-02-27 cs.RO cs.AI cs.CV 62%

RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis

Yao Mu, Junting Chen, Qinglong Zhang, Shoufa Chen, Qiaojun Yu, Chongjian Ge, Runjian Chen, Zhixuan Liang, Mengkang Hu, Chaofan Tao, Peize Sun, Haibao Yu, Chao Yang, Wenqi Shao, Wenhai Wang, Jifeng Dai, Yu Qiao, Mingyu Ding, Ping Luo

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03507 2024-02-07 cs.AI cs.CL cs.LG 62%

Neural networks for abstraction and reasoning: Towards broad generalization in machines

Mikel Bober-Irizar, Soumya Banerjee

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments 32 pages main text, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01889 2024-02-06 cs.AI cs.LG 62%

The Role of Foundation Models in Neuro-Symbolic Learning and Reasoning

Daniel Cunnington, Mark Law, Jorge Lobo, Alessandra Russo

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08334 2024-01-30 cs.LG cs.AI cs.PL 62%

Learning logic programs by discovering higher-order abstractions

Céline Hocquette, Sebastijan Dumančić, Andrew Cropper

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14786 2024-01-29 cs.CV cs.AI cs.RO 62%

GPT-4V Takes the Wheel: Promises and Challenges for Pedestrian Behavior Prediction

Jia Huang, Peng Jiang, Alvika Gautam, Srikanth Saripalli

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17778 2024-01-23 cs.CV cs.LG 62%

Look, Remember and Reason: Grounded reasoning in videos with language models

Apratim Bhattacharyya, Sunny Panchal, Mingu Lee, Reza Pourreza, Pulkit Madan, Roland Memisevic

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments To appear at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02191 2023-12-06 cs.CV cs.AI 62%

Prompt Tuning for Zero-shot Compositional Learning

Lingyu Zhang, Ting Hua, Yilin Shen, Hongxia Jin

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06964 2023-11-14 cs.CV cs.LG 62%

Adaptive recurrent vision performs zero-shot computation scaling to unseen difficulty levels

Vijay Veerabadran, Srinivas Ravishankar, Yuan Tang, Ritik Raina, Virginia R. de Sa

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments 37th Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06386 2023-11-14 cs.CV cs.LG 62%

Towards A Unified Neural Architecture for Visual Recognition and Reasoning

Calvin Luo, Boqing Gong, Ting Chen, Chen Sun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09009 2023-11-01 cs.CL cs.AI cs.LG 62%

How is ChatGPT's behavior changing over time?

Lingjiao Chen, Matei Zaharia, James Zou

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Comments add more evaluations on instruction following

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18807 2023-10-31 cs.AI cs.CV 62%

OC-NMN: Object-centric Compositional Neural Module Network for Generative Visual Analogical Reasoning

Rim Assouel, Pau Rodriguez, Perouz Taslakian, David Vazquez, Yoshua Bengio

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02804 2023-10-05 cs.CL cs.CV cs.LG 62%

DOMINO: A Dual-System for Multi-step Visual Language Reasoning

Peifang Wang, Olga Golovneva, Armen Aghajanyan, Xiang Ren, Muhao Chen, Asli Celikyilmaz, Maryam Fazel-Zarandi

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04053 2023-09-01 cs.CV cs.AI cs.CL 62%

DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models

Jaemin Cho, Abhay Zala, Mohit Bansal

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments ICCV 2023 (34 pages; see appendix for version changelog)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09668 2023-07-20 cs.RO cs.AI cs.LG 62%

Towards A Unified Agent with Foundation Models

Norman Di Palo, Arunkumar Byravan, Leonard Hasenclever, Markus Wulfmeier, Nicolas Heess, Martin Riedmiller

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00509 2023-07-04 cs.CL cs.AI cs.IR cs.LG 62%

HeGeL: A Novel Dataset for Geo-Location from Hebrew Text

Tzuf Paz-Argaman, Tal Bauman, Itai Mondshine, Itzhak Omer, Sagi Dalyot, Reut Tsarfaty

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted for ACL findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04928 2023-03-22 cs.AI cs.LG cs.NE cs.SC 62%

GAMR: A Guided Attention Model for (visual) Reasoning

Mohit Vaishnav, Thomas Serre

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

Journal ref Eleventh International Conference on Learning Representations (ICLR) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11381 2023-03-22 cs.CV cs.CL cs.LG 62%

MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action

Zhengyuan Yang, Linjie Li, Jianfeng Wang, Kevin Lin, Ehsan Azarnasab, Faisal Ahmed, Zicheng Liu, Ce Liu, Michael Zeng, Lijuan Wang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.12045 2023-02-20 cs.AI cs.LG 62%

Raven's Progressive Matrices Completion with Latent Gaussian Process Priors

Fan Shi, Bin Li, Xiangyang Xue

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15402 2022-11-29 cs.CV cs.AI 62%

Perceive, Ground, Reason, and Act: A Benchmark for General-purpose Visual Representation

Jiangyong Huang, William Yicheng Zhu, Baoxiong Jia, Zan Wang, Xiaojian Ma, Qing Li, Siyuan Huang

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏