arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2403.11487 2024-04-03 cs.RO cs.AI 57%

Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis

Vishnu Sashank Dorbala, Sanjoy Chowdhury, Dinesh Manocha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

Comments 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06505 2024-04-02 cs.CV 57%

Grounded Question-Answering in Long Egocentric Videos

Shangzhe Di, Weidi Xie

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project website at https://dszdsz.cn/GroundVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14444 2024-04-01 cs.CV 57%

Visual Superordinate Abstraction for Robust Concept Learning

Qi Zheng, Chaoyue Wang, Dadong Wang, Dacheng Tao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 14 pages, 11 figures

Journal ref Machine Intelligence Research vol. 20, no. 1, pp. 79-91, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16385 2024-03-29 cs.CV cs.CL 57%

Synthesize Step-by-Step: Tools, Templates and LLMs as Data Generators for Reasoning-Based Chart VQA

Zhuowan Li, Bhavan Jasani, Peng Tang, Shabnam Ghadar

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01629 2024-03-28 cs.CV 57%

CLAMP: Contrastive LAnguage Model Prompt-tuning

Piotr Teterwak, Ximeng Sun, Bryan A. Plummer, Kate Saenko, Ser-Nam Lim

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10185 2024-03-27 cs.CV 57%

ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights

Weixian Lei, Yixiao Ge, Jianfeng Zhang, Dylan Sun, Kun Yi, Ying Shan, Mike Zheng Shou

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

Comments 19 pages, 4 figures and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13499 2024-03-21 cs.CV 57%

Improved Baselines for Data-efficient Perceptual Augmentation of LLMs

Théophane Vallaeys, Mustafa Shukor, Matthieu Cord, Jakob Verbeek

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11317 2024-03-19 cs.CL cs.CV 57%

Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches

Igor Sterner, Weizhe Lin, Jinghong Chen, Bill Byrne

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03411 2024-03-19 cs.CL cs.CV 57%

GRAM: Global Reasoning for Multi-Page VQA

Tsachi Blau, Sharon Fogel, Roi Ronen, Alona Golts, Roy Ganz, Elad Ben Avraham, Aviad Aberdam, Shahar Tsiper, Ron Litman

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10037 2024-03-18 cs.CV 57%

Knowledge Condensation and Reasoning for Knowledge-based VQA

Dongze Hao, Jian Jia, Longteng Guo, Qunbo Wang, Te Yang, Yan Li, Yanhua Cheng, Bo Wang, Quan Chen, Han Li, Jing Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09027 2024-03-15 cs.CV 57%

VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework

Chris Kelly, Luhui Hu, Bang Yang, Yu Tian, Deshun Yang, Cindy Yang, Zaoshan Huang, Zihao Li, Jiayin Hu, Yuexian Zou

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 17 pages, 5 figures, and 1 table. arXiv admin note: substantial text overlap with arXiv:2311.10125

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07874 2024-03-13 cs.CV 57%

Beyond Text: Frozen Large Language Models in Visual Signal Comprehension

Lei Zhu, Fangyun Wei, Yanye Lu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06679 2024-03-12 cs.CV 57%

Answering Diverse Questions via Text Attached with Key Audio-Visual Clues

Qilang Ye, Zitong Yu, Xin Liu

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08173 2024-03-04 cs.LG cs.CR cs.IT math.IT stat.ML 57%

Safeguarding Data in Multimodal AI: A Differentially Private Approach to CLIP Training

Alyssa Huang, Peihan Liu, Ryumei Nakada, Linjun Zhang, Wanrong Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13288 2024-02-22 cs.DB cs.AI 57%

Training Table Question Answering via SQL Query Decomposition

Raphaël Mouravieff, Benjamin Piwowarski, Sylvain Lamprier

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07220 2024-02-21 eess.IV cs.CV 57%

KVQ: Kwai Video Quality Assessment for Short-form Videos

Yiting Lu, Xin Li, Yajing Pei, Kun Yuan, Qizhi Xie, Yunpeng Qu, Ming Sun, Chao Zhou, Zhibo Chen

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17369 2024-01-25 cs.CV cs.MM 57%

Modularized Zero-shot VQA with Pre-trained Models

Rui Cao, Jing Jiang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments accepted as Findings in ACL 2023; Code available: https://github.com/abril4416/Mod-Zero-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09883 2024-01-19 cs.CV 57%

Question-Answer Cross Language Image Matching for Weakly Supervised Semantic Segmentation

Songhe Deng, Wei Zhuo, Jinheng Xie, Linlin Shen

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08660 2024-01-18 cs.AI cs.CL 57%

Gemini Pro Defeated by GPT-4V: Evidence from Education

Gyeong-Geon Lee, Ehsan Latif, Lehong Shi, Xiaoming Zhai

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06147 2024-01-15 cs.CL cs.LG cs.SD eess.AS 57%

NAAQA: A Neural Architecture for Acoustic Question Answering

Jerome Abdelnour, Jean Rouat, Giampiero Salvi

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

Comments Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI) in April 2021 (first revision February 2022)

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023, Volume: 45 Issue: 4, Page(s): 4997-5009

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01529 2024-01-04 cs.CV 57%

Glance and Focus: Memory Prompting for Multi-Event Video Question Answering

Ziyi Bai, Ruiping Wang, Xilin Chen

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00988 2024-01-03 cs.CV 57%

Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models

Xinpeng Ding, Jinahua Han, Hang Xu, Xiaodan Liang, Wei Zhang, Xiaomeng Li

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15300 2023-12-27 cs.CV 57%

Q-Boost: On Visual Quality Assessment Ability of Low-level Multi-Modality Foundation Models

Zicheng Zhang, Haoning Wu, Zhongpeng Ji, Chunyi Li, Erli Zhang, Wei Sun, Xiaohong Liu, Xiongkuo Min, Fengyu Sun, Shangling Jui, Weisi Lin, Guangtao Zhai

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11146 2023-12-25 cs.CV 57%

OsmLocator: locating overlapping scatter marks with a non-training generative perspective

Yuming Qiu, Aleksandra Pizurica, Qi Ming, Nicolas Nadisic

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments 22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13848 2023-12-22 cs.CV 57%

Reducing Hallucinations: Enhancing VQA for Flood Disaster Damage Assessment with Visual Contexts

Yimin Sun, Chao Wang, Yan Peng

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments already be accepted by 2024 3rd International Conference on Computer, Artificial Intelligence and Control Engineering (CAICE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13219 2023-12-21 cs.RO cs.CL cs.CV 57%

Interactive Visual Task Learning for Robots

Weiwei Gu, Anant Sah, Nakul Gopalan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments In Proceedings of The 38th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09767 2023-12-20 cs.CL cs.AI 57%

VLIS: Unimodal Language Models Guide Multimodal Language Generation

Jiwan Chung, Youngjae Yu

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

Comments Accepted as main paper in EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09251 2023-12-15 cs.CV 57%

VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation

Jinguo Zhu, Xiaohan Ding, Yixiao Ge, Yuying Ge, Sijie Zhao, Hengshuang Zhao, Xiaohua Wang, Ying Shan

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06720 2023-12-15 cs.CV 57%

Audio-Visual LLM for Video Understanding

Fangxun Shu, Lei Zhang, Hao Jiang, Cihang Xie

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06685 2023-12-13 cs.AI 57%

Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language Models

Shitian Zhao, Zhuowan Li, Yadong Lu, Alan Yuille, Yan Wang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏