arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2311.14029 2023-11-27 cs.CV cs.LG 57%

Understanding the Vulnerability of CLIP to Image Compression

Cangxiong Chen, Vinay P. Namboodiri, Julian Padget

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14643 2023-11-27 cs.CV 57%

POAR: Towards Open Vocabulary Pedestrian Attribute Recognition

Yue Zhang, Suchen Wang, Shichao Kan, Zhenyu Weng, Yigang Cen, Yap-peng Tan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11695 2023-11-21 cs.CV 57%

Clarity ChatGPT: An Interactive and Adaptive Processing System for Image Restoration and Enhancement

Yanyan Wei, Zhao Zhang, Jiahuan Ren, Xiaogang Xu, Richang Hong, Yi Yang, Shuicheng Yan, Meng Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09191 2023-11-16 cs.CV 57%

Domain Aligned CLIP for Few-shot Classification

Muhammad Waleed Gondal, Jochen Gast, Inigo Alonso Ruiz, Richard Droste, Tommaso Macri, Suren Kumar, Luitpold Staudigl

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments To appear at WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05779 2023-11-13 cs.RO cs.CV 57%

Language-guided Robot Grasping: CLIP-based Referring Grasp Synthesis in Clutter

Georgios Tziafas, Yucheng Xu, Arushi Goel, Mohammadreza Kasaei, Zhibin Li, Hamidreza Kasaei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Poster CoRL 2023. Dataset and code available here: https://github.com/gtziafas/OCID-VLG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09478 2023-11-08 cs.CV 57%

MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning

Jun Chen, Deyao Zhu, Xiaoqian Shen, Xiang Li, Zechun Liu, Pengchuan Zhang, Raghuraman Krishnamoorthi, Vikas Chandra, Yunyang Xiong, Mohamed Elhoseiny

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01747 2023-11-08 cs.CV 57%

UMDFood: Vision-language models boost food composition compilation

Peihua Ma, Yixin Wu, Ning Yu, Yang Zhang, Michael Backes, Qin Wang, Cheng-I Wei

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12522 2023-11-07 cs.CV 57%

Uniformly Distributed Category Prototype-Guided Vision-Language Framework for Long-Tail Recognition

Siming Fu, Xiaoxuan He, Xinpeng Ding, Yuchen Cao, Hualiang Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 11pages, 5figures

Journal ref ACM MM2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18949 2023-10-31 cs.CV 57%

Customize StyleGAN with One Hand Sketch

Shaocong Zhang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00716 2023-10-31 cs.CV 57%

JourneyDB: A Benchmark for Generative Image Understanding

Keqiang Sun, Junting Pan, Yuying Ge, Hao Li, Haodong Duan, Xiaoshi Wu, Renrui Zhang, Aojun Zhou, Zipeng Qin, Yi Wang, Jifeng Dai, Yu Qiao, Limin Wang, Hongsheng Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to the Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18142 2023-10-30 cs.CV 57%

Semi-Supervised Panoptic Narrative Grounding

Danni Yang, Jiayi Ji, Xiaoshuai Sun, Haowei Wang, Yinan Li, Yiwei Ma, Rongrong Ji

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17887 2023-10-30 cs.CV cs.LG 57%

Impressions: Understanding Visual Semiotics and Aesthetic Impact

Julia Kruk, Caleb Ziems, Diyi Yang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments To be published in EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17737 2023-10-30 cs.CL 57%

ArchBERT: Bi-Modal Understanding of Neural Architectures and Natural Languages

Mohammad Akbari, Saeed Ranjbar Alvar, Behnam Kamranian, Amin Banitalebi-Dehkordi, Yong Zhang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

Comments CoNLL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14095 2023-10-26 cs.CV cs.LG 57%

S-CLIP: Semi-supervised Vision-Language Learning using Few Specialist Captions

Sangwoo Mo, Minkyu Kim, Kyungmin Lee, Jinwoo Shin

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14843 2023-10-25 cs.CL 57%

Meta-learning For Vision-and-language Cross-lingual Transfer

Hanxu Hu, Frank Keller

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

Comments MRL2023 (co-located with EMNLP2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13292 2023-10-23 cs.CV cs.LG 57%

CXR-CLIP: Toward Large Scale Chest X-ray Language-Image Pre-training

Kihyun You, Jawook Gu, Jiyeon Ham, Beomhee Park, Jiho Kim, Eun Kyoung Hong, Woonhyunk Baek, Byungseok Roh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by MICCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17319 2023-10-13 cs.AI 57%

Building Privacy-Preserving and Secure Geospatial Artificial Intelligence Foundation Models

Jinmeng Rao, Song Gao, Gengchen Mai, Krzysztof Janowicz

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 1 figure

Journal ref ACM SIGSPATIAL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07394 2023-10-12 cs.CV 57%

CLIP for Lightweight Semantic Segmentation

Ke Jin, Wankou Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06633 2023-10-11 cs.CV cs.CY 57%

Blind Dates: Examining the Expression of Temporality in Historical Photographs

Alexandra Barancová, Melvin Wevers, Nanne van Noord

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03734 2023-10-06 cs.CV 57%

Leveraging Unpaired Data for Vision-Language Generative Models via Cycle Consistency

Tianhong Li, Sangnie Bhardwaj, Yonglong Tian, Han Zhang, Jarred Barber, Dina Katabi, Guillaume Lajoie, Huiwen Chang, Dilip Krishnan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02777 2023-10-05 cs.CL 57%

The Role of Linguistic Priors in Measuring Compositional Generalization of Vision-Language Models

Chenwei Wu, Li Erran Li, Stefano Ermon, Patrick Haffner, Rong Ge, Zaiwei Zhang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02506 2023-10-05 cs.RO cs.AI 57%

Proactive Human-Robot Interaction using Visuo-Lingual Transformers

Pranay Mathur

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted to IROS'23 Workshop: Geriatronics: AI and Robotics for Health & Well-Being in Older Age and Workshop: Assistive Robotics for Citizens

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10592 2023-10-03 cs.CV 57%

MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, Mohamed Elhoseiny

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Project Website: https://minigpt-4.github.io/; Code, Pretrained Model, and Dataset: https://github.com/Vision-CAIR/MiniGPT-4; Deyao Zhu and Jun Chen contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16649 2023-09-29 cs.CV 57%

FLIP: Cross-domain Face Anti-spoofing with Language Guidance

Koushik Srivatsan, Muzammal Naseer, Karthik Nandakumar

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to ICCV-2023. Project Page: https://koushiksrivats.github.io/FLIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16270 2023-09-29 cs.CL 57%

Social Media Fashion Knowledge Extraction as Captioning

Yifei Yuan, Wenxuan Zhang, Yang Deng, Wai Lam

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted by SIGIR-AP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15487 2023-09-28 cs.CV 57%

Tackling VQA with Pretrained Foundation Models without Further Training

Alvin De Jun Tan, Bingquan Shen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12314 2023-09-22 cs.CV 57%

TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight Inheritance

Kan Wu, Houwen Peng, Zhenghong Zhou, Bin Xiao, Mengchen Liu, Lu Yuan, Hong Xuan, Michael Valenzuela, Xi, Chen, Xinggang Wang, Hongyang Chao, Han Hu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted By ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07372 2023-09-15 eess.AS cs.SD 57%

Training Audio Captioning Models without Audio

Soham Deshmukh, Benjamin Elizalde, Dimitra Emmanouilidou, Bhiksha Raj, Rita Singh, Huaming Wang

专题命中 图文多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06517 2023-09-14 cs.CL 57%

Overview of Memotion 3: Sentiment and Emotion Analysis of Codemixed Hinglish Memes

Shreyash Mishra, S Suryavardan, Megha Chakraborty, Parth Patwa, Anku Rani, Aman Chadha, Aishwarya Reganti, Amitava Das, Amit Sheth, Manoj Chinnakotla, Asif Ekbal, Srijan Kumar

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

Comments Defactify2 @AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01111 2023-09-14 cs.CV 57%

Exploring the Versatility of Zero-Shot CLIP for Interstitial Lung Disease Classification

Cara Van Uden, Christian Bluethgen, Maayane Attias, Malgorzata Polacin, Haiwei Henry Guo, Neha Simha, Rishi Raj, Curtis Langlotz

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏