arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2401.05676 2024-01-12 cs.CV 57%

Exploring Self- and Cross-Triplet Correlations for Human-Object Interaction Detection

Weibo Jiang, Weihong Ren, Jiandong Tian, Liangqiong Qu, Zhiyong Wang, Honghai Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04903 2024-01-11 cs.CV 57%

SnapCap: Efficient Snapshot Compressive Video Captioning

Jianqiao Sun, Yudi Su, Hao Zhang, Ziheng Cheng, Zequn Zeng, Zhengjue Wang, Bo Chen, Xin Yuan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Preprint; Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14093 2024-01-10 cs.CV 57%

Weakly Supervised 3D Open-vocabulary Segmentation

Kunhao Liu, Fangneng Zhan, Jiahui Zhang, Muyu Xu, Yingchen Yu, Abdulmotaleb El Saddik, Christian Theobalt, Eric Xing, Shijian Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13505 2024-01-05 cs.CV 57%

Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation

Yun Xing, Jian Kang, Aoran Xiao, Jiahao Nie, Ling Shao, Shijian Lu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments NeurIPS 2023. Code is available at https://github.com/xing0047/rewrite

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16886 2024-01-02 cs.CV 57%

MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices

Xiangxiang Chu, Limeng Qiao, Xinyang Lin, Shuang Xu, Yang Yang, Yiming Hu, Fei Wei, Xinyu Zhang, Bo Zhang, Xiaolin Wei, Chunhua Shen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17334 2024-01-01 cs.CV 57%

Improving Image Restoration through Removing Degradations in Textual Representations

Jingbo Lin, Zhilu Zhang, Yuxiang Wei, Dongwei Ren, Dongsheng Jiang, Wangmeng Zuo

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12073 2024-01-01 cs.CV 57%

NeuroCLIP: Neuromorphic Data Understanding by CLIP and SNN

Yufei Guo, Yuanpei Chen, Zhe Ma

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04087 2023-12-29 cs.CV 57%

SVIT: Scaling up Visual Instruction Tuning

Bo Zhao, Boya Wu, Muyang He, Tiejun Huang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15043 2023-12-27 cs.CV 57%

GroundVLP: Harnessing Zero-shot Visual Grounding from Vision-Language Pre-training and Open-Vocabulary Object Detection

Haozhan Shen, Tiancheng Zhao, Mingwei Zhu, Jianwei Yin

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14074 2023-12-22 cs.CV 57%

LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding

Senqiao Yang, Jiaming Liu, Ray Zhang, Mingjie Pan, Zoey Guo, Xiaoqi Li, Zehui Chen, Peng Gao, Yandong Guo, Shanghang Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07063 2023-12-21 cs.CV cs.LG 57%

Bootstrapping Vision-Language Learning with Decoupled Language Pre-training

Yiren Jian, Chongyang Gao, Soroush Vosoughi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023 (spotlight). The code is available at https://github.com/yiren-jian/BLIText

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10439 2023-12-20 cs.CV 57%

Simple Image-level Classification Improves Open-vocabulary Object Detection

Ruohuan Fang, Guansong Pang, Xiao Bai

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07374 2023-12-20 cs.CV 57%

Relax Image-Specific Prompt Requirement in SAM: A Single Generic Prompt for Segmenting Camouflaged Objects

Jian Hu, Jiayi Lin, Weitong Cai, Shaogang Gong

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18072 2023-12-20 cs.CV 57%

Image Captioning with Multi-Context Synthetic Data

Feipeng Ma, Yizhou Zhou, Fengyun Rao, Yueyi Zhang, Xiaoyan Sun

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10613 2023-12-19 cs.CV 57%

p-Laplacian Adaptation for Generative Pre-trained Vision-Language Models

Haoyuan Wu, Xinyun Zhang, Peng Xu, Peiyu Liao, Xufeng Yao, Bei Yu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by AAAI24. The first two authors contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09445 2023-12-19 cs.CV 57%

Data Efficient Language-supervised Zero-shot Recognition with Optimal Transport Distillation

Bichen Wu, Ruizhe Cheng, Peizhao Zhang, Tianren Gao, Peter Vajda, Joseph E. Gonzalez

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01890 2023-12-15 cs.CV cs.LG 57%

DualCoOp++: Fast and Effective Adaptation to Multi-Label Recognition with Limited Annotations

Ping Hu, Ximeng Sun, Stan Sclaroff, Kate Saenko

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments TPAMI. arXiv admin note: substantial text overlap with arXiv:2206.09541

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03026 2023-12-07 cs.CV 57%

Uni3DL: Unified Model for 3D and Language Understanding

Xiang Li, Jian Ding, Zhaoyang Chen, Mohamed Elhoseiny

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00500 2023-12-07 cs.CV 57%

Self-Supervised Open-Ended Classification with Small Visual Language Models

Mohammad Mahdi Derakhshani, Ivona Najdenkoska, Cees G. M. Snoek, Marcel Worring, Yuki M. Asano

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00674 2023-12-04 cs.CV 57%

LightCLIP: Learning Multi-Level Interaction for Lightweight Vision-Language Models

Ying Nie, Wei He, Kai Han, Yehui Tang, Tianyu Guo, Fanyi Du, Yunhe Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07574 2023-11-30 cs.CV 57%

To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning

Junke Wang, Lingchen Meng, Zejia Weng, Bo He, Zuxuan Wu, Yu-Gang Jiang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments techical report; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02124 2023-11-30 cs.CV 57%

Transform, Contrast and Tell: Coherent Entity-Aware Multi-Image Captioning

Jingqiang Chen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 32 pages, 11 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08223 2023-11-29 cs.CV 57%

Improving Image Captioning via Predicting Structured Concepts

Ting Wang, Weidong Chen, Yuanhe Tian, Yan Song, Zhendong Mao

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by EMNLP 2023 (Main Conference, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14822 2023-11-28 cs.CV 57%

Text and Click inputs for unambiguous open vocabulary instance segmentation

Nikolai Warner, Meera Hahn, Jonathan Huang, Irfan Essa, Vighnesh Birodkar

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 20 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14029 2023-11-27 cs.CV cs.LG 57%

Understanding the Vulnerability of CLIP to Image Compression

Cangxiong Chen, Vinay P. Namboodiri, Julian Padget

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14643 2023-11-27 cs.CV 57%

POAR: Towards Open Vocabulary Pedestrian Attribute Recognition

Yue Zhang, Suchen Wang, Shichao Kan, Zhenyu Weng, Yigang Cen, Yap-peng Tan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11695 2023-11-21 cs.CV 57%

Clarity ChatGPT: An Interactive and Adaptive Processing System for Image Restoration and Enhancement

Yanyan Wei, Zhao Zhang, Jiahuan Ren, Xiaogang Xu, Richang Hong, Yi Yang, Shuicheng Yan, Meng Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09191 2023-11-16 cs.CV 57%

Domain Aligned CLIP for Few-shot Classification

Muhammad Waleed Gondal, Jochen Gast, Inigo Alonso Ruiz, Richard Droste, Tommaso Macri, Suren Kumar, Luitpold Staudigl

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments To appear at WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05779 2023-11-13 cs.RO cs.CV 57%

Language-guided Robot Grasping: CLIP-based Referring Grasp Synthesis in Clutter

Georgios Tziafas, Yucheng Xu, Arushi Goel, Mohammadreza Kasaei, Zhibin Li, Hamidreza Kasaei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Poster CoRL 2023. Dataset and code available here: https://github.com/gtziafas/OCID-VLG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09478 2023-11-08 cs.CV 57%

MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning

Jun Chen, Deyao Zhu, Xiaoqian Shen, Xiang Li, Zechun Liu, Pengchuan Zhang, Raghuraman Krishnamoorthi, Vikas Chandra, Yunyang Xiong, Mohamed Elhoseiny

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏