arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2303.11313 2023-04-20 cs.CV 57%

CLIP goes 3D: Leveraging Prompt Tuning for Language Grounded 3D Recognition

Deepti Hegde, Jeya Maria Jose Valanarasu, Vishal M. Patel

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Website: https://jeya-maria-jose.github.io/cg3d-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04231 2023-04-11 cs.CV 57%

CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model

Dingkang Liang, Jiahao Xie, Zhikang Zou, Xiaoqing Ye, Wei Xu, Xiang Bai

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02916 2023-04-07 cs.SD cs.LG eess.AS 57%

Efficient Audio Captioning Transformer with Patchout and Text Guidance

Thodoris Kouzelis, Grigoris Bastas, Athanasios Katsamanis, Alexandros Potamianos

专题命中 图文多模态 :multi-modal(abstract);分类 eess.AS

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17644 2023-04-03 cs.CV 57%

Vision-Language Modelling For Radiological Imaging and Reports In The Low Data Regime

Rhydian Windsor, Amir Jamaludin, Timor Kadir, Andrew Zisserman

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to MIDL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00794 2023-03-31 cs.CV 57%

Scaling Language-Image Pre-training via Masking

Yanghao Li, Haoqi Fan, Ronghang Hu, Christoph Feichtenhofer, Kaiming He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Tech report; arXiv v2: update scaling results and add code repo

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16312 2023-03-23 cs.CV 57%

PLA: Language-Driven Open-Vocabulary 3D Scene Understanding

Runyu Ding, Jihan Yang, Chuhui Xue, Wenqing Zhang, Song Bai, Xiaojuan Qi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07389 2023-03-22 cs.CV cs.LG 57%

Towards Models that Can See and Read

Roy Ganz, Oren Nuriel, Aviad Aberdam, Yair Kittenplon, Shai Mazor, Ron Litman

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09252 2023-03-17 cs.CV 57%

GridCLIP: One-Stage Object Detection by Grid-Level CLIP Representation Learning

Jiayi Lin, Shaogang Gong

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04748 2023-03-17 cs.CV 57%

CLIP-FO3D: Learning Free Open-world 3D Scene Representations from 2D Dense CLIP

Junbo Zhang, Runpei Dong, Kaisheng Ma

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02400 2023-03-17 cs.CV 57%

Location-Aware Self-Supervised Transformers for Semantic Segmentation

Mathilde Caron, Neil Houlsby, Cordelia Schmid

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02489 2023-03-16 cs.CV 57%

CapDet: Unifying Dense Captioning and Open-World Detection Pretraining

Yanxin Long, Youpeng Wen, Jianhua Han, Hang Xu, Pengzhen Ren, Wei Zhang, Shen Zhao, Xiaodan Liang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06547 2023-03-14 cs.CV 57%

Towards Universal Vision-language Omni-supervised Segmentation

Bowen Dong, Jiaxi Gu, Jianhua Han, Hang Xu, Wangmeng Zuo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06345 2023-03-14 cs.CV 57%

Semantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation

Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments AAAI 2023. 11 pages. 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04388 2023-03-09 cs.CV 57%

Interpretable Visual Question Answering Referring to Outside Knowledge

He Zhu, Ren Togo, Takahiro Ogawa, Miki Haseyama

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00289 2023-03-02 cs.CV 57%

StrucTexTv2: Masked Visual-Textual Prediction for Document Image Pre-training

Yuechen Yu, Yulin Li, Chengquan Zhang, Xiaoqiang Zhang, Zengyuan Guo, Xiameng Qin, Kun Yao, Junyu Han, Errui Ding, Jingdong Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06958 2023-03-01 cs.CV 57%

RILS: Masked Visual Reconstruction in Language Semantic Space

Shusheng Yang, Yixiao Ge, Kun Yi, Dian Li, Ying Shan, Xiaohu Qie, Xinggang Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06710 2023-03-01 cs.LG cs.CV 57%

TIER: Text-Image Entropy Regularization for CLIP-style models

Anil Palepu, Andrew L. Beam

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Submitted to CHIL 2023 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13996 2023-02-28 cs.CV 57%

Aligning Bag of Regions for Open-Vocabulary Object Detection

Size Wu, Wenwei Zhang, Sheng Jin, Wentao Liu, Chen Change Loy

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12066 2023-02-24 cs.CV 57%

Teaching CLIP to Count to Ten

Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, Tali Dekel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03432 2023-02-08 cs.CV 57%

SimCon Loss with Multiple Views for Text Supervised Semantic Segmentation

Yash Patel, Yusheng Xie, Yi Zhu, Srikar Appalaraju, R. Manmatha

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.02748 2023-02-06 cs.CV cs.LG 57%

Zero-Shot Out-of-Distribution Detection Based on the Pre-trained Model CLIP

Sepideh Esmaeilpour, Bing Liu, Eric Robertson, Lei Shu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05516 2023-02-02 cs.LG cs.CV 57%

Quality Not Quantity: On the Interaction between Dataset Design and Robustness of CLIP

Thao Nguyen, Gabriel Ilharco, Mitchell Wortsman, Sewoong Oh, Ludwig Schmidt

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Oral paper at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10916 2023-01-27 cs.CV 57%

ITstyler: Image-optimized Text-based Style Transfer

Yunpeng Bai, Jiayue Liu, Chao Dong, Chun Yuan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13977 2023-01-03 cs.CV 57%

CLIP-ReID: Exploiting Vision-Language Model for Image Re-Identification without Concrete Text Labels

Siyuan Li, Li Sun, Qingli Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI23

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12739 2022-12-21 cs.CV 57%

Texts as Images in Prompt Tuning for Multi-Label Image Recognition

Zixian Guo, Bowen Dong, Zhilong Ji, Jinfeng Bai, Yiwen Guo, Wangmeng Zuo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14100 2022-12-19 cs.CV 57%

GIT: A Generative Image-to-text Transformer for Vision and Language

Jianfeng Wang, Zhengyuan Yang, Xiaowei Hu, Linjie Li, Kevin Lin, Zhe Gan, Zicheng Liu, Ce Liu, Lijuan Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00836 2022-12-05 cs.CV 57%

UniT3D: A Unified Transformer for 3D Dense Captioning and Visual Grounding

Dave Zhenyu Chen, Ronghang Hu, Xinlei Chen, Matthias Nießner, Angel X. Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00638 2022-12-02 cs.CV cs.LG 57%

Finetune like you pretrain: Improved finetuning of zero-shot vision models

Sachin Goyal, Ananya Kumar, Sankalp Garg, Zico Kolter, Aditi Raghunathan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 20 Pages, 7 Tables, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14958 2022-11-29 cs.CV 57%

MGDoc: Pre-training with Multi-granular Hierarchy for Document Image Understanding

Zilong Wang, Jiuxiang Gu, Chris Tensmeyer, Nikolaos Barmpalios, Ani Nenkova, Tong Sun, Jingbo Shang, Vlad I. Morariu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14843 2022-11-29 cs.CV 57%

Learning Object-Language Alignments for Open-Vocabulary Object Detection

Chuang Lin, Peize Sun, Yi Jiang, Ping Luo, Lizhen Qu, Gholamreza Haffari, Zehuan Yuan, Jianfei Cai

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏