arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2210.15871 2022-11-28 cs.CV 57%

VLT: Vision-Language Transformer and Query Generation for Referring Segmentation

Henghui Ding, Chang Liu, Suchen Wang, Xudong Jiang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12494 2022-11-23 cs.CV cs.LG 57%

On the Transferability of Visual Features in Generalized Zero-Shot Learning

Paola Cascante-Bonilla, Leonid Karlinsky, James Seale Smith, Yanjun Qi, Vicente Ordonez

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12148 2022-11-23 cs.CV cs.LG 57%

Aligning Source Visual and Target Language Domains for Unpaired Video Captioning

Fenglin Liu, Xian Wu, Chenyu You, Shen Ge, Yuexian Zou, Xu Sun

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Published at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06679 2022-11-22 cs.CL 57%

AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities

Zhongzhi Chen, Guang Liu, Bo-Wen Zhang, Fulong Ye, Qinghong Yang, Ledell Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07275 2022-11-15 cs.CV 57%

Zero-shot Image Captioning by Anchor-augmented Vision-Language Space Alignment

Junyang Wang, Yi Zhang, Ming Yan, Ji Zhang, Jitao Sang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03594 2022-11-15 cs.CV 57%

Levenshtein OCR

Cheng Da, Peng Wang, Cong Yao

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.03911 2022-11-15 cs.CV 57%

Language Matters: A Weakly Supervised Vision-Language Pre-training Approach for Scene Text Detection and Spotting

Chuhui Xue, Wenqing Zhang, Yu Hao, Shijian Lu, Philip Torr, Song Bai

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ECCV2022 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05521 2022-11-11 cs.CV cs.CY 57%

Zero-shot Visual Commonsense Immorality Prediction

Yujin Jeong, Seongbeom Park, Suhong Moon, Jinkyu Kim

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments BMVC2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04785 2022-11-10 cs.CV 57%

Masked Vision-Language Transformers for Scene Text Recognition

Jie Wu, Ying Peng, Shengming Zhang, Weigang Qi, Jian Zhang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments The paper is accepted by the 33rd British Machine Vision Conference (BMVC 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11316 2022-11-08 cs.LG cs.CV 57%

CLOOB: Modern Hopfield Networks with InfoLOOB Outperform CLIP

Andreas Fürst, Elisabeth Rumetshofer, Johannes Lehner, Viet Tran, Fei Tang, Hubert Ramsauer, David Kreil, Michael Kopp, Günter Klambauer, Angela Bitto-Nemling, Sepp Hochreiter

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Published at NeurIPS 2022; Blog: https://ml-jku.github.io/cloob; GitHub: https://github.com/ml-jku/cloob

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08455 2022-11-01 cs.CV 57%

Open-world Semantic Segmentation via Contrasting and Clustering Vision-Language Embedding

Quande Liu, Youpeng Wen, Jianhua Han, Chunjing Xu, Hang Xu, Xiaodan Liang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted to ECCV 2022 (revise acknowledgement)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12826 2022-10-25 cs.CV cs.LG 57%

Towards Real-Time Text2Video via CLIP-Guided, Pixel-Level Optimization

Peter Schaldenbrand, Zhixuan Liu, Jean Oh

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09407 2022-10-18 cs.CV 57%

DetCLIP: Dictionary-Enriched Visual-Concept Paralleled Pre-training for Open-world Detection

Lewei Yao, Jianhua Han, Youpeng Wen, Xiaodan Liang, Dan Xu, Wei Zhang, Zhenguo Li, Chunjing Xu, Hang Xu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.09502 2022-10-18 cs.CV 57%

GAMA: Generative Adversarial Multi-Object Scene Attacks

Abhishek Aich, Calvin-Khang Ta, Akash Gupta, Chengyu Song, Srikanth V. Krishnamurthy, M. Salman Asif, Amit K. Roy-Chowdhury

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2022; First two authors contributed equally; Includes Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12343 2022-09-27 cs.CV cs.LG 57%

Paraphrasing Is All You Need for Novel Object Captioning

Cheng-Fu Yang, Yao-Hung Hubert Tsai, Wan-Cyuan Fan, Ruslan Salakhutdinov, Louis-Philippe Morency, Yu-Chiang Frank Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04372 2022-09-12 cs.CV 57%

Pre-training image-language transformers for open-vocabulary tasks

AJ Piergiovanni, Weicheng Kuo, Anelia Angelova

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.12066 2022-08-30 cs.CV 57%

Zero-shot Object Detection Through Vision-Language Embedding Alignment

Johnathan Xie, Shuai Zheng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Code: https://github.com/Johnathan-Xie/ZSD-YOLO

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02583 2022-08-16 cs.CV 57%

PIC 4th Challenge: Semantic-Assisted Multi-Feature Encoding and Multi-Head Decoding for Dense Video Captioning

Yifan Lu, Ziqi Zhang, Yuxin Chen, Chunfeng Yuan, Bing Li, Weiming Hu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 5 pages, 2 figures, report of PIC 4th Challenge Accepted by PIC'22 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04060 2022-08-09 cs.CV 57%

GRIT-VLP: Grouped Mini-batch Sampling for Efficient Vision and Language Pre-training

Jaeseok Byun, Taebaek Hwang, Jianlong Fu, Taesup Moon

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.03550 2022-08-09 cs.CV 57%

Frozen CLIP Models are Efficient Video Learners

Ziyi Lin, Shijie Geng, Renrui Zhang, Peng Gao, Gerard de Melo, Xiaogang Wang, Jifeng Dai, Yu Qiao, Hongsheng Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05333 2022-08-02 cs.CV cs.LG 57%

IDEA: Increasing Text Diversity via Online Multi-Label Recognition for Vision-Language Pre-training

Xinyu Huang, Youcai Zhang, Ying Cheng, Weiwei Tian, Ruiwei Zhao, Rui Feng, Yuejie Zhang, Yaqian Li, Yandong Guo, Xiaobo Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by the 30th ACM International Conference on Multimedia (ACM MM 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11100 2022-07-29 cs.CV 57%

Zero-Shot Video Captioning with Evolving Pseudo-Tokens

Yoad Tewel, Yoav Shalev, Roy Nadler, Idan Schwartz, Lior Wolf

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.09248 2022-07-21 cs.CV 57%

Don't Stop Learning: Towards Continual Learning for the CLIP Model

Yuxuan Ding, Lingqiao Liu, Chunna Tian, Jingyuan Yang, Haoxuan Ding

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06230 2022-07-21 cs.CV 57%

Simple Open-Vocabulary Object Detection with Vision Transformers

Matthias Minderer, Alexey Gritsenko, Austin Stone, Maxim Neumann, Dirk Weissenborn, Alexey Dosovitskiy, Aravindh Mahendran, Anurag Arnab, Mostafa Dehghani, Zhuoran Shen, Xiao Wang, Xiaohua Zhai, Thomas Kipf, Neil Houlsby

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ECCV 2022 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08034 2022-07-19 cs.CV 57%

Progress and limitations of deep networks to recognize objects in unusual poses

Amro Abbas, Stéphane Deny

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07993 2022-07-12 cs.CL 57%

CoLLIE: Continual Learning of Language Grounding from Language-Image Embeddings

Gabriel Skantze, Bram Willemsen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Published in Journal of Artificial Intelligence Research (JAIR)

Journal ref Journal of Artificial Intelligence Research (JAIR), 2022, vol. 74, pp. 1201-1223

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01076 2022-07-05 cs.CV 57%

Divert More Attention to Vision-Language Tracking

Mingzhe Guo, Zhipeng Zhang, Heng Fan, Liping Jing

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09541 2022-06-22 cs.CV 57%

DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations

Ximeng Sun, Ping Hu, Kate Saenko

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06619 2022-06-15 cs.CV 57%

TransVG++: End-to-End Visual Grounding with Language Conditioned Vision Transformer

Jiajun Deng, Zhengyuan Yang, Daqing Liu, Tianlang Chen, Wengang Zhou, Yanyong Zhang, Houqiang Li, Wanli Ouyang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2104.08541

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05912 2022-06-14 cs.CV 57%

INDIGO: Intrinsic Multimodality for Domain Generalization

Puneet Mangla, Shivam Chandhok, Milan Aggarwal, Vineeth N Balasubramanian, Balaji Krishnamurthy

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏