arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2306.07831 2023-06-14 cs.CV 57%

Visual Language Pretrained Multiple Instance Zero-Shot Transfer for Histopathology Images

Ming Y. Lu, Bowen Chen, Andrew Zhang, Drew F. K. Williamson, Richard J. Chen, Tong Ding, Long Phi Le, Yung-Sung Chuang, Faisal Mahmood

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03514 2023-06-12 cs.CV 57%

Recognize Anything: A Strong Image Tagging Model

Youcai Zhang, Xinyu Huang, Jinyu Ma, Zhaoyang Li, Zhaochuan Luo, Yanchun Xie, Yuzhuo Qin, Tong Luo, Yaqian Li, Shilong Liu, Yandong Guo, Lei Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Homepage: https://recognize-anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02329 2023-06-12 cs.CV 57%

Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes

Alexandros Delitzas, Maria Parelli, Nikolas Hars, Georgios Vlassis, Sotirios Anagnostidis, Gregor Bachmann, Thomas Hofmann

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments The first two authors contributed equally. arXiv admin note: text overlap with arXiv:2304.06061

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03932 2023-06-08 cs.CV 57%

Q: How to Specialize Large Vision-Language Models to Data-Scarce VQA Tasks? A: Self-Train on Unlabeled Images!

Zaid Khan, Vijay Kumar BG, Samuel Schulter, Xiang Yu, Yun Fu, Manmohan Chandraker

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09737 2023-06-08 cs.CV 57%

Position-guided Text Prompt for Vision-Language Pre-training

Alex Jinpeng Wang, Pan Zhou, Mike Zheng Shou, Shuicheng Yan

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Camera-ready version, code is in https://github.com/sail-sg/ptp

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03678 2023-06-07 cs.CL 57%

On the Difference of BERT-style and CLIP-style Text Encoders

Zhihong Chen, Guiming Hardy Chen, Shizhe Diao, Xiang Wan, Benyou Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL

Comments Natural Language Processing. 10 pages, 1 figure. Findings of ACL-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16328 2023-05-29 cs.CL cs.LG 57%

Semantic Composition in Visually Grounded Language Models

Rohan Pandey

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL

Comments Carnegie Mellon University Senior Thesis. arXiv admin note: substantial text overlap with arXiv:2212.10549

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15407 2023-05-25 cs.CV 57%

Balancing the Picture: Debiasing Vision-Language Datasets with Synthetic Contrast Sets

Brandon Smith, Miguel Farinha, Siobhan Mackenzie Hall, Hannah Rose Kirk, Aleksandar Shtedritski, Max Bain

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Github: https://github.com/oxai/debias-gensynth

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13782 2023-05-24 cs.CL 57%

Images in Language Space: Exploring the Suitability of Large Language Models for Vision & Language Tasks

Sherzod Hakimov, David Schlangen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted at ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12777 2023-05-23 cs.CL 57%

Evaluating Pragmatic Abilities of Image Captioners on A3DS

Polina Tsvilodub, Michael Franke

专题命中 图文多模态 :image-text(abstract);分类 cs.CL

Comments 5 pages, 2 figures, to appear in the 61st Proceedings of the Association for Computational Linguistics (ACL 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10420 2023-05-18 cs.CV 57%

CLIP-GCD: Simple Language Guided Generalized Category Discovery

Rabah Ouldnoughi, Chia-Wen Kuo, Zsolt Kira

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09699 2023-05-18 cs.CV 57%

Mobile User Interface Element Detection Via Adaptively Prompt Tuning

Zhangxuan Gu, Zhuoer Xu, Haoxing Chen, Jun Lan, Changhua Meng, Weiqiang Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR23

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00788 2023-05-18 cs.CV 57%

Open-Vocabulary Point-Cloud Object Detection without 3D Annotation

Yuheng Lu, Chenfeng Xu, Xiaobao Wei, Xiaodong Xie, Masayoshi Tomizuka, Kurt Keutzer, Shanghang Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments I want to update this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06378 2023-05-18 cs.CV 57%

Learning Grounded Vision-Language Representation for Versatile Understanding in Untrimmed Videos

Teng Wang, Jinrui Zhang, Feng Zheng, Wenhao Jiang, Ran Cheng, Ping Luo

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.06547 2023-05-04 eess.AS cs.SD 57%

Investigations in Audio Captioning: Addressing Vocabulary Imbalance and Evaluating Suitability of Language-Centric Performance Metrics

Sandeep Kothinti, Dimitra Emmanouilidou

专题命中 图文多模态 :cross-modal(abstract);分类 eess.AS

Comments Submitted to EUSIPCO 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11313 2023-04-20 cs.CV 57%

CLIP goes 3D: Leveraging Prompt Tuning for Language Grounded 3D Recognition

Deepti Hegde, Jeya Maria Jose Valanarasu, Vishal M. Patel

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Website: https://jeya-maria-jose.github.io/cg3d-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04231 2023-04-11 cs.CV 57%

CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model

Dingkang Liang, Jiahao Xie, Zhikang Zou, Xiaoqing Ye, Wei Xu, Xiang Bai

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02916 2023-04-07 cs.SD cs.LG eess.AS 57%

Efficient Audio Captioning Transformer with Patchout and Text Guidance

Thodoris Kouzelis, Grigoris Bastas, Athanasios Katsamanis, Alexandros Potamianos

专题命中 图文多模态 :multi-modal(abstract);分类 eess.AS

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17644 2023-04-03 cs.CV 57%

Vision-Language Modelling For Radiological Imaging and Reports In The Low Data Regime

Rhydian Windsor, Amir Jamaludin, Timor Kadir, Andrew Zisserman

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to MIDL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00794 2023-03-31 cs.CV 57%

Scaling Language-Image Pre-training via Masking

Yanghao Li, Haoqi Fan, Ronghang Hu, Christoph Feichtenhofer, Kaiming He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Tech report; arXiv v2: update scaling results and add code repo

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16312 2023-03-23 cs.CV 57%

PLA: Language-Driven Open-Vocabulary 3D Scene Understanding

Runyu Ding, Jihan Yang, Chuhui Xue, Wenqing Zhang, Song Bai, Xiaojuan Qi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07389 2023-03-22 cs.CV cs.LG 57%

Towards Models that Can See and Read

Roy Ganz, Oren Nuriel, Aviad Aberdam, Yair Kittenplon, Shai Mazor, Ron Litman

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09252 2023-03-17 cs.CV 57%

GridCLIP: One-Stage Object Detection by Grid-Level CLIP Representation Learning

Jiayi Lin, Shaogang Gong

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04748 2023-03-17 cs.CV 57%

CLIP-FO3D: Learning Free Open-world 3D Scene Representations from 2D Dense CLIP

Junbo Zhang, Runpei Dong, Kaisheng Ma

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02400 2023-03-17 cs.CV 57%

Location-Aware Self-Supervised Transformers for Semantic Segmentation

Mathilde Caron, Neil Houlsby, Cordelia Schmid

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02489 2023-03-16 cs.CV 57%

CapDet: Unifying Dense Captioning and Open-World Detection Pretraining

Yanxin Long, Youpeng Wen, Jianhua Han, Hang Xu, Pengzhen Ren, Wei Zhang, Shen Zhao, Xiaodan Liang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06547 2023-03-14 cs.CV 57%

Towards Universal Vision-language Omni-supervised Segmentation

Bowen Dong, Jiaxi Gu, Jianhua Han, Hang Xu, Wangmeng Zuo

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06345 2023-03-14 cs.CV 57%

Semantics-Aware Dynamic Localization and Refinement for Referring Image Segmentation

Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, Philip H. S. Torr

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments AAAI 2023. 11 pages. 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04388 2023-03-09 cs.CV 57%

Interpretable Visual Question Answering Referring to Outside Knowledge

He Zhu, Ren Togo, Takahiro Ogawa, Miki Haseyama

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00289 2023-03-02 cs.CV 57%

StrucTexTv2: Masked Visual-Textual Prediction for Document Image Pre-training

Yuechen Yu, Yulin Li, Chengquan Zhang, Xiaoqiang Zhang, Zengyuan Guo, Xiameng Qin, Kun Yao, Junyu Han, Errui Ding, Jingdong Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏