arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2402.01950 2024-03-08 cs.CV 57%

ConRF: Zero-shot Stylization of 3D Scenes with Conditioned Radiation Fields

Xingyu Miao, Yang Bai, Haoran Duan, Fan Wan, Yawen Huang, Yang Long, Yefeng Zheng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16634 2024-03-08 cs.CV 57%

CDUL: CLIP-Driven Unsupervised Learning for Multi-Label Image Classification

Rabab Abdelfattah, Qing Guo, Xiaoguang Li, Xiaofeng Wang, Song Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted in ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03715 2024-03-07 cs.CV 57%

MeaCap: Memory-Augmented Zero-shot Image Captioning

Zequn Zeng, Yan Xie, Hao Zhang, Chiyu Chen, Zhengjue Wang, Bo Chen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02330 2024-03-05 cs.CV 57%

RegionGPT: Towards Region Understanding Vision Language Model

Qiushan Guo, Shalini De Mello, Hongxu Yin, Wonmin Byeon, Ka Chun Cheung, Yizhou Yu, Ping Luo, Sifei Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17259 2024-02-28 cs.SD eess.AS 57%

EDTC: enhance depth of text comprehension in automated audio captioning

Liwen Tan, Yin Cao, Yi Zhou

专题命中 图文多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15537 2024-02-28 cs.CV 57%

SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation

Bin Xie, Jiale Cao, Jin Xie, Fahad Shahbaz Khan, Yanwei Pang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03475 2024-02-27 cs.MM 57%

COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment

Chaoya Jiang, Haiyang Xu, Wei Ye, Qinghao Ye, Chenliang Li, Ming Yan, Bin Bi, Shikun Zhang, Ji Zhang, Fei Huang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.MM

Comments Accepted on ACM MM2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17085 2024-02-20 cs.CV 57%

Beyond Visual Cues: Synchronously Exploring Target-Centric Semantics for Vision-Language Tracking

Jiawei Ge, Xiangmei Chen, Jiuxin Cao, Xuelin Zhu, Bo Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11572 2024-02-20 cs.CL 57%

Cobra Effect in Reference-Free Image Captioning Metrics

Zheng Ma, Changxin Wang, Yawen Ouyang, Fei Zhao, Jianbing Zhang, Shujian Huang, Jiajun Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

Comments pre-print version

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00685 2024-02-19 cs.CV 57%

Vision-Language Models for Vision Tasks: A Survey

Jingyi Zhang, Jiaxing Huang, Sheng Jin, Shijian Lu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09671 2024-02-16 cs.CV cs.LG 57%

Exploiting Alpha Transparency In Language And Vision-Based AI Systems

David Noever, Forrest McKee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08657 2024-02-14 cs.CV 57%

PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs

Michael Dorkenwald, Nimrod Barazani, Cees G. M. Snoek, Yuki M. Asano

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06475 2024-02-12 cs.CV 57%

Large Language Models for Captioning and Retrieving Remote Sensing Images

João Daniel Silva, João Magalhães, Devis Tuia, Bruno Martins

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05090 2024-02-08 cs.RO cs.CV 57%

Language-Based Augmentation to Address Shortcut Learning in Object Goal Navigation

Dennis Hoftijzer, Gertjan Burghouts, Luuk Spreeuwers

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 6 figures, to be published in IEEE IRC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12531 2024-02-06 cs.CL 57%

ICU: Conquering Language Barriers in Vision-and-Language Modeling by Dividing the Tasks into Image Captioning and Language Understanding

Guojun Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments EMNLP 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01378 2024-02-06 cs.RO cs.AI cs.LG 57%

Vision-Language Foundation Models as Effective Robot Imitators

Xinghang Li, Minghuan Liu, Hanbo Zhang, Cunjun Yu, Jie Xu, Hongtao Wu, Chilam Cheang, Ya Jing, Weinan Zhang, Huaping Liu, Hang Li, Tao Kong

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Fix typos. Project page: https://roboflamingo.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12217 2024-01-23 cs.CV cs.LG 57%

Exploring Simple Open-Vocabulary Semantic Segmentation

Zihang Lai

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Code is available at: https://github.com/zlai0/S-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11228 2024-01-23 cs.CV 57%

Unifying Visual and Vision-Language Tracking via Contrastive Learning

Yinchao Ma, Yuyang Tang, Wenfei Yang, Tianzhu Zhang, Jinpeng Zhang, Mengxue Kang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09712 2024-01-19 cs.CV 57%

SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model

Yang Zhan, Zhitong Xiong, Yuan Yuan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08968 2024-01-18 cs.CV 57%

COCO is "ALL'' You Need for Visual Instruction Fine-tuning

Xiaotian Han, Yiqi Wang, Bohan Zhai, Quanzeng You, Hongxia Yang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07457 2024-01-17 cs.CV 57%

Concept-Guided Prompt Learning for Generalization in Vision-Language Models

Yi Zhang, Ce Zhang, Ke Yu, Yushun Tang, Zhihai He

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05676 2024-01-12 cs.CV 57%

Exploring Self- and Cross-Triplet Correlations for Human-Object Interaction Detection

Weibo Jiang, Weihong Ren, Jiandong Tian, Liangqiong Qu, Zhiyong Wang, Honghai Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04903 2024-01-11 cs.CV 57%

SnapCap: Efficient Snapshot Compressive Video Captioning

Jianqiao Sun, Yudi Su, Hao Zhang, Ziheng Cheng, Zequn Zeng, Zhengjue Wang, Bo Chen, Xin Yuan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Preprint; Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14093 2024-01-10 cs.CV 57%

Weakly Supervised 3D Open-vocabulary Segmentation

Kunhao Liu, Fangneng Zhan, Jiahui Zhang, Muyu Xu, Yingchen Yu, Abdulmotaleb El Saddik, Christian Theobalt, Eric Xing, Shijian Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13505 2024-01-05 cs.CV 57%

Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation

Yun Xing, Jian Kang, Aoran Xiao, Jiahao Nie, Ling Shao, Shijian Lu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments NeurIPS 2023. Code is available at https://github.com/xing0047/rewrite

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16886 2024-01-02 cs.CV 57%

MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices

Xiangxiang Chu, Limeng Qiao, Xinyang Lin, Shuang Xu, Yang Yang, Yiming Hu, Fei Wei, Xinyu Zhang, Bo Zhang, Xiaolin Wei, Chunhua Shen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17334 2024-01-01 cs.CV 57%

Improving Image Restoration through Removing Degradations in Textual Representations

Jingbo Lin, Zhilu Zhang, Yuxiang Wei, Dongwei Ren, Dongsheng Jiang, Wangmeng Zuo

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12073 2024-01-01 cs.CV 57%

NeuroCLIP: Neuromorphic Data Understanding by CLIP and SNN

Yufei Guo, Yuanpei Chen, Zhe Ma

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04087 2023-12-29 cs.CV 57%

SVIT: Scaling up Visual Instruction Tuning

Bo Zhao, Boya Wu, Muyang He, Tiejun Huang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15043 2023-12-27 cs.CV 57%

GroundVLP: Harnessing Zero-shot Visual Grounding from Vision-Language Pre-training and Open-Vocabulary Object Detection

Haozhan Shen, Tiancheng Zhao, Mingwei Zhu, Jianwei Yin

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏