arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2403.11675 2024-03-19 cs.CV 57%

Better (pseudo-)labels for semi-supervised instance segmentation

François Porcher, Camille Couprie, Marc Szafraniec, Jakob Verbeek

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Appeared at the Practical ML for Low Resource Settings workshop at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11550 2024-03-19 cs.CV 57%

TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling

Weiran Chen, Xin Li, Jiaqi Su, Guiqian Zhu, Ying Li, Yi Ji, Chunping Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05657 2024-03-19 cs.CV 57%

Tag2Text: Guiding Vision-Language Model via Image Tagging

Xinyu Huang, Youcai Zhang, Jinyu Ma, Weiwei Tian, Rui Feng, Yuejie Zhang, Yaqian Li, Yandong Guo, Lei Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07901 2024-03-14 cs.CV cs.LG 57%

MIP: CLIP-based Image Reconstruction from PEFT Gradients

Peiheng Zhou, Ming Hu, Xiaofei Xie, Yihao Huang, Kangjie Chen, Mingsong Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07874 2024-03-13 cs.CV 57%

Beyond Text: Frozen Large Language Models in Visual Signal Comprehension

Lei Zhu, Fangyun Wei, Yanye Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15637 2024-03-13 cs.CV cs.GR 57%

Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D Strokes

Hao-Bin Duan, Miao Wang, Yan-Xun Li, Yong-Liang Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17910 2024-03-12 cs.CV 57%

ControlCap: Controllable Region-level Captioning

Yuzhong Zhao, Yue Liu, Zonghao Guo, Weijia Wu, Chen Gong, Fang Wan, Qixiang Ye

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments https://github.com/callsys/ControlCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08255 2024-03-12 cs.CV 57%

Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification

Sravanti Addepalli, Ashish Ramayee Asokan, Lakshay Sharma, R. Venkatesh Babu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Project page: http://val.cds.iisc.ac.in/VL2V-ADiP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05381 2024-03-11 cs.CV 57%

Exploring Robust Features for Few-Shot Object Detection in Satellite Imagery

Xavier Bou, Gabriele Facciolo, Rafael Grompone von Gioi, Jean-Michel Morel, Thibaud Ehret

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01950 2024-03-08 cs.CV 57%

ConRF: Zero-shot Stylization of 3D Scenes with Conditioned Radiation Fields

Xingyu Miao, Yang Bai, Haoran Duan, Fan Wan, Yawen Huang, Yang Long, Yefeng Zheng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16634 2024-03-08 cs.CV 57%

CDUL: CLIP-Driven Unsupervised Learning for Multi-Label Image Classification

Rabab Abdelfattah, Qing Guo, Xiaoguang Li, Xiaofeng Wang, Song Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted in ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03715 2024-03-07 cs.CV 57%

MeaCap: Memory-Augmented Zero-shot Image Captioning

Zequn Zeng, Yan Xie, Hao Zhang, Chiyu Chen, Zhengjue Wang, Bo Chen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02330 2024-03-05 cs.CV 57%

RegionGPT: Towards Region Understanding Vision Language Model

Qiushan Guo, Shalini De Mello, Hongxu Yin, Wonmin Byeon, Ka Chun Cheung, Yizhou Yu, Ping Luo, Sifei Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17259 2024-02-28 cs.SD eess.AS 57%

EDTC: enhance depth of text comprehension in automated audio captioning

Liwen Tan, Yin Cao, Yi Zhou

专题命中 图文多模态 :multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15537 2024-02-28 cs.CV 57%

SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation

Bin Xie, Jiale Cao, Jin Xie, Fahad Shahbaz Khan, Yanwei Pang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03475 2024-02-27 cs.MM 57%

COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment

Chaoya Jiang, Haiyang Xu, Wei Ye, Qinghao Ye, Chenliang Li, Ming Yan, Bin Bi, Shikun Zhang, Ji Zhang, Fei Huang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.MM

Comments Accepted on ACM MM2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17085 2024-02-20 cs.CV 57%

Beyond Visual Cues: Synchronously Exploring Target-Centric Semantics for Vision-Language Tracking

Jiawei Ge, Xiangmei Chen, Jiuxin Cao, Xuelin Zhu, Bo Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11572 2024-02-20 cs.CL 57%

Cobra Effect in Reference-Free Image Captioning Metrics

Zheng Ma, Changxin Wang, Yawen Ouyang, Fei Zhao, Jianbing Zhang, Shujian Huang, Jiajun Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

Comments pre-print version

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00685 2024-02-19 cs.CV 57%

Vision-Language Models for Vision Tasks: A Survey

Jingyi Zhang, Jiaxing Huang, Sheng Jin, Shijian Lu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09671 2024-02-16 cs.CV cs.LG 57%

Exploiting Alpha Transparency In Language And Vision-Based AI Systems

David Noever, Forrest McKee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08657 2024-02-14 cs.CV 57%

PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs

Michael Dorkenwald, Nimrod Barazani, Cees G. M. Snoek, Yuki M. Asano

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06475 2024-02-12 cs.CV 57%

Large Language Models for Captioning and Retrieving Remote Sensing Images

João Daniel Silva, João Magalhães, Devis Tuia, Bruno Martins

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05090 2024-02-08 cs.RO cs.CV 57%

Language-Based Augmentation to Address Shortcut Learning in Object Goal Navigation

Dennis Hoftijzer, Gertjan Burghouts, Luuk Spreeuwers

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 6 figures, to be published in IEEE IRC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12531 2024-02-06 cs.CL 57%

ICU: Conquering Language Barriers in Vision-and-Language Modeling by Dividing the Tasks into Image Captioning and Language Understanding

Guojun Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments EMNLP 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01378 2024-02-06 cs.RO cs.AI cs.LG 57%

Vision-Language Foundation Models as Effective Robot Imitators

Xinghang Li, Minghuan Liu, Hanbo Zhang, Cunjun Yu, Jie Xu, Hongtao Wu, Chilam Cheang, Ya Jing, Weinan Zhang, Huaping Liu, Hang Li, Tao Kong

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Fix typos. Project page: https://roboflamingo.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12217 2024-01-23 cs.CV cs.LG 57%

Exploring Simple Open-Vocabulary Semantic Segmentation

Zihang Lai

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Code is available at: https://github.com/zlai0/S-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11228 2024-01-23 cs.CV 57%

Unifying Visual and Vision-Language Tracking via Contrastive Learning

Yinchao Ma, Yuyang Tang, Wenfei Yang, Tianzhu Zhang, Jinpeng Zhang, Mengxue Kang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09712 2024-01-19 cs.CV 57%

SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model

Yang Zhan, Zhitong Xiong, Yuan Yuan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08968 2024-01-18 cs.CV 57%

COCO is "ALL'' You Need for Visual Instruction Fine-tuning

Xiaotian Han, Yiqi Wang, Bohan Zhai, Quanzeng You, Hongxia Yang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07457 2024-01-17 cs.CV 57%

Concept-Guided Prompt Learning for Generalization in Vision-Language Models

Yi Zhang, Ce Zhang, Ke Yu, Yushun Tang, Zhihai He

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏