Learning Multimodal VAEs through Mutual Supervision
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.AI
Comments Accpted by IJCAI'2022 survey track
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2201.11307
Journal ref WACV2023
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted at ECCV 2022
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments 9 pages, 7 figures
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 14 pages, 4 figures
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
Comments 9 pages, 8 figures including appendix figure, 2 tables. Published in Findings of ACL workshop, CONSTRAINT 2022 (Long paper). The manuscript is slightly revised after the camera ready version
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted to CVPR 2022
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Accepted at the IEEE International Symposium on Biomedical Imaging (ISBI) 2022 as an oral presentation
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by 2021 ACMMM Open Source Software Competition. Source code: https://github.com/YehLi/xmodaler
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
Comments 10 pages, 4 figures
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 12 pages, 1 figure, 7 tables
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted by IJCAI 2021
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper is accepted by ACM International Conference on Multimedia Retrieval (ICMR), 2021
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments accepted by AAAI-2020. arXiv admin note: text overlap with arXiv:1909.11740 by other authors
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CL
Comments 7 pages
Journal ref 2019 Annual Conference of the North American Chapter of the Association for Computational Linguistics
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
Comments Published in BMVC 2018
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM
机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul 06974, Republic of Korea(人工智能系,成均馆大学,韩国首尔)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract)
Comments Multi-modal, Multi-modal Representation Learning, Missing Modality, Missing Modality Reconstruction, Speech and Multi-modality, Vision and Language
SARVLM:一种用于SAR图像语义理解的视觉语言基础模型
机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Yuelushan Center for Industrial Innovation(岳麓山创新中心) ; School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)
AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。
Comments 13 pages, 13 figures
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);multimodal foundation model(abstract)
Comments 18 pages
学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割
机构 * Seoul National University of Science and Technology(首尔科技大学) ; Chung-Ang University(中央大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。
Comments 14 pages
Journal ref Neurocomputing, 2026
通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉
机构 * Meta AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。