Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
机构 * Google DeepMind(谷歌DeepMind) ; University of Central Florida(中央佛罗里达大学)
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Google DeepMind(谷歌DeepMind) ; University of Central Florida(中央佛罗里达大学)
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
Comments 10 pages, 10 figures, CoLM 2025
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL
Comments 33 pages, 11 figures, 7 tables
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
机构 * Intelligent Game and Decision Lab(智能游戏与决策实验室)
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
Comments IEEE Submission
机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ; ETRI(电子技术研究院) ; KAIST(韩国科学技术院)
专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; InspireOmni AI ; Alibaba Group(阿里巴巴集团) ; Case Western Reserve University(凯斯西储大学)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted at NeurIPS 2025
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) ; Tencent AI Seattle Lab(腾讯AI西雅图实验室) ; University of Edinburgh(爱丁堡大学) ; NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达圣克拉拉人工智能技术中心)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted as a spotlight at NeurIPS 2025
机构 * Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(计算机视觉系,Mohamed bin Zayed人工智能大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
机构 * Florida State University(佛罗里达州立大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 5 figures
机构 * School of Electronic Engineering(电子工程学院) ; Xidian University(西安电子科技大学) ; School of Computer Science(计算机科学学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
机构 * NAVER AI Lab(NAVER AI实验室)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Code: https://github.com/naver-ai/prolip HuggingFace Hub: https://huggingface.co/collections/SanghyukChun/prolip-6712595dfc87fd8597350291 33 pages, 4.5 MB; LongProLIP paper: arXiv:2503.08048; Multiplicity paper for more background: arxiv.org:2505.19614; v4: fix typos
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) ; Tsinghua University(清华大学)
专题命中 图文多模态 :image-text(abstract)
Comments 13 pages
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; Zhejiang University(浙江大学) ; Ping An Technology (Shenzhen) Co., Ltd(平安科技(深圳)有限公司)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2025 Main Track
机构 * Department of Computer Science & Technology, Tongji University(计算机科学与技术系,同济大学) ; Alibaba Group(阿里巴巴集团) ; Oosto
专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI
Comments 14 pages, 9 figures
机构 * Imperial College London(伦敦帝国学院) ; Meta AI ; NatWest AI Research(NatWest人工智能研究)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments NeurIPS 2025
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
机构 * MTS AI(MTS人工智能公司) ; ITMO University(ITMO大学)
专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL
Comments 11 pages, 4 figures, 3 tables
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; Hochschule für Musik Detmold(音乐学院Detmold)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
机构 * Computer Science and Engineering University of California, Santa Cruz(计算机科学与工程大学加州大学圣克ruz分校)
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments PhD thesis
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV
机构 * University of Washington(华盛顿大学) ; University of California Los Angeles(加州大学洛杉矶分校) ; Allen Institute for AI(人工智能研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted to COLM 2025
机构 * Department of Computational Linguistics, University of Zurich, Zurich, Switzerland(计算语言学系,苏黎世大学,苏黎世,瑞士)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * University of Bristol(布里斯托大学) ; Memories.ai Research(Memories.ai研究)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * NVIDIA
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
Comments EMNLP 2025
机构 * Rochester Institute of Technology(罗切斯特技术研究所)
专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract)