Switch-BERT: Learning to Model Multimodal Interactions by Switching Attention and Input
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by ECCV2022
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by ECCV2022
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI
Comments Accepted by ACL 2023 Main Conference
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted at the WikiWorkshop 2023. Data is readily available at https://github.com/google-research-datasets/wit/blob/main/wikiweb2m.md. arXiv admin note: text overlap with arXiv:2305.03668
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Work in progress, v0.2
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 13 pages, 9 figures, Accepted by TIP2023
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments 14 pages, 5 figures
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments SIGIR 2022
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments Preprint
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 11 pages, 6 figures
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments Short version. Accepted at Data Centric AI NeurIPS Workshop 2021
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 14pages, 9 figures. Accepted at: IEEE Transactions on Circuits and Systems for Video Technology (Early Access Print) | |Codes Available at: https://github.com/kywen1119/DSRAN
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accept to ACM MM2020, code available at https://github.com/MILVLG/mmnas/
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 12 pages, 3 figures, 7 tables
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 13 pages. NIPS 2014 deep learning workshop
机构 * Computer Science, School of Science and Engineering, University of Missouri - Kansas City(计算机科学系,科学与工程学院,密苏里大学-堪萨斯城分校)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV;multimodal(journal_ref)
Comments 8 pages, 6 figures, 3 tables
Journal ref Non-Archival track - The First Workshop on Multimodal Knowledge and Language Modeling IJCAI 2025 Workshop, August 16, 2025 IJCAI 2025 Workshop, August 16, 2025 Room 516B, Palais des congrès, Montreal, Canada
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments vision-language pre-training, contrastive learning, cross-modal, associative learning, associative mapping classification
驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架
机构 * SANNO University(山王大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。
仅掩码不足:面向医疗AI的多模态去标识化生成式修复
机构 * Kennesaw State University(肯尼索州立大学) ; Miami University(迈阿密大学) ; Georgia State University(佐治亚州立大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。
合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试
机构 * NAVER Cloud(NAVER云) ; KAIST AI(韩国科学技术院人工智能)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。
VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题
机构 * Pohang University of Science
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。
PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配
专题命中 图文多模态 :cross-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CL
AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。
Comments Under Review
ZOMP:面向视觉-语言模型的零阶多模态提示调优
机构 * UC Santa Barbara(加州大学圣巴巴拉分校)
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。
面向恶劣天气去除的退化感知跨模态补偿提示学习
机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) ; School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) ; The Hong Kong Polytechnic University(香港理工大学) ; University of California, San Francisco(加利福尼亚大学旧金山分校) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 该研究针对恶劣天气导致图像退化影响视觉系统可靠性的问题,提出 DCMPC-Net 模型,通过跨模态提示补偿实现鲁棒的恶劣天气图像修复,性能优于现有最先进方法。
Comments Accepted for publication in IEEE Transactions on Image Processing. The code is available at: https://github.com/fanamber831/DCMPC-Net
Jagle:构建大规模日语多模态预训练数据集以构建视觉-语言模型
机构 * Kyoto University(京都大学) ; NII LLMC(国立信息学研究所LLMC) ; Waseda University(早稻田大学) ; Institute of Science Tokyo(东京科学大学) ; NII(国立信息学研究所) ; Aichi Institute of Technology(爱知工业大学) ; Institute of Physical and Chemical Research(理化学研究所)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出Jagle,一个包含920万实例的日语多模态预训练数据集,通过多种策略生成VQA对,实验表明其在日语任务中表现优异,且与FineVision结合能提升英文性能。
Comments Accepted to COLM 2026