MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models
MM-PoE:通过多模态模型的排除过程进行多选推理
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MM-PoE:通过多模态模型的排除过程进行多选推理
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。
为何文本占上风:视觉可能损害多模态医疗决策制定
机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) ; University of Pittsburgh(匹兹堡大学) ; NC State University(北卡罗来纳州立大学) ; University of Washington(华盛顿大学) ; University of Maryland(马里兰大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。
Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining
SELECT:在现实世界场景文本数据中检测标签错误
机构 * Yidun AI Lab, NetEase(网易异度人工智能实验室)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 SELECT通过多模态训练和SSLC方法有效检测现实世界场景文本数据中的标签错误,提升文本识别准确性。
Med3DVLM: 一种高效的视觉-语言模型用于3D医学图像分析
机构 * University of Florida(佛罗里达大学)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 Med3DVLM通过三个创新提出,实现了高效的3D医学图像分析,显著提升了图像-文本检索、报告生成和视觉问答的性能。
SuperCLIP:带有简单分类监督的CLIP
机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ; ByteDance(字节跳动)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。
Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP
擦除CLIP记忆:非破坏性、无数据零样本类去学习在CLIP模型中
机构 * Hewlett Packard Labs(惠普实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种基于空空间投影的非破坏性零样本类去学习方法,有效降低CLIP模型中目标类别的性能,同时保留整体多模态知识。
选择性、可控性和领域无关的预训练CLIP模型去学习:一种无需训练和数据的方法
机构 * Hewlett Packard Labs(惠普实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种无需训练和数据的CLIP去学习方法,能够实现选择性、可控性和领域无关的模型遗忘,提升模型在不同任务上的适应性与效率。
为低数据情形下的X射线衍射成像适应通用基础模型
机构 * The University of Alabama(阿拉巴马大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出PtychoBench基准,通过比较SFT和ICL策略,在低数据环境下优化X射线衍射成像任务的模型适应性,发现任务模态决定最佳专门化路径。
聚焦:一种高效的视觉-语言模型流式集中架构
专题命中 图文多模态 :cross-modal(abstract)
AI总结 Focus提出了一种高效的视觉-语言模型流式集中架构,通过分层压缩和细粒度冗余消除,实现2.4倍速度提升和3.3倍能效提升。
Comments HPCA 2026