A Corpus for English-Japanese Multimodal Neural Machine Translation with Comparable Sentences
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2020
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments 9 pages, 3 figures
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2019 Oral
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract)
自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; DSO National Laboratories(国防部国家实验室) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。
Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning
为何文本占上风:视觉可能损害多模态医疗决策制定
机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) ; University of Pittsburgh(匹兹堡大学) ; NC State University(北卡罗来纳州立大学) ; University of Washington(华盛顿大学) ; University of Maryland(马里兰大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。
Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining
机构 * The Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; East China Normal University(东华师范大学) ; National Tsing Hua University(国立清华大学)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI
Journal ref IROS 2025 Robosense Cross-Modal Drone Navigation Challenge first place
机构 * MICS, CentraleSupélec - Université Paris-Saclay, France(MICS,中央圣艾尔布兰大学-巴黎萨克雷大学,法国) ; Google DeepMind, London, UK(谷歌DeepMind,伦敦,英国) ; CONICET, Universidad de Buenos Aires, Argentina(CONICET,布宜诺斯艾利斯大学,阿根廷)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Accepted to MICCAI 2025 1st Workshop on Multimodal Large Language Models (MLLMs) in Clinical Practice
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI
Comments Keywords: Explainable Computer Vision, Large Vision-Language Models, AI Interpretability, Explainable AI, Visual Saliency, Attribution Maps, Cross-Modal Attribution, Human Attention Alignment, AI Transparency
机构 * Mathematics and Statistics Department, University of Texas at Dallas(德克萨斯大学达拉斯分校数学与统计学系)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 11 pages, 3 figures. Accepted at the First Workshop on Multimodal Knowledge and Language Modeling (MKLM), IJCAI-25
专题命中 图文多模态 :multi-modal(title);image-text(abstract);分类 cs.CV、cs.AI;multimodal(comments)
Comments First three authors contributed equally. Code are available at https://github.com/amazon-research/mix-generation. Oral presentation at WACV 2023 Pretraining Large Vision and Multimodal Models Workshop
PWLR:用于边界感知分布外检测的成对见证局部拒绝
机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)
专题命中 图文多模态 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。
Comments Accepted by ACM MM 2026
超越度量偏差的遥感图像描述评估
机构 * Hohai University(河海大学) ; Cardiff University(卡迪夫大学)
专题命中 图文多模态 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出ReconScore指标,通过文本重建能力评估描述质量,发现未微调的MLLM在零样本遥感图像描述任务中表现更优,并引入无需训练的RemoteDescriber方法提升语义精度。
为何大规模多模态语言模型难以确定物体方向
机构 * Department of Computer Science(计算机科学系)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);image-text(abstract)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);image-text(abstract)
面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架
机构 * Cornell University(康奈尔大学) ; University of Central Florida(中佛罗里达大学) ; Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。
CaRGo-T:因果推理思维图提升多模态幽默理解能力
机构 * Microsoft Research India(微软研究院印度分部) ; LinkedIn(领英公司) ; Nutanix(Nutanix公司) ; Indian Institute of Science(印度科学学院) ; Apple(苹果公司) ; Fujitsu Research India(富士通印度研究院) ; Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。
Comments 18 pages, 5 figures
解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集
机构 * Mehta Family School of Data Science and Artificial Intelligence(梅塔家庭数据科学与人工智能学院) ; Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) ; Department of Metallurgical and Materials Engineering(冶金与材料工程系)
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI
AI总结 针对科学文献中复合图像导致图文配对困难的问题,提出MatMMExtract管道,通过分解复合图、利用大语言模型生成结构化标注,构建包含39万对面板级图文对的MatSciFig数据集,并引入MaterialScope检测数据集和微调YOLO12检测器,显著提升视觉语言检索性能。
你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架
机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Computer Network Information Center(计算机网络信息中心) ; Chinese Academy of Sciences(中国科学院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。
Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author
通过语义感知多模态预训练释放医疗表格数据的力量
机构 * Faculty of Information Technology, Monash University(莫纳什大学信息技术学院) ; Monash University(莫纳什大学) ; The University of Queensland(昆士兰大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对医疗表格数据的语义利用不足问题,提出语义感知多模态预训练框架,含重要性感知自适应掩码与软标签离散化模块,在皮肤病学、眼科数据集上实现SOTA,鲁棒性与跨域泛化能力优异。
Comments INTERNATIONAL CONFERENCE ON MEDICAL IMAGE COMPUTING AND COMPUTER ASSISTED INTERVENTION (ORAL presentation)
面向多模态大语言模型的多分支策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Sichuan University(四川大学) ; Shanghai University(上海大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。
Comments 10 pages,8 figures
LookME:用于视觉语言模型层注入的基于查找的多模态嵌入
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Journal ref Pattern Recognition 172 (2026) 112348
拼接与讲述:一种结构化多模态数据增强方法用于空间理解
机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Xiaohongshu Inc(小红书公司)
专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV、cs.AI
AI总结 Stitch and Tell通过结构化空间监督提升视觉-语言模型的空间理解能力,有效缓解空间幻觉并提高相关任务性能。
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
面向多讲座教育推理的证据 grounded 多模态知识图谱构建
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对讲座视频知识保留不全问题,提出基于证据的多模态知识图谱构建流程,在神经网络讲座实验中取得高覆盖率与检索准确率,贡献可审计的知识图谱构建方法。