An Algebraic Topological Method for Multimodal Brain Networks Comparisons
专题命中 跨模态检索 :multimodal(title,abstract)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multimodal(title,abstract)
专题命中 跨模态检索 :multimodal(title,abstract)
Comments 11 pages, 5 figures
作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解
机构 * ByteDance(字节跳动)
专题命中 跨模态检索 :multimodal(abstract,abstract_cn);cross-modal(abstract);分类 cs.CV
AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。
多样化意图的多轮时尚图像检索
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。
通过优势加权排序揭示二元抑郁检测中的潜在抑郁严重程度
机构 * South China Normal University(华南师范大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI
AI总结 研究利用视听数据检测抑郁的挑战,提出含时间编码器和相互变压器的多模态框架,核心是二元优势加权排序损失,通过两种机制优化潜在空间分布,实验表明该模型重建潜在有序结构,性能达最优。
协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础
机构 * Huazhong University of Science and Technology(华中科技大学) ; Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Anhui University(安徽大学)
专题命中 跨模态检索 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV
AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。
Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)
非结构化度假租赁图像集合中的房间场景发现与分组
机构 * Expedia Group(Expedia集团)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 针对度假租赁平台图片缺乏结构化分类的问题,提出一种低延迟、样本高效的机器学习流水线,通过监督式房间类型检测、重叠检测和聚类算法实现房间分组,并利用多模态大语言模型识别床型,显著优于对比学习和预训练嵌入聚类方法。
Comments Presented at the Two-sided Marketplace Optimization Workshop, KDD 2025
LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。
Comments Accpeted by ECCV 2026
MIRAGE:基于层次分解的多向量图像检索运行时调度
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; School of Information, Renmin University of China(中国人民大学信息学院) ; School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。
Comments Will appear in DAC'2026, camera ready
弥合法医图像检索中的模态差距
机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) ; Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。
Comments 23 pages, 5 figures, paper submitted to Elsevier journal
混合模态双人脸-发型检索
机构 * Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南) ; University of Information Technology, VNU-HCM, Ho Chi Minh City, Vietnam(信息技术大学,VNU-HCM,胡志明市,越南)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出混合模态双参考检索任务DFHR,通过解耦身份与发型特征并融合多模态嵌入,实现跨模态的身份感知与属性可控检索。
ValueGround: 评估多模态大语言模型中文化条件化的视觉价值基础
机构 * University of Technology Nuremberg (UTN)(图恩大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CL
AI总结 提出ValueGround基准,通过最小对比图像对评估多模态大语言模型在文化条件化视觉价值判断中的表现,发现模型在可视化选项下准确率显著低于文本选项。
Comments Updated preprint
用更好的检索核查事实:用于证据检索的动态对比学习
机构 * Zhengzhou University(郑州大学) ; Henan University of Science and Technology(河南科技大学)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出动态自适应对比学习方法DACLR,通过事件级特征提取、两阶段检索和动态对比损失优化,提升多模态证据检索的准确性。
过程链:用于过程问答的层次视觉语言推理
机构 * NLP ; CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) ; Department of Electrical and Computer Engineering, University of Macau(电气与计算机工程系,澳门大学) ; Centre for Cognitive and Brain Sciences, University of Macau(认知与脑科学中心,澳门大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL
AI总结 本文提出ProcedureVQA基准,针对视觉过程问答任务,通过过程链框架解决现有VLMs在跨模态检索和步骤分解上的不足,实验显示其在六个VLMs上提升达13%。
为精细化视频检索适应大语言模型
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。
Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website
VeRVE:通过统一嵌入实现视频的多功能检索
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊) ; Keystone AI
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。
跌入陷阱,获得智慧:通过误判风险模式检索的认知引导有害迷因检测
机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) ; Science and Technology on Integrated Information System Laboratory(集成信息系统技术研究所) ; Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 本文提出PatMD方法,通过学习并主动缓解潜在误判风险,识别有害迷因的深层误判风险模式,提升多模态大语言模型的检测能力,实验显示在5项有害检测任务中,F1-score和准确率均显著提升。
Comments 14 pages, 11 figures
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
Comments 6 pages, 4 figures, 2025 IEEE International Conference on Systems, Man, and Cybernetics
专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CL
Comments Presented at NLP@IR workshop at SIGIR conference
专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Work in progress
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments 14 pages. Under review at ECCVW (MULA 2018)
CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.AI
AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。
MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理
机构 * Weill Cornell Medicine(威尔康乃尔医学院) ; University of Western Australia(西澳大利亚大学) ; Indiana University(印第安纳大学) ; Regenstrief Institute(瑞根斯特里夫研究所) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.CL
AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。
Unveil: 统一视觉-文本集成与蒸馏的多模态文档检索
机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京理工大学通用人工智能国家重点实验室) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) ; Key Laboratory of Target Cognition and Application Technology(目标认知与应用技术重点实验室) ; Beijing Institute of Technology(北京理工大学) ; Ucap Cloud(Ucap云)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.CL
AI总结 提出Unveil框架,通过视觉-文本嵌入和知识蒸馏实现鲁棒的文档检索,兼顾布局与语义信息。
Comments ACL 2025 Main Conference
通过嵌套多模态对比学习进行皮肤病变表型分析
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV、cs.AI
AI总结 SLIMP通过嵌套多模态对比学习,结合图像与元数据提升皮肤病变分类性能。
基于大语言模型的可干预多模态适配器用于肺癌手术后并发症预测
机构 * University at Buffalo(布法罗大学) ; Roswell Park Comprehensive Cancer Center(罗斯威尔帕克综合癌症中心)
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI
AI总结 MIRACLE通过整合术前临床和放射学数据,利用超球面嵌入空间和干预式深度学习模块,实现肺癌手术后并发症风险的预测与可解释性管理。
Comments Accepted to P2P-CV @ WACV 2026
HARMON-E:多模态肿瘤病历的分层代理推理以提取结构化数据
机构 * Triomics ; University of Pittsburgh(匹兹堡大学) ; Ontada
专题命中 跨模态检索 :multimodal(title);分类 cs.CL、cs.AI
AI总结 HARMON-E通过分层代理推理框架,实现对多模态肿瘤病历的结构化数据提取,达到高精度和大规模应用。
Comments 39 Pages, Supplementary Included
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.AI
机构 * University of Naples Federico II(那不勒斯费迪里奇二世大学) ; Northwestern University(西北大学)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CL、cs.AI
Journal ref SIGIR '25: Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2025