arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3484 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3484 篇

2602.23605 2026-07-02 cs.AI 版本更新 70%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 70%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交 70%

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08144 2026-06-09 cs.CV 新提交 70%

IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval

IMAGINE:自适应模式-意象增强组合用于组合视频检索

Jiale Huang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Chunxiao Wang, Yupeng Hu

机构 * Shandong University(山东大学) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对组合视频检索中修改文本隐含语义与显式视觉内容不匹配的问题,提出自适应模式-意象增强组合网络(IMAGINE),通过动态多模态原型捕获隐含概念并调制视觉特征,在三个基准上达到最优性能。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04604 2026-06-04 cs.CV 70%

COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations

COMBINER: 基于属性邻居关系的组合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Haokun Wen, Xuemeng Song, Liqiang Nie

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对组合图像检索中视觉相似但属性不同的样本问题,提出基于属性原型的跨模态统一表示方法COMBINER,通过自适应语义解耦、统一原型组合和双重关系建模提升检索准确性。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27154 2026-05-27 cs.CV 70%

Touch-R1: Reinforcing Touch Reasoning in MLLMs

Touch-R1:在多模态大语言模型中强化触觉推理

Yingxin Lai, Yafei Zhou, Fucai Zhu, Siyu Zhu, Weihao Yuan

机构 * Xiamen University(厦门大学) Great Bay University(大湾大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达摩机器人)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 针对触觉推理中物理属性序数性和跨传感器分布偏移的挑战,提出基于触觉接地GRPO目标训练的Touch-R1模型,在TouchReason-Bench上平均性能超过Octopi-13B和GPT-4o。

Comments Our code and data will be made public on the https://laiyingxin2.github.io/Projects

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24621 2026-05-26 cs.CV 70%

FreeRet: MLLMs as Training-Free Retrievers

FreeRet: 无需训练的多模态大语言模型检索器

Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Institute of Science Tokyo(东京科学研究院) Zhejiang University(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出FreeRet框架,将现成的多模态大语言模型转化为无需额外训练的两阶段检索器,通过语义嵌入和重排序提升检索性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29897 2026-05-26 cs.IR cs.AI 70%

UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates

UniRank: 混合文本-图像候选的端到端领域特定重排序

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出UniRank,一种基于视觉语言模型的重排序框架,通过无需模态转换的统一评分和端到端领域适应(包括指令微调和基于强化学习的偏好对齐),在科学文献检索和设计专利搜索中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22484 2026-05-22 cs.CV 70%

Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

监督分类头作为语义原型:通过权重重用解锁视觉-语言对齐

David Méndez, Roberto Confalonieri, Natalia Díaz Rodríguez

机构 * Department of Computer Science and Artificial Intelligence, DaSCI Institute, University of Granada, Granada, Spain(计算机科学与人工智能系,DaSCI研究所,格拉纳达大学,格拉纳达,西班牙) Department of Mathematics ``Tullio Levi-Civita'', University of Padova, Padova, Italy(托里利-西维塔数学系,帕多瓦大学,帕多瓦,意大利)

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出利用预训练视觉模型的分类头作为语义原型,通过权重重用实现视觉-语言对齐,提升跨模态检索、零样本和少样本分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15642 2026-05-14 cs.CV 70%

UNIV: Unified Foundation Model for Infrared and Visible Modalities

UNIV:用于红外和可见模态的统一基础模型

Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 跨模态检索 :cross-modal(abstract,abstract_cn);分类 cs.CV

AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11591 2026-05-13 cs.CV 70%

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

Logit-Attention Divergence:通过注意力引导的校准缓解多图像检索中的位置偏差

Mingtao Xian, Yifeng Yang, Qinying Gu, Xinbing Wang, Nanyang Ye

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学紫阳学院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的注意力引导去偏框架,通过利用内在注意力信号在推理时进行实例级校正,显著提升排列不变性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13710 2026-05-12 cs.CV 70%

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索

Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu, Yue Ming, Hao Wu, Kai Zuo, Yibo Chen, Xu Tang

机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) Xiaohongshu Inc., China(小红书公司)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。

Comments Accepted to ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 70%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18715 2026-05-11 cs.CV 70%

ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval

ChatSearch: 一个用于通用对话图像检索的数据集和生成检索模型

Zijia Zhao, Longteng Guo, Tongtian Yue, Erdong Hu, Shuai Shao, Zehuan Yuan, Hua Huang, Jing Liu

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Bytedance Inc.(字节跳动公司) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出ChatSearch数据集和生成检索模型,用于开放领域图像的对话式检索,通过多轮多模态对话上下文查询提升检索准确性。

Journal ref Pattern Recognition, 167 (2025) 111696

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05572 2026-05-08 cs.CV 70%

Text-to-CAD Retrieval: a Strong Baseline

基于文本的CAD检索:一个强大的基线

Honghu Pan, Zibo Du, Daxiang Liu, Chengliang Liu, Xiaoling Luo

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) College of Computer Science and Software Engineer, Shenzhen University(深圳大学计算机科学与软件工程学院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出文本到CAD检索任务,通过多模态嵌入框架实现CAD模型的语义检索,为下游CAD生成奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22958 2026-04-30 cs.CV 70%

Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records

对比学习太阳物理图像预训练用于太阳动力学观测记录

Shiyu Shen, Zhe Gao, Taifeng Chai, Yang Huang, Bin Pan

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05513 2026-04-27 cs.CV 70%

ViFiCon: Vision and Wireless Association Via Self-Supervised Contrastive Learning

ViFiCon:通过自监督对比学习实现视觉与无线关联

Nicholas Meegan, Hansi Liu, Bryan Bo Cao, Abrar Alali, Kristin Dana, Marco Gruteser, Shubham Jain, Ashwin Ashok

机构 * Rutgers University(罗切斯特大学) Stony Brook University(石溪大学) Saudi Electronic University(沙特电子大学) Georgia State University(佐治亚州立大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ViFiCon通过自监督对比学习实现视觉与无线模态的关联,利用RGB-D相机和WiFi测距数据,减少隐私和能耗,无需标注数据即可实现高精度关联。

Comments 8 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14222 2026-04-23 cs.CR cs.AI 70%

Membership Inference for Contrastive Pre-training Models with Text-only PII Queries

对比预训练模型的成员推断与仅文本隐私信息查询

Ruoxi Cheng, Yizhong Ding, Jian Zhao, Hongyi Zhang, Haoxuan Ma, Tianle Zhang, Yiyan Huang, Xuelong Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出UMID框架,通过仅文本模态推断多模态模型的记忆,有效检测隐私信息泄露,无需生物特征输入,提升隐私审计效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 70%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18051 2026-04-21 cs.CV 70%

INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval

INTENT: 为鲁棒的复合图像检索的不变性与判别意识噪声缓解

Zhiwei Chen, Yupeng Hu, Zhiheng Fu, Zixu Li, Jiale Huang, Qinlei Huang, Yinwei Wei

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出INTENT网络,通过视觉不变组成和双目标判别学习处理复合图像检索中的两种噪声类型,提升检索鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17581 2026-04-21 cs.LG cs.AI q-bio.NC 70%

How Much Data is Enough? The Zeta Law of Discoverability in Biomedical Data, featuring the enigmatic Riemann zeta function

需要多少数据?生物医学数据的发现率ζ定律,涉及神秘的黎曼ζ函数

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging & Informatics(神经影像与信息学史蒂文斯研究所) University of Southern California(南加州大学) Los Angeles, CA, USA(洛杉矶,加利福尼亚州,美国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于数据协方差算子谱结构的跨模态发现率定律框架,揭示性能指标与ζ函数的关系,为数据规模、表示学习和多模态扩展提供理论指导。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16247 2026-04-20 cs.LG cs.AI 70%

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

基于结构保持和信息平衡正则化的联合中心双对比对齐

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出HILBERT框架,通过跨模态注意力和自注意力池化学习文档级音频文本表示,采用双对比目标和辅助正则化提升跨模态对齐效果,实现长序列语义表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14710 2026-04-17 cs.CV 70%

G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

G-MIXER:基于测地混合的隐式语义扩展和显式语义重新排序用于零样本复合图像检索

Jiyoung Lim, Heejae Yang, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 G-MIXER通过测地混合生成隐式语义特征并重新排序显式语义,提升零样本复合图像检索的多样性和准确性,实现跨多个基准的最优性能。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV 70%

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18994 2026-04-14 cs.CV 70%

Dual-Margin Embedding for Fine-Grained Long-Tailed Plant Taxonomy

细粒度长尾植物分类的双边嵌入

Cheng Yaw Low, Heejoon Koo, Jaewoo Park, Meeyoung Cha

机构 * Changwon National University(昌原国立大学) Max Planck Institute for Security and Privacy (MPI-SP)(马克斯·普朗克安全与隐私研究所) AiV Co.(AiV公司)

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出TaxoNet框架,通过理论支撑的双边目标优化类别决策边界,在类别不平衡情况下提升细粒度区分能力和稀有类表示几何。在开放世界设置中,利用多种植物数据集验证了其优于多模态基础模型的性能。

Comments 4 figures, 5 tables, and 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15623 2026-04-09 cs.CV 70%

PCSR: Pseudo-label Consistency-Guided Sample Refinement for Noisy Correspondence Learning

PCSR:基于伪标签一致性的样本细化用于噪声对应学习

Zhuoyao Liu, Yang Liu, Wentao Feng, Shudong Huang

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PCSR框架,通过伪标签一致性提升对应可靠性,解决噪声对应问题,提升检索鲁棒性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26341 2026-03-30 cs.CV 70%

HINT: Composed Image Retrieval with Dual-path Compositional Contextualized Network

HINT: 基于双路径组合上下文化网络的复合图像检索

Mingyu Zhang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Jiajia Nie, Yinwei Wei, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HINT模型,通过双路径组合上下文化网络增强匹配与非匹配样本的相似度差异,提升复杂场景下复合图像检索性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25891 2026-03-30 cs.CV 70%

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

少样本文本到图像检索:新基准数据集和优化方法

Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出FSIR任务及FSIR-BD数据集,通过少样本学习方法提升图像检索性能,实验表明其基准挑战性及优化方法优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14961 2026-03-27 cs.LG cs.CV 70%

Graph Memory: A Structured and Interpretable Framework for Modality-Agnostic Embedding-Based Inference

图记忆:一种结构化且可解释的多模态嵌入推理框架

Artur A. Oliveira, Mateus Espadoto, Roberto M. Cesar, Roberto Hirata

机构 * Institute of Mathematics and Statistics, University of São Paulo(数学统计研究所,圣保罗大学)

专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 图记忆通过紧凑的可靠性标注原型区域图表示嵌入空间,结合原型关系编码局部几何和区域模糊性,实现查询证据扩散推理,统一实例检索、原型推理和图扩散,提供更准确和可解释的多模态推理。

Comments This version expands the published conference paper (VISAPP 2026) with additional methodological details, experiments, and analysis that were omitted due to page limits. The final published version is available via DOI: 10.5220/0014578800004084

Journal ref Proc. 21st Int. Conf. Comput. Vision Theory Appl. (VISAPP 2026), Vol. 1, pp. 652-659 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21886 2026-03-24 cs.IR cs.CV 70%

ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval

ADaFuSE: 适应性扩散生成图像与文本融合用于交互式文本到图像检索

Zhuocheng Zhang, Xingwu Zhang, Kangheng Liang, Guanxuan Li, Richard Mccreadie, Zijun Long

机构 * Hunan University(湖南大学) University of Glasgow(格拉斯哥大学)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ADaFuSE通过引入双分支融合机制,结合自适应门控和语义感知专家混合,提升交互式文本到图像检索的性能,实现更稳健的多模态融合。

详情

展开后加载摘要…

URL PDF HTML 收藏