How can embedding models bind concepts?
嵌入模型如何绑定概念?
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文研究视觉-语言嵌入模型(如CLIP)在概念绑定上的局限性,发现场景嵌入可加性分解为对象表示,但CLIP的高复杂度绑定函数阻碍了泛化,而通过充分数据训练的Transformer模型能学习低复杂度乘法交互绑定函数实现系统泛化。
Comments ICML 2026
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
嵌入模型如何绑定概念?
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文研究视觉-语言嵌入模型(如CLIP)在概念绑定上的局限性,发现场景嵌入可加性分解为对象表示,但CLIP的高复杂度绑定函数阻碍了泛化,而通过充分数据训练的Transformer模型能学习低复杂度乘法交互绑定函数实现系统泛化。
Comments ICML 2026
CPPO: 面向VLM智能体的对比感知策略优化
机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) ; Huawei Cloud(华为云)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。
RadJEPA:基于联合嵌入预测架构的胸部X光放射学编码器
机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) ; Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系) ; Koita Centre for Digital Health, Indian Institute of Technology Bombay(印度理工学院孟买分校Koita数字健康中心)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV
AI总结 提出RadJEPA,一种无需语言监督的自监督框架,通过联合嵌入预测架构在约84万张无标签胸部X光图像上预训练,学习预测掩码区域的潜在表示,在放射学报告生成等任务中达到或超越现有基线。
ARMA-C3: 一种用于无监督和半监督分类的对比ARMA卷积框架
机构 * VSS Tejaswi Abburi ; Saurabh J. Shigwan ; Nitin Kumar
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 提出ARMA-C3框架,利用对比学习和图割正则化在无监督和半监督场景下学习图节点的判别性表示,在多个医学影像数据集上表现优异。
FIKA-Bench: 从细粒度识别到细粒度知识获取
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FIKA-Bench,一个包含311个公开来源和现实实例的细粒度知识获取基准,通过过滤和审计确保实例质量,评估最新多模态模型和代理发现细粒度识别任务仍具挑战性,需改进代理设计以提升知识获取能力。
Comments Project page with code: https://ligeng0197.github.io/FIKA-Bench.github.io/
无需硬负样本:基于概念的学习在不降低对比模型零样本能力的情况下实现组合性
机构 * Samsung AI Center(三星人工智能中心)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于概念的学习方法,无需使用硬负样本即可在不损害对比模型零样本和检索能力的情况下实现组合性,通过简单的方法改进了文本和图像编码器的全局池化问题。
Comments Accepted at CVPR 2026. 2nd rev: update github repo URL
GeoMamba: 一种基于几何的MambaVision框架及数据集,用于细粒度光学-雷达目标检索
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; School of Artificial Intelligence and Information Engineering, Zhejiang University of Science & Technology(浙江科技大学人工智能与信息工程学院) ; Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出GeoMamba框架,通过引入几何特征注入模块和几何一致性约束模块,提升光学-雷达细粒度目标检索的鲁棒性,并构建了新的FGOS-as数据集来评估跨模态检索性能。
基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Irvine(加州大学 Irvine 分校)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。
TIGER-FG: 基于文本引导的隐式细粒度 grounding 用于电商检索
机构 * Kuaishou Technology(快手科技)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出TIGER-FG框架,通过文本引导生成目标聚焦的物品表示,解决电商检索中模态和粒度不匹配的问题,并在两个基准测试中提升了检索精度。
在开源视觉语言模型中,什么因素影响杂货产品检索
机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) ; EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。
Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)
通过流匹配学习无偏排列
机构 * Department of Computer Science(计算机科学系) ; Cornell University(康奈尔大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本文提出PermFlow框架,通过在具有单位行和列和的矩阵仿射子空间上直接操作,学习多模态排列分布,避免了基于熵正则化Sinkhorn方法在模糊性下的崩溃问题。
将化学结构作为治疗手段提高显微镜图像的表示以进行形态学分析
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Microsoft Research(微软研究院) ; Department of Computer Science, Zhejiang University(浙江大学计算机科学系)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出MICON框架,通过整合化学结构信息提升显微镜图像的表示能力,改进了形态学分析中的特征学习。
Comments 24 pages
增强检索的辅导系统用于AI教育中的算法追踪与问题解决
机构 * North Carolina State University(北卡罗来纳州立大学) ; University of Pittsburgh(匹兹堡大学) ; University of California, Berkeley(加州大学伯克利分校) ; Aalto University(阿尔托大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。
Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026
CoLVR: 通过对比优化增强探索性潜在视觉推理
机构 * Shandong University(山东大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; The University of Hong Kong(香港大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 CoLVR通过引入潜在对比训练框架,利用角度扰动引导学习多样化且探索性的表示,提升潜在视觉推理的探索能力,在VSP和Jigsaw任务中分别提升5.83%和8.00%。
CMKL:面向演变生物医学知识图谱的模态感知持续学习
机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业部门) ; King Abdullah University of Science and Technology(卡塔尔科技大学) ; School of Computing and Information Systems(计算与信息系统学院) ; The University of Melbourne(墨尔本大学) ; College of Computer Science and Technology(计算机科学与技术学院) ; Jilin University(吉林大学) ; School of Computing Technologies(计算技术学院) ; RMIT University(皇家墨尔本理工大学) ; College of Computing and Data Science(计算与数据科学学院) ; Nanyang Technological University(南洋理工大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 CMKL通过混合专家路由融合结构、文本和分子信息,利用EWC和K-means多样化重放缓冲区保护已有知识,在生物医学持续学习任务中取得显著提升。
HyNeuralMap:视觉语义到神经层次的双曲映射
机构 * School of Electronic Information (School of Artificial Intelligence), the Xi’an Key Laboratory of Radiomics and Intelligent Perception, Northwest University(电子信息学院(人工智能学院)、西安放射组学与智能感知重点实验室、西北大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出HyNeuralMap框架,利用双曲洛伦兹模型将视觉语义映射到共享的跨被试神经层次,通过双曲空间的负曲率捕捉层次化语义结构,实验表明其在多标签预测和跨模态检索中优于欧几里得基线。
Comments 14 pages, 4 figures
DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Inc.(华为公司)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。
Comments CVPR 2026 Highlight
超越图像块:通过文本监督学习全局布局用于晚期交互视觉文档检索
机构 * University of Stuttgart(斯图加特大学) ; Bosch Center for Artificial Intelligence(博世人工智能中心)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出通过文本监督学习文档全局布局,改进视觉文档检索的晚期交互架构,提升检索性能。
GRAPE:通过检索排名监督查询重写
机构 * Dalian University of Technology, Dalian, China(大连理工大学) ; Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。
面向可解释性工业异常检测的基于知识引导的潜在推理
机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出Reason-IAD框架,通过引入领域特定文本描述和熵驱动的潜在推理机制,提升工业异常检测的准确性和可解释性,实验表明其在多个任务中均优于现有方法。
模态感知的对比学习与不确定性正则化情绪识别
专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM
AI总结 本文提出MCUR框架,通过表征一致性方法提升多模态情绪识别的鲁棒性,采用模态组合对比学习和样本级不确定性正则化,实验表明在MOSI、MOSEI和IEMOCAP数据集上均取得显著提升。
Comments 24 pages, 6 figures and 16 tables
回忆以预测:在可解释的运动库中 grounded 运动预测
机构 * FZI Forschungszentrum Informatik(弗劳恩霍夫研究所信息技术研究中心) ; Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种端到端的可区分框架,通过对比学习构建全面的'运动库'来 grounding 运动预测,采用新颖的锚点检索层动态检索显式运动先验,结合 DETR 式解码器和 WTA 动态高斯混合模型,实现可解释的多模态预测。
Comments Sumitted for PeerReview
CEZSAR:一种用于零样本动作识别的对比嵌入方法
机构 * Federal Institute of Paraná, Irati, Brasil(巴西南里奥格兰德联邦理工学院) ; Federal University of Paraná, Curitiba, Brasil(巴西南里奥格兰德联邦大学) ; Pontifical Catholic University of Paraná, Curitiba, Brasil(巴西南里奥格兰德天主教大学) ; University of Campinas, Campinas, Brasil(坎皮纳斯大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种基于对比学习的零样本动作识别方法,通过联合嵌入空间对视频和句子进行编码,解决语义鸿沟和领域偏移问题,实验在UCF-101和Kinetics-400数据集上取得最佳效果。
Comments Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026
通过俳句连接空间生物学与临床组织学
机构 * Department of Pathology and Laboratory Medicine, University of Pennsylvania(宾夕法尼亚大学病理学与实验室医学系) ; Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) ; Department of Biostatistics, Epidemiology & Informatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与信息学系) ; Enable Medicine, Menlo Park, CA, USA(Enable Medicine)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出Haiku模型,整合分子、形态和临床数据,通过三模态对比学习实现跨模态检索,提升分类和预测任务性能,并支持零样本生物标志物推断。
对TCGA数据中整张滑动图像检索的整张滑动图像基础模型进行验证
机构 * KIMIA Lab, Artificial Intelligence and Informatics, Mayo Clinic, Rochester, MN, USA(KIMIA实验室,人工智能与信息学,梅奥诊所,罗切斯特,明尼苏达州,美国) ; Department of Neurology, Northwestern University Feinberg School of Medicine, Chicago, IL, USA(神经病学系,北western大学费因伯格医学院,芝加哥,伊利诺伊州,美国) ; Department of Computer Science, Temple University, Philadelphia, PA, USA(计算机科学系,泰勒大学,费城,宾夕法尼亚州,美国) ; Department of Breast and Melanoma Surgical Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(乳腺和黑色素瘤外科肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) ; Department of Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) ; Department of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA(定量健康科学系,梅奥诊所,罗切斯特,明尼苏达州,美国)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本研究验证了TCGA数据中整张滑动图像基础模型的检索性能,发现基于片段和监督聚合的方法在Top-1和Top-3准确率上表现相当,但整体性能受器官和诊断差异影响较大,形态学检索存在固有限制,需进一步改进特征表示和多模态框架。
HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。
Comments ACL 2026 Findings
DualGeo: 一个用于全球图像地理定位的双视角框架
机构 * Henan Key Laboratory of Cyberspace Situation Awareness, Zhengzhou, China(河南空域态势感知重点实验室,郑州,中国) ; Information Engineering University, Zhengzhou, China(信息工程大学,郑州,中国)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 DualGeo通过融合图像与语义分割特征构建地理表示,并利用双视角对比学习与地理聚类提升全球图像定位精度,实验表明其在街道和城市级别定位准确率提升显著。
Comments ICME2026 Accept
GeoSearch:通过网络级反向图像搜索和图像匹配增强全球地理定位
机构 * University of Science, VNU-HCM(越南国家科学大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出GeoSearch框架,通过整合网络级反向图像搜索与图像匹配技术,提升全球图像地理定位的准确性,实验表明其在考虑泄漏因素下的优越性。
Comments Accepted to SIGIR 2026 Main Conference
从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ; ByteDance(字节跳动) ; Northeastern University(东北大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。
一个扰动,两种失效模式:通过嵌入引导的字形扰动探测VLM安全性
机构 * Cisco Systems(思科系统)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文通过实证研究揭示多模态嵌入距离对VLM攻击成功率的预测作用,并提出基于嵌入引导的字形扰动方法,验证了可读性与安全对齐的交互影响。