arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3493 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3493 篇

1406.5679 2014-06-24 cs.CV cs.CL cs.LG 62%

Deep Fragment Embeddings for Bidirectional Image Sentence Mapping

Andrej Karpathy, Armand Joulin, Li Fei-Fei

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01537 2026-06-04 cs.CV cs.LG 61%

PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder

PaCX-MAE: 生理增强的胸部X光掩码自编码器

Yancheng Liu, Kenichi Maeda, Manan Pancholy

机构 * University of California, Berkeley(加州大学伯克利分校) University of Tokyo(东京大学) University of Michigan(密歇根大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV;multi-modal(comments)

AI总结 提出PaCX-MAE跨模态蒸馏框架,通过双对比预测目标将生理先验注入胸部X光编码器,在保持单模态推理的同时提升生理相关任务性能。

Comments Accepted at the ICML 2026 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05898 2024-06-25 cs.IR cs.AI cs.LG 61%

Async Learned User Embeddings for Ads Delivery Optimization

Mingwei Tang, Meng Liu, Hong Li, Junjie Yang, Chenglin Wei, Boyang Li, Dai Li, Rengan Xu, Yifan Xu, Zehua Zhang, Xiangyu Wang, Linfeng Liu, Yuelei Xie, Chengye Liu, Labib Fawaz, Li Li, Hongnan Wang, Bill Zhu, Sri Reddy

专题命中 跨模态检索 :multimodal(abstract,comments);分类 cs.AI

Comments Accepted by workshop on Multimodal Representation and Retrieval at SIGIR 2024, Washington DC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26088 2026-08-27 cs.AI cs.LG 新提交 57%

Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings

行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测

Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty

机构 * Google Research(谷歌研究院) Institut National de Recherche Biomédicale(国家生物医学研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 57%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交 57%

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24176 2026-08-26 cs.IR cs.AI 新提交 57%

Tlow: Flow-based Item Tokenizer for Recommendation

Tlow:用于推荐的基于流的物品分词器

Nian Li, Chonggang Song, Jingtao Ding, Lingling Yi, Yong Li, Qingmin Liao

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 该研究提出基于流的物品分词器Tlow,解决传统推荐模型的参数过多与冷启动问题,经实验验证其能提升推荐性能,在微信多模态检索任务中使全局用户CTR提升10.32%、新物品提升11.64%。

Comments CIKM'26 Applied Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24132 2026-08-26 cs.LG cs.AI 新提交 57%

From Gradient-Boosted Trees to Deep Recommenders: Practical Lessons from Migrating a Production Customer Support Recommender

从梯度提升树到深度推荐器:迁移生产环境客户支持推荐器的实践经验

Sonia Sharma, Jeyendran Balakrishnan, Shreya Rajpal, Swapnil Parekh, Nagaraj Janardhana, Andrew Mattarella-Micke

机构 * Intuit(英图易公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文介绍了将生产环境客户支持推荐系统从梯度提升树迁移到成对二元深度推荐器的实践,通过多种技术优化后,该方法在对话后期的推荐性能优于CatBoost基线。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22785 2026-08-26 cs.CV 版本更新 57%

OmicSync: Reliability-Aware Spatial Multi-Omics Clustering with Evidence-Constrained LLM Reasoning

OmicSync:结合证据约束大语言模型推理的可靠性感知空间多组学聚类

Rabeya Tus Sadia, Qiang Ye, Qiang Cheng

机构 * University of Kentucky(肯塔基大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 OmicSync是结合证据约束LLM推理的可靠性感知空间多组学聚类框架,集成KAN-GCN骨干等功能,在多组学基准测试中表现优异,OmicSync-R进一步提升了人乳腺癌的聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21913 2026-08-25 cs.CV 新提交 57%

Entity-Constrained CBCT Retrieval for Low-Resource Dental Record Completion

用于低资源牙科记录补全的实体约束锥形束计算机断层扫描(CBCT)检索

Nhi Ngoc-Yen Nguyen, Thai Nguyen, Kiet Huynh Cao Tuan, Huy-Hieu Pham

机构 * VinUniversity Vietnam National University Ho Chi Minh City(胡志明市国家大学) University of Science(科学大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对低资源牙科记录补全难题,提出实体约束CBCT引导检索框架,其在MMDental任务3验证集与测试集上均优于基线方法,获测试阶段第二名,证实控制多模态证据修改范围比传输完整记录更可靠。

Comments Accepted at the ODIN 2026 Workshop, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17906 2026-08-25 cs.AI cs.MA 版本更新 57%

AutoResearch: Insight In, Hallucination Out

AutoResearch:输入洞见,输出无幻觉

Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang

机构 * EvoMap(伊沃地图)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20840 2026-08-24 cs.IR cs.CV 新提交 57%

KoViDoRe: Korean Visual Document Retrieval

KoViDoRe:韩文视觉文档检索

Yongbin Choi, Yongwoo Song, Mujeen Sung

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有韩文视觉文档检索基准的不足,本文推出KoViDoRe基准及配套训练数据集Ko-VDR Train Public,评估发现现有模型难以处理该任务,为相关模型开发提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-21 cs.AI cs.LG 版本更新 57%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交 57%

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15736 2026-08-18 cs.AI 新提交 57%

Toward AI-Friendly Cartography: Understanding How Color Design Influences Foundation Model Spatial Reasoning on Sequential Choropleth Maps

面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理

Yonghe Sun, Zhenjia Liu, Hua Liao, Wenjia Xu, Nai Yang, Weihua Dong, Zhiwei Wei

机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。

Comments 42 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14666 2026-08-18 cs.AI 新提交 57%

Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring

基于因果机制监测的跨域工业故障检测

Dhiraj Neupane, Mohamed Reda Bouadjenek, Richard Dazeley, Sunil Aryal

机构 * Deakin University(迪肯大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13495 2026-08-14 cs.CV cs.LG 新提交 57%

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习

Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Purdue University(普渡大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17782 2026-08-14 cs.CV 版本更新 57%

Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval

面向主体的多粒度对齐用于零样本EEG到图像检索

Lin Jiang, Qingshan She, Jiale Xu, Haiqi Xu, Duanpo Wu, Zhenzhong Kuang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications, Hangzhou, Zhejiang(浙江省脑机协同智能技术与应用重点实验室,杭州,浙江) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SAMGA框架,通过多粒度对齐解决EEG到图像检索中主体依赖性和多尺度信息的问题,提升检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11030 2026-08-12 cs.IR cs.CL 新提交 57%

Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching

用于专利匹配的自知识检索增强生成框架

Jian Zhang, Songlin Lei, Zhuohao Yang, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09474 2026-08-11 cs.CV 新提交 57%

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08883 2026-08-11 cs.AI 新提交 57%

AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups

AquiLLM:支持研究群体中隐性知识捕获的架构

Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

机构 * Southern Oregon University(南俄勒冈大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。

Comments Accepted for publication in the NGEN-AI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08757 2026-08-11 cs.SD eess.AS 新提交 57%

Steering dense music retrieval with open-vocabulary concept discovery

基于开放词汇概念发现的密集音乐检索控制

Julien Guinot, Alain Riou, Elio Quinton, György Fazekas

专题命中 跨模态检索 :multimodal(abstract);分类 eess.AS

AI总结 本研究提出一种轻量无需训练的开放词汇概念发现方法,用于可控音乐检索,可恢复与概念音频示例对齐更紧密的稀疏特征,实现更优的编辑强度与内容保留权衡。

Comments Accepted to ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16445 2026-08-11 cs.CV 57%

CLAP: Isolating Content from Style through Contrastive Learning with Augmented Prompts

Yichao Cai, Yuhang Liu, Zhen Zhang, Javen Qinfeng Shi

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) University of Adelaide(阿德莱德大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted as a conference paper at ECCV 2024; v7: Minor corrections to the adversarial robustness results and corresponding text. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 57%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11313 2026-08-07 cs.CV 57%

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

机构 * Southeast University(东南大学) The University of Adelaide(阿德莱德大学) The Hong Kong Polytechnic University(香港理工大学) The University of Western Australia(西澳大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05149 2026-08-06 cs.CV 新提交 57%

CoCo-IR: Contextual Composed Image Retrieval

CoCo-IR:上下文组合图像检索

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) OpenAI

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 57%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03524 2026-08-05 cs.AI 新提交 57%

Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS

Dr. AGENTONOMICS:AGENTONOMICS的教学实验

Fengjunjie Pan, Alois Knoll

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。

Comments Technical report, Technical University of Munich

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03150 2026-08-05 cs.AI 新提交 57%

UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval

UniGD:面向工业检索的统一生成-判别框架

Shujie Ji, Yawei Kong, Yilin Zhao, Li Wang, Xialong Liu, Peng Jiang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 UniGD是整合检索与相关性评分的统一框架,通过CAGE、CAM、HAM解决工业检索问题,在快手平台及NQ320K、MS300K数据集上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交 57%

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏