Deep Fragment Embeddings for Bidirectional Image Sentence Mapping
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL
PaCX-MAE: 生理增强的胸部X光掩码自编码器
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Tokyo(东京大学) ; University of Michigan(密歇根大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV;multi-modal(comments)
AI总结 提出PaCX-MAE跨模态蒸馏框架,通过双对比预测目标将生理先验注入胸部X光编码器,在保持单模态推理的同时提升生理相关任务性能。
Comments Accepted at the ICML 2026 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS)
专题命中 跨模态检索 :multimodal(abstract,comments);分类 cs.AI
Comments Accepted by workshop on Multimodal Representation and Retrieval at SIGIR 2024, Washington DC
行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测
机构 * Google Research(谷歌研究院) ; Institut National de Recherche Biomédicale(国家生物医学研究院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。
PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。
Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper
HMGCLIP:面向电商表征学习的异构多粒度对比学习
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。
Tlow:用于推荐的基于流的物品分词器
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI
AI总结 该研究提出基于流的物品分词器Tlow,解决传统推荐模型的参数过多与冷启动问题,经实验验证其能提升推荐性能,在微信多模态检索任务中使全局用户CTR提升10.32%、新物品提升11.64%。
Comments CIKM'26 Applied Research
从梯度提升树到深度推荐器:迁移生产环境客户支持推荐器的实践经验
机构 * Intuit(英图易公司)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本文介绍了将生产环境客户支持推荐系统从梯度提升树迁移到成对二元深度推荐器的实践,通过多种技术优化后,该方法在对话后期的推荐性能优于CatBoost基线。
Comments 10 pages
OmicSync:结合证据约束大语言模型推理的可靠性感知空间多组学聚类
机构 * University of Kentucky(肯塔基大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 OmicSync是结合证据约束LLM推理的可靠性感知空间多组学聚类框架,集成KAN-GCN骨干等功能,在多组学基准测试中表现优异,OmicSync-R进一步提升了人乳腺癌的聚类性能。
用于低资源牙科记录补全的实体约束锥形束计算机断层扫描(CBCT)检索
机构 * VinUniversity ; Vietnam National University Ho Chi Minh City(胡志明市国家大学) ; University of Science(科学大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 针对低资源牙科记录补全难题,提出实体约束CBCT引导检索框架,其在MMDental任务3验证集与测试集上均优于基线方法,获测试阶段第二名,证实控制多模态证据修改范围比传输完整记录更可靠。
Comments Accepted at the ODIN 2026 Workshop, MICCAI 2026
AutoResearch:输入洞见,输出无幻觉
机构 * EvoMap(伊沃地图)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。
KoViDoRe:韩文视觉文档检索
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 针对现有韩文视觉文档检索基准的不足,本文推出KoViDoRe基准及配套训练数据集Ko-VDR Train Public,评估发现现有模型难以处理该任务,为相关模型开发提供支撑。
哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔
机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。
D2-ScaleAgent:面向长文档理解的双维度缩放方法
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。
面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理
机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) ; Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) ; School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) ; School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) ; Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。
Comments 42 pages, 12 figures, 13 tables
基于因果机制监测的跨域工业故障检测
机构 * Deakin University(迪肯大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。
TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习
机构 * Uber AV Labs(优步自动驾驶实验室) ; Purdue University(普渡大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。
面向主体的多粒度对齐用于零样本EEG到图像检索
机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) ; Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications, Hangzhou, Zhejiang(浙江省脑机协同智能技术与应用重点实验室,杭州,浙江) ; College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SAMGA框架,通过多粒度对齐解决EEG到图像检索中主体依赖性和多尺度信息的问题,提升检索精度。
用于专利匹配的自知识检索增强生成框架
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。
Comments Accepted by IEEE CSCWD 2026
FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索
机构 * Vietnamese-German University(越南-德国大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology(信息技术大学) ; Ho Chi Minh city University of Science(胡志明市科学大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
基于开放词汇概念发现的密集音乐检索控制
专题命中 跨模态检索 :multimodal(abstract);分类 eess.AS
AI总结 本研究提出一种轻量无需训练的开放词汇概念发现方法,用于可控音乐检索,可恢复与概念音频示例对齐更紧密的稀疏特征,实现更优的编辑强度与内容保留权衡。
Comments Accepted to ISMIR 2026
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; University of Adelaide(阿德莱德大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
Comments Accepted as a conference paper at ECCV 2024; v7: Minor corrections to the adversarial robustness results and corresponding text. Conclusions unchanged
基于特权传感器引导对比学习的点目标导航鲁棒场景迁移
机构 * University of Padua(帕多瓦大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。
Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)
机构 * Southeast University(东南大学) ; The University of Adelaide(阿德莱德大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Western Australia(西澳大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
Comments Accepted by IJCAI 2025
CoCo-IR:上下文组合图像检索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google DeepMind(谷歌DeepMind) ; OpenAI
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。
Comments ECCV 2026
将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。
Dr. AGENTONOMICS:AGENTONOMICS的教学实验
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。
Comments Technical report, Technical University of Munich
UniGD:面向工业检索的统一生成-判别框架
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 UniGD是整合检索与相关性评分的统一框架,通过CAGE、CAM、HAM解决工业检索问题,在快手平台及NQ320K、MS300K数据集上均取得显著性能提升。
SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。
Comments ACMMM 26