CAMIE: Co-Engagement-Aware Multimodal Item Embeddings for Snap Dynamic Product Ads Retrieval
CAMIE:用于Snap动态产品广告检索的协同交互感知多模态物品嵌入
专题命中 其他VLM :MLLM(summary_cn,abstract)
AI总结 针对Snap动态产品广告检索的挑战,提出CAMIE框架,基于LLM/MLLM主干与协同交互数据微调,线上部署后显著提升多场景下的CTR与CVR。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
CAMIE:用于Snap动态产品广告检索的协同交互感知多模态物品嵌入
专题命中 其他VLM :MLLM(summary_cn,abstract)
AI总结 针对Snap动态产品广告检索的挑战,提出CAMIE框架,基于LLM/MLLM主干与协同交互数据微调,线上部署后显著提升多场景下的CTR与CVR。
VisLens:面向多模态大语言模型的单次可解释视觉搜索方法
机构 * Technical University of Munich(慕尼黑工业大学) ; Helmholtz Munich(慕尼黑亥姆霍兹中心) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型的细粒度视觉搜索问题,提出VisLens方法,通过单次前向传播实现可解释的视觉搜索,性能优于或相当现有方法且推理速度大幅提升。
Social Caption: 评估多模态模型的社会理解能力
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.LG
AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。
Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures
GarmentWeaver:面向多模态缝纫图案的模式感知结构化合成
机构 * Donghua University(东华大学) ; Ningbo University(宁波大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 GarmentWeaver是一种模式感知多模态缝纫图案生成框架,通过分层结构化建模与可行性正则化,生成更准确、可执行且仿真兼容的缝纫图案,性能优于基线方法。
Comments 10 pages, 7 figures
现实小样本标注协议下的 whole-slide 图像分析
机构 * Institute of Information and Communication Technologies, Electronics, and Applied Mathematics (ICTEAM), Université catholique de Louvain (UCLouvain)(天主教鲁汶大学信息与通信技术、电子与应用数学研究所)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对现实 whole-slide 图像场景的小样本标注问题,提出 SlideCRF 模型,结合空间与生物线索优化预测,在四个数据集上宏观 F1 较现有转导方法更优,零样本预测提升显著。
Comments Preprint under review
编织视觉叙事:超越原子视觉匹配的智能体图像束合成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; OPPO(OPPO(广东欧珀移动通信有限公司))
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对传统图像检索原子匹配范式无法捕捉用户视觉搜索意图的问题,提出BundleWeaver智能体框架,构建IBCBench数据集,实现图像束合成并取得显著性能提升。
Comments Accepted by EMNLP'26 Main Conference
LeMat-Synth:用于从科学文献中构建广泛合成程序数据库的多模态工具箱
专题命中 其他VLM :vision language model(abstract);分类 cs.AI
AI总结 本研究开发LeMat-Synth Parser多模态工具箱,从8.1万篇文献构建含5.8万种合成方案的最大无机材料合成数据集,验证其质量并通过氨分解、超导领域应用展示其可扩展性,相关工具与数据集已公开。