Factorized Transport Alignment for Multimodal and Multiview E-commerce Representation Learning
因子化运输对多模态和多视角电商表示学习
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。
Comments Accepted by WSDM'26
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
因子化运输对多模态和多视角电商表示学习
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。
Comments Accepted by WSDM'26
多模态文化安全:评估框架与对齐策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce人工智能研究) ; Google DeepMind(谷歌DeepMind)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。
VLDBench:评估具有监管对齐的多模态虚假信息
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。
Comments Accepted in Information Fusion Journal
无需词汇的细粒度视觉识别 via 增强的上下文感知视觉语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出E-FineR方法,无需词汇实现细粒度视觉识别,提供高可解释性和在零样本和少样本分类中的高性能。
Comments Accepted to ICCV 2025
3SGen: 一种统一的主体、风格和结构驱动的图像生成方法,具有自适应任务特定记忆
机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) ; CASIA ; AntGroup(蚂蚁集团)
专题命中 其他VLM :MLLM(abstract);分类 cs.CV
AI总结 3SGen通过统一的框架实现主体、风格和结构驱动的图像生成,采用自适应任务特定记忆模块提升生成质量和跨任务迁移性。