VeRVE: Versatile Retrieval for Videos via Unified Embeddings
VeRVE:通过统一嵌入实现视频的多功能检索
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊) ; Keystone AI
AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。
大厂专区
VeRVE:通过统一嵌入实现视频的多功能检索
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊) ; Keystone AI
AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。
从边缘干预数据估计联合干预分布
机构 * Max Planck Institute for Intelligent Systems Tübingen, Germany(图宾根马克斯·普朗克智能系统研究所,德国) ; Amazon Tübingen, Germany(图宾根亚马逊公司,德国) ; Max Planck Institute for Intelligent Systems ELLIS Institute Tübingen, Germany(图宾根马克斯·普朗克智能系统研究所ELLIS研究所,德国)
AI总结 本文提出利用最大熵原理从边缘干预数据估计所有变量的联合条件分布,通过扩展因果最大熵方法,结合干预和观察数据,实现因果特征选择和联合干预分布推断。
Comments Accepted at the Causal Reasoning and Learning (CLeaR) conference 2026
MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型
机构 * ETH Zurich(苏黎世联邦理工学院) ; MBZUAI(马克斯·普朗克人工智能研究所) ; Amazon(亚马逊) ; University of Oxford(牛津大学) ; University of Bern(伯尔尼大学) ; Imperial College London(伦敦帝国理工学院) ; Peking University(北京大学)
AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。
自对齐奖励:迈向高效且有效的推理器
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文提出自对齐奖励(SAR),通过补充可验证奖励以提升推理准确性和效率,实验表明SAR在4个模型7个基准上提升了4%的准确率并降低了30%的计算成本。