LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
机构 * TU Darmstadt(图宾根大学) ; DFKI(德累斯顿人工智能研究所) ; Intrinsic ; Lab1141(Lab1141实验室) ; CERTAIN, Germany(德国CERTAIN) ; MPI-Inf, SIC(慕尼黑人工智能研究所) ; Meta
大厂专区
机构 * TU Darmstadt(图宾根大学) ; DFKI(德累斯顿人工智能研究所) ; Intrinsic ; Lab1141(Lab1141实验室) ; CERTAIN, Germany(德国CERTAIN) ; MPI-Inf, SIC(慕尼黑人工智能研究所) ; Meta
FRESCO:用于检索增强生成中动态语义冲突的重排序器基准测试与优化
机构 * Meta Superintelligence Labs(Meta超智能实验室)
AI总结 FRESCO针对检索增强生成中动态语义冲突问题,评估重排序器在时间动态场景下的性能,发现现有重排序器对较旧文档存在偏见,通过指令优化框架改进了27%的动态知识任务性能。
多校准的度量
机构 * Central Applied Science at Meta and Fundamental Artificial Intelligence Research at Meta(Meta 应用科学中心和 Meta 基础人工智能研究)
AI总结 本文提出一种新的度量方法,用于评估多校准性能,该方法基于Kuiper统计量,考虑不同子群体的信噪比,避免了传统分箱或核密度估计的缺点。
Comments 25 pages, 12 tables