arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-17 至 2026-04-17 共收录 3
2604.15149 2026-04-17 cs.LG cs.AI

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14227 2026-04-17 cs.IR cs.AI

FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation

FRESCO:用于检索增强生成中动态语义冲突的重排序器基准测试与优化

Sohyun An, Hayeon Lee, Shuibenyang Yuan, Chun-cheng Jason Chen, Cho-Jui Hsieh, Vijai Mohan, Alexander Min

机构 * Meta Superintelligence Labs(Meta超智能实验室)

AI总结 FRESCO针对检索增强生成中动态语义冲突问题,评估重排序器在时间动态场景下的性能,发现现有重排序器对较旧文档存在偏见,通过指令优化框架改进了27%的动态知识任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11251 2026-04-17 stat.ME cs.AI cs.LG

Measuring multi-calibration

多校准的度量

Ido Guy, Daniel Haimovich, Fridolin Linder, Nastaran Okati, Lorenzo Perini, Niek Tax, Mark Tygert

机构 * Central Applied Science at Meta and Fundamental Artificial Intelligence Research at Meta(Meta 应用科学中心和 Meta 基础人工智能研究)

AI总结 本文提出一种新的度量方法,用于评估多校准性能,该方法基于Kuiper统计量,考虑不同子群体的信噪比,避免了传统分箱或核密度估计的缺点。

Comments 25 pages, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏