arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-02-19 至 2026-02-19 共收录 1
2505.15801 2026-02-19 cs.CL cs.AI

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

VerifyBench: 大型语言模型参考式奖励系统的基准测试

Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Meituan Group(美团集团) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。

Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench

详情

展开后加载摘要…

URL PDF HTML 收藏