机构
*
Saarland University(萨尔兰大学)
;
Independent Researcher(独立研究者)
;
Bielefeld University(比勒菲尔德大学)
;
Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
;
Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中
后训练与偏好优化
:RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
解耦推理与置信度:在可验证奖励的强化学习中恢复校准
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
;
University of Chicago(芝加哥大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
East China Normal University(华东师范大学)
专题命中
后训练与偏好优化
:LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)