Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
解耦推理与置信度:在可验证奖励的强化学习中恢复校准
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)
机构
*
School of Informatics, Xiamen University(厦门大学信息学院)
;
Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)
;
The Hong Kong Polytechnic University(香港理工大学)
机构
*
Nanyang Technological University(南洋理工大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
Tsinghua University(清华大学)
;
Sun Yat-sen University(中山大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading
REC-CBM:面向可信开放评分的基于规则感知的错误修正概念瓶颈模型
Chengshuai Zhao, Fan Zhang, Kumar Satvik Chaudhary, Yiwen Li, Lo Pang-Yun Ting, Ying-Chih Chen, Huan Liu
机构
*
School of Computing and Augmented Intelligence, Arizona State University, USA(计算与增强智能学院,亚利桑那州立大学,美国)
;
Mary Lou Fulton Teachers College, Arizona State University, USA(玛丽·卢·福洛顿教师学院,亚利桑那州立大学,美国)
;
Department of Computer Science, National Yang Ming Chiao Tung University, TW(国立阳明交通大学计算机科学系,台湾)
Human Label Variation as Stable Signal: Learning Annotator-Specific Explanation Behavior via Cross-Annotator Preference Optimization
人类标注变异作为稳定信号:通过跨标注者偏好优化学习标注者特定的解释行为
Beiduo Chen, Pingjun Hong, Ziyun Zhang, Benjamin Roth, Anna Korhonen, Barbara Plank
机构
*
MaiNLP
;
Center for Information and Language Processing(信息与语言处理中心)
;
LMU Munich(慕尼黑大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
University of Vienna(维也纳大学)
;
LTL
;
University of Cambridge(剑桥大学)
Rethinking Video-Language Model from the Language Input Perspective
从语言输入角度重新思考视频-语言模型
Xiang Fang, Wanlong Fang, Changshuo Wang, Xiaoye Qu, Daizong Liu
机构
*
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
;
University College London(伦敦大学学院)
;
Huazhong University of Science and Technology(华中科技大学)
;
Wuhan University(武汉大学)
机构
*
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
;
University College London(伦敦大学学院)
;
Guangzhou University(广州大学)
;
Wuhan University(武汉大学)
;
Nanjing University(南京大学)