Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training
隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)
Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang
机构
*
College of Software, Nankai University(南开大学软件学院)
;
Zhongguancun Academy(中关村学院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
East China Normal University(华东师范大学)
;
Zhejiang University(浙江大学)
;
Beijing Institute of Technology(北京理工大学)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
用推理树调度你的LLM强化学习
Hong Wang, Zhezheng Hao, Jian Luo, Chenxing Wei, Yao Shu, Lei Liu, Qiang Lin, Hande Dong, Jiawei Chen
机构
*
Cranberry-Lemon University(Cranberry-Lemon 大学)
;
University of the Witwatersrand(独立研究者)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
机构
*
Shanghai University of Finance and Economics(上海金融学院)
;
Ant Group(蚂蚁集团)
;
Southern University of Science and Technology(南方科技大学)
;
MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)
Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms
解构大语言模型中的数学推理:对内部机制的调查
Tanja Baeumel, Josef van Genabith, Simon Ostermann
机构
*
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Saarland University(萨尔兰大学)
;
Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
用评分奖励模型治愈大语言模型数学推理中的奇迹步骤
Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He
机构
*
School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳))
;
UC Berkeley(加州大学伯克利分校)
;
Zhejiang University(浙江大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Renmin University of China(中国人民大学)
;
Xiaohongshu Inc.(小红书公司)