Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO
Skills-Coach:一种通过无训练GRPO实现的自我进化技能优化器
Yu Tian, Jiawei Chen, Lifan Zheng, Mingxiang Tao, Xinyi Zeng, Zhaoxia Yin, Hang Su, Xian Sun
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
East China Normal University(华东师范大学)
;
Zhongguancun Academy(中关村学院)
;
Southeast University(东南大学)
;
Hainan University(海南大学)
;
Tsinghua University(清华大学)
专题命中
后训练与偏好优化
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Matteo Gioele Collu, Tom Janssen-Groesbeek, Stefanos Koffas, Mauro Conti, Stjepan Picek
机构
*
University of Padova(帕多瓦大学)
;
Radboud University(拉德博德大学)
;
Delft University of Technology(代尔夫特理工大学)
;
Örebro University(欧雷布罗大学)
;
University of Zagreb Faculty of Electrical Engineering(Zagreb大学电子工程学院)
;
University of Bergen(卑尔根大学)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
CommentsPresented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/
Journal refProc. Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), CEUR-WS.org, Vol-4198, 35, 2026
Comments17 pages, 12 figures, 14 tables. Preprint; under review at EACL 2027 (ACL Rolling Review, August 2026 cycle). Code and data: https://github.com/mohammadi-hadi/MAP-PO
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Xiaomi Corporation(小米公司)
;
State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Vellore Institute of Technology(维洛雷理工学院)
;
University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
;
Northwestern University(西北大学)
;
Yale University(耶鲁大学)
;
Algoverse AI Research(Algoverse AI研究)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
NJIT(新泽西理工学院)
;
Jilin University(吉林大学)
;
Institute of Computing Technology, CAS(中国科学院计算技术研究所)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中
后训练与偏好优化
:preference optimization(title);LLM(abstract_cn);large language model(abstract);language model(abstract)
Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training
偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法
Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley
机构
*
Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系)
;
School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院)
;
Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG