UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models
UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法
机构 * East China Normal University(东华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。
Comments Accepted to EMNLP 2026 (Main Conference)