MC-CPO: Mastery-Conditioned Constrained Policy Optimization for Pedagogically Safe Intelligent Tutoring Systems
MC-CPO:基于 mastery 的约束策略优化用于教学安全的智能辅导系统
机构 * School of Computing Sciences(计算科学学院) ; Computer Engineering, University of Southern Mississippi, Hattiesburg, MS 39406, USA(计算机工程,密西西比大学,哈特斯伯格,MS 39406,USA)
AI总结 本文提出 MC-CPO 框架,通过结构化约束解决教学安全问题,提升学习者知识掌握率,实验证明其在两个平台上的效果显著。
Comments 35 pages, 8 figures. v2: Major revision adding real-world validation on Junyi Academy (16.2M interactions, 72,758 students) and XES3G5M (NeurIPS 2023, 5.1M interactions, 14,453 students). Revised title and abstract. Submitted to Computers and Education: Artificial Intelligence