论文导读
斯坦福大学、佐治亚理工学院、卡内基梅隆大学提出Sherpa,让AI老师根据模拟学生的学习效果调整讲解方式。在七类模拟学生上,教学后的平均答题率从48.6%提高到69.0%;教学评测分从52.5%升到79.2%。它把学生能否进步变成训练信号,让同一道题能按不同讲解需求展开。
会解题,不一定能把学生教会
有的学生需要拆小步骤,有的想比较两种解法,还有的希望知道为什么这样推理。直接给出标准答案,不足以覆盖这些学习需求。Sherpa把老师能否适应不同需求作为训练目标。
研究用较强模型担任老师、较弱模型模拟学生,让一次教学依次经历备课、对话辅导和测试。老师通过学生回复判断它需要什么,再用教学后答题表现获得训练反馈。
实验聚焦数学题,筛掉老师不会解和学生本来就能做的样本,留下759道训练题与528道评测题。这里的学生是模型,不是真实课堂学生,答题率不能直接写成真人成绩提升。
图:模拟学生检查、师生对话,以及备课、辅导和测试三个阶段的示意。
别泄露答案,也别忽略讲解偏好
模拟学生前面有两道检查。第一道防止老师直接透露最终答案,中间计算和部分解题步骤仍可提供;第二道检查讲解策略是否符合学生的偏好。
符合需求的信息才送到学生模型,学生回复也反映其学习要求。老师因此需要逐步诊断错误、拆分目标、比较方法或说明因果,不能用一套完整答案应付所有人。
研究设置了七类学生,其中四类参与训练,另三类用于检查新偏好。老师底座为Qwen3-8B,学生底座为Qwen3-1.7B,训练改变老师的教学方式,学生底座保持冻结。
图:不同教学策略与学生偏好的学习改善和投诉比例热力图。
69%是模拟学生,79.6%是教师偏好
七类模拟学生的教学后平均答题率,原始老师为48.6%,只用无偏好学生训练的版本为52.0%,使用多样偏好训练的Sherpa为69.0%。训练过的四类学生平均为72.0%,未见三类平均为65.1%,说明迁移改善并不均匀。
外部MathTutorBench教学回复评测中,平均分从52.5%升到79.2%。部分找错位置与苏格拉底提问指标没有同步提高,不能只根据教学回复得分认定各项教学能力全面变好。
人类比较另外邀请96名高中教师,为320组回复各做三次判断,共960次。Sherpa获728次偏好,基础模型获187次,45次持平;排除持平后胜率为79.6%。这说明教师更喜欢这些回复,并未测量真人学生经过辅导后的长期学习效果。
图:七类模拟学生接受不同教师辅导后的答题率与整体置信区间。
下一步,把模拟偏好接向真实教学需求
Sherpa把学生需求与老师训练分开,后续可以细化学生偏好,或组合多种需求,让老师在对话中逐步推断。模拟学生也需要维持可学习性,避免只扮演错误却无法从指导中受益。
论文把支持真实学生列为后续方向。走到教学产品时,需要观察学生能否独立解题、不同学习者是否持续受益,以及老师有没有泄露答案。现有模拟实验和教师偏好比较给出了两类不同证据,可以分别作为后续评测的起点。