论文导读
论文公开页面未披露作者机构。StudentBench让2383名参与者接受AI辅导、专家人类辅导或无辅导,再直接比较GRE前后测学习增益。实验报告AI辅导与专家人类辅导统计等效,其中一个AI辅导器的单位学习增益成本低918倍。
不再问AI“讲得像不像老师”
很多AI教育测试评估的是回答准确率、教案质量或人对对话的偏好。这些指标能衡量“教得像不像”,却不能直接证明学生是否真的学会了。StudentBench把问题改成更硬的实验:学生做完前测,接受辅导,再做一份长度和知识点对应的后测。
平台累计收集超过17.5万条学生与AI的消息,并把学习实验分为GRE量化和语文领域。参与者被分到13种基于大模型的AI辅导器、人类辅导或无辅导对照组。
图:AI辅导界面同时展示GRE练习题、选项与家教对话,学生可在同一页练习并追问。
2383人实验,比的是前后测变化
实验有三个阶段。学生先完成27道量化或语文前测题,再用5分钟回顾错题;随后进入AI、人类或无辅导条件;最后完成与前测知识点匹配的后测。团队用前测分数校正后比较后测表现,避免把起点更高的学生错当成辅导效果。
图:Figure 2将实验分为27题前测、三种辅导条件和等长后测三步。
在2383名参与者中,AI辅导的GRE学习增益与专家人类辅导达到统计等效。在七个GRE领域中,表现最好的AI辅导器在其中五个领域的平均增益高于人类辅导。这个结果是平均比较,不等于每个学生、每道题或所有AI辅导器都超过人类。
未来应用:成本低918倍,但范围只到GRE题目
一个AI辅导器在学习增益上与人类辅导统计等效,每个百分点增益的成本为0.0052美元,人类辅导为4.81美元,相差918倍。论文还发现,在GRE量化会话中,AI回复更快与学生消息更多相关,更多消息又与更多正确练习相关,正确练习数则与更大学习增益相关。
图:Figure A.4展示人类家教在视频通话中共享定量比较题,并用红色手写标记分步讲解。
这份论文证明的是特定GRE题目、指定AI辅导器和该参与者群体的学习增益,不能直接扩大到开放性写作、长期课程或高风险教育决策。后续更有价值的测试是长期知识保留、不同年龄群体和更开放的学习任务。
从产品角度看,918倍成本差给出了扩大练习反馈覆盖面的理由,但不等于可以用AI完全替代教师。实验衡量的是短时前后测增益,尚未回答学生数周后是否仍能掌握知识,也没有覆盖学习动机、误导性解释和需要情绪支持的场景。更稳妥的应用方式,是让AI承担可标准化的练习与即时反馈,把教师时间留给诊断、纠错和个体化干预,并持续抽查AI给出的讲解是否可靠。