Allen人工智能研究所(Ai2)推出TutorMoments框架,用于衡量大型语言模型作出教育领域最困难的决策之一的能力:是向学生提供额外支持,帮助他们开始解题,还是退后一步,促使他们自行完成更多思考?该框架通过重现真实一对一数学辅导课程中的片段来实现这一点,而不是仅依靠那些奖励单一行为的测试,例如总是提供提示,或总是不透露答案。
该项目的预览版于2026年8月7日以Hugging Face博客社区文章的形式发布,文章由Kyle Wiggers代表Ai2Comms撰写。公告包括一份技术报告、Hugging Face上的可用数据集、运行重新评估流程的代码,以及模型为受评估片段生成的课程重演。
为什么仅仅总是给出有帮助的回应还不够?
项目以一个教育学观察为出发点:良好的教学并不意味着替学生完成任务中最困难的部分。教师可能会提出一个问题,帮助自己判断学生理解了什么;也可能给学生留出空间,让他们解释正确答案并证明自己的理解。在其他时候,学生可能需要先降低问题的难度,才能开始解决。
但语言模型接受的训练目标是提供帮助,这可能促使它们迅速解释概念、排列步骤,并引导学生得出答案。根据该材料,这种行为可能会缩短所谓的“生产性挣扎”,即解决问题时有时困难或令人沮丧的努力,而学习研究认为这种努力有助于形成更深入的理解。因此,TutorMoments的开发者认为,正确的问题并不是模型通常是否提供了提示或避免了回答,而是它的选择是否适合这个学生在那一刻的需要。
TutorMoments如何运作?
预览版TutorMoments-Preview由462段经过匿名化处理的真实一对一数学辅导文本对话组成,参与者是来自美国二年级至七年级的学生。数据包含教师标注的1500多个关键片段,以及27名美国教师提供的数千条自由文本评论。
这些对话来自一个强化辅导项目,大多数学生就读于接受第一条款(Title I)资助的学校。数据依据一项获得家长和监护人同意的研究条款提供;数据提供方首先删除了身份识别细节,随后又通过一套考虑数学内容的额外处理流程进行了处理。
有经验的教师阅读文本,并标记出教师需要在支架支持(即让问题更容易理解和处理)与推动严谨性(即鼓励学生进行更困难的思考)之间取得平衡的时刻。系统在其中一个节点暂停对话,然后在五轮模拟课程中将教师角色交给一个语言模型,同时由另一个语言模型扮演学生。
随后,一个基于语言模型的评分流程从三个方面进行评估:模型是否在学生需要时提供了支架支持;学生准备好时,模型是否推动其进行更严谨的思考;以及模型是否避免了过度支架,即把挑战程度降低到超出该时刻所需的程度。评估过程以教师制定的参考判断为起点。当教师意见不一致时,采用多数意见作为标注;如果三名教师中有两人认为该时刻需要严谨性,就将这一判断作为参考结果。
初步结果显示了什么?
团队使用两种指令测试了七个语言模型。第一种指令要求模型进行良好教学,但不实际解释所需的权衡;第二种指令明确说明支架支持、过度支架和推动学生进行严谨思考之间的区别。片段在两类情形之间平均分配:一类是支架支持为正确选择的情形,另一类是需要更多推动学生思考的情形。
结果显示,所有模型在使用解释这种权衡的指令时,得分都更高。这表明,默认的“有帮助的助手”行为本身不足以提供良好教学。不过,在指令中表述这种权衡并没有完全解决问题;模型在可靠作出适当决策的程度上仍存在很大差异,即使是表现最好的模型,也仍有明显的改进空间。
团队还发现,当模型被要求推动学生进行严谨思考时,它们倾向于采用比教师更少样化的策略,通常依赖于要求学生解释自己的答案。相比之下,人类教师使用的方法更加多样,也更倾向于退后一步,让学生独立完成任务。
比较的局限性及其含义
不应将TutorMoments的结果解读为人类教师的效率低于人工智能的证据。数据中的人类教师在采用相同方式评估时,在适当支架支持、适当严谨性和避免过度支架三个方面的得分分别为0.458、0.182和0.496。这些得分低于模型在使用评估感知型指令时的得分,并接近模型使用普通指令时的得分范围。
但该数据集最初就是围绕教师认为教学本可以做得更好的片段设计的,因此它聚焦于错失的机会,而不是理想教学。此外,重演中的学生由语言模型模拟,这意味着这些分数衡量的是模型在决策节点上的行为,并不衡量真实学生是否确实学会了。
数据在地理和教育方面仍然有限;它聚焦于美国小学和中学阶段的数学教学,并依赖一组教育工作者。来源还指出,检测推动学生进行严谨思考的能力不如检测支架支持可靠;严谨性片段共有260个,而支架支持片段有738个。
TutorMoments以当前形式提供了一种更具体的方法,用于审视模型作出的教育决策,但它不能替代使用真实学生并衡量学习成果的研究。团队计划在开发规模更大、包含多种模态的数据集、更强的评估流程和更深入的分析之前,先收集有关该预览版的反馈。