Институт Аллена по искусственному интеллекту (Ai2) представляет платформу TutorMoments для измерения способности больших языковых моделей принимать одно из самых сложных решений в образовании: предложить ли ученику дополнительную поддержку, чтобы он начал решать задачу, или отступить и побудить его выполнить большую часть рассуждений самостоятельно? Платформа основывается на воспроизведении реальных моментов индивидуальных занятий математикой вместо того, чтобы ограничиваться тестами, поощряющими одно поведение, например постоянное предоставление подсказок или постоянный отказ раскрывать ответ.
Предварительная версия проекта была опубликована в статье сообщества в блоге Hugging Face 7 августа 2026 года. Её автором от имени Ai2Comms указан Kyle Wiggers. Объявление включает технический отчёт, набор данных, доступный на Hugging Face, код для запуска конвейера повторной оценки, а также воспроизведения сессий, созданные моделями для оцениваемых моментов.
Почему одной полезной реакции недостаточно?
Проект исходит из педагогического наблюдения, что хорошее преподавание не означает выполнение самой сложной части задания вместо ученика. Преподаватель может задать вопрос, который поможет ему диагностировать понимание ученика, или оставить ему пространство, чтобы тот объяснил правильный ответ и подтвердил своё понимание. В других случаях ученику может потребоваться упростить задачу, чтобы он смог начать.
Однако языковые модели обучены быть полезными, что может побуждать их быстро объяснять концепцию, выстраивать шаги и направлять ученика к ответу. Согласно материалу, такое поведение может сокращать так называемую продуктивную борьбу — трудное или иногда вызывающее раздражение усилие по решению проблемы, которое исследования в области обучения связывают с более глубоким пониманием. Поэтому разработчики TutorMoments считают, что правильный вопрос заключается не в том, дал ли модель подсказку или в целом воздержалась от ответа, а в том, соответствовал ли её выбор потребностям конкретного ученика в данный момент.
Как работает TutorMoments?
Предварительная версия TutorMoments-Preview состоит из 462 обезличенных текстовых диалогов реальных индивидуальных занятий математикой с американскими учениками со второго по седьмой класс. Набор данных включает более 1500 ключевых моментов, прокомментированных преподавателями, и несколько тысяч свободных текстовых комментариев, оставленных 27 американскими преподавателями.
Диалоги были получены в рамках интенсивной программы обучения, и большинство учеников посещали школы, получающие поддержку по программе Title I. Данные были предоставлены в соответствии с исследовательским положением, одобренным родителями и опекунами. Сначала идентифицирующие сведения удаляла организация, предоставившая данные, а затем применялся дополнительный конвейер обработки, учитывающий содержание математических материалов.
Опытные преподаватели прочитали тексты и определили моменты, в которых учителю приходилось выбирать между поддержкой, то есть повышением доступности задачи, и повышением строгости, то есть поощрением ученика к более сложному мышлению. Система останавливает диалог в одной из таких точек, после чего передаёт роль преподавателя языковой модели в пятираундовой симуляции, тогда как другая языковая модель играет роль ученика.
Затем конвейер оценивания на основе языковой модели оценивает три аспекта: предложила ли модель поддержку, когда ученик в ней нуждался; побуждала ли она его к большей строгости, когда он был к этому готов; и избегала ли чрезмерной поддержки, которая снижает уровень сложности сильнее, чем того требует данный момент? Оценивание начинается с эталонного решения, принятого преподавателями. Если их мнения расходились, использовалась оценка большинства: если двое из трёх считали, что момент требует строгости, это решение принималось в качестве эталонного результата.
Что показали первые результаты?
Команда протестировала семь языковых моделей, используя два типа инструкций. Первый тип просит модель хорошо преподавать, не объясняя подробно требуемый баланс, тогда как второй прямо разъясняет различие между поддержкой, чрезмерной поддержкой и побуждением ученика к строгости. Моменты были поровну разделены между случаями, в которых правильным выбором была поддержка, и случаями, требовавшими большего побуждения к самостоятельному мышлению.
Результаты показали, что все модели демонстрировали более высокие показатели при использовании инструкций, объясняющих компромисс. Это указывает на то, что одного лишь стандартного поведения «полезного помощника» недостаточно для хорошего преподавания. Однако формулировка компромисса в инструкциях не решила проблему полностью: модели по-прежнему значительно различались по надёжности принятия подходящего решения, а даже у лучших моделей оставалось очевидное пространство для улучшения.
Команда также обнаружила, что при указании побуждать ученика к строгости модели склонны использовать менее разнообразные стратегии, чем преподаватели, и часто ограничиваются просьбой объяснить свой ответ. В то же время люди-преподаватели применяли более разнообразные методы и чаще отступали, позволяя ученику работать самостоятельно.
Ограничения сравнения и его значение
Результаты TutorMoments не следует интерпретировать как доказательство того, что люди-преподаватели менее эффективны, чем искусственный интеллект. При оценивании тем же способом люди-преподаватели из набора данных получили показатели 0,458 за подходящую поддержку, 0,182 за подходящую строгость и 0,496 за предотвращение чрезмерной поддержки. Эти показатели были ниже результатов моделей при использовании инструкций, учитывающих критерии оценивания, и близки к диапазону их показателей при обычных инструкциях.
Однако набор данных изначально был сформирован вокруг моментов, в которых преподаватели считали, что преподавание могло быть лучше, поэтому он сосредоточен на упущенных возможностях, а не на идеальном преподавании. Кроме того, ученики в воспроизведённых сессиях представлены симуляциями, выполняемыми языковой моделью, а это означает, что показатели измеряют поведение модели в точке принятия решения, но не показывают, действительно ли научился реальный ученик.
Данные также ограничены географически и с точки зрения образования: они сосредоточены на математике в начальной и средней школе в США и опираются на одну группу педагогов. Источник также отмечает, что обнаружение побуждения ученика к строгости менее надёжно, чем обнаружение поддержки, а число моментов строгости составляло 260 по сравнению с 738 моментами поддержки.
В нынешнем виде TutorMoments предлагает более конкретный способ изучать педагогические решения, принимаемые моделями, но не заменяет исследования с участием реальных учеников и измерением результатов обучения. Команда намерена собрать отзывы о предварительной версии, прежде чем разработать более крупный мультимодальный набор данных, более надёжный конвейер оценивания и более глубокий анализ.