O Allen Institute for AI (Ai2) apresenta o framework TutorMoments para medir a capacidade de grandes modelos de linguagem de tomar uma das decisões mais difíceis na educação: oferecer ao aluno apoio adicional para que ele comece a resolver o problema ou recuar e incentivá-lo a realizar uma parte maior do raciocínio por conta própria. O framework se baseia na reprodução de momentos reais de sessões individuais de ensino de matemática, em vez de se limitar a testes que recompensam um único comportamento, como sempre dar uma dica ou nunca revelar a resposta.
Uma prévia do projeto foi publicada em um artigo da comunidade no blog do Hugging Face em 7 de agosto de 2026, escrito por Kyle Wiggers em nome da Ai2Comms. O anúncio inclui um relatório técnico, um conjunto de dados disponível no Hugging Face e código para executar o pipeline de reavaliação, além das reproduções das sessões geradas pelos modelos para os momentos avaliados.
Por que uma resposta sempre útil não é suficiente?
O projeto parte da observação pedagógica de que ensinar bem não significa realizar a parte mais difícil da tarefa no lugar do aluno. Um professor pode fazer uma pergunta que o ajude a diagnosticar o que o aluno entende ou dar-lhe espaço para explicar uma resposta correta e demonstrar sua compreensão. Em outras ocasiões, o aluno pode precisar que o problema seja tornado mais fácil para conseguir começar.
Mas os modelos de linguagem são treinados para serem úteis, o que pode levá-los a explicar o conceito, organizar as etapas e orientar rapidamente o aluno até a resposta. Segundo o material, esse comportamento pode reduzir o chamado esforço produtivo, isto é, o esforço difícil ou às vezes frustrante para resolver o problema, que pesquisas sobre aprendizagem associam a uma compreensão mais sólida. Por isso, os desenvolvedores do TutorMoments consideram que a pergunta correta não é se o modelo deu uma dica ou se absteve de responder em termos gerais, mas se a escolha foi adequada ao que aquele aluno precisava naquele momento.
Como funciona o TutorMoments?
A versão de prévia TutorMoments-Preview é composta por 462 conversas textuais desidentificadas de sessões reais de ensino individual de matemática com estudantes americanos do segundo ao sétimo ano. Os dados incluem mais de 1.500 momentos-chave comentados por professores e vários milhares de comentários textuais livres fornecidos por 27 professores americanos.
As conversas vieram de um programa intensivo de tutoria, e a maioria dos alunos frequentava escolas apoiadas pelo Title I. Os dados foram disponibilizados sob uma cláusula de pesquisa aprovada pelos pais e responsáveis. Os detalhes identificáveis foram primeiro removidos pela entidade que forneceu os dados e, depois, por um pipeline adicional de processamento voltado para o conteúdo matemático.
Professores experientes leram as transcrições e identificaram os momentos em que o professor precisava equilibrar o andaime, ou seja, tornar o problema mais acessível, e o estímulo ao rigor, isto é, incentivar o aluno a realizar um raciocínio mais difícil. O sistema interrompe a conversa em um desses pontos e então transfere o papel do professor para um modelo de linguagem em uma sessão simulada de cinco rodadas, enquanto outro modelo de linguagem desempenha o papel do aluno.
Em seguida, um pipeline de pontuação baseado em modelo de linguagem avalia três aspectos: se o modelo ofereceu um andaime quando o aluno precisava dele, se o incentivou a buscar mais rigor quando estava preparado para isso e se evitou o andaime excessivo que reduz o nível de desafio mais do que o momento exige. O processo de avaliação começa com um julgamento de referência feito pelos professores. Quando eles discordavam, era utilizada a classificação da maioria; se dois de três considerassem que o momento exigia rigor, esse julgamento era adotado como resultado de referência.
O que os resultados iniciais mostraram?
A equipe testou sete modelos de linguagem usando dois tipos de instruções. O primeiro pede ao modelo que ensine bem sem explicar de fato o equilíbrio necessário; o segundo esclarece explicitamente a diferença entre andaime, andaime excessivo e estímulo ao rigor. Os momentos foram divididos igualmente entre casos em que o andaime era a escolha correta e casos que exigiam um incentivo maior ao raciocínio.
Os resultados mostraram que todos os modelos tiveram desempenho melhor quando foram usadas instruções que explicavam o dilema. Isso indica que o comportamento padrão de “assistente útil” não é suficiente, por si só, para oferecer um bom ensino. No entanto, formular o dilema nas instruções não resolveu completamente o problema; os modelos continuaram diferindo significativamente na confiabilidade com que tomavam a decisão adequada, e até os melhores modelos ainda tinham uma margem clara para melhorar.
A equipe também constatou que, quando orientados a incentivar o aluno a buscar rigor, os modelos tendiam a usar estratégias menos variadas que os professores e frequentemente se limitavam a pedir que o aluno explicasse sua resposta. Em contrapartida, os professores humanos usavam métodos mais diversificados e tinham maior probabilidade de recuar e deixar o aluno trabalhar de forma independente.
Limitações da comparação e seu significado
Os resultados do TutorMoments não devem ser interpretados como evidência de que os professores humanos são menos eficientes que a inteligência artificial. Os professores humanos presentes nos dados obtiveram, quando avaliados pelo mesmo método, pontuações de 0,458 em andaime adequado, 0,182 em rigor adequado e 0,496 em evitar andaime excessivo. Essas pontuações foram inferiores às dos modelos quando usaram instruções conscientes da avaliação e próximas da faixa de pontuações obtida por eles com instruções normais.
Mas o conjunto foi originalmente elaborado em torno de momentos que os professores consideraram oportunidades em que o ensino poderia ter sido melhor; portanto, concentra-se em oportunidades perdidas, não no ensino ideal. Além disso, os alunos nas reproduções são simulados por um modelo de linguagem, o que significa que as pontuações medem o comportamento do modelo em um ponto de decisão, e não se um aluno real de fato aprendeu.
Os dados também continuam limitados geográfica e educacionalmente: concentram-se em matemática nos níveis fundamental e médio dentro dos Estados Unidos e baseiam-se em um único grupo de educadores. A fonte também indica que a detecção do estímulo ao rigor é menos confiável que a detecção do andaime, e que o número de momentos de rigor foi de 260, em comparação com 738 momentos de andaime.
Em sua forma atual, o TutorMoments oferece uma maneira mais específica de examinar as decisões pedagógicas tomadas pelos modelos, mas não substitui estudos que utilizem alunos reais e meçam os resultados de aprendizagem. A equipe pretende coletar comentários sobre a prévia antes de desenvolver um conjunto de dados maior e multimodal, um pipeline de avaliação mais robusto e uma análise mais aprofundada.