TutorMoments: Os Tutores de IA Sabem Quando Ajudar e Quando se Conter?
Hugging Face
A Hugging Face apresenta o TutorMoments, uma estrutura para avaliar se os modelos de linguagem em grande escala (LLMs) conseguem equilibrar o apoio aos alunos com o deixá-los enfrentar desafios por conta própria. Baseado em dados reais de tutoria, utiliza momentos-chave anotados por professores para testar tutores de IA em sessões simuladas. Os resultados preliminares mostram que os modelos tendem a ajudar em excesso por padrão, mas que instruções explícitas melhoram o desempenho, embora ainda fiquem aquém do julgamento humano.
O Hugging Face lançou uma prévia do TutorMoments, um framework projetado para medir se os LLMs de ponta conseguem equilibrar a troca entre ajudar um estudante e se conter para incentivar o raciocínio independente. O framework é construído sobre um conjunto de dados de 462 transcrições não identificadas de sessões reais de tutoria individual de matemática com estudantes dos EUA do 2º ao 7º ano, anotadas por professores de matemática experientes que marcaram momentos-chave em que os tutores tiveram que escolher entre fornecer suporte e exigir rigor. Nos testes, sete LLMs receberam transcrições até um ponto de decisão e foram instruídos a continuar como o tutor com um estudante simulado. Os resultados mostraram que, com um prompt simples, os modelos tendiam a ajudar demais, mas quando a troca era descrita explicitamente no prompt, todos os modelos melhoraram, embora ainda ficando aquém da consistência dos tutores humanos. Os pesquisadores estão disponibilizando o conjunto de dados, o código e as reproduções para reprodutibilidade, e enfatizam que a avaliação automatizada não pode substituir estudos de resultados de aprendizagem no mundo real. O projeto recebeu apoio da Fundação Gates e do Learning Commons.
Fonte: Hugging Face blog —
original
