TutorMoments : les tuteurs IA savent-ils quand aider et quand s'abstenir ?
Hugging Face
Hugging Face présente TutorMoments, un framework permettant d'évaluer si les grands modèles de langage (LLM) parviennent à trouver un équilibre entre aider les étudiants et les laisser se confronter aux difficultés. Construit à partir de données réelles de tutorat, il s'appuie sur des moments clés annotés par des enseignants pour tester les tuteurs IA lors de sessions simulées. Les résultats préliminaires montrent que les modèles ont tendance à trop aider par défaut, mais qu'un amorçage explicite améliore leurs performances, bien qu'ils restent en retrait par rapport au jugement humain.
Hugging Face a publié un aperçu de TutorMoments, un cadre conçu pour mesurer si les modèles de langage de pointe peuvent équilibrer le compromis entre aider un élève et se retenir pour encourager le raisonnement indépendant. Le cadre repose sur un ensemble de données de 462 transcriptions désidentifiées de séances de tutorat en mathématiques en tête-à-tête avec des élèves américains de la 2e à la 7e année, annotées par des enseignants de mathématiques expérimentés qui ont signalé les moments clés où les tuteurs devaient choisir entre l'étayage et l'exigence de rigueur. Lors des tests, sept modèles de langage ont reçu des transcriptions jusqu'à un point de décision et ont été invités à poursuivre en tant que tuteur avec un étudiant simulé. Les résultats ont montré qu'avec une invite simple, les modèles avaient tendance à trop aider, mais lorsque le compromis était explicitement décrit dans l'invite, tous les modèles se sont améliorés, tout en restant en deçà de la constance des tuteurs humains. Les chercheurs publient l'ensemble de données, le code et les rediffusions pour la reproductibilité, et soulignent que l'évaluation automatisée ne peut pas remplacer les études sur les résultats d'apprentissage réels. Le projet a reçu le soutien de la Fondation Gates et de Learning Commons.
Source: Hugging Face blog —
original
