L’un des tests réels les plus ambitieux de tutorat en IA a livré un verdict qui donne à réfléchir. Un essai randomisé en grappes de deux ans mené auprès du tuteur Khanmigo de la Khan Academy dans 18 collèges du Tennessee a révélé que l'accès au tuteur en IA produisait des gains mesurables mais modestes en mathématiques, et que les résultats étaient freinés par un problème que les technologues annoncent rarement : la plupart des étudiants l'utilisaient à peine. L'étude, intitulée « One Click Away : AI Tutoring with Khanmigo in a Two-Year School Experiment », a été menée par Philip Oreopoulos et Nina Low et publiée par l'Institut Annenberg de la série EdWorkingPapers de l'Université Brown.
Les résultats comptent bien au-delà d’un seul produit, car Khanmigo est l’un des tuteurs d’IA les plus largement déployés dans les écoles américaines et l’étude fait partie des premières évaluations expérimentales à grande échelle du tutorat d’IA générative dans des conditions normales de classe. Pour quiconque suit l'actualité de la recherche sur l'IA (https://aibuzzwire.news) et sa collision avec les institutions du monde réel, le document constitue une preuve tangible rare dans un débat dominé par les allégations marketing, et il a fait la une de Hacker News cette semaine alors que les éducateurs et les technologues analysaient ses implications.
Ce que l'étude a trouvé
L'essai a assigné au hasard des élèves de 18 collèges du Tennessee à utiliser Khan Academy avec son tuteur en IA Khanmigo pendant les séances quotidiennes de rattrapage mathématique. Fondamentalement, le tuteur était configuré pour coacher plutôt que pour donner des réponses, reflétant la pédagogie déclarée de la Khan Academy. L’expérience a duré deux années scolaires, ce qui en fait l’une des plus longues expériences de terrain sur le tutorat en IA à ce jour.
Les principaux résultats : l'affectation à la condition de tutorat en IA a augmenté les résultats en mathématiques de 1,3 centile national par trimestre, ce que les auteurs calculent comme étant d'environ 0,06 à 0,08 écarts-types sur une année scolaire. L’effet implicite d’une année complète de participation active atteint 0,14 écart-type. Ce sont des gains réels, statistiquement détectables, et pour une intervention logicielle à faible coût, ils sont respectables.
Mais la comparaison qui dégonfle le battage médiatique est la suivante : les gains ressemblent à ceux de la pratique de la Khan Academy sans l’aide de l’IA. Les étudiants qui ont utilisé les outils pratiques existants de la plateforme, sans tuteur en IA, semblent avoir fait à peu près aussi bien que les étudiants qui avaient accès à Khanmigo.
Le problème d'engagement dans les données
La section la plus révélatrice du document est son compte rendu médico-légal de son utilisation. En apparence, l’adoption semble forte : 96 % des étudiants ont essayé Khanmigo au moins une fois. En dessous, l’engagement s’effondre. L’élève médian a envoyé un message au tuteur seulement environ un tiers des jours où il a pratiqué les mathématiques, et dans seulement 17 % des séances d’exercices au cours desquelles il a commis une erreur. Lorsque les étudiants envoyaient un message au tuteur, les auteurs ont constaté que les messages étaient pour la plupart de simples réponses ou des clics sur des invites suggérées, plutôt qu'un dialogue mathématique de fond.
En d’autres termes, le tuteur était configuré pour coacher socratiquement les étudiants en cas d’erreurs, mais les étudiants évitaient pour la plupart complètement la conversation de coaching. Les auteurs concluent que la contrainte majeure semble être l’engagement : pour concrétiser les promesses du tutorat en IA, il faudra inciter les étudiants à l’utiliser, et pas seulement leur en donner accès.
Pourquoi c'est important pour les écoles qui achètent de l'IA
Les districts des États-Unis sont sous pression pour adopter des outils d’IA, et le tutorat est le cas d’utilisation phare dans presque tous les pitchs. L’IA générative a été présentée comme la technologie qui pourrait enfin réaliser ce que les chercheurs en éducation appellent le rêve des deux sigmas : un tuteur personnel pour chaque élève. Le cadre à deux sigma de Bloom provient de recherches plus anciennes sur le tutorat humain, et c'est exactement la promesse contre laquelle les tuteurs IA sont commercialisés.
Cette étude suggère que le goulot d’étranglement ne vient pas de la qualité ou de l’accès du modèle. Chaque étudiant du groupe de traitement disposait d'un tuteur LLM de pointe, accessible en un clic, sans frais, dans son bloc de mathématiques quotidien. La contrainte était de savoir si les adolescents accepteraient volontairement un dialogue de tutorat, jour après jour, dans une classe de rattrapage. Le tutorat humain fonctionne en partie parce qu'une personne remarque lorsque vous vous désengagez. Jusqu’à présent, les logiciels ne reproduisent pas cette attraction de manière fiable.
Mises en garde à garder à l'esprit
L'article est un EdWorkingPaper, distribué par l'intermédiaire de l'Institut Annenberg de l'Université Brown, et les lecteurs devraient le considérer comme une recherche de travail plutôt que comme des résultats évalués par des pairs. L'étude couvre les mathématiques de rattrapage au collège dans un État, donc la généralisation à d'autres matières, niveaux scolaires ou modèles de mise en œuvre est spéculative. Le propre cadrage des auteurs est mesuré : ils rapportent ce qui s'est passé lorsqu'un tuteur en IA largement disponible a été ajouté aux séances de pratique existantes, et non ce qui pourrait se produire dans le cadre de programmes d'études différents ou d'incitations plus fortes à s'engager.
Il convient également de noter ce que l’étude ne dit pas. Il ne considère pas que le tutorat en IA soit inutile ; un effet d’écart type de 0,14 sur une année complète de participation active serait significatif si l’engagement pouvait être soutenu. Le constat est plus proche de celui-ci : la technologie a fonctionné ainsi que les outils pratiques non-IA sur lesquels elle a été intégrée, car les étudiants n'ont pas utilisé l'IA différemment des boutons qu'ils ignoraient déjà.
Les plats à emporter
Le secteur des technologies éducatives a passé deux ans à promettre que les tuteurs en IA générative transformeraient les salles de classe. Cet essai, l'un des premiers à suivre de vrais étudiants pendant deux années complètes, suggère que la transformation est liée à un problème ancien : donner envie aux enfants de faire le travail. Pour les chefs d’établissement, la leçon est d’exiger des données d’engagement, et pas seulement le nombre de licences, des fournisseurs d’IA. Pour l’industrie de l’IA, cela rappelle que les problèmes les plus difficiles en matière de déploiement de l’IA concernent rarement le modèle.
Suivez la recherche sur l'IA
Les expériences sur le terrain comme celle-ci coupent le cycle de battage médiatique plus rapidement que n’importe quelle référence. Pour une couverture continue de la recherche sur l'IA avec des conséquences concrètes, suivez l'actualité de l'IA sur aibuzzwire.news.
Lire plus d'actualités sur l'IA →