Una de las pruebas más ambiciosas del mundo real de tutoría de IA ha arrojado un veredicto aleccionador. Una prueba aleatoria por grupos de dos años del tutor Khanmigo de Khan Academy en 18 escuelas secundarias de Tennessee encontró que el acceso al tutor de IA produjo avances en matemáticas mensurables pero modestos, y que los resultados se vieron frenados por un problema que los tecnólogos rara vez publicitan: la mayoría de los estudiantes apenas lo usaban. El estudio, titulado "A un clic: tutoría de IA con Khanmigo en un experimento escolar de dos años", fue realizado por Philip Oreopoulos y Nina Low y publicado a través de la serie EdWorkingPapers del Instituto Annenberg de la Universidad de Brown.
Los hallazgos importan mucho más allá de un solo producto, porque Khanmigo es uno de los tutores de IA más utilizados en las escuelas estadounidenses y el estudio se encuentra entre las primeras evaluaciones experimentales a gran escala de tutorías de IA generativa en condiciones normales de aula. Para cualquiera que siga las noticias de investigación de IA y su colisión con instituciones del mundo real, el artículo es una rara pieza de evidencia contundente en un debate dominado por afirmaciones de marketing, y llegó a la portada de Hacker News esta semana mientras educadores y tecnólogos analizaban sus implicaciones.
Lo que encontró el estudio
La prueba asignó al azar a estudiantes de 18 escuelas intermedias de Tennessee para que utilizaran Khan Academy con su tutor de inteligencia artificial, Khanmigo, durante las sesiones diarias de recuperación de matemáticas existentes. Fundamentalmente, el tutor estaba configurado para asesorar en lugar de dar respuestas, lo que refleja la pedagogía declarada de Khan Academy. El experimento duró dos años escolares, lo que lo convierte en uno de los experimentos de campo más largos sobre tutoría de IA hasta la fecha.
Los resultados principales: la asignación a la condición de tutoría de IA aumentó el rendimiento en matemáticas en 1,3 percentiles nacionales por trimestre, lo que los autores calculan como aproximadamente entre 0,06 y 0,08 desviaciones estándar durante un año escolar. El efecto implícito de un año completo de participación activa alcanza 0,14 desviaciones estándar. Se trata de beneficios reales, detectables estadísticamente y, tratándose de una intervención de software de bajo coste, son respetables.
Pero la comparación que desinfla el revuelo es la siguiente: los beneficios se parecen a los de la práctica de Khan Academy sin ayuda de la IA. Los estudiantes que utilizaron las herramientas de práctica existentes de la plataforma, sin un tutor de IA adjunto, parecen haber obtenido resultados tan buenos como los estudiantes que tuvieron acceso a Khanmigo.
El problema del engagement en los datos
La sección más reveladora del artículo es su relato forense del uso. A primera vista, la adopción parece sólida: el 96 por ciento de los estudiantes probaron Khanmigo al menos una vez. En el fondo, el compromiso colapsa. El estudiante medio envió mensajes al tutor sólo alrededor de un tercio de los días que practicaba matemáticas, y en sólo el 17 por ciento de las sesiones de ejercicio en las que cometió un error. Cuando los estudiantes enviaron mensajes al tutor, los autores descubrieron que los mensajes eran en su mayoría respuestas simples o clics en sugerencias sugeridas, en lugar de un diálogo matemático sustancial.
En otras palabras, el tutor estaba configurado para entrenar socráticamente a los estudiantes a través de errores, pero la mayoría de los estudiantes evitaban por completo la conversación de coaching. Los autores concluyen que la limitación vinculante parece ser el compromiso: hacer realidad la promesa de la tutoría de IA requerirá lograr que los estudiantes la utilicen, no solo darles acceso.
Por qué es importante que las escuelas compren IA
Los distritos de todo Estados Unidos están bajo presión para adoptar herramientas de inteligencia artificial, y la tutoría es el caso de uso emblemático en casi todos los lanzamientos. La IA generativa se ha promocionado como la tecnología que finalmente podría hacer realidad lo que los investigadores en educación llaman el sueño dos sigma: un tutor personal para cada estudiante. El marco dos sigma de Bloom proviene de investigaciones más antiguas sobre tutoría humana, y es exactamente la promesa contra la que se comercializan los tutores de IA.
Este estudio sugiere que el cuello de botella no es la calidad del modelo ni el acceso. Cada estudiante del grupo de tratamiento tenía un tutor de LLM de última generación a un clic de distancia, sin costo alguno, dentro de su bloque diario de matemáticas. La limitación era si los adolescentes mantendrían voluntariamente un diálogo de tutoría, día tras día, en una clase de recuperación. La tutoría humana funciona en parte porque una persona se da cuenta cuando usted se desconecta. El software, hasta ahora, no replica de manera confiable esa atracción.
Advertencias que vale la pena tener en cuenta
El artículo es un EdWorkingPaper, distribuido a través del Instituto Annenberg de la Universidad de Brown, y los lectores deben tratarlo como una investigación en funcionamiento en lugar de como resultados revisados por pares. El estudio cubre matemáticas de recuperación de secundaria en un estado, por lo que generalizar a otras materias, niveles de grado o modelos de implementación es especulativo. El propio marco de los autores es medido: informan lo que sucedió cuando un tutor de IA ampliamente disponible se superpuso a las sesiones de práctica existentes, no lo que podría suceder bajo diferentes planes de estudio o incentivos más fuertes para participar.
También vale la pena señalar lo que el estudio no dice. No considera que la tutoría de IA sea inútil; un efecto de desviación estándar de 0,14 de un año completo de participación activa sería significativo si el compromiso pudiera mantenerse. El hallazgo se acerca más a esto: la tecnología funcionó tan bien como las herramientas de práctica sin IA a las que estaba integrada, porque los estudiantes no usaron la IA de manera diferente a los botones que ya ignoraban.
La comida para llevar
El sector de la tecnología educativa lleva dos años prometiendo que los tutores de IA generativa transformarán las aulas. Este ensayo, uno de los primeros que siguió a estudiantes reales durante dos años completos, sugiere que la transformación está motivada por un antiguo problema: lograr que los niños quieran hacer el trabajo. Para los líderes escolares, la lección es exigir datos de participación, no solo recuentos de licencias, de los proveedores de IA. Para la industria de la IA, es un recordatorio de que los problemas más difíciles en la implementación de la IA rara vez tienen que ver con el modelo.
Manténgase al día con la investigación de IA
Experimentos de campo como éste cortan el ciclo de exageración más rápido que cualquier punto de referencia. Para una cobertura continua de la investigación de IA con consecuencias en el mundo real, siga las noticias de IA en aibuzzwire.news.
Leer más noticias sobre IA →