Um dos mais ambiciosos testes de tutoria de IA do mundo real apresentou um veredicto preocupante. Um estudo randomizado de dois anos com o tutor Khanmigo da Khan Academy em 18 escolas de ensino médio do Tennessee descobriu que o acesso ao tutor de IA produziu ganhos matemáticos mensuráveis, mas modestos, e que os resultados foram prejudicados por um problema que os tecnólogos raramente anunciam: a maioria dos alunos mal o usava. O estudo, intitulado "One Click Away: AI Tutoring with Khanmigo in a Two-Year School Experiment", foi conduzido por Philip Oreopoulos e Nina Low e publicado pelo Annenberg Institute na série EdWorkingPapers da Brown University.

As descobertas são importantes muito além de um único produto, porque Khanmigo é um dos tutores de IA mais amplamente utilizados nas escolas americanas e o estudo está entre as primeiras avaliações experimentais em grande escala de tutoria de IA generativa em condições normais de sala de aula. Para quem acompanha notícias de pesquisa sobre IA e sua colisão com instituições do mundo real, o artigo é uma rara evidência concreta em um debate dominado por afirmações de marketing, e chegou à primeira página do Hacker News esta semana, enquanto educadores e tecnólogos analisavam suas implicações.

O que o estudo descobriu

O estudo designou aleatoriamente alunos de 18 escolas de ensino médio do Tennessee para usarem a Khan Academy com seu tutor de IA Khanmigo durante as sessões corretivas diárias de matemática existentes. Fundamentalmente, o tutor foi configurado para orientar em vez de dar respostas, refletindo a pedagogia declarada da Khan Academy. O experimento durou dois anos letivos, tornando-se um dos experimentos de campo mais longos sobre aulas de IA até hoje.

O resultado principal: a atribuição à condição de tutoria de IA aumentou o desempenho em matemática em 1,3 percentis nacionais por período, que os autores calculam como aproximadamente 0,06 a 0,08 desvios padrão ao longo de um ano letivo. O efeito implícito de um ano completo de participação ativa atinge 0,14 desvios-padrão. Esses são ganhos reais, estatisticamente detectáveis, e para uma intervenção de software de baixo custo são respeitáveis.

Mas a comparação que diminui o entusiasmo é esta: os ganhos se assemelham aos da prática da Khan Academy sem assistência de IA. Os alunos que usaram as ferramentas práticas existentes da plataforma, sem nenhum tutor de IA anexado, parecem ter se saído tão bem quanto os alunos que tiveram acesso ao Khanmigo.

O problema de engajamento nos dados

A seção mais reveladora do artigo é o relato forense de uso. Superficialmente, a adoção parece forte: 96% dos estudantes experimentaram o Khanmigo pelo menos uma vez. Por baixo, o engajamento entra em colapso. O aluno médio enviou mensagens ao tutor apenas em cerca de um terço dos dias em que praticou matemática e em apenas 17% das sessões de exercícios em que cometeu erros. Quando os alunos enviaram mensagens ao tutor, os autores descobriram que as mensagens eram, em sua maioria, respostas simples ou cliques em instruções sugeridas, em vez de diálogos matemáticos substantivos.

Em outras palavras, o tutor foi configurado para treinar os alunos de maneira socrática em relação aos erros, mas a maioria dos alunos evitava totalmente a conversa de coaching. Os autores concluem que a restrição vinculativa parece ser o envolvimento: concretizar a promessa da tutoria de IA exigirá que os alunos a utilizem, e não apenas lhes dar acesso.

Por que é importante para as escolas que compram IA

Os distritos dos Estados Unidos estão sob pressão para adotar ferramentas de IA, e a tutoria é o principal caso de uso em quase todos os campos. A IA generativa foi promovida como a tecnologia que poderia finalmente proporcionar o que os investigadores da educação chamam de sonho dos dois sigma: um tutor pessoal para cada aluno. O enquadramento dois sigma do Bloom vem de pesquisas mais antigas sobre tutoria humana, e é exatamente a promessa contra a qual os tutores de IA são comercializados.

Este estudo sugere que o gargalo não é a qualidade ou o acesso do modelo. Cada aluno do grupo de tratamento tinha um tutor LLM de última geração a um clique de distância, sem nenhum custo, dentro de seu bloco diário de matemática. A restrição era se os adolescentes manteriam voluntariamente um diálogo de tutoria, dia após dia, numa aula de reforço. A tutoria humana funciona em parte porque a pessoa percebe quando você se desliga. O software, até agora, não replica essa atração de maneira confiável.

Advertências que vale a pena manter em mente

O artigo é um EdWorkingPaper, distribuído pelo Instituto Annenberg da Universidade Brown, e os leitores devem tratá-lo como uma pesquisa de trabalho, em vez de resultados revisados ​​por pares. O estudo cobre matemática corretiva do ensino médio em um estado, portanto, generalizar para outras disciplinas, séries ou modelos de implementação é especulativo. O enquadramento dos próprios autores é medido: eles relatam o que aconteceu quando um tutor de IA amplamente disponível foi adicionado às sessões práticas existentes, e não o que poderia acontecer sob diferentes currículos ou incentivos mais fortes para o envolvimento.

Também vale a pena notar o que o estudo não diz. Ele não considera que o ensino de IA seja inútil; um efeito de desvio padrão de 0,14 de um ano completo de participação activa seria significativo se o envolvimento pudesse ser sustentado. A descoberta está mais próxima desta: a tecnologia funcionou tão bem quanto as ferramentas práticas não-IA às quais foi aparafusada, porque os alunos não usaram a IA de forma diferente dos botões que já ignoravam.

A conclusão

O setor de tecnologia educacional passou dois anos prometendo que os tutores de IA generativa transformarão as salas de aula. Este ensaio, um dos primeiros a acompanhar estudantes reais ao longo de dois anos completos, sugere que a transformação é condicionada por um problema antigo: fazer com que as crianças queiram fazer o trabalho. Para os líderes escolares, a lição é exigir dados de envolvimento, e não apenas contagens de licenças, dos fornecedores de IA. Para a indústria da IA, é um lembrete de que os problemas mais difíceis na implantação da IA ​​raramente têm a ver com o modelo.

Acompanhe a pesquisa de IA

Experimentos de campo como este cortam o ciclo de hype mais rápido do que qualquer benchmark. Para uma cobertura contínua da pesquisa sobre IA com consequências no mundo real, siga as notícias sobre IA em aibuzzwire.news.

Leia mais notícias sobre IA →