AI 개인교습에 대한 가장 야심찬 실제 테스트 중 하나가 냉철한 판결을 내렸습니다. 테네시 중학교 18곳을 대상으로 Khan Academy의 Khanmigo 교사를 대상으로 2년간 클러스터 무작위 시험을 실시한 결과 AI 교사에 대한 접근이 측정 가능하지만 미미한 수준의 수학 향상을 가져왔고 그 결과는 기술자들이 거의 광고하지 않는 문제로 인해 보류되었습니다. 대부분의 학생들은 거의 사용하지 않았습니다. "One Click Away: 2년 학교 실험에서 Khanmigo를 사용한 AI 튜터링"이라는 제목의 이 연구는 Philip Oreopoulos와 Nina Low가 수행했으며 Brown University의 Annenberg Institute의 EdWorkingPapers 시리즈를 통해 출판되었습니다.

Khanmigo는 미국 학교에서 가장 널리 배포된 AI 교사 중 하나이고 이 연구는 일반적인 교실 조건에서 생성적 AI 교사에 대한 최초의 대규모 실험 평가 중 하나이기 때문에 이번 연구 결과는 단일 제품 그 이상으로 중요합니다. AI 연구 뉴스 및 실제 기관과의 충돌을 추적하는 사람에게 이 논문은 마케팅 주장이 지배하는 논쟁에서 보기 드문 확실한 증거이며 교육자와 기술자가 그 의미를 분석하면서 이번 주 Hacker News의 첫 페이지에 게재되었습니다.

연구 결과

이 실험에서는 테네시 중학교 18곳의 학생들을 무작위로 배정하여 기존 일일 교정 수학 세션 중에 AI 교사 Khanmigo와 함께 Khan Academy를 사용하도록 했습니다. 결정적으로, 교사는 Khan Academy의 명시된 교수법을 반영하여 답변을 제공하기보다는 코칭하도록 ​​구성되었습니다. 이 실험은 2학년 동안 진행되었으며, 이는 현재까지 AI 개인교습에 대한 가장 긴 현장 실험 중 하나가 되었습니다.

헤드라인 결과: AI 튜터링 조건에 할당하면 수학 성취도가 학기당 1.3 국가 백분위수 순위만큼 향상되었으며, 저자는 이를 한 학년 동안 대략 0.06~0.08 표준 편차로 계산했습니다. 1년간 적극적으로 참여하면 암시된 효과는 0.14 표준편차에 이릅니다. 이는 통계적으로 감지할 수 있는 실제적인 이득이며, 저비용 소프트웨어 개입의 경우에는 상당한 가치가 있습니다.

그러나 과대광고를 무색하게 만드는 비교는 이것이다: AI의 도움 없이 칸아카데미 연습을 통해 얻을 수 있는 이득과 유사하다는 것입니다. AI 교사 없이 플랫폼의 기존 연습 도구를 사용한 학생들은 Khanmigo에 접근할 수 있었던 학생들과 마찬가지로 비슷한 일을 한 것으로 보입니다.

데이터의 참여 문제

이 논문에서 가장 눈에 띄는 부분은 사용법에 대한 법의학적 설명입니다. 표면적으로는 채택률이 매우 높아 보입니다. 학생의 96%가 Khanmigo를 한 번 이상 사용해 보았습니다. 그 아래에서는 참여가 무너집니다. 중앙값 학생은 수학을 연습하는 날의 약 3분의 1만 교사에게 메시지를 보냈고, 실수를 한 연습 세션 중 17%만 튜터에게 메시지를 보냈습니다. 학생들이 교사에게 메시지를 보냈을 때, 저자는 메시지가 실질적인 수학적 대화라기보다는 대부분 단순한 답변이나 제안된 프롬프트에 대한 클릭이라는 것을 발견했습니다.

즉, 튜터는 실수를 통해 학생들을 소크라테스적으로 지도하도록 구성되었지만, 학생들은 대부분 코칭 대화를 완전히 피했습니다. 저자는 구속력 있는 제약이 참여인 것으로 결론을 내립니다. 즉, AI 개인교습의 가능성을 실현하려면 학생들에게 단순히 액세스 권한을 부여하는 것이 아니라 AI를 사용하도록 해야 합니다.

AI를 구매하는 학교에 중요한 이유

미국 전역의 지역에서는 AI 도구를 채택하라는 압력을 받고 있으며 개인교습은 거의 모든 분야에서 대표적인 사용 사례입니다. 제너레이티브 AI는 교육 연구자들이 2시그마 꿈이라고 부르는 모든 학생을 위한 개인 교사를 마침내 실현할 수 있는 기술로 홍보되었습니다. Bloom의 2-시그마 프레이밍은 인간 튜터링에 대한 오래된 연구에서 비롯되었으며, 이는 AI 튜터가 마케팅하는 약속과 정확히 일치합니다.

이 연구는 병목 현상이 모델 품질이나 액세스가 아니라는 점을 시사합니다. 치료 그룹의 모든 학생은 일일 수학 블록 내에서 클릭 한 번으로 무료로 최첨단 LLM 교사를 접할 수 있었습니다. 제약은 청소년들이 교정 수업에서 매일 자발적으로 사교육 대화를 유지할 것인지 여부였습니다. 인간 튜터링은 부분적으로 당신이 이탈할 때 사람이 알아차리기 때문에 효과가 있습니다. 지금까지의 소프트웨어는 해당 풀을 안정적으로 복제하지 못했습니다.

명심해야 할 주의 사항

이 논문은 Brown University의 Annenberg Institute를 통해 배포되는 EdWorkingPaper이며, 독자는 동료 검토 결과가 아닌 실제 연구로 취급해야 합니다. 이 연구는 한 주의 중학교 교정 수학을 다루고 있으므로 다른 과목, 학년 수준 또는 구현 모델을 일반화하는 것은 추측에 불과합니다. 저자 자신의 프레이밍이 측정됩니다. 그들은 널리 사용 가능한 AI 교사가 기존 연습 세션에 계층화되었을 때 발생한 일을 보고하며, 다른 커리큘럼이나 참여에 대한 더 강력한 인센티브에서 발생할 수 있는 일이 아니라 보고합니다.

또한 연구가 말하지 않은 내용도 주목할 가치가 있습니다. AI 튜터링이 쓸모없다고 생각하지 않습니다. 참여가 지속될 수 있다면 1년간의 적극적인 참여로 인한 0.14 표준편차 효과는 의미가 있을 것입니다. 결과는 이것에 더 가깝습니다. 학생들이 이미 무시한 버튼과 다르게 AI를 사용하지 않았기 때문에 기술이 작동한 것은 물론 이 기술이 적용된 비 AI 연습 도구도 마찬가지였습니다.

테이크아웃

교육 기술 부문에서는 생성적 AI 교사가 교실을 변화시킬 것이라고 약속하며 2년을 보냈습니다. 2년에 걸쳐 실제 학생들을 추적한 최초의 실험 중 하나인 이 실험은 변화가 고대의 문제, 즉 아이들이 일을 하고 싶어하게 만드는 것에 의해 관문이 이루어지고 있음을 시사합니다. 학교 리더들에게 교훈은 AI 벤더에게 라이선스 수뿐만 아니라 참여 데이터를 요구하는 것입니다. AI 업계에서는 AI 배포에서 가장 어려운 문제가 모델에 관한 것이 아니라는 점을 상기시켜 줍니다.

AI 연구 동향 파악

이와 같은 현장 실험은 어떤 벤치마크보다 더 빠르게 과대광고 주기를 단축했습니다. 실제 결과와 함께 AI 연구를 지속적으로 보도하려면 aibuzzwire.news에서 AI 뉴스를 팔로우하세요.

AI 뉴스 자세히 보기 →