중국의 약 27,000명의 학생을 추적한 새로운 연구는 교육 분야의 생성적 AI에 대해 지금까지 가장 경각심을 불러일으키는 증거 중 일부를 제시했습니다. AI 도구를 사용한 학생들은 숙제 점수가 18% 증가하고 훨씬 짧은 시간에 과제를 완료했으며, AI 지원 없이 치른 시험에서 같은 반 친구보다 20% 낮은 점수를 받았습니다. 스톡홀름 대학교의 David Strömberg가 홍콩 대학교의 Victor Lei 및 Wu Yanhui와 함께 주도한 이 연구는 8월 18일 The Economist에서 강조되었으며 SSRN에 대한 연구 논문으로 회람되고 있습니다. AI 속보를 따르는 독자들에게는 교육자와 부모가 쉽게 무시하지 못할 데이터 포인트입니다.

설정과 충격

연구자들은 대부분의 학교가 추측해왔던 질문에 답하기 시작했습니다. AI가 학생들의 학습에 도움이 됩니까, 아니면 학업을 마치는 데 도움이 됩니까? 6개월 동안 과목별로 수만 명의 학생을 추적함으로써 팀은 AI 사용자와 비사용자 모두를 대상으로 숙제 성과를 후속 시험 결과와 비교할 수 있었습니다.

이코노미스트(The Economist)가 요약한 헤드라인 결과는 다음과 같습니다. 6개월 후 AI를 사용하는 학생들은 모든 과목에서 평균 숙제 점수가 18% 증가한 반면, 각 과제에 소요되는 시간은 평균 64분에서 45분으로 감소했습니다. 그러나 시험 시간이 되자 같은 학생들은 숙제에 AI를 사용한 적이 없는 급우보다 20% 낮은 점수를 받았습니다.

더 깊은 발견은 더 미묘하고 더 문제가 됩니다. 이코노미스트의 분석에서는 "숙제 점수는 한때 시험 성과를 예측했지만 이제는 가장 높은 점수를 받은 사람들이 시험에서 더 나쁜 성적을 낼 가능성이 더 높습니다"라고 지적했습니다. 즉, 교사가 이해를 대신하는 숙제 성적에 의존하는 전통적인 신호 방식이 조용히 깨졌습니다. 과제가 가장 좋아 보이는 학생은 자료를 가장 적게 이해하는 학생일 수도 있습니다.

학습이 아닌 아웃소싱

왜 숙제 점수는 올랐는데 시험 점수는 떨어졌나? 데이터는 연구원들이 아웃소싱이라고 설명하는 것을 가리킵니다. 즉, 학생들이 작업을 교사로 사용하는 대신 모델에 작업 자체를 전달하는 것입니다. 공개 토론에서 인용된 논문의 수치에 따르면, 연구에 참여한 AI 사용자 중 약 81%가 효과적으로 숙제를 언어 모델에 위임하고 있었으며, 학생들이 도구에 노출된 기간이 길어질수록 아웃소싱 비율이 높아진 것으로 나타났습니다.

패턴은 점차 나타났다. 연구 초기에 일부 AI를 사용하는 학생들은 여전히 ​​과제당 65분 이상(비사용자와 거의 같은 시간)을 보냈으며 그들의 숙제와 시험 결과는 AI를 피한 동료들과 유사해 보였습니다. 연구자들은 이 학생들이 모델을 거의 사용하지 않고 있다고 추론했습니다. 그러나 입양 후 6개월이 지나도 AI에 노출된 학생은 여전히 ​​숙제에 65분 이상을 소비하지 않았습니다. 가끔 지원으로 시작하는 것이 할당별로 할당되어 완전한 위임으로 전환되는 것처럼 보입니다.

이러한 확대는 결과를 무시하기 어렵게 만듭니다. AI 튜터링이 작동하지 않는다는 것은 아닙니다. 의도적으로 설명하고 퀴즈를 내는 소크라테스 파트너로서 이 기술을 사용하면 사람들이 학습하는 데 확실히 도움이 될 수 있습니다. 십대와 기한이 지난 과제가 있는 자연주의적인 조건에서는 저항이 가장 적은 경로가 답을 통해 곧장 이어진다는 것입니다.

중국이 클린 테스트 케이스를 만드는 이유

연구의 설정은 결론을 강화합니다. 중국에서는 대학 입학이 높은 수준의 표준화된 시험을 통해 이루어지며, 숙제 성적은 다른 곳과 달리 과정 결과를 부풀리지 않습니다. 시험은 외부적으로 벤치마킹되고 매우 결과적이므로 쉬운 채점이나 교사의 관대함으로 인해 20%의 격차를 설명하기가 더 어려워집니다. 이 연구는 연구자들이 관심을 갖는 채널을 효과적으로 분리했습니다. AI는 숙제 제작 방식을 바꾸고 시험은 실제로 배운 내용을 측정했습니다.

수백 개의 포인트를 수집한 Hacker News의 논문에 대한 토론은 AI가 부지런한 학생들을 더 좋게 만들고 참여하지 않는 학생들을 더 나쁘게 만드는 "증폭기"인지 여부라는 명백한 후속 질문과 씨름했습니다. 이 논문의 자체 분석은 이러한 위안을 주는 프레임을 뒤로 밀어냅니다. 시간 사용 데이터는 AI를 책임감 있게 사용하기 시작한 학생조차도 몇 달에 걸쳐 위임 쪽으로 표류했음을 시사하며, 위험이 애초에 학습할 의도가 전혀 없었던 학생에게만 국한되지 않음을 암시합니다.

학교의 정책 딜레마

결과는 어색한 순간에 도착합니다. 정부와 교육 기술 기업은 AI 교사를 학생 앞에 배치하기 위해 경쟁하고 있으며 개인화된 AI 지원이 성취도 격차를 줄일 것이라고 확신하고 있습니다. 이 연구는 대규모로 정반대의 결과가 가능함을 시사합니다. 즉, 숙제가 원활해지고 성적이 향상되며 그 아래에 있는 측정된 학습이 조용히 침식됩니다. 이는 수정하기에는 너무 늦었을 때만 발견됩니다.

학교의 경우 그 의미는 구체적입니다. 숙제가 더 이상 학습의 증거가 될 수 없다면 평가는 교실 내에서 감독되어야 합니다. AI 사용이 불가피하다면 과제는 구두 방어, 수업 내 문제 세션, 연구에서 학생들이 건너뛴 어려움을 보상하는 프로세스 기반 채점 등 기술을 중심으로 재설계해야 할 수도 있습니다. 그리고 노출로 인해 아웃소싱이 강화된다면 지연은 중립적이지 않습니다. 매달 구조화되지 않은 AI 액세스가 습관을 심화시키는 것처럼 보입니다.

연구원들의 기여는 교실 내 ChatGPT 시대의 일화적인 패닉을 세로 숫자로 대체하는 것이며 숫자는 암울합니다. 시험이 20% 감소하는 대가로 숙제를 18% 개선하는 것은 학습 이득이 아닙니다. 이는 시험 당일 이자를 지불하고 학생에서 기계로 작업을 이전하는 것입니다.

AI보다 앞서 나가세요

교육 분야의 AI에 대한 연구 혁신, 정책 실패, 정직한 분석을 보려면 AI Buzz Wire를 즐겨찾기에 추가하세요.

AI 뉴스 자세히 보기 →