Kajian baharu yang menjejaki kira-kira 27,000 pelajar di China telah menghasilkan beberapa bukti yang paling meyakinkan tentang AI generatif dalam pendidikan: murid yang menggunakan alatan AI melihat markah kerja rumah mereka melonjak 18 peratus dan menyelesaikan tugasan dalam masa yang jauh lebih singkat — kemudian mendapat 20 peratus di bawah rakan sekelas mereka pada peperiksaan yang diambil tanpa bantuan AI. Penyelidikan yang diketuai oleh David Strömberg dari Universiti Stockholm bersama Victor Lei dan Wu Yanhui dari Universiti Hong Kong, telah diketengahkan oleh The Economist pada 18 Ogos dan sedang diedarkan sebagai kertas kerja mengenai SSRN. Bagi pembaca yang mengikuti berita terbaharu AI, ia adalah titik data pendidik dan ibu bapa tidak akan mudah menolak.
Persediaan dan kejutan
Para penyelidik berusaha untuk menjawab soalan yang kebanyakan sekolah telah meneka: adakah AI membantu pelajar belajar, atau adakah ia membantu mereka menyelesaikannya? Dengan mengikuti puluhan ribu murid merentas subjek selama enam bulan, pasukan itu boleh membandingkan prestasi kerja rumah dengan keputusan peperiksaan berikutnya untuk pengguna AI dan bukan pengguna.
Penemuan tajuk utama, seperti yang diringkaskan oleh The Economist: selepas enam bulan, murid yang menggunakan AI menyaksikan purata markah kerja rumah mereka meningkat sebanyak 18 peratus merentas semua mata pelajaran, manakala masa yang dihabiskan untuk setiap tugasan jatuh daripada purata 64 minit kepada 45. Tetapi apabila tiba masa peperiksaan, pelajar yang sama mendapat markah 20 peratus di bawah rakan sekelas yang tidak pernah menggunakan AI untuk kerja rumah mereka.
Penemuan yang lebih mendalam adalah lebih halus dan lebih merisaukan. "Skor kerja rumah pernah meramalkan prestasi peperiksaan; kini mereka yang mendapat markah tertinggi, sebaliknya, lebih berkemungkinan melakukan lebih teruk dalam peperiksaan," kata analisis Economist. Dalam erti kata lain, guru isyarat tradisional bergantung pada - gred kerja rumah sebagai proksi untuk pemahaman - telah dipecahkan secara senyap-senyap. Pelajar yang tugasan mereka kelihatan terbaik mungkin adalah mereka yang paling kurang memahami bahan tersebut.
Outsourcing, bukan belajar
Mengapakah markah kerja rumah melonjak manakala markah peperiksaan runtuh? Data menunjukkan perkara yang diterangkan oleh penyelidik sebagai penyumberan luar: pelajar menyerahkan kerja itu sendiri kepada model dan bukannya menggunakannya sebagai tutor. Angka-angka daripada kertas yang dipetik dalam perbincangan awam menunjukkan bahawa sekitar 81 peratus pengguna AI dalam kajian itu secara berkesan mewakilkan kerja rumah mereka kepada model bahasa - dan bahawa kadar penyumberan luar meningkat apabila pelajar lebih lama terdedah kepada alatan tersebut.
Corak itu muncul secara beransur-ansur. Pada awal kajian, sesetengah pelajar yang menggunakan AI masih menghabiskan lebih daripada 65 minit setiap tugasan — kira-kira masa yang sama dengan bukan pengguna — dan kerja rumah serta keputusan peperiksaan mereka kelihatan serupa dengan rakan sebaya yang mengelak AI. Para penyelidik membuat kesimpulan bahawa pelajar ini hampir tidak menggunakan model tersebut sama sekali. Tetapi enam bulan selepas anak angkat, tiada pelajar yang terdedah kepada AI masih menghabiskan lebih daripada 65 minit untuk kerja rumah. Perkara yang bermula sebagai bantuan sekali-sekala kelihatan meluncur, penugasan demi tugasan, menjadi perwakilan penuh.
Peningkatan itulah yang menjadikan penemuan itu sukar untuk ditolak. Bukannya tunjuk ajar AI tidak boleh berfungsi — digunakan dengan sengaja, sebagai rakan kongsi Socratic yang menerangkan dan membuat kuiz, teknologi ini boleh dibuktikan dapat membantu orang ramai belajar. Ia adalah bahawa dalam keadaan naturalistik, dengan remaja dan tugasan yang tertunggak, jalan yang paling sedikit tentangan berjalan lurus melalui jawapannya.
Mengapa China membuat kes ujian yang bersih
Keadaan kajian mengukuhkan kesimpulannya. Di China, kemasukan universiti dijalankan melalui peperiksaan piawai yang mempunyai pertaruhan tinggi, dan gred kerja rumah tidak meningkatkan keputusan kursus seperti yang mereka boleh lakukan di tempat lain. Peperiksaan ditanda aras secara luaran dan berbangkit secara kejam, yang menjadikan jurang 20 peratus lebih sukar untuk dijelaskan dengan penggredan yang mudah atau kelonggaran guru. Kajian itu dengan berkesan mengasingkan penyelidik saluran yang mengambil berat tentang: AI mengubah cara kerja rumah dihasilkan, dan peperiksaan mengukur perkara yang sebenarnya telah dipelajari.
Perbincangan kertas di Hacker News, di mana ia mengumpulkan ratusan mata, bergelut dengan soalan susulan yang jelas — sama ada AI ialah "penguat" yang menjadikan pelajar yang rajin lebih baik dan pelajar yang tidak terlibat lebih teruk. Analisis kertas itu sendiri menolak bingkai yang selesa itu: data penggunaan masa menunjukkan bahawa walaupun pelajar yang mula menggunakan AI secara bertanggungjawab melayang ke arah delegasi selama berbulan-bulan, membayangkan risiko tidak terhad kepada mereka yang tidak pernah berniat untuk belajar sejak awal.
Dilema dasar untuk sekolah
Penemuan mendarat pada saat yang janggal. Kerajaan dan firma edtech berlumba-lumba untuk meletakkan tutor AI di hadapan pelajar, dengan pertaruhan bahawa bantuan AI yang diperibadikan akan merapatkan jurang pencapaian. Kajian ini mencadangkan hasil yang bertentangan adalah mungkin pada skala: kerja rumah menjadi tanpa geseran, gred bertambah baik, dan pembelajaran yang diukur di bawahnya secara senyap terhakis — ditemui hanya apabila sudah terlambat untuk diperbaiki.
Bagi sekolah, implikasinya adalah konkrit. Jika kerja rumah tidak lagi boleh menjadi bukti pembelajaran, penilaian mesti bergerak dalam kelas dan dikawal. Jika penggunaan AI tidak dapat dielakkan, tugasan mungkin perlu direka bentuk semula mengikut teknologi - pertahanan lisan, sesi masalah dalam kelas dan penggredan berasaskan proses yang memberi ganjaran kepada perjuangan yang didapati oleh pelajar melangkau. Dan jika penyumberan luar meningkat dengan pendedahan, kelewatan tidak neutral: setiap bulan akses AI tidak berstruktur nampaknya memperdalam tabiat itu.
Sumbangan penyelidik adalah untuk menggantikan panik anekdot era ChatGPT-dalam-bilik darjah dengan nombor membujur, dan nombornya suram. Penambahbaikan kerja rumah sebanyak 18 peratus yang dibeli dengan kos penurunan peperiksaan sebanyak 20 peratus bukanlah keuntungan pembelajaran — ia adalah pemindahan kerja daripada pelajar ke mesin, dengan faedah yang perlu dibayar pada hari peperiksaan.
Kekal Mendahului AI
Untuk penemuan penyelidikan, kejatuhan dasar dan analisis jujur AI dalam pendidikan, tandai halaman AI Buzz Wire.
Baca lebih banyak berita AI →