Büyük bir dil modeli beşinci sınıfın ötesindeki materyali asla görmediğinde ne olur? Yedi araştırmacıdan oluşan bir ekip bu soruyu tam anlamıyla yanıtladı: ABD ilkokul müfredatına göre filtrelenmiş bir derleme üzerinde sıfırdan eğitilmiş 5 milyar parametreli bir LLM olan LittleLearner'ı geliştirdiler ve ardından herhangi bir şeyin (daha fazla parametre, daha fazla eğitim sonrası, daha akıllı yönlendirmeler) modeli eğitim öncesi verilerinin ona öğrettiğinin ötesine taşıyıp taşıyamayacağını test ettiler. Yanıtın hayır olduğunu bildiriyorlar.

"LittleLearner: Pedagojik Kontrollü Bilgiye Maruz Kalma Altındaki Dil Modelleri" makalesi 13 Ağustos'ta Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell ve Wieland Brendel tarafından arXiv'e sunuldu. 16 Ağustos'a gelindiğinde, araştırmacılar ve uygulayıcılar bunun endüstrinin favori varsayımı olan eğitim sonrası yeteneklerin yoktan var olabileceği varsayımı açısından ne anlama geldiğini tartışırken, 200'den fazla olumlu oy alan ve hızla tırmanan Hacker News tartışmasının konusu oldu. Bu tam olarak Yapay Zeka araştırma kapsamımızda beklediğimiz türden dikkatli, aykırı bir deney.

Bilgi Sınırına Sahip Bir Korumalı Alan

Modern Yüksek Lisans'lar esasen her konuda eğitilir; bu da gösterilen bir becerinin gerçekten eğitim sırasında mı öğrenildiğini yoksa yalnızca doğru yönlendirmeyle mi ortaya çıktığını söylemeyi neredeyse imkansız hale getirir. Takımın çözümü antrenman dağıtımını kısıtlamaktı. FineWeb-Edu'dan başlayarak, Küçük Müfredat olarak adlandırılan 88 milyar jetonluk bir külliyatı, anaokulundan 5. sınıfa kadar Ortak Çekirdek standartlarına göre hizalanmış beş aşamalı bir filtreleme hattı yoluyla damıttılar. 5. sınıfın üzerinde öğretilen kavramlar, gerçekler ve sözcükler açıkça hariç tutuldu.

Bu derlemede modelleri sıfırdan üç ölçekte (0,6B, 1,3B ve 5B parametreleri) eğittiler; her biri, aynı mimariye ve token bütçesine sahip, filtrelenmemiş veriler üzerinde eğitilmiş eşleşen bir kontrol modeliyle birlikte gönderildi. Sonuç, açık uçlu değerlendirme için yeterince akıcı olan (bir tarayıcıda barındırılan 5B sürümüyle sohbet edebilirsiniz) ancak keskin, yorumlanabilir bir bilgi sınırına sahip bir modeldir: İlköğretim müfredatında olmasaydı, model onu hiç görmemişti.

Edinim Değil, Ortaya Çıkarma

Temel bulgu çok açık: Modelleri daha akıllı hale getirmeye yönelik standart araç seti, LittleLearner'ın zaten bildiği şeyleri güçlendirdi, ancak hiçbiri kapsam dışı performansı anlamlı bir şekilde iyileştirmedi.

Ölçeklendirme, modelin kontrollü bilgisi dahilinde doğruluğu artırdı ve aynı öğrenme yörüngesi boyunca mütevazı bir şekilde genişletildi, ancak 5. sınıf materyallerinin ötesinde yetenek gerektiren problemler için çok az şey yaptı. Akıl yürütme modeli patlamasının çoğunun arkasındaki takviyeli öğrenme yöntemi olan GRPO ile eğitim sonrası, kapsam içi K-5 yeteneklerini önemli ölçüde artırdı, ancak kapsam dışı verilerle eğitilse bile K-5'in ötesindeki yetenekleri iyileştirmede başarısız oldu. Ve bağlam içi öğrenme, bilgiyi bir bilgi istemine doldurmanın günlük büyüsü, modelin sahip olduğu şeyi kullanmasına yardımcı oldu, ancak sınırların ötesinde yeni akıl yürütmenin kilidini açmadı.

Kısaca ön eğitim filtresi etkili yetenek tavanını belirler. Yazarlar sonucu, alanın sürekli olarak bulanıklaştırdığı bir ayrımın kanıtı olarak çerçeveliyorlar: eğitim sonrası ve teşvikin ortaya çıkarılması; ön eğitim kazanır.

Temiz Kontroller, Kamu Kontrol Noktaları

İddialara gücünü veren şey metodolojidir. Her LittleLearner modeli, eşleşen, filtrelenmemiş bir kontrolle (aynı mimari, aynı jeton sayısı, aynı eğitim tarifi) birlikte gönderildiğinden, ekip herhangi bir davranış farklılığını yalnızca müfredat filtresine bağlayabilir. MathCAMPS karşılaştırmasında sonradan eğitim alan matematik uzmanları, araştırmacıların performansı okul notuna göre derecelendirmesine ve kapsam dahilindeki yeteneğin tam olarak nerede bittiğini takip etmesine olanak tanıyor. Ve çoğu sınır gazetesinin aksine, her şey halka açıktır: HuggingFace'teki üç ölçekteki külliyat, üs ve eğitim sonrası kontrol noktaları ve barındırılan bir sohbet demosu, böylece bağımsız ekipler sınırı kendileri araştırabilir.

Bu açıklık Hacker News tartışmasını alevlendiriyor. Yorum yapanlar barındırılan modelin davranışını bilgi sınırında test ediyor (5. sınıftan sonra çekimser mi kalıyor, tahmin mi ediyor yoksa halüsinasyon mu görüyor) ve bunun sonuçları üzerinde tartışıyorlar: Bazıları sonuçları akıl yürütme modelinin abartılması için kötü haber olarak okuyor, diğerleri ise web ölçeğindeki ön eğitim verilerinin ilkokul kavramlarından çok daha fazlasını içerdiğini, dolayısıyla sınır modellerinin tavanlarının da buna uygun olarak daha yüksek olduğunu belirtiyor. Makalenin yazarları bu noktada dikkatli davranıyor: İddiaları, sınır laboratuvarları hakkında doğrudan bir tahmin değil, bilinen, kontrollü bir eğitime sahip bir model için standart müdahalelerin neler yapamayacağıyla ilgili.

Sınıfın Ötesi Neden Önemlidir

Deney doğrudan yapay zekadaki canlı tartışmalara hitap ediyor. Yapay zeka laboratuvarları, takviyeli öğrenmenin temel bir modeli ham yeteneklerinin çok ötesine taşıyabileceği fikrine dayanan eğitim sonrası rejimlere milyarlarca dolar harcıyor. LittleLearner, bu kazanımların büyük ölçüde eğitim öncesi verilerin desteklediği şeylerle sınırlı olabileceğini ve bunlarla sınırlı olabileceğini öne sürüyor. Bu, veri iyileştirmeye daha fazla önem verilmesi ve "ortaya çıkan" eğitim sonrası yetenek iddialarına şüpheyle yaklaşmak için bir argümandır.

Bu sürüm aynı zamanda yalnızca bir makale değil, gerçek bir araştırma aracıdır. Ekip, LittleCurriculum'ı ve tüm model kontrol noktalarını açık bir şekilde yayınladı ve proje sayfası, sanal alanın mümkün kıldığı deneylerin taslağını çiziyor: RL'nin onu ödüllendirmek yerine gerçekten yetenek yaratıp yaratamayacağı, bir modelin negatif sayılar gibi gerçekten yeni bir kavramı tanıtıldığında örnek açısından ne kadar verimli bir şekilde öğrendiği ve kesirleri öğrenirken makinelerin ve çocukların benzer maruz kalmaya ihtiyaç duyup duymadığı veya benzer hatalar yapıp yapmadığı.

Nadiren temiz kontrollere sahip olan bir alan için açıkça belirtilen eğitime sahip bir model nadir bir hediyedir. Ve diğer herkes için bu, masanın üzerine asılmaya değer bir hatırlatmadır: hiçbir model veya kişi, kendilerine asla öğretilmeyen bir şeyin dışına çıkamaz.

Yapay Zekanın Önünde Kalın

Yapay zekayı yeniden şekillendiren araştırmanın hakemli dereceli kapsamı günlük olarak sunulmaktadır. En son yapay zeka gelişmeleri için merkezimize yer işareti koyun.

Daha fazla AI haberini okuyun →