John Schulman, co-fondatorul OpenAI, care este acum om de știință șef la Thinking Machines, a spus că se așteaptă la auto-îmbunătățire recursivă - sistemele AI care își accelerează propria dezvoltare - în aproximativ trei până la patru ani, o cronologie care îl plasează printre cei mai agresivi prognozatori din domeniu. Schulman a dat estimarea în timpul unui episod de masă rotundă al Podcast-ului Dwarkesh publicat vineri, în care trei cercetători de laborator de frontieră au dezbătut deschis cât de aproape este de fapt industria de plafonul său.
Conversația a oferit o privire rară și nepăzită asupra modului în care cercetătorii din apropierea frontierei se gândesc la progres, sosind în mijlocul unei săptămâni zgomotoase în care CEO-ul Nvidia, Jensen Huang, a declarat că „a sosit AGI” și un grup de 25 de medaliați Fields avertizează că urmărirea benchmark-urilor AI dăunează matematicii. Pentru cititorii care urmăresc cele mai recente evoluții AI, episodul este o contrapondere utilă: aceștia sunt oameni care construiesc sistemele și nu sunt de acord unul cu celălalt.
Cine era la masă
Gazda Dwarkesh Patel a spus că a asamblat panoul pentru că oaspeții lucrează la ceea ce el a numit „laboratoare și companii oarecum deschise”, ceea ce înseamnă că ar putea vorbi în înregistrare. S-au alăturat lui Schulman Beren Millidge, director de tehnologie la Zyphra, un startup care dezvoltă modele open-source, și Charlie O'Neill, șef de formare pentru modele la Baseten.
Acreditările lui Schulman conferă discuției sale cronologice o importanță deosebită. El a co-fondat OpenAI și a condus învățarea de întărire din cercetarea feedback-ului uman care a produs tehnicile din spatele ChatGPT, înainte de a pleca la Thinking Machines, unde acum servește ca om de știință șef.
Cazul împotriva singularității, cu echipaj de oțel
Patel a deschis cu o întrebare ascuțită: dacă 2036 va ajunge fără miliarde de sisteme superinteligente care să transforme lumea, care va fi motivul tehnic? Millidge a oferit cele mai puternice argumente pentru scepticism, descriind ceea ce el a numit un model aproape paradoxal al lui Moravec, în care modelele se ocupă de orice criterii de referință puse cercetătorii în fața lor, dar impactul în lumea reală dezamăgește.
„Există încă un decalaj persistent sim-to-real care blochează cumva totul”, a spus Millidge, descriind o lume în care AI devine „extrem de bună la tot ceea ce oamenii pun într-un etalon”, fără a generaliza mai mult. El a adăugat că consideră că acest rezultat este puțin probabil, indicând dovezi că învățarea prin consolidare se generalizează deja în practică.
Schulman a fost în mare măsură de acord că progresul nu este automat. Oamenii dețin avantaje reale față de modelele de astăzi, a spus el, iar fiecare lansare de model nou ajunge din urmă în unele domenii, rămânând în același timp blocat în altele - modelul care a definit ultimele mai multe cicluri de produs.
Cronologie cu foc rapid: doi ani, trei până la patru, cinci până la zece
Când Patel a apăsat pentru numere, panoul s-a împărțit. Întrebat când AI ar putea oferi o creștere de zece ori a productivității unui muncitor competent, Schulman a refuzat mai întâi să dea o singură cifră, apoi a spus „Aș spune doi ani”. Millidge a spus că ar putea „cumva să vadă asta, de fapt”, argumentând că câștigul depășește deja de 10 ori pentru unele categorii de muncă. O'Neill a fost cel mai conservator, a răspuns „de la 5 la 10” ani.
Patel a continuat apoi, caracterizand scenariul drept „practic doar ASI”. Răspunsul lui Schulman: „Aș spune 3-4 ani”, adăugând că automatizarea cercetării AI în sine „nu este unul dintre cele mai dificile lucruri pentru AI, deoarece implică multă” muncă pe care tehnicile actuale o pot aborda deja. Schimbul a fost remarcabil pentru cât de puțină respingere a atras estimarea de la ceilalți cercetători.
Cum ar fi de fapt pregătiți cercetătorii automatizați
O parte substanțială a episodului s-a ocupat de mecanica scenariului în care se prețuia Schulman. Întrebat cum ar fi antrenate sistemele AI capabile să automatizeze cercetarea AI, Schulman a descris „o combinație de învățare din feedback-ul uman pentru a absorbi gustul cercetătorilor și doar crearea multor medii de practică care implică efectuarea de cercetări în mai multe etape”.
Răspunsul se leagă de unde merg banii industriei. Acordul recent încheiat de Google pentru Mechanize, un startup care creează medii de lucru simulate pentru agenții de formare, reflectă exact acest pariu că terenuri de antrenament mai bune - nu doar modele mai mari - vor conduce următoarea rundă de câștiguri de capacitate. Schulman a semnalat, de asemenea, o dificultate de bază: funcțiile de recompensă construite pe date naturale sunt greu de specificat, iar semnalele superficiale, cum ar fi dacă un utilizator a acceptat o modificare a codului, pot induce în eroare antrenamentul.
Distilarea versus centralizare
Una dintre cele mai concrete previziuni ale lui Schulman a vizat structura industriei. „Cred că distilarea este principalul lucru care luptă împotriva forței de centralizare”, a spus el, susținând că capacitățile învățate prin învățare prin consolidare pot fi transferate relativ ușor către modele mai mici, răspândind competența adiacentă frontierei dincolo de puținele companii care își pot permite curse de formare de frontieră.
Cu privire la întrebarea ce rămâne pentru oameni, Schulman a fost categoric. „Aș spune că ultimul loc de muncă pentru oameni, sau rolul oamenilor care va dura cel mai mult, este definirea obiectivului și deciderea ce ne dorim de fapt”, a spus el. Când Patel a rezumat „alinierea este sarcina finală”, Schulman a fost de acord: „Alinierea este un fel de răspuns”, în timp ce a remarcat că se descompune în găsirea obiectivului potrivit și apoi realizarea efectivă a acestuia.
Unde se încadrează episodul în dezbaterea cronologică
Subtitlul episodului – „Nu suntem nicăieri aproape de plafon” – surprinde tenorul său general: cercetătorii care văd o pistă substanțială în față, chiar dacă contestă cât de accidentată va fi calea. Discuția a vizat ceea ce conduce la progresul laboratoarelor chineze, dacă învățarea pe orizont lung poate obține inteligență generală și de ce RL a început să funcționeze la fel de bine cum a făcut-o.
Dezbaterea publică asupra termenelor s-a intensificat din toate părțile în această lună. Declarația lui Huang „AGI a sosit” a atras scepticismul analiștilor care au citit-o ca un caz de afaceri mai degrabă decât o afirmație științifică, în timp ce CEO-ul OpenAI, Sam Altman, a declarat personalului că compania este deschisă să încetinească dezvoltarea de ultimă oră pe măsură ce preocupările de siguranță cresc, potrivit Bloomberg. Perioada de trei până la patru ani a lui Schulman pentru auto-îmbunătățirea recursivă se află undeva între marketing și moratoriu - o estimare de lucru de la cineva cu experiență în construirea tehnicilor care conduc acum domeniul.
Dacă are dreptate, va depinde de întrebările pe care panelul le-a făcut doar în cerc: dacă învățarea prin consolidare continuă să se generalizeze dincolo de mediile sale de antrenament și dacă decalajul dintre performanța de referință și valoarea economică reală continuă să se reducă.
Rămâi înaintea AI
Cercetătorii de frontieră dezbat limitele AI în public – urmăriți povestea pe măsură ce se dezvoltă.
Citiți mai multe știri despre AI pe AI Buzz Wire