John Schulman, OpenAI-grundaren som nu fungerar som chefsforskare på Thinking Machines, sa att han förväntar sig rekursiv självförbättring – AI-system som accelererar sin egen utveckling – inom ungefär tre till fyra år, en tidslinje som placerar honom bland de mer aggressiva prognosmakarna på området. Schulman gav uppskattningen under ett rundabordsavsnitt av Dwarkesh Podcast som publicerades på fredagen, där tre fronter lab-forskare öppet diskuterade hur nära industrin faktiskt är sitt tak.
Samtalet erbjöd en sällsynt obevakad blick på hur forskare nära gränsen tänker på framsteg, och anlände mitt i en bullrig vecka där Nvidias VD Jensen Huang förklarade att "AGI har anlänt" och en grupp av 25 Fields Medalists varnar för att AI-benchmark-chasing skadar matematiken. För läsare som spårar den senaste AI-utvecklingen, är avsnittet en användbar motvikt: det här är människor som bygger systemen och de är skarpt oense med varandra.
Vem var vid bordet
Programledaren Dwarkesh Patel sa att han samlade panelen eftersom gästerna arbetar på vad han kallade "något öppna labb och företag", vilket betyder att de kunde tala på skivan. Till Schulman kom Beren Millidge, teknikchef på Zyphra, en startup som utvecklar modeller med öppen källkod, och Charlie O'Neill, chef för modellutbildning på Baseten.
Schulmans meriter ger hans tidslinjeprat särskild vikt. Han var med och grundade OpenAI och ledde förstärkningslärandet från forskning om mänsklig feedback som producerade teknikerna bakom ChatGPT, innan han åkte till Thinking Machines, där han nu fungerar som chefsforskare.
Fallet mot singulariteten, stålbemannad
Patel inledde med en spetsig fråga: om 2036 anländer utan att miljarder superintelligenta system förvandlar världen, vad kommer då att ha varit den tekniska orsaken? Millidge erbjöd det starkaste argumentet för skepsis, och beskrev vad han kallade ett nästan Moravecs paradoxliknande mönster där modeller överträffar vilka riktmärken forskare än sätter framför dem, men ändå gör den verkliga effekten besviken.
"Det finns fortfarande en ihållande klyfta mellan sim-till-verklighet som på något sätt blockerar allt", sa Millidge och beskrev en värld där AI blir "extremt bra på allt som människor sätter in i ett riktmärke" utan att generalisera ytterligare. Han tillade att han anser att detta resultat är osannolikt, och pekar på bevis på att förstärkningsinlärning redan generaliserar i praktiken.
Schulman höll i stort sett med om att framstegen inte är automatiska. Människor har verkliga fördelar jämfört med dagens modeller, sa han, och varje ny modellsläpp kommer ikapp på vissa områden samtidigt som de förblir flaskhalsar i andra - mönstret som har definierat de senaste produktcyklerna.
Tidslinjer för snabb eld: två år, tre till fyra, fem till tio
När Patel tryckte på siffror splittrades panelen. På frågan om när AI kan ge en tiofaldig produktivitetshöjning för en kompetent tjänsteman vägrade Schulman först att ge en enda siffra och sa sedan "jag skulle säga två år." Millidge sa att han "kan se det faktiskt" och hävdade att vinsten redan överstiger 10x för vissa kategorier av arbete. O'Neill var den mest konservativa och svarade "5 till 10" år.
Patel drev sedan vidare och karakteriserade scenariot som "i princip bara ASI." Schulmans svar: "Jag skulle säga 3-4 år," och tillade att automatisering av AI-forskning i sig är "inte en av de svåraste sakerna för AI, eftersom det innebär mycket" arbete som nuvarande tekniker redan kan närma sig. Utbytet var anmärkningsvärt för hur lite pushback uppskattningen drog från de andra forskarna.
Hur automatiserade forskare faktiskt skulle utbildas
En stor del av avsnittet handlade om mekaniken i scenariot Schulman prissatte. På frågan om hur AI-system som kan automatisera AI-forskning skulle tränas beskrev Schulman "någon kombination av att lära sig av mänsklig feedback för att absorbera forskarnas smak, och att bara skapa en massa övningsmiljöer som involverar forskning i flera steg."
Det svaret ansluter till vart branschens pengar tar vägen. Googles nyligen avslutade affär för Mechanize, en startup som bygger simulerade arbetsmiljöer för utbildningsagenter, speglar exakt denna satsning på att bättre träningsplatser – inte bara större modeller – kommer att driva nästa omgång av kapacitetsvinster. Schulman flaggade också för en kärnsvårighet: belöningsfunktioner byggda på naturliga data är svåra att specificera, och ytliga signaler som huruvida en användare accepterade en kodredigering kan vilseleda träning.
Destillation kontra centralisering
En av Schulmans mest konkreta förutsägelser gällde industristruktur. "Jag tror att destillation är det viktigaste som kämpar mot den centraliserande kraften", sa han och hävdade att förmågor som lärts genom förstärkningsinlärning relativt enkelt kan överföras till mindre modeller, och sprida gränsöverskridande kompetens bortom de få företag som har råd med gränsutbildningskörningar.
På frågan om vad som återstår för människor var Schulman kategorisk. "Jag skulle säga att det sista jobbet för människor, eller rollen för människor som varar längst, är att definiera målet och bestämma vad vi faktiskt vill ha", sa han. När Patel sammanfattade "anpassning är det sista jobbet", instämde Schulman: "Alignering är typ av svaret", samtidigt som det noterade att det sönderfaller till att räkna ut rätt mål och sedan faktiskt uppnå det.
Där avsnittet passar in i tidslinjedebatten
Avsnittets undertitel - "Vi är inte i närheten av taket" - fångar dess övergripande tenor: forskare som ser en betydande landningsbana framför sig, även när de ifrågasätter hur ojämn vägen kommer att vara. Diskussionen sträckte sig över vad som driver kinesiska labbs framsteg, huruvida förstärkningsinlärning med lång horisont kan framkalla allmän intelligens och varför RL har börjat fungera så bra som det har gjort.
Den offentliga debatten om tidslinjer har intensifierats från alla håll den här månaden. Huangs "AGI has arrived" proklamation drog skepsis från analytiker som läste det som ett affärscase snarare än ett vetenskapligt påstående, medan OpenAI:s vd Sam Altman sa till personalen att företaget är öppet för att bromsa spjutspetsutvecklingen när säkerhetsproblemen ökar, enligt Bloomberg. Schulmans tre-till-fyra-åriga fönster för rekursiv självförbättring ligger någonstans mellan marknadsföring och moratorium - en fungerande uppskattning från någon med erfarenhet av att bygga de tekniker som nu driver fältet.
Huruvida han har rätt kommer att bero på frågor som panelen bara cirklade i: om förstärkningsinlärning fortsätter att generaliseras förbi sina träningsmiljöer, och om klyftan mellan riktmärkeprestanda och verkligt ekonomiskt värde fortsätter att sluta.
Ligg före AI
Frontierforskare diskuterar AI:s gränser offentligt – följ historien när den utvecklas.
Läs fler AI-nyheter på AI Buzz Wire