John Schulman, spoluzakladatel OpenAI, který nyní působí jako hlavní vědec ve společnosti Thinking Machines, řekl, že očekává rekurzivní sebezdokonalování – systémy AI urychlující svůj vlastní vývoj – zhruba za tři až čtyři roky, což je časová osa, která ho řadí mezi agresivnější prognostiky v oboru. Schulman uvedl odhad během epizody kulatého stolu v pátek zveřejněném Dwarkesh Podcast, ve kterém tři výzkumníci z hraničních laboratoří otevřeně diskutovali o tom, jak blízko je průmysl ke svému stropu.

Konverzace nabídla vzácný nestřežený pohled na to, jak vědci poblíž hranic přemýšlejí o pokroku, dorazili uprostřed hlučného týdne, kdy generální ředitel Nvidia Jensen Huang prohlásil, že „AGI dorazila“ a skupina 25 Fields Medalists varuje, že AI benchmark-honba poškozuje matematiku. Pro čtenáře sledující [nejnovější vývoj AI] (https://aibuzzwire.news) je epizoda užitečnou protiváhou: jsou to lidé, kteří vytvářejí systémy, a ostře spolu nesouhlasí.

Kdo byl u stolu

Moderátor Dwarkesh Patel řekl, že panel sestavil, protože hosté pracují v takzvaných „poněkud otevřených laboratořích a společnostech“, což znamená, že mohou mluvit na záznam. K Schulmanovi se připojili Beren Millidge, technologický ředitel společnosti Zyphra, startupu vyvíjejícím open-source modely, a Charlie O'Neill, vedoucí modelového školení ve společnosti Baseten.

Schulmanovy pověřovací listiny dávají jeho rozhovoru na časové ose zvláštní váhu. Před odchodem do Thinking Machines, kde nyní působí jako hlavní vědec, byl spoluzakladatelem OpenAI a vedl posilující učení z výzkumu lidské zpětné vazby, který vytvořil techniky stojící za ChatGPT.

Případ proti singularitě, s ocelovou posádkou

Patel zahájil ostrou otázku: pokud přijde rok 2036, aniž by svět přetvořily miliardy superinteligentních systémů, jaký byl technický důvod? Millidge nabídl nejsilnější argument pro skepticismus, když popsal to, co nazval téměř Moravcův vzor ve stylu paradoxu, v němž modely překonávají všechna měřítka, která jim výzkumníci předloží, ale dopad v reálném světě zklame.

"Stále existuje určitá trvalá mezera mezi simulací a realitou, která nějak vše blokuje," řekl Millidge a popsal svět, kde se umělá inteligence stává "extrémně dobrou ve všem, co lidé dávají do benchmarku", aniž by to dále zobecňovali. Dodal, že tento výsledek považuje za nepravděpodobný a poukázal na důkazy, že posilování učení již v praxi zobecňuje.

Schulman do značné míry souhlasil s tím, že pokrok není automatický. Lidé mají oproti dnešním modelům skutečné výhody, řekl, a každé nové vydání modelu se v některých oblastech vyrovná, zatímco v jiných zůstává úzké hrdlo – vzorec, který definoval několik posledních produktových cyklů.

Časové osy rychlé palby: dva roky, tři až čtyři, pět až deset

Když Patel stiskl čísla, panel se rozdělil. Na otázku, kdy by umělá inteligence mohla přinést desetinásobné zvýšení produktivity pro schopného bílého límečku, Schulman nejprve odmítl uvést jediné číslo a pak řekl: „Řekl bych, že dva roky“. Millidge řekl, že to „tak nějak vlastně vidí“, argumentoval tím, že zisk už u některých kategorií práce překračuje 10x. O'Neill byl nejkonzervativnější, odpověděl „5 až 10“ let.

Patel poté pokročil dále a charakterizoval scénář jako „v podstatě jen ASI“. Schulmanova odpověď: „Řekl bych 3–4 roky,“ a dodal, že automatizace výzkumu AI sama o sobě „není jednou z nejtěžších věcí pro AI, protože zahrnuje spoustu“ práce, které se současné techniky již mohou přiblížit. Tato výměna byla pozoruhodná tím, jak malý odraz od ostatních výzkumníků odhad vyvolal.

Jak by se ve skutečnosti školili automatizovaní výzkumníci

Podstatná část epizody se zabývala mechanikou scénáře, který Schulman nacenil. Na otázku, jak by se trénovaly systémy AI schopné automatizovat výzkum AI, Schulman popsal „nějakou kombinaci učení z lidské zpětné vazby, aby bylo možné absorbovat chuť výzkumníků, a jen vytváření mnoha praktických prostředí, která zahrnují provádění vícestupňového výzkumu“.

Tato odpověď souvisí s tím, kam jdou peníze v tomto odvětví. Nedávno dokončená dohoda společnosti Google pro Mechanize, startup, který vytváří simulovaná pracovní prostředí pro školicí agenty, přesně odráží tuto sázku, že lepší tréninková hřiště – nejen větší modely – budou řídit další kolo zvyšování schopností. Schulman také upozornil na základní problém: funkce odměňování postavené na přirozených datech se těžko specifikují a povrchní signály, jako zda uživatel přijal úpravu kódu, mohou vést k omylu při školení.

Destilace versus centralizace

Jedna z nejkonkrétnějších Schulmanových předpovědí se týkala struktury průmyslu. „Myslím si, že destilace je hlavní věcí, která bojuje proti centralizační síle,“ řekl s argumentem, že schopnosti naučené prostřednictvím posilovacího učení lze relativně snadno přenést na menší modely, čímž se rozšíří kompetence sousedící s hranicemi za několik málo společností, které si mohou dovolit běhy na hraniční školení.

V otázce, co zůstává pro lidi, byl Schulman kategorický. "Řekl bych, že poslední práce pro lidi, nebo role pro lidi, která bude trvat nejdéle, je definování cíle a rozhodnutí, co vlastně chceme," řekl. Když Patel shrnul „zarovnání je poslední úkol“, Schulman souhlasil: „Zarovnání je svým způsobem řešením“, přičemž poznamenává, že se rozkládá na nalezení správného cíle a jeho skutečné dosažení.

Kde epizoda zapadá do debaty o časové ose

Podtitul epizody — „Nikde nejsme u stropu“ — vystihuje její celkový charakter: vědci, kteří před sebou vidí značnou dráhu, i když se přou o to, jak hrbolatá cesta bude. Diskuse se týkala toho, co je hnacím motorem pokroku čínských laboratoří, zda učení s dlouhým horizontem může vyvolat všeobecnou inteligenci a proč RL začala fungovat tak dobře, jak funguje.

Veřejná debata o termínech se tento měsíc na všech stranách zintenzivnila. Huangovo prohlášení „AGI dorazilo“ vyvolalo skepsi od analytiků, kteří to četli jako obchodní případ spíše než jako vědecké tvrzení, zatímco generální ředitel OpenAI Sam Altman zaměstnancům řekl, že společnost je podle Bloombergu otevřena zpomalení špičkového vývoje, protože narůstají obavy o bezpečnost. Schulmanovo tří až čtyřleté okno pro rekurzivní sebezdokonalování leží někde mezi marketingem a moratoriem – pracovní odhad od někoho, kdo má zkušenosti s budováním technik, které nyní řídí pole.

Zda má pravdu, bude záležet na otázkách, které panel pouze zakroužkoval: zda se posilovací učení stále zobecňuje mimo jeho školicí prostředí a zda se propast mezi výkonností ve srovnávacích testech a skutečnou ekonomickou hodnotou nadále uzavírá.

Udržujte si náskok před AI

Frontier výzkumníci diskutují o limitech umělé inteligence na veřejnosti – sledujte příběh, jak se vyvíjí.

Přečtěte si další zprávy o AI na AI Buzz Wire