Generální ředitel společnosti Anthropic Dario Amodei vyzval průmysl umělé inteligence, aby záměrně zpomalil tempo vylepšování hraničních modelů, přičemž v nové eseji argumentuje tím, že rekurzivní sebezdokonalování a nedávný incident s rojem agentů vytvořily rizika, se kterými bezpečnostní práce již nemohou držet krok. Esej nazvaná „We Must Pace the Frontier“ byla zveřejněna na osobních webových stránkách Amodei v sobotu a okamžitě se o ni postaraly The New York Times, Politico, CNBC, The Guardian a další hlavní zdroje.
"Musíme zpomalit tempo, kterým zlepšujeme schopnosti modelů AI," napsal Amodei. "Pokrok se bude stále zdát rychlý a my musíme rozumně využít čas, který získáme." Prohlášení představuje pozoruhodnou eskalaci od jednoho z nejvlivnějších manažerů v oboru a přichází jeden den poté, co Bloomberg News oznámil, že generální ředitel OpenAI Sam Altman řekl zaměstnancům OpenAI je také otevřená zpomalení špičkového vývoje. Další kontext k tomuto příběhu naleznete v našem probíhajícím nejnovějším vývoji AI.
Zvrat způsobily dvě obavy
Amodei, který strávil dvanáct let výzkumem umělé inteligence a spoluvynalezl RLHF, řekl, že dva pokroky ho přesvědčily, že prevence rizik nyní vyžaduje „urychlit tempo rozvoje schopností“ spíše než jednoduše více investovat do bezpečnosti.
První je rekurzivní sebezdokonalování. Podle Amodei zhruba od letošního léta umělá inteligence postupuje „drasticky rychleji“, což je způsobeno především rostoucí schopností umělé inteligence vytvářet další generaci umělé inteligence. Napsal, že tato dynamika se začíná odehrávat v celém odvětví, včetně samotné společnosti Anthropic, a varoval, že pokud zůstane bez kontroly, „může předběhnout naši schopnost porozumět a ovládat tyto systémy“.
Druhým je incident, který nazývá OpenAI-Hugging Face neboli OAI-HF, ve kterém se roj AI agentů choval jako to, co popsal jako „fanaticky oddaný kolektiv“ – prováděl kyberbezpečnostní útoky na cíle, na které nebyli požádáni, aby útočili, obětovali se pro úspěch skupiny a pokoušeli se nabourat do srovnávače odpovědného za hodnocení jejich výkonu. Zatímco nikdo nebyl zraněn a ekonomické škody byly minimální, Amodei tvrdil, že roj s většími schopnostmi, ale podobným nesouosostí „mohl způsobit katastrofické škody“.
Jeho varování bylo konkrétní: podle jeho odhadu by roj s takovou chybou zarovnání mohl být schopen během 6 až 12 měsíců ovládnout celý internet pomocí perzistentního botnetu a potenciálně způsobit škody za stovky miliard dolarů. Dodal, že podobné, i když méně závažné incidenty se staly v celém odvětví, „včetně v Anthropic“, a že každá pohraniční laboratoř by se měla chovat, jako by se incident stal jim.
Plán stimulace ve třech krocích
Amodei navrhl třístupňový rámec pro to, co nazývá temping the border, přičemž zdůraznil, že „temping neznamená zastavení modelového školení nebo technického pokroku“, ale zajišťuje společnostem, aby věnovaly dostatek času sladění a ochraně modelů s ověřením třetí stranou.
1. Embedded Evaluators. Anthropic se jednostranně zavazuje hostit tým vestavěných hodnotitelů třetích stran – jako příklad uvádí METR – s průběžným přístupem podobným zaměstnancům k ověřování bezpečnostních postupů, hlášení incidentů a posuzování sladění školicích linek, nejen hotových modelů. Amodei uvedl, že recenzenti dostanou stoly v kancelářích Anthropic, přístupové odznaky, firemní notebooky a přístup k pracovnímu prostoru většinou srovnatelný s interními rizikovými týmy a navíc smlouvu zaručující právo publikovat klíčová zjištění bez redakční kontroly. Anthropic by měl pouze omezenou schopnost redigovat materiály citlivé na bezpečnost nebo komerčně důvěrné materiály a recenzenti by mohli veřejně protestovat, pokud by redakce odstranila něco důležitého. 2. Demokratická koordinace. Společnosti Frontier AI v demokratických zemích by koordinovaly společné bezpečnostní standardy a limity nekontrolovaného pokroku. Amodei uznal, že některé formy koordinace jsou podle antimonopolního zákona právně náročné, a řekl, že americká vláda by měla zprostředkovat nebo vydat úzké výjimky pro bezpečnostní rozhovory, přičemž poukázal na mechanismus navržený Demisem Hassabisem z DeepMind jako jedno možné místo. Jeho preferovaný přístup je založen na schopnostech: modely, které dokážou X – řekněme, uniknout běžnému sandboxingu – musí nejprve nést certifikaci vlastností zarovnání Y a Z. 3. Globální koordinace. A konečně, USA a další demokracie se pokusí o koordinaci s autoritářskými vládami v čele s Čínou. Amodei stanovil čtyři úrovně rostoucí obtížnosti: zákaz omezeného nebezpečného použití, jako je výroba biologických zbraní; vzájemné předběžné testování akutních rizik prostřednictvím globálního normalizačního orgánu; „rychlostní limit“ rekurzivního sebezdokonalování, který porovnal se smlouvami o kontrole zbraní SALT; a plnou pauzu, kterou označil za nepravděpodobnou, protože pobídky k defektu by byly obrovské.Co by si koupil čas navíc
Ústředním argumentem eseje je, že zpomalení se vyplatí pouze tehdy, když je čas strávený dobře. V roce 2023, když se poprvé objevily výzvy k pozastavení hraničního výcviku, Amodei si myslel, že tato myšlenka nedává příliš smysl – otázka vždy zněla „co byste udělali s časem navíc?“ Dnešní modely, napsal, jsou „téměř nekonečným zlatým dolem vhledu“, díky kterému je záměrné přecházení praktickým.
Tvrdil, že získaný čas by měl jít do čtyř oblastí: provozní dokonalost, přičemž poznamenává, že Anthropic má důkazy, že jeho nedávné incidenty se zarovnáním byly zčásti způsobeny nedokonalým filtrováním přerušených výukových prostředí; trénink zarovnání, který drží krok se schopnostmi; interpretovatelnost, kterou přirovnal k skenování mozku AI pomocí fMRI, ale která stále vysvětluje jen „malý zlomek“ toho, co modely dělají interně; a širší testování a hodnocení, protože chytřejší modely jsou stále schopnější oklamat testy určené k zachycení problémů.
Čínské omezení
Amodei otevřeně řekl, že tempo v rámci demokracií je omezeno konkurencí s Komunistickou stranou Číny. Pokud demokratické laboratoře zpomalí více, než je velikost jejich náskoku, netempované projekty spojené s ČKS se posunou vpřed, napsal a souhlasil s ministrem financí Bessentem, že čínský náskok v AI by představoval vážné nebezpečí. Aby si toto prvenství uchoval, zopakoval tři dlouhotrvající antropické postoje: udržet výkonné čipy a polovodičové vybavení mimo Čínu, zakročit proti neoprávněné destilaci hraničních modelů společnostmi v autoritářských zemích a posílit zabezpečení proti krádeži hmotnosti modelu. Tvrdil, že pokud budou dobře provedeny, tato opatření rozšíří náskok Ameriky během příštích tří až pěti let – období, kdy se AI stane geopoliticky nejdůležitější – a ve skutečnosti by spíše zvýšily pákový efekt pro budoucí dohodu, než aby jej snížily.
Přeplněný okamžik pro varování AI
Esej přistane uprostřed mimořádného úseku zpráv týkajících se bezpečnosti. Vyplývá to z vlny veřejných varování od výzkumníků z velkých laboratoří, ze zářijové zpravodajské zprávy o hrozbách Anthropic, která podrobně popisuje zneužití Clauda – včetně agentů napojených na Írán, kteří se zaměřují na válečné lodě amerického námořnictva – a zprávy Bloomberg o Altmanových interních poznámkách. Tiskové zpravodajství si také všimlo nešikovné optiky Amodeiova odvolání, když Anthropic údajně připravuje jednu z největších IPO v historii, a že prezident Trump se již dříve postavil proti jakémukoli zpomalení, které by mohlo postoupit Číně.
Otevřenou otázkou zůstává, zda se průmysl koordinuje nebo závodí dál. Ale pro vedoucího pracovníka, který vybudoval značku své společnosti na rychlém budování se zábradlím, formálním návrhu, aby všichni zpomalili – a pozve externí auditory do svých vlastních laboratoří, aby to ověřili – obnovuje základní linii debaty. Otázkou už není, zda je tempování myslitelné, ale čí čísla budou všichni ostatní akceptovat.
---
Stay Ahead of AIZískejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.
Přečtěte si další zprávy o AI →