Джон Шульман, соучредитель OpenAI, который сейчас является главным научным сотрудником Thinking Machines, сказал, что он ожидает рекурсивного самосовершенствования — систем искусственного интеллекта, ускоряющих свое собственное развитие — примерно через три-четыре года, и это сроки, которые ставят его в число наиболее агрессивных прогнозистов в этой области. Шульман дал оценку во время круглого стола в подкасте Dwarkesh, опубликованном в пятницу, в котором три исследователя пограничной лаборатории открыто обсуждали, насколько близка отрасль на самом деле к своему потолку.
Беседа позволила взглянуть на то, как исследователи, находящиеся на переднем крае, думают о прогрессе, и появилась на фоне шумной недели, когда генеральный директор Nvidia Дженсен Хуанг заявил, что «AGI прибыл», а группа из 25 медалистов Филдса предупреждает, что погоня за тестами ИИ вредит математике. Для читателей, следящих за последними разработками в области искусственного интеллекта, этот эпизод является полезным противовесом: это люди, создающие системы, и они резко не согласны друг с другом.
Кто был за столом
Ведущий Дваркеш Патель сказал, что собрал группу, потому что гости работают в так называемых «открытых лабораториях и компаниях», то есть они могут говорить под запись. К Шульману присоединились Берен Миллидж, технический директор Zyphra, стартапа, разрабатывающего модели с открытым исходным кодом, и Чарли О'Нил, руководитель отдела обучения моделей в Baseten.
Полномочия Шульмана придают его докладу о хронологии особую значимость. Он стал соучредителем OpenAI и руководил обучением с подкреплением на основе исследований обратной связи с людьми, в результате которых были созданы методы, лежащие в основе ChatGPT, прежде чем перейти в Thinking Machines, где он сейчас работает главным научным сотрудником.
Дело против сингулярности, стальное вооружение
Патель начал с острого вопроса: если 2036 год наступит без миллиардов сверхразумных систем, преобразующих мир, какова будет техническая причина? Миллидж представил самые веские аргументы в пользу скептицизма, описав то, что он назвал почти парадоксальным паттерном Моравека, в котором модели превосходят любые тесты, которые ставят перед ними исследователи, но реальный результат разочаровывает.
«Все еще существует некий постоянный разрыв между симуляцией и реальностью, который каким-то образом блокирует все», — сказал Миллидж, описывая мир, в котором ИИ становится «чрезвычайно хорош во всем, что люди закладывают в тесты», не делая дальнейших обобщений. Он добавил, что считает такой результат маловероятным, указав на доказательства того, что обучение с подкреплением уже распространяется на практике.
Шульман в целом согласился с тем, что прогресс не происходит автоматически. По его словам, люди обладают реальными преимуществами перед сегодняшними моделями, и каждая новая модель догоняет их в одних областях, оставаясь при этом узким местом в других — эта закономерность определяла последние несколько циклов разработки продукта.
Быстрые сроки: два года, три-четыре, пять-десять
Когда Патель нажал на цифры, панель разделилась. На вопрос, когда ИИ сможет обеспечить десятикратное повышение производительности компетентного служащего, Шульман сначала отказался назвать конкретную цифру, а затем ответил: «Я бы сказал, два года». Миллидж сказал, что он «на самом деле это вроде как видит», утверждая, что прирост уже превышает 10 раз для некоторых категорий работ. О'Нил был самым консервативным, ответив «от 5 до 10 лет».
Затем Патель пошел еще дальше, охарактеризовав этот сценарий как «по сути просто ИСИ». Ответ Шульмана: «Я бы сказал, 3-4 года», добавив, что автоматизация исследований ИИ сама по себе «не является одной из самых сложных задач для ИИ, потому что она включает в себя много» работы, с которой современные методы уже могут справиться. Обсуждение было примечательно тем, как мало сопротивления вызвала оценка со стороны других исследователей.
Как на самом деле будут обучать автоматизированных исследователей
Значительная часть эпизода была посвящена механике сценария, который оценивал Шульман. Отвечая на вопрос, как будут обучаться системы искусственного интеллекта, способные автоматизировать исследования в области ИИ, Шульман описал «некоторое сочетание обучения на основе отзывов людей, чтобы впитать вкусы исследователей, и просто создание множества практических сред, которые включают в себя проведение многоэтапных исследований».
Этот ответ связан с тем, куда идут деньги отрасли. Недавно завершенная сделка Google с Mechanize, стартапом, создающим моделируемую рабочую среду для обучающих агентов, отражает именно ставку на то, что лучшие тренировочные площадки, а не просто более крупные модели, будут способствовать следующему раунду роста возможностей. Шульман также отметил основную трудность: функции вознаграждения, построенные на естественных данных, трудно определить, а поверхностные сигналы, например, принял ли пользователь редактирование кода, могут ввести в заблуждение при обучении.
Дистилляция против централизации
Одно из самых конкретных предсказаний Шульмана касалось структуры промышленности. «Я думаю, что дистилляция — это главное, что борется с силой централизации», — сказал он, утверждая, что способности, полученные с помощью обучения с подкреплением, можно относительно легко перенести на более мелкие модели, распространяя передовые компетенции за пределы немногих компаний, которые могут позволить себе обучение на передовых рубежах.
В вопросе о том, что остается человеку, Шульман был категоричен. «Я бы сказал, что последняя работа для людей или роль, которая продлится дольше всего, — это определение цели и решение того, чего мы на самом деле хотим», — сказал он. Когда Патель резюмировал, что «согласование — это конечная задача», Шульман согласился: «Согласование — это своего рода ответ», отметив при этом, что оно сводится к выяснению правильной цели и затем фактическому ее достижению.
Как эпизод вписывается в дебаты о сроках
Подзаголовок эпизода — «Мы далеки от потолка» — отражает его общий смысл: исследователи, которые видят впереди значительную взлетную полосу, даже несмотря на то, что они спорят, насколько ухабистым будет этот путь. Дискуссия велась вокруг того, что движет прогрессом китайских лабораторий, может ли долгосрочное обучение с подкреплением повысить общий интеллект и почему RL начало работать так хорошо.
В этом месяце общественные дебаты по поводу сроков активизировались со всех сторон. Заявление Хуанга «AGI прибыло» вызвало скептицизм со стороны аналитиков, которые восприняли его как экономическое обоснование, а не как научное утверждение, в то время как генеральный директор OpenAI Сэм Альтман заявил сотрудникам, что компания открыта для замедления передовых разработок, поскольку проблемы безопасности растут, по данным Bloomberg. Трех-четырехлетнее окно Шульмана для рекурсивного самосовершенствования находится где-то между маркетингом и мораторием — это рабочая оценка человека, имеющего опыт разработки методов, которые сейчас являются движущей силой этой области.
Прав ли он, будет зависеть от вопросов, которые группа лишь обвела в кружок: продолжает ли обучение с подкреплением обобщать свою среду обучения и продолжает ли сокращаться разрыв между эталонными показателями и реальной экономической ценностью.
Будьте впереди ИИ
Исследователи Frontier публично обсуждают ограничения ИИ — следите за развитием событий.
Подробнее читайте на AI Buzz Wire