Anthropic опубликовала исследование, показывающее, что автоматизированные системы искусственного интеллекта могут надежно устранять сбои в выравнивании модели, что может изменить подход к обеспечению безопасности в центре индустрии искусственного интеллекта. Статья под названием «Автоматизированные исследователи могут надежно устранить ошибки выравнивания» была опубликована в пятницу и подробно описана TechCrunch.
Исследование проводится в рамках стипендиальной программы Anthropic и возглавляется Чэнь Юэ-Ханом. Ее главное утверждение поразительно: когда автоматизированным исследовательским системам компании были заданы десять критериев, измеряющих конкретное несогласованное поведение, они улучшили производительность по каждому из них, не ухудшив при этом общие возможности модели. Для отрасли, которая изо всех сил старается поддерживать работу по обеспечению безопасности в соответствии с масштабом модели, это заметный результат. Подробнее об этой истории — в нашем последние разработки в ИИ.
Эта история появилась во время напряженного периода освещения вопросов безопасности ИИ. Это следует за летом, когда неправомерное поведение агентов доминировало в заголовках: от внутреннего отчета OpenAI об агентах, взламывающих вознаграждения, до призывов к независимому расследованию взлома Hugging Face. Новая статья Anthropic подходит к проблеме с противоположной стороны: вместо того, чтобы задаваться вопросом, как агенты плохо себя ведут, она спрашивает, можно ли доверять другим агентам, чтобы исправить их.
Что на самом деле сообщает газета
Система, описанная в статье, называется «Исследователь автоматического выравнивания» или AAR. Вместо того, чтобы заменять процесс исследования, AAR во многом повторяет его: каждая автоматизированная система ищет доступную литературу, предлагает метод и обучает модель с использованием этого метода в течение примерно 30 минут. Затем процесс повторяется в течение нескольких итераций.
Механизм выбора прост. Методы, которые перемещают эталон, сохраняются; методы, которые не отбрасываются. Этот цикл позволяет системе работать быстро и в масштабах, с которыми не может сравниться ни одна человеческая команда, параллельно тестируя множество направлений исследований и сохраняя только то, что работает.
По данным газеты, результаты были одинаковыми по всем направлениям. По всем десяти тестам, охватывающим конкретные случаи несовпадения, автоматизированные системы продемонстрировали измеримые улучшения без ущерба для общей производительности модели — обычный компромисс, который затрудняет работу по выравниванию.
«В целом, эти результаты дают первые доказательства того, что автоматическое выравнивание после обучения может стать практичным в ближайшем будущем», — говорится в документе.
Победа над людьми за 1/37 стоимости
Наиболее цитируемые отрывки в статье — это те, в которых AAR сравнивается непосредственно с его человеческими аналогами. Anthropic не стал уклоняться от сравнения.
«Лучший метод AAR превосходит то, что предлагают опытные люди, в среднем в течение шести часов», — говорится в статье. В нем многозначительно добавляется, что «направления исследований, проводимых человеком, не приводят к более высоким результатам».
Экономика такая же тупая. «AAR-анализ API стоит примерно 4 доллара в час по сравнению со 150 долларами в час, которые мы платим нашим исследователям-людям», — пишут авторы. Это разница в стоимости почти в 40 раз, и это объясняет, почему лаборатории серьезно относятся к автоматизированным исследованиям, а не как к диковинке.
Почему разница в стоимости имеет значение
Исследование выравнивания является дорогостоящим, и его легко недооценить. Каждое вмешательство кандидата должно быть реализовано, обучено и оценено по критериям, и большинство кандидатов терпят неудачу. Если система может непрерывно выполнять этот цикл поиска за счет вызовов API, предельные затраты на попытку еще одной идеи приближаются к нулю. Ограничение смещается от численности персонала к вычислениям.
Ограничения, антропогенные, сами по себе отмечены
В статье откровенно говорится о том, чего в результате не установлено. Автоматизированная система работает только в том случае, если тесты действительно отражают важные цели согласования, а создание и поддержание тестов, которые фиксируют реальное неправильное поведение, остается открытой проблемой в этой области.
Существует также зависимость, которую легко не заметить: автоматизированные исследователи опираются на существующую литературу по методам. Поддержание и расширение этой литературы само по себе является важной работой, и система, которая только смешивает известные методы, может достичь потолка, которого не достигло бы человеческое творчество.
Эти предостережения важны, потому что от них зависит долгосрочная значимость исследования. Если тесты измеряют неверные показатели, AAR может оптимизировать свой путь к высоким показателям, в то время как основные риски остаются нетронутыми. Формулировка Anthropic — «ранние доказательства», а не решение — отражает эту неопределенность.
Шаг к рекурсивному самосовершенствованию
Статья также способствует более широкой дискуссии о рекурсивном самосовершенствовании, идее о том, что системы искусственного интеллекта могут в конечном итоге улучшить сами процессы обучения, которые их производят. Обучение моделей ИИ с помощью других моделей ИИ стало популярной целью передовых лабораторий, и результат Anthropic — это ранний конкретный взгляд на то, как это выглядит в узкой области.
Логика проста. Если модели смогут надежно улучшить свою собственную тренировку выравнивания, то тот же самый механизм можно будет использовать и в более широких методах обучения, включая работу над возможностями. TechCrunch отмечает, что исследователи человеческого ИИ в конечном итоге могут стать менее центральными в этом процессе, и эта возможность сама статья рассматривает, а не избегает.
Что посмотреть дальше
Три вопроса определят, будет ли этот результат обобщающим. Во-первых, выдерживает ли этот подход десять тестов, протестированных Anthropic, в отношении режимов сбоев, которые являются более запутанными и менее четко определенными. Во-вторых, можно ли решить проблему поддержки эталонных показателей достаточно быстро, чтобы обеспечить честность автоматизированных исследований. В-третьих, публикуют ли другие лаборатории сопоставимые результаты, которые могли бы превратить одну статью в отраслевое направление.
На данный момент вывод узок, но реален: в конкретных задачах согласования, протестированных Anthropic, автоматизированные исследователи превзошли опытных людей, быстрее и намного дешевле. Безопасность в индустрии искусственного интеллекта, возможно, является первым местом, где исследователи искусственного интеллекта, а не люди, выполняют большую часть работы.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →