Anthropic опублікував дослідження, яке показує, що автоматизовані системи штучного інтелекту можуть надійно виправляти помилки вирівнювання моделі, результат, який може змінити спосіб роботи з безпеки в центрі індустрії штучного інтелекту. Стаття під назвою «Автоматизовані дослідники можуть надійно зменшити помилки вирівнювання» була опублікована в п’ятницю та детально описана TechCrunch.
Дослідження є результатом програми стипендіатів Anthropic під керівництвом Чена Юе-Хана. Його головне твердження вражає: коли автоматизовані дослідницькі системи компанії були спрямовані на десять тестів, що вимірюють конкретні неузгоджені поведінки, вони покращили продуктивність кожного окремого — без погіршення загальних можливостей моделі. Для галузі, яка намагалася підтримувати роботу з безпеки в ногу з модельним масштабом, це помітний результат. For more context on this story, see our ongoing artificial intelligence updates.
Ця історія потрапила під час напруженої розмови про безпеку ШІ. Це сталося після літа, коли неналежна поведінка агентів домінувала в заголовках газет, від внутрішнього звіту OpenAI про агентів-хакерів винагород до закликів до незалежного розслідування злому Hugging Face. Нова стаття Anthropic підходить до проблеми з протилежного боку: замість того, щоб запитувати, як агенти поводяться неправильно, вона запитує, чи можна довіряти іншим агентам, щоб їх виправити.
Про що насправді повідомляє газета
Система, описана в статті, називається Automated Alignment Researcher або AAR. Замість того, щоб замінити дослідницький процес, AAR повторює його більшу частину: кожна автоматизована система шукає доступну літературу, пропонує метод і навчає модель за цим методом протягом приблизно 30 хвилин. Потім процес повторюється через кілька ітерацій.
Механізм відбору простий. Методи, які переміщують еталон, зберігаються; методи, які не відкидаються. Цей цикл дозволяє системі працювати швидко та в такому масштабі, з яким не зрівняється жодна людська команда, паралельно тестуючи багато напрямків досліджень і зберігаючи лише те, що працює.
Згідно з документом, результати були послідовними за всіма напрямками. На всіх десяти контрольних тестах, що охоплюють конкретні невідповідні поведінки, автоматизовані системи забезпечили вимірні покращення без шкоди для загальної продуктивності моделі — звичайний компроміс, який ускладнює роботу вирівнювання.
«Загалом, ці результати є ранніми доказами того, що автоматичне вирівнювання після навчання може стати практичним у найближчій перспективі», — йдеться в документі.
Побиття людей за 1/37 вартості
Найбільш цитовані уривки в статті – це ті, де AAR порівнюється безпосередньо з людськими аналогами. Anthropic не обмежився порівнянням.
«Найкращий метод AAR перевершує те, що пропонують досвідчені люди, в середньому протягом шести годин», — йдеться в статті. У ньому чітко додається, що «дослідження, керовані людиною, не призводять до кращих результатів».
Економіка така ж тупа. «AAR коштує приблизно 4 долари за годину в API-виводі проти 150 доларів за годину, яку ми платимо нашим дослідникам», — пишуть автори. Це різниця у вартості майже в 40 разів, і це пояснює, чому лабораторії сприймають автоматизовані дослідження серйозно як щось більше, ніж цікавість.
Чому розрив у вартості важливий
Дослідження вирівнювання є дорогим способом, який легко недооцінити. Кожне втручання-кандидат має бути реалізовано, навчено та оцінено за критеріями, і більшість кандидатів зазнають невдачі. Якщо система може безперервно виконувати цей цикл пошуку за ціною викликів API, граничні витрати на спробу ще однієї ідеї наближаються до нуля. Обмеження зміщується з кількості персоналу на обчислення.
Антропічні обмеження позначено
Стаття відверта про те, чого результат не встановлює. Автоматизована система працює лише тоді, коли контрольні показники дійсно відображають важливі цілі узгодження, а розробка та підтримка контрольних показників, які фіксують неправильну поведінку в реальному світі, залишається відкритою проблемою в цій галузі.
Існує також залежність, яку легко не помітити: автоматизовані дослідники спираються на наявну літературу методів. Підтримка та розширення цієї літератури сама по собі є важливою роботою, і система, яка лише реміксує відомі техніки, може досягти межі, якої не досягне людська творчість.
Ці застереження мають значення, оскільки від них залежить довгострокове значення дослідження. Якщо контрольні показники вимірюють неправильні речі, AAR може оптимізувати свій шлях до сильних чисел, а базові ризики залишаться недоторканими. Обрамлення Anthropic — «ранні докази», а не рішення — відображає цю невизначеність.
Крок до рекурсивного самовдосконалення
Стаття також підживлює більшу дискусію про рекурсивне самовдосконалення, ідею про те, що системи штучного інтелекту можуть з часом покращити самі процеси навчання, які їх створюють. Навчання моделей штучного інтелекту за допомогою інших моделей штучного інтелекту стало популярною метою передових лабораторій, і результат Anthropic — це ранній конкретний погляд на те, як це виглядає у вузькому домені.
Логіка проста. Якщо моделі можуть надійно покращити власну підготовку до вирівнювання, той самий механізм можна було б правдоподібно спрямувати на практику навчання в ширшому плані, включно з роботою з можливостей. TechCrunch зазначає наслідки того, що дослідники штучного інтелекту можуть згодом стати менш центральними для процесу, і ця можливість сама стаття займається, а не уникає.
Що подивитись далі
Три запитання визначатимуть, чи є цей результат узагальненим. По-перше, чи витримує цей підхід поза межами десяти контрольних показників, протестованих Anthropic, щодо режимів відмови, які є більш брудними та менш чітко визначеними. По-друге, чи можна проблему підтримки еталонного тесту вирішити досить швидко, щоб автоматизоване дослідження було чесним. По-третє, чи інші лабораторії публікують порівняльні результати, які перетворили б одну статтю на галузеве напрямок.
Наразі висновок вузький, але реальний: у конкретних завданнях вирівнювання, протестованих Anthropic, автоматизовані дослідники перевершили досвідчених людей, швидше та набагато дешевше. Безпека індустрії ШІ може бути першим місцем, де дослідники ШІ, а не люди, виконують більшу частину роботи.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
