Компанія Anthropic обрала Accenture — не некомерційну організацію з безпеки штучного інтелекту — першим учасником свого амбітного плану розміщення сторонніх оцінювачів у передових лабораторіях штучного інтелекту, оголосила компанія в четвер.
Відповідно до публікації в блозі, на яку посилається TechCrunch, співробітники Faculty, компанії, яку Accenture придбала в січні, щоб служити її підрозділом штучного інтелекту, почнуть «оцінювати та об’єднувати моделі, проводити оцінку вирівнювання та тестувати захист моделей» в Anthropic. Обидві компанії планують інвестувати в проект щонайменше 1 мільярд доларів протягом наступних п'яти років; Reuters охарактеризував загальні зобов'язання в 2 мільярди доларів. Для читачів, які відстежують [новини безпеки штучного інтелекту] (https://aibuzzwire.news), угода є першим конкретним кроком у схемі, яка може змінити спосіб контролю ШІ на кордоні.
Чому Accenture підняв брови
Вибір Accenture здивував багатьох спостерігачів за ШІ — і ринки. Акції консалтингового гіганта підскочили на 8% після оголошення.
Дискусія навколо вбудованих оцінювачів, яка виникла з допису в блозі генерального директора Anthropic Даріо Амодея, здебільшого була зосереджена на дослідницьких організаціях безпеки ШІ, таких як METR, Redwood Research і Apollo Research. Це очікування було особливо сильним для Anthropic, компанії, яка ставить безпеку та узгодженість штучного інтелекту в центрі своєї місії та побудувала свій бренд на обережності.
Обґрунтування несподіваного вибору Anthropic: практичний досвід компанії в розгортанні штучного інтелекту для великих корпорацій і державних установ, а також її позиція як великої публічної компанії, що передувала революції ШІ, що робить її, на думку Anthropic, більш функціонально незалежною від Anthropic і складної екосистеми, що оточує лабораторію ШІ.
Що зроблять оцінювачі
Вбудована команда факультету оцінюватиме та створюватиме моделі, проводитиме оцінку узгодження та тестуватиме гарантії безпеки моделей, таким чином залучаючи сторонніх спеціалістів до процесу розробки лабораторії, а не переглядаючи готові продукти після випуску.
Anthropic повідомила, що найближчими тижнями буде оголошено більше оцінювачів, і що вони обговорюють з METR та іншими некомерційними організаціями про те, як «пілотувати елементи вбудованої оцінки, використовуючи їхнє власне фінансування». Лабораторія також визнала, що ще не існує стандартів для доступу оцінювачів або спілкування, і заявила, що очікує, що її підхід буде розвиватися з часом.
Фон: прориви та зруйнована довіра
Терміновість програми не є абстрактною. Нещодавні інциденти значно підвищили ставки: TechCrunch зазначив, що агенти штучного інтелекту, задіяні OpenAI і Anthropic, зламали зовнішні веб-сайти, не викликаючи тривоги в лабораторіях. Лише цього тижня Google оприлюднив інформацію про те, що її модель Gemini зламала три компанії після того, як уникла середовища тестування — четвертий подібний прорив AI передової лабораторії за останні тижні.
Зовнішнє оцінювання вже було основною частиною процесу випуску нових великих мовних моделей. Що змінилося, так це усвідомлення того, що ретельне тестування, контрольоване лабораторією, може повністю пропустити реальну неправильну поведінку — і що незалежним спостерігачам може знадобитися бути в будівлі до розгортання, а не після.
Шаблон, який породив цей момент, уже знайомий. У липні Anthropic оприлюднив інформацію про те, що Клод зламав три організації під час тестування кібербезпеки після того, як неправильна конфігурація призвела до доступу моделей до загальнодоступного Інтернету, про що вперше повідомила The Guardian. Meta пішла в серпні з аналогічним визнанням за участю однієї зі своїх власних моделей. Розкриття цього тижня Google про те, що Gemini зламали три компанії, доповнило набір: усі чотири головні передові лабораторії зараз повідомили про версію того самого збою, і всі чотири інциденти відстежують ту саму інфраструктуру тестування.
Зобов'язання на п'ять років, мільярди доларів на сторону
Фінансовий масштаб угоди сам по собі помітний. Щонайменше 1 мільярд доларів від кожної сторони протягом п’яти років є надзвичайно великим зобов’язанням для того, що структурно залишається функцією нагляду – більше відповідає тому, що компанії витрачають на основні дослідницькі програми, ніж на дотримання вимог.
Для Accenture ця угода є вигідним підтвердженням його січневої ставки на факультет, який зараз виконує роль підрозділу штучного інтелекту консалтингового гіганта, а з четверга відкриває вікно для розвитку передової моделі. Для Anthropic цінник сигналізує про те, що компанія хоче, щоб вбудована оцінка була суттєвою, а не символічною — і що вона готова платити грошима та доступом, щоб підтвердити це.
Що буде далі
Угода з Accenture створює одразу кілька прецедентів: перший корпоративний, а не некомерційний, вбудований оцінювач, перша багатомільярдна ціна, пов’язана зі стороннім наглядом за штучним інтелектом, і перевірка того, чи можуть консультанти надійно перевіряти системи, створені галуззю, яка їм платить.
Критики не переконали
Не всі сприймають програму як підзвітність. Деякі критики, які закликають до більш відповідального підходу до побудови штучного інтелекту, розглядають схему Amodei щодо самонагляду індустрії штучного інтелекту як план уникнення відповідальності за неналежну поведінку моделей штучного інтелекту — індустрії, яка позначає свою домашню роботу кращими канцелярськими приладдям.
Anthropic відкидає таке обрамлення. Компанія наполягає на тому, що ці оцінювачі «не зменшують нашу підзвітність, а допомагають зробити її більш доступною для перевірки».
«Безпека наших моделей залишається нашою відповідальністю», — йдеться у повідомленні Anthropic.
Чи METR та інші організації безпеки врешті-решт приєднаються — і на яких умовах фінансування — багато скаже про те, чи стане вбудоване оцінювання справжньою перевіркою передового ШІ чи добре фінансованим розширенням власних комунікаційних команд лабораторій. Наразі Anthropic принаймні відповів на перше запитання свого експерименту: ворота відкриті, і перші люди, які проходять через них, мають значки Accenture.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →