Цього тижня компанія Anthropic опублікувала перший у своєму роді огляд власної лінії розробок, показавши, що її модель Claude зараз «очолює» 26% досліджень і розробок ШІ в компанії — порівняно з менш ніж 1% у лютому 2026 року. Цифри з’явилися в публікації в блозі компанії під назвою «Вимірювання для розуміння темпів розробки ШІ в передових лабораторіях», опублікованій Anthropic 17 вересня та повідомленій Reuters, The Washington Post та інші видання.

Публікація є частково завданням прозорості, а частково аргументом: Anthropic хоче, щоб інші передові лабораторії публікували такі ж цифри, щоб громадськість і уряди могли відстежувати, як швидко ШІ передають ключі до створення ШІ. For more context on this story, see our ongoing AI trends.

Три числа для відстеження розвитку ШІ

Компанія запропонувала три вимірювання, які, за її словами, висвітлюють темп розвитку в передових лабораторіях: скільки досліджень і розробок штучного інтелекту виконує сам штучний інтелект, наскільки добре контролюються дії агентів штучного інтелекту та як обчислення розподіляються між роботою з розробки можливостей і роботою з безпеки.

Заголовок походить від того, що Anthropic називає своїм індексом автоматизації досліджень і розробок. Компанія каталогізувала всі види досліджень і розробок у сфері ШІ, оцінила, наскільки автоматизовано кожне завдання на даний момент, і підсумувала результати за шкалою, розробленою дослідницькою групою Epoch AI. Шкала змінюється від AL0 (без залучення штучного інтелекту) до AL5 (штучний інтелект працює повністю автономно, без людини в циклі), де AL3 означає, що штучний інтелект «співпрацює» над великими частинами роботи під пильним керівництвом людини, а AL4 означає, що штучний інтелект «керує», виконуючи більшу частину завдання наскрізно за підказкою високого рівня під наглядом людини.

За даними Anthropic, станом на серпень 2026 року Клод очолює 26% науково-дослідної роботи компанії зі штучним інтелектом. Частка робіт на рівні або вище рівня «ШІ співпрацює» перевищує 90%. Клод не працює повністю автономно для будь-якої виміряної підмножини досліджень і розробок ШІ.

30 000 агентів, один монітор

Друге вимірювання стосується контролю. Anthropic повідомила, що станом на серпень 2026 року приблизно 30 000 агентів виконували дослідницьку та інженерну роботу в компанії в будь-який час на її найбільш використовуваній внутрішній платформі.

Згідно з повідомленням, кожна дія, яку виконують ці агенти, проходить через онлайн-монітор перед тим, як її виконати, зазвичай протягом кількох секунд. Anthropic каже, що протягом серпня проаналізувала понад мільярд рішень своїх дослідницьких та інженерних агентів і виявила, що частка діяльності, заблокованої або посиленої моніторами, становила 0,002%.

Щодо розподілу обчислень, третього вимірювання, компанія заявила, що протягом перевіреного тижня приблизно 6% обчислень, які пішли на дослідження та розробки штучного інтелекту, було виділено на забезпечення безпеки.

Створення власного наступника — під наглядом людей

Обрамлення має таке ж значення, як і фігури. Моделі Anthropic дедалі активніше беруть участь у створенні наступного покоління тих самих моделей — те, що дослідники називають рекурсивним самовдосконаленням, і те, що в заголовку The Washington Post більш відверто описується як чат-бот, який «бере на себе роботу зі створення свого власного наступника».

Anthropic обережно проводить межу між «ШІ веде» та «ШІ замінює». На AL4 людина все ще контролює та може втручатися; компанія прямо повідомила, що жодна виміряна частина її науково-дослідної роботи не виконується на рівні AL5. Але траєкторія крута: перехід від менш ніж 1% до 26% приблизно за сім місяців свідчить про те, що частка роботи на основі штучного інтелекту може перевищити половину задовго до кінця десятиліття, якщо поточні тенденції збережуться.

Методологія має реальні межі, і Anthropic це каже. Його рейтинги автоматизації були створені на основі вибірки власних робочих записів компанії — включно з повідомленнями Slack і внутрішньої документації — і за допомогою оцінювання як людьми, так і суддями моделі автоматизації кожного завдання. У сліпому тесті співробітники оцінювали завдання, не знаючи, які докази зібрали моделі. Компанія повідомила, що її суддя-модель погоджувався з людьми приблизно так само часто, як люди погоджувалися одне з одним: точна згода між моделлю та людиною становила 59%, тоді як згода між людиною – лише 35%, а оцінки моделі та людини були на одному рівні в 97% випадків.

Компанія також визнала ризик самопосилання у своїй власній методології: Anthropic використовувала власні моделі для оцінки своїх систем, що могло означати, що модель судді допускає ті самі помилки, що й модель, яку вона перевіряє. Перевірка третьою стороною, як стверджується, є справжньою відповіддю.

Попередні очі

З цією метою Anthropic каже, що планує включити в компанію незалежних сторонніх оцінювачів із багатьох організацій, надаючи їм доступ до внутрішніх процесів, систем і даних, які можна порівняти з тими, які мають внутрішні команди оцінки ризиків. Зовнішня некомерційна дослідницька некомерційна організація зі штучного інтелекту METR раніше об’єднувала платформу офлайн-моніторингу Anthropic.

Розголошення надходить на тлі ескалації дебатів про темп. Генеральний директор Anthropic Даріо Амодей закликав до координації щодо уповільнення кордону, і компанія зазначає, що її власні цифри можуть змінитися, якби така координація існувала. Цього тижня Anthropic і OpenAI також були предметом публічного листа від експертів з безпеки, в якому стверджувалося, що лабораторіям потрібні дійсно незалежні оцінювачі безпеки.

Питання, чи підуть конкуренти прикладу Anthropic, залишається відкритим. Компанія стверджує, що будь-який прикордонний розробник міг би регулярно публікувати ці показники, використовуючи загальнодоступну методологію. Поки вони цього не зроблять, єдині публічні дані про те, наскільки швидко ШІ створює ШІ, надходять із самих лабораторій.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →