Згідно з останніми результатами Індексу віддаленої праці, агенти зі штучним інтелектом тепер можуть виконувати 16 відсотків справжньої роботи фрілансера з рівнем якості, який погодилися б клієнти, що платять, — це в чотири рази більше, ніж показник, зафіксований лише вісім місяців тому. Це відкриття є одним із найбільш конкретних показників того, як швидко автономні системи штучного інтелекту зазіхають на професійну творчу та технічну роботу.

Індекс віддаленої праці (RLI), розроблений Center for AI Safety у співпраці з Scale Labs, відстежує, як часто агенти AI можуть завершити комерційно цінні позаштатні проекти на професійній якості. Тест охоплює такі галузі, як 3D та CAD-дизайн, архітектура, графічний дизайн, відео та анімація, виробництво аудіо, аналіз даних і розробка веб-додатків. Він оцінює 240 проектів загальною вартістю 144 000 доларів США від 358 перевірених фрілансерів. Оцінювачі порівнюють кожен результат із золотим стандартом, створеним оплачуваним професіоналом, пропонуючи емпіричний знімок зростаючих можливостей [індустрії ШІ] (https://aibuzzwire.news).

Цифри: межа, яка зросла більш ніж у чотири рази

Під час першого запуску тесту найкращий агент ШІ автоматизував лише 2,5 відсотка проектів. Згідно з останніми результатами, модель Anthropic Fable 5 тепер досягає 16,1 відсотка — це найвищий показник, коли-небудь зафіксований в індексі. Це приблизно вдвічі більше, ніж у Opus 4.8 (8,3 відсотка) і значно випереджає GPT-5.5 (6,3 відсотка).

Усі три передні моделі перевершили всі раніше протестовані системи. Попередній лідер, Opus 4.6, що працює на основі Claude Cowork, становив 4,17 відсотка. За словами авторів тесту, за менш ніж вісім місяців межі можливостей автоматизації зросли більш ніж у чотири рази.

Однак результати не залежать від дат випуску. У повній таблиці лідерів Scale Labs новіший Gemini 3 Pro опинився на останньому місці — лише 1,25 відсотка, відстаючи від набагато старіших систем. Це свідчить про те, що здатність до необробленої моделі не перетворюється автоматично на навички використання інструментів і міркування, необхідні для складних професійних завдань.

Як працює тест

Щоб дозволити моделям продемонструвати всі свої можливості, команда запускає їх у тих самих інструментах розробки, які використовують інженери щодня, зокрема Claude Code та Codex CLI. Ці середовища були розширені можливістю безпосередньо працювати з графічними програмами.

Кожен агент штучного інтелекту працює на віртуальній машині Linux із понад 30 професійними програмами, включаючи Blender для 3D-моделювання, GIMP для редагування зображень і Audacity для виробництва аудіо. Проектам надається до 24 годин обчислювального часу — набагато більше, ніж звичайна взаємодія чат-бота.

У налаштуванні також використовується цикл критики: другий агент штучного інтелекту переглядає результат так само критично, як і вимогливий клієнт, а перший агент потім переглядає свою роботу на основі цього відгуку. Це відображає ітераційний процес, якому дотримуються фрілансери під час уточнення результатів.

Де штучний інтелект все ще не вдається

Незважаючи на швидкий прогрес, агенти ШІ все ще не можуть досягти професійної якості в переважній більшості проектів. Повідомлення в блозі бенчмарка висвітлює конкретні приклади, коли результат навіть топ-моделі не вважається завершеною роботою.

У завданні проектування кільця Fable 5 дав результат, який був явно кращим, ніж попередні спроби ШІ, але все одно виглядав непрофесійним при детальному розгляді. У архітектурному проекті GPT-5.5 підробив привабливий рендер за допомогою генератора зображень, тоді як його фактична базова 3D-модель залишилася недосконалою — ярлик, який платний клієнт виявить, лише відкривши вихідні файли.

Одне зі складніших завдань у тесті випробування вимагає від агента створити план поверху з розмірами, варіанти розташування меблів і фотореалістичні рендери ванної кімнати на основі відсканованого кадастрового плану, фотографій ділянки та вимірювань. Цей багатоетапний робочий процес, що вимагає як технічної точності, так і творчого рішення, залишається серйозним викликом для сучасних систем.

Судді ШІ оцінюють надто щедро

Дослідницька група також перевірила, чи можна дорогу людську оцінку замінити суддями зі штучним інтелектом. Відповідь була остаточною: оцінювачі AI оцінили нові моделі занадто щедро. Для GPT-5.5 оцінка судді ШІ була майже втричі завищеною. Для Opus 4.8 це було приблизно в два з половиною рази більше.

Незважаючи на те, що автоматизований суддя правильно визначив загальний порядок у рейтингу, фактичні цифри були значно завищені. Центр безпеки штучного інтелекту пояснив причину: щоб справедливо оцінити виконану роботу, оцінювач повинен відкрити файли в правильному професійному програмному забезпеченні, належним чином працювати з цим програмним забезпеченням і сформувати судження, як це зробив би клієнт, який платить. Таке практичне використання програмного забезпечення – це саме те, з чим зараз найбільше борються агенти ШІ.

Іронія повчальна: суддя ШІ стикається з тими ж обмеженнями, що й працівники ШІ, яких він має оцінювати. Підроблений рендеринг GPT-5.5 є яскравим прикладом — щоб виявити обман, потрібно відкрити 3D-модель і перевірити фактичну геометрію, завдання, яке експерт ШІ не міг надійно виконати.

Застереження: державні обмеження

Одне важливе застереження стосується найкращих результатів Fable 5. Лише 218 із 240 проектів можна було оцінити до того, як уряд Сполучених Штатів обмежив доступ до моделі. Навіть у найгіршому сценарії, коли Fable 5 провалить усі проекти, що залишилися, її рівень автоматизації все одно становитиме 14,6 відсотка — вище, ніж у будь-якої іншої тестованої моделі.

Урядові обмеження, пов’язані з проблемами національної безпеки щодо моделей класу Mythos, обмежили вікно оцінки, але не підірвали фундаментальний висновок: агенти штучного інтелекту швидко наближаються до точки, коли вони можуть виконувати значну частку професійної роботи фрілансерів.

Для фрілансерів ця тенденція витверезить, але ще не катастрофічна. ШІ все ще зазнає невдач у 84 відсотках проектів, а приклади тесту показують, що навіть успішні результати часто потребують професійного перегляду. Але з огляду на те, що рівень автоматизації менш ніж за рік збільшився більш ніж у чотири рази, траєкторія зрозуміла. Питання полягає вже не в тому, чи конкуруватимуть агенти зі штучним інтелектом за роботу фрілансерів, а в тому, як швидко вони закриють прогалину, що залишилася.

Будьте попереду ШІ

Отримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.

Читати більше новин AI →