Согласно последним результатам Индекса удаленного труда, ИИ-агенты теперь могут выполнять 16 процентов реальной внештатной работы с уровнем качества, приемлемым для платящих клиентов, что более чем в четыре раза превышает показатель, зарегистрированный всего восемь месяцев назад. Это открытие дает один из наиболее конкретных показателей того, насколько быстро автономные системы искусственного интеллекта вторгаются в профессиональную творческую и техническую работу.
Индекс удаленного труда (RLI), разработанный Центром безопасности ИИ в сотрудничестве с Scale Labs, отслеживает, как часто агенты ИИ могут выполнять коммерчески ценные внештатные проекты с профессиональным качеством. Тест охватывает такие области, как 3D- и CAD-дизайн, архитектуру, графический дизайн, видео и анимацию, производство звука, анализ данных и разработку веб-приложений. Он оценивает 240 проектов на общую сумму 144 000 долларов США, полученных от 358 проверенных фрилансеров. Оценщики-люди оценивают каждый результат по золотому стандарту, созданному оплачиваемым профессионалом, предлагая эмпирическую картину растущих возможностей индустрии искусственного интеллекта.
Цифры: граница, которая увеличилась более чем в четыре раза
Когда тест был впервые запущен, лучший ИИ-агент автоматизировал лишь 2,5 процента проектов. Согласно последним результатам, модель Fable 5 от Anthropic сейчас достигает 16,1 процента — это самый высокий показатель, когда-либо зарегистрированный в индексе. Это примерно вдвое больше, чем у Opus 4.8 (8,3 процента) и значительно выше, чем у GPT-5.5 (6,3 процента).
Все три передовые модели превосходят все ранее протестированные системы. Предыдущий лидер, Opus 4.6, работающий на платформе Claude Cowork, имел показатель 4,17%. По словам авторов теста, границы возможностей автоматизации выросли более чем в четыре раза менее чем за восемь месяцев.
Однако результаты не совпадают с датами выпуска. В полной таблице лидеров Scale Labs новый Gemini 3 Pro занимает последнее место с показателем всего 1,25 процента, отставая от гораздо более старых систем. Это говорит о том, что возможности необработанных моделей не трансформируются автоматически в навыки использования инструментов и рассуждения, необходимые для сложных профессиональных задач.
Как работает тест
Чтобы модели могли продемонстрировать все свои возможности, команда запускает их с помощью тех же инструментов разработки, которые инженеры используют изо дня в день, включая Claude Code и Codex CLI. Эти среды были расширены за счет возможности напрямую работать с графическими программами.
Каждый агент искусственного интеллекта работает на виртуальной машине Linux, на которой установлено более 30 профессиональных приложений, включая Blender для 3D-моделирования, GIMP для редактирования изображений и Audacity для создания звука. Проектам предоставляется до 24 часов вычислительного времени — намного дольше, чем обычное взаимодействие с чат-ботом.
В установке также используется цикл критики: второй ИИ-агент проверяет результаты так же критично, как это сделал бы требовательный клиент, а затем первый агент пересматривает свою работу на основе этой обратной связи. Это отражает итеративный процесс, которому следуют фрилансеры при доработке результатов.
Где ИИ все еще не справляется
Несмотря на быстрый прогресс, агентам ИИ по-прежнему не удается достичь профессионального качества в подавляющем большинстве проектов. В блоге, посвящённом тесту, приводятся конкретные примеры, когда результаты даже топ-модели не считались законченной работой.
При проектировании колец Fable 5 дала результат, который был явно лучше, чем предыдущие попытки ИИ, но при внимательном рассмотрении все равно выглядел непрофессионально. В архитектурном проекте GPT-5.5 имитировал привлекательный рендеринг с помощью генератора изображений, в то время как его фактическая базовая 3D-модель оставалась ошибочной — ярлык, который платящий клиент обнаружит, только открыв исходные файлы.
Одна из наиболее сложных задач в тесте требует от агента создать план этажа с размерами, варианты расстановки мебели и фотореалистичные изображения ванной комнаты на основе отсканированного кадастрового плана, фотографий участка и измерений. Этот многоэтапный рабочий процесс, требующий как технической точности, так и творческого подхода, остается серьезной проблемой для современных систем.
Судьи искусственного интеллекта оценивают слишком щедро
Исследовательская группа также проверила, можно ли заменить дорогостоящую человеческую оценку судьями с искусственным интеллектом. Ответ был однозначным: оценщики искусственного интеллекта оценили новые модели слишком щедро. Для GPT-5.5 оценка судьи AI оказалась выше почти в три раза. Для Opus 4.8 оно было примерно в два с половиной раза выше.
Хотя автоматизированный судья правильно определил общий порядок ранжирования, фактические цифры были значительно завышены. Центр безопасности искусственного интеллекта объяснил причину: чтобы справедливо оценить выполненную работу, оценщик должен открыть файлы в правильном профессиональном программном обеспечении, правильно использовать это программное обеспечение и сформировать суждение, как это сделал бы платящий клиент. Именно с таким практическим использованием программного обеспечения нынешние агенты ИИ сталкиваются больше всего.
Ирония поучительна: судья ИИ сталкивается с теми же ограничениями, что и работники ИИ, которых он должен оценивать. Поддельный рендеринг GPT-5.5 является показательным примером: чтобы обнаружить обман, необходимо открыть 3D-модель и проверить фактическую геометрию, а эту задачу ИИ-судья не может выполнить надежно.
Предостережение: государственные ограничения
Одно важное предостережение касается лучшего результата Fable 5. Только 218 из 240 проектов удалось оценить до того, как правительство США ограничило доступ к модели. Даже в худшем случае, когда Fable 5 провалит все оставшиеся проекты, уровень автоматизации все равно будет 14,6 процента — выше, чем у любой другой протестированной модели.
Правительственные ограничения, связанные с соображениями национальной безопасности в отношении моделей класса Mythos, ограничили окно оценки, но не подорвали фундаментальный вывод: агенты ИИ быстро приближаются к моменту, когда они могут выполнять значительную часть профессиональной внештатной работы.
Для фрилансеров эта тенденция отрезвляет, но еще не катастрофична. ИИ по-прежнему терпит неудачу в 84 процентах проектов, а примеры тестов показывают, что даже успешные результаты часто требуют профессиональной проверки. Но учитывая, что менее чем за год уровень автоматизации увеличился более чем в четыре раза, траектория ясна. Вопрос уже не в том, будут ли ИИ-агенты конкурировать за внештатную работу, а в том, как быстро они преодолеют оставшийся разрыв.
Будьте впереди ИИ
Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Читать больше новостей об искусственном интеллекте →


