Новый тест под названием Real-SWE бросает вызов тому, как индустрия искусственного интеллекта измеряет способности кодирования, и первые результаты удручают передовые лаборатории. Fable 5.1 от Anthropic, работающий в составе Claude Code, лидирует по уровню разрешения 38,8% при выполнении задач, взятых из частных, реальных корпоративных кодовых баз. Ни одна протестированная модель не очищает 40 процентов.
Тест, выпущенный в этом месяце компанией Special Labs, оценивает передовые модели искусственного интеллекта на частных базах кода, которые команда лицензировала у реальных компаний. Его создатели утверждают, что сгенерированные экспертами или синтетические задачи, как бы хорошо они ни были разработаны, не являются дословной работой, которую на самом деле выполняют инженеры в реальных компаниях. Подробнее об этой истории — в нашем тенденции ИИ.
Почему частные кодовые базы меняют картину
По мнению его авторов, Real-SWE отличается от таких признанных тестов, как SWE-bench, по двум осям: базовому артефакту кодирования и специфике инструкции. Каждая задача создается собственной системой, код и решения которой недоступны в общедоступном Интернете, а это означает, что агенты не могут опираться на заученные ответы, полученные из общедоступных репозиториев.
Задачи также имеют бизнес-последствия. Примеры задач эталонного теста включают правильное выставление счетов, расчет налогов и миграцию клиентов — изменения, которые влияют на работу бизнеса, часто через несколько сервисов. У каждой компании есть свои собственные соглашения и способы написания кода, и агенты должны понимать эти нормы и вносить изменения, которые работают с тем, что уже существует.
«Может ли агент кодирования выполнять работу инженера-программиста в реальном мире?» — спрашивает введение в тест. Таблица лидеров предполагает, что ответ на данный момент таков: в лучшем случае только около трети времени.
Полная таблица лидеров
Компания Special Labs оценила восемь передовых комбинаций модели и оборудования, измерив скорость разрешения как проход @ 1, усредненный за восемь независимых запусков на задачу, с 95-процентным доверительным интервалом:
1. Басня 5.1 (Код Клода) — 38,8%
2. GPT-6 Astra (Кодекс CLI) — 33,8%
3. Gemini 3.8 Flash (Gemini CLI) — 31,2%
4. GLM 5.3 (Код Клода) — 28,8%
5. (ничья) Грок 4.6 (Грок Билд) — 23,8%
5. (ничья) Muse Spark 1.3 (Muse Code) — 23,8%
7. Кими К3 (Код Кими) — 18,8%
8. GPT-5.6 Sol (Кодекс CLI) — 16,2%
Результаты широко обсуждались на Hacker News в минувшие выходные, где эталонный тест собрал несколько сотен голосов и вызвал оживленные дебаты о том, является ли оценка частной кодовой базы правильным критерием прогресса агента.
Узкий, но значимый разброс вверху
Разрыв между четырьмя ведущими системами примечателен тем, что он говорит о текущей конкурентной среде. Пятибалльное преимущество Fable 5.1 над OpenAI GPT-6 Astra является значительным в тесте, где каждая задача является реальной производственной проблемой. Третье место Gemini 3.8 Flash поразительно, поскольку модель позиционируется как быстрая и недорогая рабочая лошадка, а не как флагманская система рассуждений. GLM 5.3 от Z.ai, оцененный Claude Code, отстающий от лидера на пять баллов, подчеркивает, насколько конкурентоспособными стали модели с открытым весом в практической инженерной работе.
Не менее красноречивым является спред внизу. GPT-5.6 Sol, более ранняя версия OpenAI, решает вдвое меньше задач, чем Fable 5.1 — напоминание о том, как быстро сдвинулся рубеж и насколько крутым может быть падение всего на одно поколение моделей назад.
Ремни имеют такое же значение, как и модели
Один из методологических решений теста привлекает внимание: вместо того, чтобы оценивать модели по отдельности, Real-SWE использует собственные средства — Claude Code, Codex CLI, Gemini CLI, Grok Build — чтобы отразить, как на практике работают корпоративные инженеры. В таблице лидеров четко ранжируются комбинации модели и оборудования, признавая, что строительные леса, доступ к инструментам и циклы итераций теперь неотделимы от возможностей модели в реальных развертываниях.
Эта структура имеет значение для предприятий, выбирающих системы. Одна и та же модель может работать по-разному в зависимости от агентского комплекса, окружающего ее, и покупатели, оценивающие помощников по программированию на основе общедоступных показателей производительности, могут получить искаженную картину того, как эти системы будут вести себя в их собственных кодовых базах.
Что это значит для отрасли
Бенчмарки неоднократно обвинялись в перенасыщенности: пограничные модели показывают почти идеальные результаты в общедоступных тестах, которые просачиваются в данные обучения. Дизайн Real-SWE пытается решить обе проблемы одновременно: код является частным и лицензируется, задачи являются подлинными продуктами работы работающих инженерных групп, а инструкции отражают беспорядочную специфику реальных заявок, а не отточенные формулировки задач.
Отрезвляющий вывод – абсолютный уровень. Даже самая лучшая система решает менее четырех из десяти реальных корпоративных задач с первой попытки (в среднем за восемь запусков). Несмотря на весь прогресс в агентном кодировании, тест показывает, что автономная разработка программного обеспечения в реальных производственных системах остается контролируемой деятельностью — такой, при которой инженеры-люди проверяют, перенаправляют и исправляют гораздо чаще, чем это предполагают демо-версии поставщиков.
Для предприятий, выбирающих помощников по программированию, эталонный тест предлагает практический контрольный список: отдавайте предпочтение системам, оцениваемым на основе частного кода, настаивайте на доверительных интервалах, а не на единичных заголовочных цифрах, и придавайте большое значение качеству использования, а также возможностям необработанной модели. Первая таблица лидеров Real-SWE не будет последним словом, но это самый прямой ответ на вопрос, который задает каждый руководитель разработки об агентном кодировании.
Чтобы узнать больше об агентах кодирования, выпусках моделей и исследованиях, формирующих их, следите за последними новостями в области искусственного интеллекта по мере выхода следующего раунда результатов тестов.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →