Полевой отчет OpenAI и его научных сотрудников показал, что агенты кодирования ИИ могут значительно ускорить модернизацию устаревшего научного программного обеспечения, переписывая инструменты на более быстрые языки и сокращая время выполнения на порядки. Подвох: одни и те же агенты не могут достоверно судить о том, является ли их работа научно правильной, часто с полной уверенностью представляя ошибочный код.

В отчете, опубликованном 1 августа 2026 года и задокументированном The Decoder, были рассмотрены восемь тематических исследований (в основном в области биологии), в которых исследовательские группы использовали агенты кодирования, такие как Codex и Claude Code, для спасения, оптимизации и переписывания критически важного программного обеспечения. Чтобы получать постоянные отчеты об инструментах, меняющих науку и промышленность, следите за нашими [последними новостями об искусственном интеллекте] (https://aibuzzwire.news).

Тихий кризис научного программного обеспечения

Большая часть программного обеспечения, лежащего в основе современных исследований, начиналась как вспомогательный код для одной статьи. Небольшие академические группы создавали эти инструменты, не имея ресурсов для надлежащего тестирования, обслуживания или оптимизации. В результате получается хрупкий фундамент: программы, которые остаются критически важными для целых областей, но требуют постоянного ремонта. Полевой отчет OpenAI предполагает, что агенты кодирования ИИ могут помочь закрыть этот давний пробел.

Проекты варьировались от планового обслуживания до полной перезаписи на современных языках программирования, и некоторые из них обеспечили заметный прирост производительности.

Восстановление STAR в Rust

Один из наиболее амбициозных проектов, rustar-aligner, перестроил STAR с нуля на Rust. STAR — это широко используемый инструмент, который сопоставляет результаты секвенирования клеток с соответствующими местами в геноме. Исходная программа содержит более 20 000 строк C и C++ и больше не поддерживается активно, хотя она по-прежнему встроена во многие исследовательские процессы.

Чтобы проверить переписывание, команда протестировала оба инструмента на 10 000 коротких считываний секвенирования дрожжевых клеток. При одностороннем считывании Rustar-Aligner дал тот же результат, что и STAR, в 99,815 процента случаев. Для парного чтения процент согласия составил 99,883 процента. Сравнение выходило за рамки сопоставленных местоположений и включало несколько других ключевых полей, которые обе программы создают для каждого чтения, и ни один инструмент не сопоставил никаких операций чтения, которые другой не смог сопоставить.

60-кратное ускорение

RustQC добился максимального ускорения за счет объединения 15 отдельных инструментов контроля качества в одну программу. На большом наборе данных время выполнения резко сократилось с 15 часов 34 минут до всего лишь 14 минут и 54 секунд — ускорение более чем в 60 раз.

Другой проект, HelixForge, заменил инструмент для генерации синтетических геномных данных версией с ускорением на графическом процессоре. В тесте, в котором использовались данные от одного донора и участок генома в десять миллионов пар оснований, HelixForge завершил весь конвейер 59,6 раз быстрее, чем оригинальный BamSurgeon, причем только основной этап вычислений выполнялся в 98,6 раз быстрее.

В более традиционной модернизации GPT-5.5 заменил устаревший процесс сборки и установки cyvcf2, библиотеки Python для чтения генетических данных. Более сложная миграция MHCflurry привела к тому, что Claude Code и Codex попеременно выполняли роли разработчика и рецензента, одновременно перенося примерно 10 000 строк кода из TensorFlow в PyTorch. MHCflurry — это иммунологическая модель, которая предсказывает, какие цели распознают иммунные клетки.

'Уверенно неверно'

Однако вывод, опубликованный в заголовке, оказался отрезвляющим. В ходе тематических исследований агенты быстро выполняли четко определенные задачи, но не могли достоверно оценить, была ли их работа научно правильной. Даже когда их код содержал ошибки, системы часто представляли их с полной уверенностью.

Брент Педерсен, разработчик cyvcf2, отразил эту напряженность в отчете: «С агентами кодирования довольно легко работать быстро; на данный момент, чтобы далеко пойти в науке, все еще необходимы экспертное руководство, понимание, вкус и внимательность».

Филип Юэлс, возглавлявший проект RustQC, был более резок. Он описал агентов как «красноречивых, убедительных и уверенно ошибающихся, которые легко не заметить». Юэлс никогда не позволял моделям судить о точности их собственной работы, вместо этого он создавал независимый тестовый комплекс, чтобы выявить их ошибки.

Ошибки, скрытые на виду

Тематическое исследование bayesm продемонстрировало, насколько сложно обнаружить эти ошибки. Его переписывание на Rust работало от двух до двадцати раз быстрее, чем оригинал, но первые версии двух продвинутых методов содержали небольшие дефекты. В одном из них агент инвертировал ключевой параметр управления, заставляя программу использовать величину, обратную заданным значениям. Отдельная ошибка коснулась самого расчета. Исследователи обнаружили обе проблемы только после проведения подробного калибровочного теста на тысячах синтетических наборов данных с известными результатами.

Этот эпизод подчеркивает структурный сдвиг в том, как ученые могут работать вместе с ИИ: вместо того, чтобы писать код самостоятельно, их главной задачей становится тщательная проверка результатов — роль, которая требует глубоких знаний в предметной области, которые сами агенты не могут предоставить.

Что это значит для науки

Результаты приходят в момент интенсивных дебатов о том, какую автономию следует предоставить системам ИИ в областях с высокими ставками. Ускорение действительно меняет ситуацию: 60-кратное сокращение времени выполнения может превратить ночную работу в перерыв на кофе. Но самым важным вкладом отчета, возможно, является его честность в отношении ограничений. Агенты, которые быстры, бегло говорят и убедительны, но не способны самостоятельно оценить научную достоверность, являются мощным инструментом только в руках экспертов, которые точно знают, что проверять.

Для участвующих исследователей урок ясен: ИИ может восстановить основы науки с поразительной скоростью, но человеческое суждение остается несущим бремя.

Будьте впереди ИИ

От научных прорывов до корпоративного внедрения — темп изменений неумолим. Добавьте в закладки AI Buzz Wire для постоянного, проверенного фактами освещения того, как искусственный интеллект меняет науку, бизнес и общество.

Подробнее о новостях исследований в области искусственного интеллекта →