OpenAI 및 학술 협력자들의 현장 보고서에 따르면 AI 코딩 에이전트는 노후된 과학 소프트웨어의 현대화를 획기적으로 가속화하고 도구를 더 빠른 언어로 다시 작성하며 런타임을 대폭 단축할 수 있다는 사실이 밝혀졌습니다. 문제점: 동일한 에이전트는 자신의 작업이 과학적으로 올바른지 여부를 확실하게 판단할 수 없으며 종종 완전한 확신을 가지고 버그가 있는 코드를 제시합니다.

2026년 8월 1일에 발행되고 The Decoder에 의해 문서화된 이 보고서는 주로 생물학 분야에서 연구 그룹이 CodexClaude Code와 같은 코딩 에이전트를 사용하여 중요한 소프트웨어를 구출, 최적화 및 재작성한 8가지 사례 연구를 조사했습니다. 과학과 산업을 재편하는 도구에 대한 지속적인 보고를 보려면 최신 AI 뉴스를 팔로우하세요.

과학 소프트웨어의 조용한 위기

현대 연구를 뒷받침하는 소프트웨어의 대부분은 단일 논문의 지원 코드로 시작되었습니다. 소규모 학술 팀은 적절한 테스트, 유지 관리 또는 최적화를 위한 리소스 없이 이러한 도구를 구축했습니다. 그 결과 기반이 취약해졌습니다. 즉, 전체 분야에 여전히 중요한 프로그램이지만 지속적인 수리가 필요한 프로그램입니다. OpenAI 현장 보고서는 AI 코딩 에이전트가 오랜 격차를 줄이는 데 도움이 될 수 있다고 제안합니다.

프로젝트는 일상적인 유지 관리부터 현대 프로그래밍 언어로의 전체 재작성까지 다양했으며, 여러 가지가 눈길을 끄는 성능 향상을 가져왔습니다.

Rust에서 STAR 재구축

보다 야심찬 프로젝트 중 하나인 rustar-alignerSTAR를 Rust로 처음부터 다시 구축했습니다. STAR는 세포의 시퀀싱 판독을 게놈의 해당 위치에 매핑하는 데 널리 사용되는 도구입니다. 원래 프로그램에는 20,000개 이상의 C 및 C++ 라인이 포함되어 있으며 많은 연구 파이프라인에 포함되어 있음에도 불구하고 더 이상 적극적으로 유지 관리되지 않습니다.

재작성을 확인하기 위해 팀은 효모 세포에서 10,000번의 짧은 시퀀싱 읽기를 통해 두 도구를 모두 테스트했습니다. 단일 엔드 읽기의 경우 Rustar-aligner는 99.815% 사례에서 STAR와 동일한 결과를 생성했습니다. 페어드 엔드 읽기의 경우 동의율은 99.883%였습니다. 비교는 매핑된 위치를 넘어 두 프로그램이 각 읽기에 대해 생성하는 여러 다른 주요 필드를 포함하도록 확장되었으며, 두 도구 모두 다른 도구가 매핑하지 못한 읽기를 매핑하지 않았습니다.

60배의 속도 향상

RustQC는 15개의 개별 품질 관리 도구를 단일 프로그램으로 결합하여 최대 속도 향상을 제공했습니다. 대규모 데이터 세트에서 런타임은 15시간 34분에서 단 14분 54초로 급감했습니다. 이는 60배 이상의 속도 향상입니다.

또 다른 프로젝트인 HelixForge는 합성 게놈 데이터 생성 도구를 GPU 가속 버전으로 대체했습니다. 한 기증자의 데이터와 게놈의 천만 염기쌍 섹션을 사용한 테스트에서 HelixForge는 원래 BamSurgeon보다 59.6배 빠르게 전체 파이프라인을 완료했으며, 기본 컴퓨팅 단계만 98.6배 빠르게 실행했습니다.

보다 전통적인 현대화에서는 GPT-5.5가 유전 데이터 읽기용 Python 라이브러리인 cyvcf2의 오래된 빌드 및 설치 프로세스를 대체했습니다. 더 복잡한 MHCflurry 마이그레이션을 통해 Claude Code와 Codex는 개발자와 검토자의 역할을 번갈아 하면서 TensorFlow에서 PyTorch로 약 10,000줄의 코드를 이식했습니다. MHCflurry는 면역 세포가 어떤 표적을 인식할지 예측하는 면역학 모델입니다.

'확실히 틀렸다'

그러나 헤드라인 결과는 냉정한 것이었다. 사례 연구 전반에 걸쳐 에이전트는 잘 정의된 작업을 신속하게 완료했지만 자신의 작업이 과학적으로 올바른지 확실하게 판단할 수 없었습니다. 코드에 오류가 포함되어 있는 경우에도 시스템은 종종 완전한 자신감을 갖고 오류를 제시했습니다.

cyvcf2의 개발자인 Brent Pedersen은 보고서에서 다음과 같이 긴장감을 포착했습니다. "코딩 에이전트를 사용하면 빠르게 진행하는 것이 매우 쉽습니다. 현재로서는 과학 분야에서 더 멀리 나아가려면 여전히 전문가의 지도, 이해, 취향 및 관리가 필요합니다."

RustQC 프로젝트를 이끌었던 Philip Ewels는 더 무뚝뚝했습니다. 그는 에이전트를 "간과하기 쉬운 방식으로 설득력 있고 설득력 있고 자신있게 틀렸다"고 설명했습니다. Ewels는 모델이 자신의 작업의 정확성을 판단하는 것을 결코 허용하지 않았으며 대신 실수를 포착하기 위해 독립적인 테스트 장치를 구축했습니다.

눈에 잘 띄지 않는 오류

bayesm 사례 연구는 이러한 오류를 포착하기가 얼마나 어려운지 보여줍니다. Rust 재작성은 원본보다 2배에서 20배 빠르게 실행되었지만 두 가지 고급 방법의 첫 번째 버전에는 미묘한 결함이 있었습니다. 하나는 에이전트가 주요 제어 매개변수를 반전시켜 프로그램이 의도한 값의 역수를 사용하도록 하는 것입니다. 별도의 버그가 계산 자체에 영향을 미쳤습니다. 연구원들은 결과가 알려진 수천 개의 합성 데이터 세트에 대해 상세한 보정 테스트를 실행한 후에야 두 가지 문제를 모두 발견했습니다.

이 에피소드는 과학자들이 AI와 함께 작업할 수 있는 방식의 구조적 변화를 강조합니다. 즉, 코드를 직접 작성하는 대신 그들의 중심 작업은 결과를 엄격하게 검증하는 것입니다. 이는 에이전트 자체가 제공할 수 없는 심층적인 도메인 전문 지식을 요구하는 역할입니다.

과학에 있어서의 의미

이번 조사 결과는 고위험 영역에서 AI 시스템에 어느 정도의 자율성을 부여해야 하는지에 대한 격렬한 논쟁의 순간에 이르렀습니다. 속도 향상은 정말 혁신적입니다. 런타임이 60배 감소하면 야간 작업이 커피 휴식 시간으로 바뀔 수 있습니다. 그러나 보고서의 가장 중요한 기여는 한계에 대한 정직성일 것입니다. 빠르고 유창하며 설득력이 있지만 과학적 타당성을 자체 평가할 수 없는 에이전트는 무엇을 확인해야 할지 정확히 아는 전문가의 손에서만 사용할 수 있는 강력한 도구입니다.

관련된 연구자들에게 교훈은 분명합니다. AI는 놀라운 속도로 과학의 기반을 재건할 수 있지만 인간의 판단은 여전히 ​​부담을 안고 있다는 것입니다.

AI보다 앞서 나가세요

연구 혁신부터 기업 배포까지 변화의 속도는 거침없습니다. 인공 지능이 과학, 비즈니스 및 사회를 어떻게 재편하고 있는지에 대한 지속적이고 사실 확인된 보도를 보려면 AI Buzz Wire를 즐겨찾기에 추가하세요.

AI 연구 뉴스 자세히 보기 →