OpenAI と学術協力者によるフィールド レポートでは、AI コーディング エージェントが老朽化した科学ソフトウェアの最新化を劇的に加速し、より高速な言語でツールを書き換え、ランタイムを桁違いに短縮できることが判明しました。問題点は、同じエージェントが自分の作業が科学的に正しいかどうかを確実に判断できず、自信を持ってバグのあるコードを提示することがよくあることです。

2026 年 8 月 1 日に発行され、The Decoder によって文書化されたこのレポートでは、研究グループが CodexClaude Code などのコーディング エージェントを使用して重要なソフトウェアを救出し、最適化し、書き直す 8 つの事例研究 (主に生物学) を調査しました。科学と産業を再構築するツールに関する継続的なレポートについては、最新の AI ニュース をフォローしてください。

科学ソフトウェアにおける静かな危機

現代の研究を支えるソフトウェアの多くは、1 つの論文のサポート コードとして始まりました。小規模な学術チームが、適切なテスト、メンテナンス、最適化のためのリソースを持たずにこれらのツールを構築しました。その結果、脆弱な基盤が生まれ、プログラムは分野全体にとって重要なままですが、継続的な修復が必要になります。 OpenAI フィールドレポートは、AI コーディング エージェントがその長年にわたるギャップを埋めるのに役立つ可能性があることを示唆しています。

プロジェクトは日常的なメンテナンスから最新のプログラミング言語での完全な書き換えまで多岐にわたり、いくつかは目を引くパフォーマンスの向上をもたらしました。

Rust で STAR を再構築する

より野心的なプロジェクトの 1 つである rustar-aligner は、STAR を Rust でゼロから再構築しました。 STAR は、細胞からのシーケンシングリードをゲノム内の対応する位置にマッピングする、広く使用されているツールです。オリジナルのプログラムには 20,000 行を超える C および C++ が含まれており、多くの研究パイプラインに埋め込まれたままですが、現在は積極的にメンテナンスされていません。

書き換えを検証するために、チームは酵母細胞からの 10,000 回のショート シーケンス リードで両方のツールをテストしました。シングルエンド読み取りの場合、rustar-aligner は 99.815% のケースで STAR と同じ結果を生成しました。ペアエンド読み取りの場合、一致率は 99.883 パーセントでした。比較は、マップされた場所を超えて、両方のプログラムが各読み取りに対して生成する他のいくつかのキー フィールドを含めて拡張され、どちらのツールも他方がマップできなかった読み取りをマップしませんでした。

60 倍のスピードアップ

RustQC は、15 個の個別の品質管理ツールを 1 つのプログラムに結合することで最大の高速化を実現しました。大規模なデータセットでは、実行時間が 15 時間 34 分からわずか 14 分 54 秒に大幅に短縮され、60 倍 以上の高速化が実現しました。

別のプロジェクトである HelixForge は、合成ゲノム データを生成するツールを GPU 高速化バージョンに置き換えました。 1 人のドナーからのデータとゲノムの 1,000 万塩基対セクションを使用したテストで、HelixForge は元の BamSurgeon よりも 59.6 倍高速で完全なパイプラインを完了し、メインの計算ステップだけで 98.6 倍高速に実行されました。

より従来型の最新化では、GPT-5.5 が、遺伝データを読み取るための Python ライブラリである cyvcf2 の古いビルドおよびインストール プロセスを置き換えました。より複雑な MHCflurry の移行では、Claude Code と Codex が開発者とレビュー担当者の役割を交代しながら、約 10,000 行のコードを TensorFlow から PyTorch に移植しました。 MHCflurry は、免疫細胞がどの標的を認識するかを予測する免疫学モデルです。

「確信を持って間違っている」

しかし、見出しの発見は厳粛なものだった。どのケーススタディでも、エージェントは明確に定義されたタスクを迅速に完了しましたが、自分の作業が科学的に正しいかどうかを確実に判断することはできませんでした。コードにエラーが含まれている場合でも、システムは多くの場合、完全な自信を持ってそれを表示しました。

cyvcf2 の開発者である Brent Pedersen 氏は、レポートの緊張感を次のように捉えています。「コーディング エージェントを使用すると、高速に作業を進めるのは非常に簡単です。今のところ、科学の分野でさらに前進するには、依然として専門家の指導、理解、センス、注意が必要です。」

RustQCプロジェクトを率いたPhilip Ewels氏は、もっと率直に語った。同氏は工作員らを「雄弁で説得力があり、見落としがちなやり方で自信を持って間違っている」と評した。 Ewels は、モデルが自分の作業の正確さを判断することを決して許可せず、代わりに、モデルの間違いを見つけるための独立したテスト ハーネスを構築しました。

目に見えないところに隠れたエラー

bayesm のケーススタディは、これらのエラーを見つけるのがいかに難しいかを示しています。 Rust の書き換えはオリジナルより 2 ~ 20 倍高速に実行されましたが、2 つの高度なメソッドの最初のバージョンには微妙な欠陥が含まれていました。 1 つでは、エージェントが主要な制御パラメータを反転し、プログラムが意図した値の逆数を使用するようにしました。別のバグが計算自体に影響を及ぼしました。研究者は、結果がわかっている数千の合成データセットに対して詳細なキャリブレーション テストを実行した後にのみ、両方の問題を発見しました。

このエピソードは、科学者が AI と協力する方法における構造的な変化を強調しています。科学者自身がコードを書くのではなく、結果を厳密に検証することが科学者の中心的な仕事となり、エージェント自身では提供できない深い専門知識が求められる役割です。

科学にとっての意味

この調査結果は、一か八かの分野でAIシステムにどの程度の自律性を与えるべきかについての激しい議論の渦中にある。高速化は本当に革新的で、実行時間が 60 分の 1 に短縮され、夜間の仕事がコーヒーブレイクに変わる可能性があります。しかし、この報告書の最も重要な貢献は、限界についての正直さかもしれない。エージェントは、迅速かつ流暢で説得力がありますが、科学的妥当性を自己評価することができないため、何をチェックすべきかを正確に知っている専門家の手にのみ強力なツールとなります。

関係する研究者にとって、教訓は明らかです。AI は驚くべきスピードで科学の足場を再構築できますが、人間の判断には依然として負荷がかかります。

AI の一歩先を行く

研究の画期的な進歩から企業への導入まで、変化のペースは容赦ありません。 AI Buzz Wire をブックマークすると、人工知能が科学、ビジネス、社会をどのように再構築するかについての事実確認済みの継続的な報道が得られます。

AI 研究ニュースをもっと読む→