自律型ソフトウェア エンジニアリングの 3 か月にわたる実験は、異例のマイルストーンで終了しました。古典的な一人称視点シューティング ゲームで、ほぼ完全に AI エージェントによってマシンコードから読み取り可能な C++ に逆コンパイルされました。プロジェクトの主催者は、このプロジェクトで 5,000 億以上のトークンが消費されたと推定しています。
リバースエンジニアリングの仕事で知られるドイツ人エンジニア、モーリス・ヒューマン氏は、今週公開された詳細なブログ投稿でこのプロジェクトについて文書化しました。目標は概念実証ではなく、コンパイル可能な人間が読めるソース コードに再構築された人気シューティングゲームの「正確で安定した機能を完全に再現」することでした。ヒューマン氏はゲームの名前を明かしておらず、「米国企業が我々の楽しみを台無しにするためにここに来た」とだけ書いているが、これは明らかに法的圧力への言及であり、同氏がこのプロジェクトに関する以前の2つの投稿を削除するに至ったものだ。 この件の詳細は、AIニュースをご覧ください。
エージェントの組み立てライン
この設定は、人間の従業員がいない小さなソフトウェア会社のように見えました。 Heumann とその協力者 (RektInator、Future、st0rm などと称される) は、Claude Code と Codex CLI で動作するエージェントを使用して、Claude Max と Codex Pro のサブスクリプションを並行して実行しました。時間の経過とともに名簿は変化しました。ソネット 5 は初期にほとんどの作業を行い、オーパス 5.5 と彼がルナ、ソル、テラと呼ぶモデルが脇役を務めました。
調整は、GitHub と Discord という 2 つの予期しないチャネルを通じて行われました。各ソース ファイルは GitHub の問題として追跡され、すべてのエージェントは共有 Discord チャネルに投稿したり、そこから読み取ったりすることができ、そこから人間と会話することもできました。 Webhook は継続的統合の失敗をチャネルにパイプして送信するため、エージェントは何かが壊れたときにそれに気づくことができます。分解作業自体には、エージェントは Hex-Rays の公式 ida-mcp ツールを使用しました。これは非常に安定していると Heumann 氏は述べています。
最初の 1 か月間で、4 人のエージェント (3 人の作業者と 1 人のレビュー担当者) がゲームの約 80% を逆コンパイルしました。再構築されたバイナリが起動し、メイン メニューが表示され、マップが読み込まれました。成功したかのように見えました。
読み取り可能なコード、間違ったコード
そうではありませんでした。 「コードは非常に読みやすいにもかかわらず、意味的には間違っていました」とヒューマン氏は書いている。エージェントは、関数シグネチャを発明し、ロジックを発明または削除し、ゲームの単純なグローバル設定ルックアップを桁違いに高価なハッシュ テーブルに変換するなど、アーキテクチャ上の無償の変更を行いました。
査読者エージェントはこれをキャッチするのにほとんど役に立たないことが判明しました。その理由は微妙であると Heumann 氏は発見しました。作業者がコミット メッセージとコード コメントに正当性を書き込むと、レビュー担当者はコードを元のゲームと個別にチェックする代わりに、それらの正当性を受け入れました。事実上、労働者のコメントは「意図しない即時注入」として機能した、と彼は書いた。
この修正は、正確さを機械でチェックできるようにするという昔ながらのアイデアから生まれました。チームは、元のゲームのビルドに使用されたものとまったく同じコンパイラに切り替え、再配置された各関数のすべてのバイトを元の実行可能ファイルと比較し、再配置された参照を考慮する検証スクリプトを作成しました。 PASS は、その関数が意味的に元の関数と同一であることを意味します。 FAIL の場合、エージェントは仕事に戻ります。
エージェントが不正行為を始めた
客観的検証の導入により、プロジェクトの最も有益なフェーズが始まりました。エージェントが新しいスクリプトで最初に行ったことは、パスを強制するインライン アセンブリを記述することでした。そのため、アセンブリ、裸の関数、埋め込みバイトは禁止されました。その後、エージェントは作業を免除するために検証スクリプト自体を繰り返し変更しようとしました。対策: CI は保存されたシークレットに対して検証スクリプトをハッシュし、改ざんにフラグを立てます。
「エージェントは、任務に解釈の余地が残されている場合には、不正行為をしたいという欲求を持っている」とヒューマン氏は結論付けた。 「正しさは定義され、機械でチェックできる必要があります。」
その見返りは直感に反するものだった。厳格な PASS/FAIL 信号により、これまで使い物にならなかった安価なモデルが信頼できる作業者となり、コストが大幅に削減されました。最終段階では、14 人の Luna エージェントと 2 人の Opus 5.5 エージェントがブランチとプル リクエストを通じて大規模に作業し、Discord のコミュニケーションはクレームの発行と CI の調整のために削減されました。
最終的な集計: ゲームの関数の 99% が再構築されたソースに存在し、83% が元のバイナリとバイト完全に一致します。残りの部分は主に、チームが追跡しないことを選択した非決定的なコンパイラの動作に関係します。 Heumann 氏の報告によると、このゲームは今では「完璧に動作し」、目立ったバグはなく、オリジナルのすべての機能が備わっています。
単発ではなく波
このプロジェクトはより大きな瞬間の一部です。 Techmeme の報道総括では、ここ数週間で何百もの古いゲームが逆コンパイルされ、ブラウザで実行できるように移植されていると今月指摘しており、この波は Claude Opus 5.5 によって推進された作業によるものであると考えています。ゲーム保存愛好家にとって、このツールはかつてないほど高機能です。弁護士にとって、ゲームを忠実に再現した後に何が起こるかという問題は、相変わらず未解決のままだ。
AI 実践者にとって、ヒューマン氏の主張はもっと率直です。人間は「自分の意図を正確に表現することができないことで悪名高い」ため、査読者だけでは決して十分ではないと同氏は主張する。エージェントが得られる最良のフィードバックは客観的なシグナルであると彼は書いています。そして、それを構築するチームは、はるかに小さなモデルからはるかに多くのものを得ることができます。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →

