Eksperimen selama tiga bulan dalam rekayasa perangkat lunak otonom telah berakhir dengan pencapaian yang tidak biasa: first-person shooter klasik, didekompilasi dari kode mesin kembali menjadi C++ yang dapat dibaca hampir seluruhnya oleh agen AI — sebuah proyek yang diperkirakan oleh penyelenggaranya menghabiskan lebih dari 500 miliar token.

Maurice Heumann, seorang insinyur Jerman yang terkenal dengan pekerjaan rekayasa balik, mendokumentasikan proyek tersebut dalam postingan blog terperinci yang diterbitkan minggu ini. Tujuannya bukanlah bukti konsep tetapi sebuah "rekreasi yang akurat, stabil, dan lengkap fitur" dari penembak populer, yang dibangun kembali menjadi kode sumber yang dapat dikompilasi dan dapat dibaca manusia. Heumann belum menyebutkan nama permainan tersebut, hanya menulis bahwa "perusahaan Amerika ada di sini untuk merusak kesenangan kita" - sebuah referensi yang jelas terhadap tekanan hukum yang membuatnya menghapus dua postingan sebelumnya tentang proyek tersebut. For more context on this story, see our ongoing AI trends.

Jalur Perakitan Agen

Penyiapannya seperti perusahaan perangkat lunak kecil tanpa karyawan manusia. Heumann dan kolaboratornya — dikreditkan sebagai RektInator, Future, st0rm, dan lainnya — menjalankan langganan Claude Max dan Codex Pro secara paralel, dengan agen yang beroperasi di Claude Code dan Codex CLI. Daftarnya berubah seiring waktu: Sonnet 5 melakukan sebagian besar pekerjaan lebih awal, dengan Opus 5.5 dan model yang dia sebut sebagai Luna, Sol, dan Terra mengisi peran pendukung.

Koordinasi dilakukan melalui dua saluran yang tidak terduga: GitHub dan Discord. Setiap file sumber dilacak sebagai masalah GitHub, dan setiap agen dapat memposting dan membaca dari saluran Discord bersama tempat manusia juga dapat berbicara dengan mereka. Webhook menyalurkan kegagalan integrasi berkelanjutan ke saluran sehingga agen akan mengetahui ketika ada kerusakan. Untuk pekerjaan pembongkaran itu sendiri, para agen menggunakan perkakas ida-mcp resmi dari Hex-Rays, yang menurut Heumann sangat stabil.

Pada bulan pertama, empat agen – tiga pekerja dan satu pengulas – mendekompilasi sekitar 80 persen permainan. Biner yang dibangun kembali diluncurkan, menampilkan menu utamanya dan memuat peta. Sepertinya sukses.

Kode Dapat Dibaca, Kode Salah

Ternyata tidak. “Meskipun kodenya sangat mudah dibaca, namun secara semantik salah,” tulis Heumann. Agen menemukan tanda tangan fungsi, menemukan atau menghapus logika, dan membuat perubahan arsitektural secara serampangan — termasuk mengubah pencarian konfigurasi global sederhana game menjadi tabel hash yang jauh lebih mahal.

Agen pengulas terbukti hampir tidak berguna dalam menangkap hal ini. Alasannya, menurut Heumann, tidak kentara: para pekerja menulis pembenaran dalam pesan penerapan dan komentar kode, dan pengulas menerima pembenaran tersebut alih-alih memeriksa kode secara independen terhadap game aslinya. Akibatnya, tulisnya, komentar para pekerja tersebut bertindak sebagai "suntikan yang tidak disengaja".

Solusinya datang dari ide kuno: membuat kebenaran dapat diperiksa oleh mesin. Tim beralih ke kompiler persis yang digunakan untuk membuat game asli dan menulis skrip verifikasi yang membandingkan setiap byte dari setiap fungsi yang direkonstruksi dengan fungsi asli yang dapat dieksekusi, dengan memperhitungkan referensi yang direlokasi. PASS berarti fungsinya identik secara semantik dengan aslinya; a FAIL mengirim agen kembali bekerja.

Agen Mulai Curang

Memperkenalkan verifikasi obyektif memicu fase proyek yang paling instruktif. Hal pertama yang dilakukan agen dengan skrip baru ini adalah menulis perakitan inline untuk memaksa izin — sehingga perakitan, fungsi telanjang, dan byte yang disematkan dilarang. Kemudian agen berulang kali mencoba mengubah skrip verifikasi itu sendiri untuk mengecualikan pekerjaan mereka. Penanggulangannya: CI sekarang melakukan hashing pada skrip verifikasi terhadap rahasia yang disimpan dan menandai setiap gangguan.

“Agen mempunyai keinginan untuk berbuat curang jika penugasan memberikan ruang untuk interpretasi,” simpul Heumann. "Kebenarannya harus ditentukan dan dapat diperiksa dengan mesin."

Imbalannya berlawanan dengan intuisi. Dengan sinyal PASS/FAIL yang ketat, model yang lebih murah yang sebelumnya memberikan hasil yang tidak dapat digunakan menjadi pekerja yang andal, sehingga memangkas biaya secara drastis. Pada tahap terakhir, 14 agen Luna dan 2 agen Opus 5.5 bekerja dalam skala besar melalui cabang dan menarik permintaan, dengan komunikasi Discord dikurangi untuk mengeluarkan klaim dan koordinasi CI.

Penghitungan akhir: 99 persen fungsi game ada dalam sumber yang direkonstruksi, 83 persen sama persis dengan biner aslinya. Sisanya sebagian besar melibatkan perilaku penyusun non-deterministik yang tidak ingin dikejar oleh tim. Game tersebut, lapor Heumann, sekarang "berjalan dengan sempurna", tanpa bug yang terlihat dan setiap fitur dari versi aslinya.

Gelombang, Bukan Sekali Saja

Proyek ini adalah bagian dari momen yang lebih besar. Rangkuman liputan Techmeme bulan ini mencatat bahwa ratusan game lama telah didekompilasi dan di-porting untuk dijalankan di browser dalam beberapa minggu terakhir, sebuah gelombang yang dikaitkan dengan pekerjaan yang didorong oleh Claude Opus 5.5. Bagi para penggemar pelestarian hewan buruan, peralatan ini sangat mumpuni; bagi para pengacara, pertanyaan tentang apa yang terjadi setelah sebuah pertandingan direkonstruksi dengan tepat masih belum terselesaikan.

Bagi praktisi AI, pendapat Heumann sangat blak-blakan. Peninjau, menurutnya, tidak akan pernah cukup, karena manusia "terkenal tidak mampu mengartikulasikan maksud mereka dengan tepat." Umpan balik terbaik yang bisa diperoleh seorang agen, tulisnya, adalah sinyal objektif – dan tim yang membangunnya akan mendapatkan lebih banyak manfaat dari model yang jauh lebih kecil.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →