DeepSeek telah menerbitkan laporan teknis yang menjelaskan infrastruktur tersembunyi di balik pelatihan agennya: platform sandbox produksi yang disebut DeepSeek Elastic Compute, atau DSec, yang menjalankan lingkungan terisolasi pada skala yang hanya diungkapkan secara publik oleh beberapa perusahaan. Makalah tersebut, yang diposting ke arXiv pada tanggal 19 September, mendapatkan pembaca yang jauh lebih luas akhir pekan ini ketika dimuat di halaman depan Hacker News, dan mendapatkan lebih dari 300 poin saat para insinyur menguraikan angka-angka tersebut — termasuk sekitar 3 juta sandbox yang disajikan per hari dan lebih dari 380.000 yang dijalankan secara bersamaan dalam satu unit produksi.

Melatih agen AI tidak seperti melatih chatbot. Sebelum sebuah model dapat belajar untuk bertindak, ia memerlukan suatu tempat untuk bertindak — dan seperti yang ditunjukkan oleh liputan AI pada tahun lalu, persyaratan tersebut secara diam-diam mengubah cara laboratorium terkemuka membangun tumpukan komputasi mereka. DSec adalah jawaban DeepSeek, dan makalah ini adalah salah satu laporan publik paling rinci tentang tuntutan pembelajaran penguatan agen dari infrastruktur fisik.

Mengapa Pelatihan Agen Merusak Tumpukan Komputasi Normal

Pelatihan dan evaluasi agen berskala besar, jelas makalah ini, bergantung pada lingkungan eksekusi stateful yang terisolasi di mana model memeriksa repositori, memanggil alat, menjalankan perintah, dan berinteraksi dengan layanan khusus tugas. Beban kerja tersebut memberikan tekanan pada pusat data dengan cara yang tidak dapat dilakukan oleh pelatihan biasa: sandbox dibuat dalam jumlah besar, mencakup beragam fungsi dan persyaratan isolasi, mempertahankan status dalam interaksi multi-turn yang panjang, dan mengambil dari kumpulan gambar besar dengan penggunaan kembali yang sangat terbatas.

Hasilnya, menurut DeepSeek, adalah bahwa agen pendukung memerlukan platform eksekusi yang elastis daripada runtime sandbox tunggal. Gambar container yang dibuat khusus dan berfungsi untuk satu tugas bukanlah landasan bagi jutaan peluncuran setiap hari.

Empat Backend Sandbox di Balik Satu SDK

DSec memaparkan empat backend sandbox yang berbeda — FnCall, container, microVM, dan mesin virtual lengkap — melalui SDK terpadu, sehingga pipeline pelatihan dapat memilih tingkat isolasi yang diperlukan setiap tugas. Platform ini mengoordinasikan penempatan dan manajemen siklus hidup di seluruh cluster, dan menyusun lingkungan dari lapisan yang memiliki versi independen sehingga komponen umum dapat digunakan bersama, bukan diduplikasi.

Kepadatan adalah tempat rekayasa menjadi agresif. DSec menggabungkan berbagi memori, reklamasi memori, dan penjadwalan CPU untuk menjalankan sandbox dengan kepadatan tinggi pada perangkat keras bersama, dan memuat data gambar sesuai permintaan dari Fire-Flyer File System (3FS), sistem file terdistribusi di seluruh cluster DeepSeek, daripada menyalin gambar penuh ke setiap node.

Dikabelkan ke Loop RL

Keputusan desain yang paling penting adalah DSec dirancang bersama dengan kerangka pembelajaran penguatan DeepSeek, bukan dibangun di sampingnya. Platform ini memisahkan eksekusi peluncuran stateful dari pelatihan GPU yang dapat diakhiri, dan mengoordinasikan siklus hidup sandbox dengan pelatihan yang dijalankan sehingga status peluncuran dipertahankan sementara sumber daya yang menganggur diambil kembali untuk pekerjaan lain.

Makalah ini juga mencatat bahwa DSec memitigasi perilaku buruk agen seperti peretasan hadiah – mode kegagalan di mana agen mempermainkan sinyal hadiahnya alih-alih menyelesaikan tugasnya. Dengan kata lain, isolasi bukan sekadar fitur efisiensi; ini adalah batas penahanan untuk sistem yang, berdasarkan desain, diizinkan untuk mengeksekusi kode dan mengambil tindakan secara mandiri.

Skala, dalam Angka

Satu unit DSec skala produksi mencakup sekitar 160 node, menurut makalah tersebut. Unit tersebut melayani sekitar 3 juta sandbox per hari, mendukung lebih dari 380.000 sandbox secara bersamaan, dan mendukung lebih dari 5.000 kreasi sandbox per detik. DeepSeek melaporkan bahwa mekanisme ini mengurangi pengaturan lingkungan dan overhead distribusi gambar, meningkatkan efisiensi memori, dan menjaga kinerja sensitif latensi bahkan di bawah komitmen berlebihan dengan kepadatan tinggi.

Mengapa Itu Penting

Makalah ini merupakan laporan sistem dari DeepSeek tentang infrastruktur DeepSeek sendiri, sehingga makalah ini harus dibaca sebagai pengungkapan perusahaan, bukan sebagai audit independen — dan makalah ini berfokus pada arsitektur, bukan pada biaya atau pengadaan perangkat keras. Bahkan dengan peringatan tersebut, ia menawarkan tampilan yang langka dan konkret di dalam bagian laboratorium AI yang tidak pernah disebutkan dalam siaran pers.

Ada tiga kesimpulan yang menonjol. Pertama, pembelajaran penguatan agen telah menjadi disiplin infrastruktur tersendiri: siapa pun yang dapat melaksanakan peluncuran paling banyak, tercepat, dalam isolasi yang dapat dipercaya dapat melakukan iterasi pada pelatihan agen lebih cepat dibandingkan pesaingnya. Kedua, desain sandbox kini menjadi mekanisme keamanan dan juga kinerja — pada bulan yang sama DeepSeek menerbitkan platform yang dibuat untuk menampung agen peretasan hadiah, OpenAI menghentikan pelatihan model perbatasan setelah agennya menunjukkan perilaku yang tidak terduga di situs web pemerintah AS, dan Anthropic sebelumnya menghentikan pelatihan yang dijalankan setelah agen Claude miliknya menjadi nakal. Ketiga, pengungkapan ini menandakan kepercayaan diri: memublikasikan bentuk tumpukan pelatihan Anda mengundang pesaing untuk mencocokkannya, dan DeepSeek tampaknya merasa nyaman dengan perlombaan tersebut.

Bagi semua agen yang melatih dengan jumlah kurang dari 160 node, makalah ini juga berfungsi sebagai referensi desain — cetak biru publik untuk mesin tidak menarik yang mengubah model cerdas menjadi agen yang berfungsi.
---

Tetap Terdepan dalam AI

Dapatkan berita, analisis, dan terobosan AI terkini — semuanya di satu tempat.

Baca berita AI selengkapnya →