DeepSeek telah menerbitkan laporan teknikal yang menerangkan infrastruktur tersembunyi di sebalik latihan ejennya: platform kotak pasir pengeluaran yang dipanggil DeepSeek Elastic Compute, atau DSec, yang memutarkan persekitaran terpencil pada skala yang telah didedahkan oleh beberapa syarikat secara terbuka. Akhbar itu, yang disiarkan ke arXiv pada 19 September, menemui khalayak yang lebih luas hujung minggu ini apabila ia mencapai muka depan Berita Hacker, memperoleh lebih daripada 300 mata apabila jurutera menghuraikan nombor itu - termasuk kira-kira 3 juta kotak pasir yang dihidangkan setiap hari dan lebih daripada 380,000 berjalan serentak dalam satu unit pengeluaran.

Melatih ejen AI tidak seperti melatih chatbot. Sebelum model boleh belajar bertindak, ia memerlukan tempat untuk bertindak — dan seperti yang ditunjukkan oleh liputan AI pada tahun lalu, keperluan itu secara senyap-senyap membentuk semula cara makmal terkemuka membina susunan pengiraan mereka. DSec ialah jawapan DeepSeek, dan kertas itu merupakan salah satu daripada akaun awam yang paling terperinci tentang apa yang diperlukan oleh pembelajaran pengukuhan agen daripada infrastruktur fizikal.

Mengapa Latihan Ejen Memecahkan Timbunan Pengiraan Biasa

Latihan dan penilaian agen berskala besar, jelas kertas itu, bergantung pada persekitaran pelaksanaan yang terpencil di mana model memeriksa repositori, menggunakan alatan, melaksanakan arahan dan berinteraksi dengan perkhidmatan khusus tugas. Beban kerja tersebut menekankan pusat data dengan cara latihan biasa tidak: kotak pasir dicipta dalam letusan besar, ia merangkumi fungsi heterogen dan keperluan pengasingan, ia mengekalkan keadaan merentas interaksi berbilang pusingan yang panjang, dan ia menarik daripada korpora imej besar dengan penggunaan semula yang sangat terhad.

Hasilnya, menurut DeepSeek, ialah ejen sokongan memerlukan platform pelaksanaan anjal dan bukannya satu masa jalan kotak pasir. Imej bekas yang dipesan lebih dahulu yang berfungsi untuk satu tugasan bukanlah asas untuk berjuta-juta pelancaran sehari.

Empat Bahagian Belakang Kotak Pasir Di Belakang Satu SDK

DSec mendedahkan empat bahagian belakang kotak pasir yang berbeza — FnCall, bekas, mikroVM dan mesin maya penuh — melalui SDK bersatu, membenarkan saluran paip latihan memilih tahap pengasingan yang diperlukan oleh setiap tugas. Platform menyelaraskan penempatan dan pengurusan kitaran hayat merentas kluster, dan mengarang persekitaran daripada lapisan versi bebas supaya komponen biasa dikongsi dan bukannya diduplikasi.

Ketumpatan adalah tempat kejuruteraan menjadi agresif. DSec menggabungkan perkongsian memori, penambakan memori dan penjadualan CPU untuk menjalankan kotak pasir pada ketumpatan tinggi pada perkakasan yang dikongsi, dan memuatkan data imej atas permintaan daripada Sistem Fail Fire-Flyer (3FS), sistem fail teragih seluruh kluster DeepSeek, dan bukannya menyalin imej penuh ke setiap nod.

Disambungkan ke Gelung RL

Keputusan reka bentuk yang paling penting ialah DSec telah direka bentuk bersama dengan rangka kerja pembelajaran pengukuhan DeepSeek dan bukannya dibina di sebelahnya. Platform ini memisahkan pelaksanaan pelancaran stateful daripada latihan GPU yang boleh dielakkan, dan menyelaraskan kitaran hayat kotak pasir dengan larian latihan supaya keadaan pelancaran dikekalkan manakala sumber terbiar dituntut semula untuk kerja lain.

Makalah itu juga menyatakan bahawa DSec mengurangkan salah laku ejen seperti penggodaman ganjaran — mod kegagalan di mana ejen memainkan isyarat ganjarannya dan bukannya menyelesaikan tugas. Pengasingan, dengan kata lain, bukan sekadar ciri kecekapan; ia adalah sempadan pembendungan untuk sistem yang, mengikut reka bentuk, dibenarkan untuk melaksanakan kod dan mengambil tindakan secara autonomi.

Skala, dalam Nombor

Satu unit skala pengeluaran tunggal DSec merangkumi sekitar 160 nod, menurut kertas itu. Unit itu menyediakan kira-kira 3 juta kotak pasir setiap hari, menyokong lebih daripada 380,000 kotak pasir serentak dan mengekalkan lebih daripada 5,000 ciptaan kotak pasir sesaat. DeepSeek melaporkan bahawa mekanisme ini mengurangkan persediaan persekitaran dan overhed pengedaran imej, meningkatkan kecekapan memori dan mengekalkan prestasi sensitif kependaman walaupun di bawah overcommit berketumpatan tinggi.

Mengapa Ia Penting

Kertas itu ialah laporan sistem daripada DeepSeek tentang infrastruktur DeepSeek sendiri, jadi ia harus dibaca sebagai pendedahan syarikat dan bukannya audit bebas — dan ia memfokuskan pada seni bina dan bukannya pada kos atau perolehan perkakasan. Walaupun dengan kaveat tersebut, ia menawarkan rupa konkrit yang jarang berlaku di dalam bahagian makmal AI yang tidak pernah disebut oleh siaran akhbar.

Tiga makanan bawaan menyerlah. Pertama, pembelajaran pengukuhan ejen telah menjadi disiplin infrastruktur tersendiri: sesiapa yang boleh melaksanakan pelancaran yang paling banyak, paling cepat, dalam pengasingan yang boleh dipercayai boleh mengulangi latihan ejen lebih cepat daripada saingan. Kedua, reka bentuk kotak pasir kini merupakan mekanisme keselamatan seperti prestasi — pada bulan yang sama DeepSeek menerbitkan platform yang dibina untuk mengandungi ejen penggodam ganjaran, OpenAI menghentikan latihan model sempadan selepas ejennya mempamerkan tingkah laku yang tidak dijangka di tapak web kerajaan A.S. dan Anthropic sebelum ini menghentikan latihan selepas ejen Claudenya sendiri menjadi penyangak. Ketiga, pendedahan itu menandakan keyakinan: menerbitkan bentuk susunan latihan anda menjemput pesaing untuk memadankannya, dan DeepSeek kelihatan selesa dengan perlumbaan itu.

Untuk semua ejen latihan yang jauh lebih sedikit daripada 160 nod, kertas itu berfungsi sebagai rujukan reka bentuk — pelan tindakan awam untuk jentera yang tidak menarik yang menjadikan model pintar menjadi ejen yang berfungsi.
---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →