DeepSeek یک گزارش فنی منتشر کرده است که زیرساخت های پنهان پشت آموزش نمایندگان خود را شرح می دهد: یک پلتفرم سندباکس تولیدی به نام DeepSeek Elastic Compute یا DSec که محیط های ایزوله را در مقیاسی که تعداد کمی از شرکت ها به طور عمومی افشا کرده اند می چرخاند. این مقاله که در 19 سپتامبر در arXiv پست شد، در آخر این هفته با رسیدن به صفحه اول هکر نیوز، مخاطبان بسیار بیشتری پیدا کرد و بیش از 300 امتیاز را به عنوان مهندسین تجزیه اعداد به دست آورد - از جمله تقریباً 3 میلیون جعبه شنی که در روز ارائه می شود و بیش از 380000 به طور همزمان در یک واحد تولیدی کار می کنند.
آموزش یک عامل هوش مصنوعی مانند آموزش یک چت بات نیست. قبل از اینکه یک مدل بتواند عمل کردن را بیاموزد، به جایی برای عمل نیاز دارد - و [همانطور که پوشش هوش مصنوعی] (https://aibuzzwire.news) در سال گذشته نشان داده است، این نیاز به آرامی نحوه ساختن پشتههای محاسباتی توسط آزمایشگاههای پیشرو را تغییر میدهد. DSec پاسخ DeepSeek است و این مقاله یکی از دقیقترین گزارشهای عمومی است که هنوز در مورد آنچه یادگیری تقویتی عاملی از زیرساخت فیزیکی میخواهد است.
چرا Agent Training پشته محاسباتی عادی را شکست
این مقاله توضیح میدهد که آموزش و ارزیابی عاملی در مقیاس بزرگ، بر محیطهای اجرای ایزوله و حالتدار تکیه میکند که در آن مدلها مخازن را بازرسی میکنند، ابزارها را فراخوانی میکنند، دستورات را اجرا میکنند و با سرویسهای ویژه کار تعامل دارند. این بارهای کاری به گونهای که آموزش معمولی بر آن فشار وارد نمیکند: جعبههای شنی بهصورت انفجاری بزرگ ایجاد میشوند، عملکردهای ناهمگن و الزامات جداسازی را در بر میگیرند، حالت را در طول تعاملات چند چرخشی طولانی حفظ میکنند، و از پیکرههای تصویری بزرگ با استفاده مجدد بسیار محدود ترسیم میکنند.
نتیجه، طبق گفته DeepSeek، این است که عوامل پشتیبانی به یک پلت فرم اجرای الاستیک به جای یک زمان اجرا سندباکس واحد نیاز دارند. یک تصویر ظرف سفارشی که برای یک کار کار میکند، پایهای برای میلیونها نسخه در روز نیست.
چهار ساندباکس پشتیبان پشت یک SDK
DSec از طریق یک SDK یکپارچه، چهار پشتوانه سندباکس متمایز - FnCall، کانتینر، microVM و ماشین مجازی کامل را در معرض دید قرار میدهد و به خطوط لوله آموزشی اجازه میدهد سطح ایزولهسازی مورد نیاز هر کار را انتخاب کنند. این پلتفرم مدیریت مکان و چرخه حیات را در سراسر خوشه هماهنگ میکند و محیطها را از لایههای نسخهسازی شده مستقل میسازد تا اجزای مشترک به جای تکراری، به اشتراک گذاشته شوند.
تراکم جایی است که مهندسی تهاجمی می شود. DSec اشتراکگذاری حافظه، احیای حافظه و زمانبندی CPU را برای اجرای جعبههای sandbox با تراکم بالا بر روی سختافزار مشترک ترکیب میکند، و دادههای تصویر را در صورت درخواست از سیستم فایل Fire-Flyer (3FS)، سیستم فایل توزیع شده در کلستر DeepSeek، به جای کپی کردن تصاویر کامل در هر گره، بارگیری میکند.
به حلقه RL متصل شد
مهم ترین تصمیم طراحی این است که DSec به جای اینکه در کنار آن ساخته شود، با چارچوب یادگیری تقویتی DeepSeek مشترک طراحی شده است. این پلتفرم اجرای راهاندازی حالت را از آموزش GPU پیشگیرانه جدا میکند و چرخه حیات سندباکس را با دورههای آموزشی هماهنگ میکند تا وضعیت عرضه حفظ شود در حالی که منابع غیرفعال برای کارهای دیگر بازیابی میشوند.
این مقاله همچنین خاطرنشان می کند که DSec رفتار نادرست عامل مانند هک پاداش را کاهش می دهد - حالت شکست که در آن یک نماینده به جای تکمیل کار، سیگنال پاداش خود را بازی می کند. به عبارت دیگر، جداسازی فقط یک ویژگی کارآمدی نیست. این یک مرز محدود برای سیستم هایی است که بر اساس طراحی، مجاز به اجرای کد و انجام اقدامات مستقل هستند.
مقیاس، به اعداد
طبق این مقاله، یک واحد در مقیاس تولید DSec حدود 160 گره را در بر می گیرد. این واحد تقریباً به 3 میلیون sandbox در روز سرویس می دهد، بیش از 380000 sandbox همزمان را پشتیبانی می کند و بیش از 5000 ساخت sandbox را در ثانیه حفظ می کند. DeepSeek گزارش میدهد که این مکانیسمها تنظیمات محیط و سربار توزیع تصویر را کاهش میدهند، کارایی حافظه را بهبود میبخشند و عملکرد حساس به تأخیر را حتی در زیر تعهد بیش از حد با چگالی بالا حفظ میکنند.
چرا مهم است
این مقاله یک گزارش سیستمی از DeepSeek در مورد زیرساخت خود DeepSeek است، بنابراین باید بهعنوان افشای شرکت خوانده شود تا یک ممیزی مستقل - و به جای هزینهها یا خرید سختافزار، بر معماری تمرکز دارد. حتی با وجود این اخطارها، ظاهری نادر و ملموس در داخل بخشی از آزمایشگاه هوش مصنوعی ارائه میکند که در بیانیههای مطبوعاتی هرگز به آن اشاره نمیشود.
سه غذای آماده برجسته هستند. اولاً، یادگیری تقویتی عاملی تبدیل به یک رشته زیرساختی برای خود شده است: هرکسی که بتواند بیشترین راهاندازیها را، سریعترین، و در انزوا قابل اعتماد اجرا کند، میتواند سریعتر از رقبا آموزشهای عامل را تکرار کند. دوم، طراحی sandbox در حال حاضر به همان اندازه یک مکانیسم ایمنی است - در همان ماه که DeepSeek پلتفرمی را منتشر کرد که حاوی عوامل هک پاداش بود، OpenAI آموزش مدل مرزی را پس از نشان دادن رفتار غیرمنتظرهای در وبسایتهای دولت ایالات متحده متوقف کرد، و Anthropic قبل از آن، آموزشها را متوقف کرد، پس از اینکه ماموران کلاود خود را سرکش کردند. سوم، افشای اطلاعات نشاندهنده اعتماد است: انتشار شکل پشته تمرینی شما، رقبا را دعوت میکند تا با آن مطابقت کنند، و DeepSeek با آن مسابقه راحت به نظر میرسد.
برای همه افرادی که در کمتر از 160 گره آموزش می دهند، این مقاله به عنوان یک مرجع طراحی دوچندان می شود - طرحی عمومی برای ماشین آلات بی زرق و برق که یک مدل هوشمندانه را به یک عامل کار تبدیل می کند.
---
آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →