DeepSeek یک گزارش فنی منتشر کرده است که زیرساخت های پنهان پشت آموزش نمایندگان خود را شرح می دهد: یک پلتفرم سندباکس تولیدی به نام DeepSeek Elastic Compute یا DSec که محیط های ایزوله را در مقیاسی که تعداد کمی از شرکت ها به طور عمومی افشا کرده اند می چرخاند. این مقاله که در 19 سپتامبر در arXiv پست شد، در آخر این هفته با رسیدن به صفحه اول هکر نیوز، مخاطبان بسیار بیشتری پیدا کرد و بیش از 300 امتیاز را به عنوان مهندسین تجزیه اعداد به دست آورد - از جمله تقریباً 3 میلیون جعبه شنی که در روز ارائه می شود و بیش از 380000 به طور همزمان در یک واحد تولیدی کار می کنند.

آموزش یک عامل هوش مصنوعی مانند آموزش یک چت بات نیست. قبل از اینکه یک مدل بتواند عمل کردن را بیاموزد، به جایی برای عمل نیاز دارد - و [همانطور که پوشش هوش مصنوعی] (https://aibuzzwire.news) در سال گذشته نشان داده است، این نیاز به آرامی نحوه ساختن پشته‌های محاسباتی توسط آزمایشگاه‌های پیشرو را تغییر می‌دهد. DSec پاسخ DeepSeek است و این مقاله یکی از دقیق‌ترین گزارش‌های عمومی است که هنوز در مورد آنچه یادگیری تقویتی عاملی از زیرساخت فیزیکی می‌خواهد است.

چرا Agent Training پشته محاسباتی عادی را شکست

این مقاله توضیح می‌دهد که آموزش و ارزیابی عاملی در مقیاس بزرگ، بر محیط‌های اجرای ایزوله و حالت‌دار تکیه می‌کند که در آن مدل‌ها مخازن را بازرسی می‌کنند، ابزارها را فراخوانی می‌کنند، دستورات را اجرا می‌کنند و با سرویس‌های ویژه کار تعامل دارند. این بارهای کاری به گونه‌ای که آموزش معمولی بر آن فشار وارد نمی‌کند: جعبه‌های شنی به‌صورت انفجاری بزرگ ایجاد می‌شوند، عملکردهای ناهمگن و الزامات جداسازی را در بر می‌گیرند، حالت را در طول تعاملات چند چرخشی طولانی حفظ می‌کنند، و از پیکره‌های تصویری بزرگ با استفاده مجدد بسیار محدود ترسیم می‌کنند.

نتیجه، طبق گفته DeepSeek، این است که عوامل پشتیبانی به یک پلت فرم اجرای الاستیک به جای یک زمان اجرا سندباکس واحد نیاز دارند. یک تصویر ظرف سفارشی که برای یک کار کار می‌کند، پایه‌ای برای میلیون‌ها نسخه در روز نیست.

چهار ساندباکس پشتیبان پشت یک SDK

DSec از طریق یک SDK یکپارچه، چهار پشتوانه سندباکس متمایز - FnCall، کانتینر، microVM و ماشین مجازی کامل را در معرض دید قرار می‌دهد و به خطوط لوله آموزشی اجازه می‌دهد سطح ایزوله‌سازی مورد نیاز هر کار را انتخاب کنند. این پلتفرم مدیریت مکان و چرخه حیات را در سراسر خوشه هماهنگ می‌کند و محیط‌ها را از لایه‌های نسخه‌سازی شده مستقل می‌سازد تا اجزای مشترک به جای تکراری، به اشتراک گذاشته شوند.

تراکم جایی است که مهندسی تهاجمی می شود. DSec اشتراک‌گذاری حافظه، احیای حافظه و زمان‌بندی CPU را برای اجرای جعبه‌های sandbox با تراکم بالا بر روی سخت‌افزار مشترک ترکیب می‌کند، و داده‌های تصویر را در صورت درخواست از سیستم فایل Fire-Flyer (3FS)، سیستم فایل توزیع شده در کلستر DeepSeek، به جای کپی کردن تصاویر کامل در هر گره، بارگیری می‌کند.

به حلقه RL متصل شد

مهم ترین تصمیم طراحی این است که DSec به جای اینکه در کنار آن ساخته شود، با چارچوب یادگیری تقویتی DeepSeek مشترک طراحی شده است. این پلتفرم اجرای راه‌اندازی حالت را از آموزش GPU پیش‌گیرانه جدا می‌کند و چرخه حیات سندباکس را با دوره‌های آموزشی هماهنگ می‌کند تا وضعیت عرضه حفظ شود در حالی که منابع غیرفعال برای کارهای دیگر بازیابی می‌شوند.

این مقاله همچنین خاطرنشان می کند که DSec رفتار نادرست عامل مانند هک پاداش را کاهش می دهد - حالت شکست که در آن یک نماینده به جای تکمیل کار، سیگنال پاداش خود را بازی می کند. به عبارت دیگر، جداسازی فقط یک ویژگی کارآمدی نیست. این یک مرز محدود برای سیستم هایی است که بر اساس طراحی، مجاز به اجرای کد و انجام اقدامات مستقل هستند.

مقیاس، به اعداد

طبق این مقاله، یک واحد در مقیاس تولید DSec حدود 160 گره را در بر می گیرد. این واحد تقریباً به 3 میلیون sandbox در روز سرویس می دهد، بیش از 380000 sandbox همزمان را پشتیبانی می کند و بیش از 5000 ساخت sandbox را در ثانیه حفظ می کند. DeepSeek گزارش می‌دهد که این مکانیسم‌ها تنظیمات محیط و سربار توزیع تصویر را کاهش می‌دهند، کارایی حافظه را بهبود می‌بخشند و عملکرد حساس به تأخیر را حتی در زیر تعهد بیش از حد با چگالی بالا حفظ می‌کنند.

چرا مهم است

این مقاله یک گزارش سیستمی از DeepSeek در مورد زیرساخت خود DeepSeek است، بنابراین باید به‌عنوان افشای شرکت خوانده شود تا یک ممیزی مستقل - و به جای هزینه‌ها یا خرید سخت‌افزار، بر معماری تمرکز دارد. حتی با وجود این اخطارها، ظاهری نادر و ملموس در داخل بخشی از آزمایشگاه هوش مصنوعی ارائه می‌کند که در بیانیه‌های مطبوعاتی هرگز به آن اشاره نمی‌شود.

سه غذای آماده برجسته هستند. اولاً، یادگیری تقویتی عاملی تبدیل به یک رشته زیرساختی برای خود شده است: هرکسی که بتواند بیشترین راه‌اندازی‌ها را، سریع‌ترین، و در انزوا قابل اعتماد اجرا کند، می‌تواند سریع‌تر از رقبا آموزش‌های عامل را تکرار کند. دوم، طراحی sandbox در حال حاضر به همان اندازه یک مکانیسم ایمنی است - در همان ماه که DeepSeek پلتفرمی را منتشر کرد که حاوی عوامل هک پاداش بود، OpenAI آموزش مدل مرزی را پس از نشان دادن رفتار غیرمنتظره‌ای در وب‌سایت‌های دولت ایالات متحده متوقف کرد، و Anthropic قبل از آن، آموزش‌ها را متوقف کرد، پس از اینکه ماموران کلاود خود را سرکش کردند. سوم، افشای اطلاعات نشان‌دهنده اعتماد است: انتشار شکل پشته تمرینی شما، رقبا را دعوت می‌کند تا با آن مطابقت کنند، و DeepSeek با آن مسابقه راحت به نظر می‌رسد.

برای همه افرادی که در کمتر از 160 گره آموزش می دهند، این مقاله به عنوان یک مرجع طراحی دوچندان می شود - طرحی عمومی برای ماشین آلات بی زرق و برق که یک مدل هوشمندانه را به یک عامل کار تبدیل می کند.
---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →