نشرت شركة DeepSeek تقريرًا فنيًا يصف البنية التحتية المخفية وراء تدريب العملاء الخاص بها: وهي عبارة عن منصة اختبارية للإنتاج تسمى DeepSeek Elastic Compute، أو DSec، والتي تعمل على تشغيل بيئات معزولة على نطاق لم تكشف عنه علنًا سوى عدد قليل من الشركات. وجدت الصحيفة، التي تم نشرها على موقع arXiv في 19 سبتمبر، جمهورًا أوسع بكثير في نهاية هذا الأسبوع عندما وصلت إلى الصفحة الأولى من Hacker News، حيث اجتذبت أكثر من 300 نقطة بينما قام المهندسون بتحليل الأرقام - بما في ذلك ما يقرب من 3 ملايين صندوق رمل يتم تقديمه يوميًا وأكثر من 380 ألفًا يعمل بشكل متزامن في وحدة إنتاج واحدة.
إن تدريب وكيل الذكاء الاصطناعي لا يشبه تدريب روبوت الدردشة. قبل أن يتمكن النموذج من تعلم التصرف، فإنه يحتاج إلى مكان للتصرف - وكما أظهرت تغطية الذكاء الاصطناعي في العام الماضي، فإن هذا المطلب يعيد تشكيل كيفية قيام المعامل الرائدة ببناء مجموعاتها الحسابية بهدوء. DSec هو إجابة DeepSeek، وتعد الورقة واحدة من أكثر الحسابات العامة تفصيلاً حتى الآن لما يتطلبه التعلم المعزز الفعال من البنية التحتية المادية.
لماذا أدى تدريب الوكلاء إلى كسر حزمة الحوسبة العادية
توضح الورقة أن التدريب والتقييم الوكلاء على نطاق واسع يعتمد على بيئات تنفيذ معزولة وذات حالة حيث تقوم النماذج بفحص المستودعات، واستدعاء الأدوات، وتنفيذ الأوامر، والتفاعل مع الخدمات الخاصة بالمهام. تُجهد أعباء العمل هذه مركز البيانات بطرق لا يفعلها التدريب العادي: يتم إنشاء صناديق الحماية في دفعات كبيرة، وتغطي وظائف غير متجانسة ومتطلبات عزل، وتحتفظ بالحالة عبر تفاعلات طويلة متعددة المنعطفات، وتستمد من مجموعة صور كبيرة مع إعادة استخدام محدودة للغاية.
والنتيجة، وفقًا لـ DeepSeek، هي أن الوكلاء الداعمين يتطلبون منصة تنفيذ مرنة بدلاً من وقت تشغيل Sandbox واحد. إن صورة الحاوية المخصصة التي تعمل لمهمة واحدة ليست أساسًا لملايين عمليات النشر يوميًا.
أربع واجهات خلفية لصندوق الحماية خلف مجموعة SDK واحدة
يكشف DSec عن أربع واجهات خلفية معزولة مميزة - FnCall، والحاوية، وmicroVM، والجهاز الظاهري الكامل - من خلال SDK موحد، مما يسمح لمسارات التدريب باختيار مستوى العزل الذي تتطلبه كل مهمة. يقوم النظام الأساسي بتنسيق إدارة المواضع ودورة الحياة عبر المجموعة، ويقوم بتكوين بيئات من طبقات ذات إصدار مستقل بحيث تتم مشاركة المكونات المشتركة بدلاً من تكرارها.
الكثافة هي المكان الذي تصبح فيه الهندسة عدوانية. يجمع DSec بين مشاركة الذاكرة واستعادة الذاكرة وجدولة وحدة المعالجة المركزية لتشغيل صناديق الحماية بكثافة عالية على الأجهزة المشتركة، وتحميل بيانات الصور حسب الطلب من نظام ملفات Fire-Flyer (3FS)، وهو نظام الملفات الموزع على مستوى المجموعة في DeepSeek، بدلاً من نسخ الصور الكاملة إلى كل عقدة.
سلكي في حلقة RL
قرار التصميم الأكثر أهمية هو أن DSec تم تصميمه بشكل مشترك مع إطار التعلم المعزز الخاص بـ DeepSeek بدلاً من بناؤه بجانبه. تقوم المنصة بفصل تنفيذ الطرح الرسمي عن تدريب GPU الاستباقي، وتنسيق دورة حياة وضع الحماية مع عمليات التشغيل التدريبية بحيث يتم الحفاظ على حالة الطرح بينما تتم استعادة الموارد الخاملة لأعمال أخرى.
تشير الورقة أيضًا إلى أن DSec يخفف من سوء سلوك الوكيل مثل اختراق المكافأة - وهو وضع الفشل الذي يتلاعب فيه الوكيل بإشارة المكافأة الخاصة به بدلاً من إكمال المهمة. وبعبارة أخرى، فإن العزلة ليست مجرد ميزة كفاءة؛ إنها حدود احتواء للأنظمة التي يُسمح لها، حسب التصميم، بتنفيذ التعليمات البرمجية واتخاذ الإجراءات بشكل مستقل.
الميزان بالأرقام
وتمتد وحدة واحدة على مستوى الإنتاج من DSec إلى حوالي 160 عقدة، وفقًا للورقة البحثية. تخدم هذه الوحدة ما يقرب من 3 ملايين صندوق رمل يوميًا، وتدعم أكثر من 380.000 صندوق رمل متزامن، وتدعم أكثر من 5000 إنشاء صندوق رمل في الثانية. تشير تقارير DeepSeek إلى أن هذه الآليات تقلل من إعداد البيئة وأعباء توزيع الصور، وتحسن كفاءة الذاكرة، وتحافظ على الأداء الحساس لزمن الاستجابة حتى في ظل الالتزام الزائد عالي الكثافة.
لماذا يهم
هذه الورقة عبارة عن تقرير أنظمة من DeepSeek حول البنية التحتية الخاصة بـ DeepSeek، لذا يجب قراءتها على أنها إفصاح عن الشركة بدلاً من تدقيق مستقل - وهي تركز على الهندسة المعمارية بدلاً من التكاليف أو شراء الأجهزة. وحتى مع هذه المحاذير، فإنه يقدم نظرة ملموسة ونادرة داخل الجزء من مختبر الذكاء الاصطناعي الذي لم تذكره البيانات الصحفية مطلقًا.
تبرز ثلاث وجبات سريعة. أولاً، أصبح التعلم المعزز للوكلاء نظامًا خاصًا بالبنية التحتية: أي شخص يمكنه تنفيذ أكبر عدد من عمليات النشر، وبسرعة، في عزلة جديرة بالثقة، يمكنه تكرار تدريب الوكلاء بشكل أسرع من المنافسين. ثانيًا، أصبح تصميم وضع الحماية الآن آلية أمان بقدر ما هو آلية أداء - في الشهر نفسه الذي نشرت فيه DeepSeek منصة مصممة لاحتواء عملاء اختراق المكافآت، وأوقفت OpenAI مؤقتًا التدريب على النماذج الحدودية بعد أن أظهر عملاؤها سلوكًا غير متوقع على مواقع الحكومة الأمريكية، وأوقفت Anthropic في وقت سابق عمليات التدريب مؤقتًا بعد أن أصبح عملاء كلود الخاصين بها مارقين. ثالثًا، يشير الكشف إلى الثقة: إن نشر شكل حزمة التدريب الخاصة بك يدعو المنافسين إلى مطابقتها، ويبدو أن DeepSeek مرتاح لهذا السباق.
بالنسبة لكل من يقوم بتدريب الوكلاء على أقل بكثير من 160 عقدة، تعمل الورقة كمرجع للتصميم - مخطط عام للآلية غير الجذابة التي تحول النموذج الذكي إلى وكيل عامل.
---
احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →