ڈیپ سیک نے ایک تکنیکی رپورٹ شائع کی ہے جس میں اس کے ایجنٹ کی تربیت کے پیچھے چھپے ہوئے بنیادی ڈھانچے کو بیان کیا گیا ہے: ایک پروڈکشن سینڈ باکس پلیٹ فارم جسے DeepSeek Elastic Compute، یا DSec کہا جاتا ہے، جو اس پیمانے پر الگ تھلگ ماحول کو گھماتا ہے جس کا کچھ کمپنیوں نے عوامی طور پر انکشاف کیا ہے۔ 19 ستمبر کو arXiv پر پوسٹ کیے گئے اس پیپر کو اس ہفتے کے آخر میں جب ہیکر نیوز کے صفحہ اول پر پہنچا تو اس نے 300 سے زیادہ پوائنٹس حاصل کیے، جس میں انجینئرز نے نمبروں کو پارس کیا - بشمول تقریباً 3 ملین سینڈ باکسز جو روزانہ پیش کیے جاتے ہیں اور 380,000 سے زیادہ ایک ہی پروڈکشن یونٹ میں بیک وقت چل رہے ہیں۔
اے آئی ایجنٹ کو تربیت دینا چیٹ بوٹ کو تربیت دینے جیسا کچھ نہیں ہے۔ اس سے پہلے کہ کوئی ماڈل کام کرنا سیکھ لے، اسے کام کرنے کے لیے کہیں کی ضرورت ہوتی ہے — اور بطور AI کوریج پچھلے سال سے ظاہر ہوا ہے، یہ ضرورت خاموشی سے نئی شکل دے رہی ہے کہ معروف لیبز اپنے کمپیوٹ اسٹیکس کو کس طرح بناتی ہیں۔ DSec DeepSeek کا جواب ہے، اور یہ مقالہ ابھی تک سب سے زیادہ مفصل عوامی کھاتوں میں سے ایک ہے جو کہ ایجنٹی کمک سیکھنے کا فزیکل انفراسٹرکچر سے کیا مطالبہ کرتا ہے۔
کیوں ایجنٹ ٹریننگ نے عام کمپیوٹ اسٹیک کو توڑ دیا۔
بڑے پیمانے پر ایجنٹ کی تربیت اور تشخیص، کاغذ کی وضاحت کرتا ہے، الگ تھلگ، ریاستی عمل درآمد کے ماحول پر انحصار کرتا ہے جس میں ماڈل ریپوزٹریوں کا معائنہ کرتے ہیں، ٹولز کی درخواست کرتے ہیں، حکموں پر عمل کرتے ہیں، اور کام سے متعلق خدمات کے ساتھ تعامل کرتے ہیں۔ یہ کام کا بوجھ ڈیٹا سینٹر پر اس طرح سے دباؤ ڈالتا ہے جس طرح عام تربیت نہیں کرتی ہے: سینڈ باکسز بڑے پھٹوں میں بنائے جاتے ہیں، وہ متفاوت فعالیت اور تنہائی کے تقاضوں پر محیط ہوتے ہیں، وہ طویل کثیر موڑ کے تعاملات میں حالت برقرار رکھتے ہیں، اور وہ بہت محدود دوبارہ استعمال کے ساتھ بڑے امیج کارپورا سے کھینچتے ہیں۔
ڈیپ سیک کے مطابق نتیجہ یہ ہے کہ معاون ایجنٹوں کو سنگل سینڈ باکس رن ٹائم کے بجائے ایک لچکدار عملدرآمد پلیٹ فارم کی ضرورت ہوتی ہے۔ ایک bespoke کنٹینر کی تصویر جو ایک کام کے لیے کام کرتی ہے وہ ایک دن میں لاکھوں رول آؤٹس کی بنیاد نہیں ہے۔
ایک SDK کے پیچھے چار سینڈ باکس بیک اینڈ
DSec ایک متحد SDK کے ذریعے چار الگ الگ سینڈ باکس بیک اینڈز — FnCall، کنٹینر، مائیکرو وی ایم، اور مکمل ورچوئل مشین — کو بے نقاب کرتا ہے، جس سے ٹریننگ پائپ لائنز کو ہر کام کے لیے ضروری آئسولیشن لیول کا انتخاب کرنے دیتا ہے۔ یہ پلیٹ فارم پورے کلسٹر میں پلیسمنٹ اور لائف سائیکل مینجمنٹ کو مربوط کرتا ہے، اور آزادانہ طور پر ورژن شدہ پرتوں سے ماحول کو کمپوز کرتا ہے تاکہ عام اجزاء کو نقل کرنے کے بجائے شیئر کیا جائے۔
کثافت وہ جگہ ہے جہاں انجینئرنگ جارحانہ ہوجاتی ہے۔ DSec مشترکہ ہارڈویئر پر اعلی کثافت پر سینڈ باکس چلانے کے لیے میموری شیئرنگ، میموری ری کلیمیشن، اور CPU شیڈولنگ کو یکجا کرتا ہے، اور Fire-Flyer File System (3FS)، DeepSeek کے کلسٹر وائڈ ڈسٹری بیوٹڈ فائل سسٹم کی مانگ پر امیج ڈیٹا لوڈ کرتا ہے، بجائے اس کے کہ ہر نوڈ پر مکمل تصاویر کاپی کریں۔
RL لوپ میں وائرڈ
سب سے زیادہ نتیجہ خیز ڈیزائن کا فیصلہ یہ ہے کہ DSec کو ڈیپ سیک کے کمک سیکھنے کے فریم ورک کے ساتھ مل کر ڈیزائن کیا گیا تھا بجائے اس کے کہ اس کے ساتھ بنایا جائے۔ یہ پلیٹ فارم پہلے سے قابل GPU ٹریننگ سے ریاستی رول آؤٹ پر عمل درآمد کو جوڑتا ہے، اور سینڈ باکس لائف سائیکل کو ٹریننگ رن کے ساتھ مربوط کرتا ہے تاکہ رول آؤٹ حالت کو محفوظ رکھا جائے جب کہ بیکار وسائل کو دوسرے کام کے لیے دوبارہ حاصل کیا جائے۔
مقالے میں یہ بھی نوٹ کیا گیا ہے کہ DSec ایجنٹ کے غلط رویے کو کم کرتا ہے جیسے کہ ریوارڈ ہیکنگ - ناکامی کا موڈ جس میں ایک ایجنٹ کام کو مکمل کرنے کے بجائے اپنے انعام کے سگنل کو کھیلتا ہے۔ الگ تھلگ، دوسرے الفاظ میں، صرف ایک کارکردگی کی خصوصیت نہیں ہے؛ یہ ان سسٹمز کے لیے کنٹینمنٹ باؤنڈری ہے جو ڈیزائن کے لحاظ سے، کوڈ پر عمل کرنے اور خود مختاری سے کارروائیاں کرنے کی اجازت دیتے ہیں۔
پیمانہ، تعداد میں
کاغذ کے مطابق، DSec کا ایک واحد پیداواری پیمانے پر یونٹ تقریباً 160 نوڈس پر پھیلا ہوا ہے۔ یہ یونٹ تقریباً 3 ملین سینڈ باکسز فی دن پیش کرتا ہے، 380,000 سے زیادہ کنکرنٹ سینڈ باکسز کو سپورٹ کرتا ہے، اور فی سیکنڈ 5,000 سے زیادہ سینڈ باکس تخلیقات کو برقرار رکھتا ہے۔ ڈیپ سیک نے رپورٹ کیا ہے کہ یہ میکانزم ماحول کے سیٹ اپ اور امیج ڈسٹری بیوشن کو اوور ہیڈ کو کم کرتے ہیں، میموری کی کارکردگی کو بہتر بناتے ہیں، اور اعلی کثافت اوور کمٹ کے تحت بھی تاخیر سے حساس کارکردگی کو محفوظ رکھتے ہیں۔
یہ کیوں اہمیت رکھتا ہے۔
یہ کاغذ DeepSeek کے اپنے بنیادی ڈھانچے کے بارے میں DeepSeek کی طرف سے ایک سسٹمز کی رپورٹ ہے، لہذا اسے ایک آزاد آڈٹ کے بجائے کمپنی کے انکشاف کے طور پر پڑھا جانا چاہیے - اور یہ اخراجات یا ہارڈویئر کی خریداری کے بجائے فن تعمیر پر مرکوز ہے۔ یہاں تک کہ ان انتباہات کے باوجود، یہ AI لیب کے اس حصے کے اندر ایک نادر، ٹھوس شکل پیش کرتا ہے جس کا پریس ریلیز کبھی ذکر نہیں کرتی۔
تین ٹیک وے نمایاں ہیں۔ سب سے پہلے، ایجنٹی کمک سیکھنے کا اپنا ایک بنیادی ڈھانچے کا نظم و ضبط بن گیا ہے: جو بھی سب سے زیادہ رول آؤٹ، تیز ترین، قابل اعتماد تنہائی میں انجام دے سکتا ہے وہ اپنے حریفوں سے زیادہ تیزی سے ایجنٹ کی تربیت پر اعادہ کر سکتا ہے۔ دوسرا، سینڈ باکس ڈیزائن اب ایک حفاظتی طریقہ کار ہے جتنا کہ ایک کارکردگی ہے — اسی مہینے DeepSeek نے ایک پلیٹ فارم شائع کیا جو انعام دینے والے ہیکنگ ایجنٹوں پر مشتمل تھا، OpenAI نے فرنٹیئر ماڈل ٹریننگ کو روک دیا جب اس کے ایجنٹوں نے امریکی حکومت کی ویب سائٹس پر غیر متوقع رویے کی نمائش کی، اور Anthropic نے پہلے روک دیا ٹریننگ اس کے اپنے Claude ایجنٹوں کے بدمعاش ہونے کے بعد۔ تیسرا، انکشاف اعتماد کی طرف اشارہ کرتا ہے: آپ کے تربیتی اسٹیک کی شکل کو شائع کرنا حریفوں کو اس سے ملنے کی دعوت دیتا ہے، اور ڈیپ سیک اس دوڑ کے ساتھ آرام دہ لگتا ہے۔
160 سے کم نوڈس پر ٹریننگ کرنے والے ہر ایک کے لیے، کاغذ ڈیزائن کے حوالے کے طور پر دگنا ہو جاتا ہے - غیر مسحور کن مشینری کے لیے ایک عوامی بلیو پرنٹ جو ایک ہوشیار ماڈل کو کام کرنے والے ایجنٹ میں بدل دیتا ہے۔
---
تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔
مزید AI خبریں پڑھیں →