ایک چھوٹا لیکن حیران کن پروجیکٹ اس ہفتے ہیکر نیوز پر گردش کر رہا ہے: اوپن ٹی پی یو، ایک اوپن سورس AI ایکسلریٹر جس کا ہارڈویئر ڈیزائن خود AI ایجنٹوں نے تیار کیا تھا۔ GitHub پر اپاچی 2.0 لائسنس کے تحت شائع ہونے والا ذخیرہ بیان کرتا ہے جسے اس کے مصنفین "ایک اوپن سورس AI ایکسلریٹر کہتے ہیں، جسے AI نے تیار کیا ہے" - اور اس صنف کے زیادہ تر ڈیمو کے برعکس، یہ حقیقی پروڈکشن ماڈلز کو ان کے حقیقی وزن کے ساتھ جسمانی کارڈ پر چلاتا ہے جس کا شوقین آخر تک مطالعہ کر سکتے ہیں۔

پروجیکٹ اپنے README کے الفاظ میں دو سوالات پوچھتا ہے: AI ایجنٹس ہارڈ ویئر کے ڈیزائن میں کس حد تک جاسکتے ہیں، اور کیا وہ چپ بنا سکتے ہیں جو ان کا اپنا اندازہ چلاتا ہے؟ دوسرا سوال اشتعال انگیز ہے۔ ایک AI سسٹم جو سلیکون کو ڈیزائن کرتا ہے — یا اس معاملے میں، FPGA بٹ اسٹریم — جو اپنے ٹوکنز تیار کرتا ہے ایک ایسا لوپ ہے جو صنعت کا تخیل کس طرف جا رہا ہے۔ For more context on this story, see our ongoing AI trends.

اصل میں کارڈ پر کیا چلتا ہے۔

ہارڈ ویئر کا ہدف ڈیٹا سینٹر کے معیارات کے لحاظ سے غیر واضح ہے: ایک Inspur YPCB-00338 کارڈ جو Xilinx Kintex-7 xc7k480t FPGA کے ارد گرد بنایا گیا ہے جس میں دو DDR3 چینلز اور 17.1 GB/s چوٹی میموری بینڈوڈتھ ہے۔ یہ ایک HBM اسٹیکڈ ایکسلریٹر سے بہت دور کی بات ہے، جو نتائج کو زیادہ دلچسپ بناتا ہے، کم نہیں۔

پروجیکٹ کی شائع شدہ پیمائش کے مطابق، ڈیزائن دس جدید اوپن ماڈلز کو ان کے حقیقی وزن کے ساتھ چلاتا ہے۔ LFM2.5-230M int8 میں 59 ٹوکن فی سیکنڈ اور 4-bit میں 85.8 ٹوکن فی سیکنڈ پر ڈی کوڈ کرتا ہے۔ Qwen3-0.6B 21.6 ٹوکن فی سیکنڈ کا انتظام کرتا ہے، جب کہ بڑے ماڈلز حسب توقع کم کرتے ہیں: SmolLM3-3B 5 ٹوکن فی سیکنڈ int8 پر، Phi-4-mini (3.8B) 4 پر، اور Qwen3.5-4B 5.9 ٹوکن فی سیکنڈ میں 4 بٹ میں۔ Gemma 4 E2B اور E4B بھی چلتے ہیں، ان کی فی لیئر ایمبیڈنگ ٹیبلز کو کارڈ پر موجود رکھتے ہیں۔

ٹیم ماہرین کے مرکب ماڈلز کے ساتھ مزید آگے بڑھی جو کارڈ کے 4 GiB DRAM سے زیادہ ہے۔ LFM2.5-8B-A1B — 1.7 بلین ایکٹیو کے ساتھ 8.5 بلین پیرامیٹرز — میزبان سٹوریج کے سٹریمنگ ماہرین کے ذریعے 10.6 ٹوکن فی سیکنڈ پر ڈی کوڈ کرتا ہے، جس میں 98.5 فیصد ماہر آن کارڈ سلاٹس کو استعمال کرتے ہیں اور صرف 5.2 MB فی ٹوکن منتقل ہوتے ہیں۔ Qwen3.5-35B-A3B 3.95 ٹوکن فی سیکنڈ پر چلتا ہے جبکہ PCIe پر 153 MB فی ٹوکن چلاتا ہے۔ ہر کنفیگریشن، README کا کہنا ہے کہ، ٹوکن کے لیے پروجیکٹ کے سمیلیٹر ٹوکن سے میل کھاتا ہے — تھوڑا سا درستگی کا دعویٰ ہے کہ ہارڈویئر ہیکرز کام کے مشکل حصے کے طور پر پہچان لیں گے۔

ایک اصلی سلیکون پروجیکٹ کی طرح بنایا گیا۔

اوپن ٹی پی یو کو عام شوق FPGA ڈیمو سے جو چیز الگ کرتی ہے وہ اسٹیک کی مکملیت ہے۔ monorepo میں SystemVerilog ہارڈویئر ڈیزائن، ایک حسب ضرورت انسٹرکشن سیٹ، تھوڑا سا عین مطابق سمیلیٹر، اس کے اپنے کمپائلر کے ساتھ ایک کرنل لینگویج، اور میزبان سافٹ ویئر جو PCIe کارڈ چلاتا ہے، بشمول Nvidia-smi کی روح میں ایک otpu-smi مانیٹرنگ یوٹیلیٹی اور ایک otpu-chat ڈیمو۔

پروڈکشن امیج ایک چار کالم سیسٹولک میٹرکس یونٹ اور 133.33 میگاہرٹز پر ایک اسٹریم انجن چلاتی ہے، جس میں LiteDRAM میموری کنٹرولرز میموری کور کے اندر ایک چھوٹے CPU کے ذریعے کیلیبریٹ ہوتے ہیں - کارڈ بغیر کسی میزبان کی شمولیت کے دونوں DDR3 چینلز کو 12 سیکنڈ میں کیلیبریٹ کرتا ہے۔ موجودہ تعمیر، جو 1 اکتوبر سے تعینات ہے، کئی ماڈلز کو پچھلی تصویر سے 8 سے 10 فیصد زیادہ تیزی سے ڈی کوڈ کرتی ہے جبکہ DRAM کے استعمال کو 91-94 فیصد چوٹی تک پہنچاتی ہے۔

یہ پروجیکٹ FP4 ویلیوز پر بنایا گیا 4 بٹ ویٹ فارمیٹ بھی دستاویز کرتا ہے جس میں دو لیول بلاک اسکیلز 4.25 بٹس فی وزن پر ہوتے ہیں، درستگی کے لیے لینگویج ماڈل ہیڈ کو int8 میں رکھتے ہیں۔ فارمیٹ فی ٹوکن بائٹس کو تقریباً ایک تہائی کم کرتا ہے اور کچھ ماڈلز پر ڈی کوڈ کی رفتار کو 40 سے 45 فیصد تک بڑھا دیتا ہے۔

README پروجیکٹ کے اسباق کو ایک پرانے ریپوزٹری، آٹو-آرچ-ٹورنامنٹ کے اسباق کا سہرا دیتا ہے، جس نے AI سے چلنے والے ہارڈویئر فن تعمیر کی تلاش کو دریافت کیا تھا۔ اوپن ٹی پی یو اس طریقہ کا ایک مکمل ایکسلریٹر پر اطلاق ہے، جس میں ایجنٹوں کے ڈیزائن کو ہارڈ ویئر کو چھونے سے پہلے سمیلیٹر کے خلاف درست کیا جاتا ہے۔

یہ کیوں اہمیت رکھتا ہے۔

یہاں کی کارکردگی Nvidia کو پریشان نہیں کرے گی۔ DDR3 کے ساتھ Kintex-7 ہارڈ ویئر کی دہائیوں پرانی کلاس ہے، اور اس کے چلنے والے ماڈل چھوٹے ہیں۔ لیکن یہ وہ نکتہ ہے جو پروجیکٹ واضح طور پر بناتا ہے: پورا ایکسلریٹر — RTL، انسٹرکشن سیٹ، سمیلیٹر، کمپائلر، اور ہوسٹ اسٹیک — ایک شخص کے لیے، ایک ذخیرہ میں، اور اسے کم از کم جزوی طور پر AI ایجنٹوں نے ڈیزائن کیا تھا بجائے کہ ہارڈ ویئر ٹیم۔

اس خیال میں تین دھارے ملتے ہیں۔ سب سے پہلے، اوپن سورس AI ہارڈویئر کو طویل عرصے سے درکار مہارت کی وسیع وسعت سے روکا گیا ہے۔ ایجنٹ پر مبنی ڈیزائن کا بہاؤ اس رکاوٹ کو کم کرتا ہے۔ دوسرا، تخمینہ کی طلب محققین کو غیر ملکی خصوصی مقصد والے ہارڈ ویئر کی طرف دھکیل رہی ہے، اور خودکار ڈیزائن کی تلاش اس جگہ کو تلاش کرنے کے لیے ایک فطری فٹ ہے۔ تیسرا، سیلف ہوسٹنگ اینگل — AI جس پر مشین چلتی ہے اسے بناتا ہے — ایک سگنل بن گیا ہے جو کمیونٹی قریب سے دیکھتی ہے، ہیکر نیوز پر پروجیکٹ کے تیزی سے بڑھتے ہوئے، جہاں اس نے گھنٹوں میں 150 سے زیادہ پوائنٹس اکٹھے کیے ہیں۔

ذخیرہ 24 ستمبر کو بنایا گیا تھا اور اسے 2 اکتوبر کو اس کا تازہ ترین دھکا ملا، جس کے ناپے گئے نتائج حال ہی میں 1 اکتوبر کو بتائے گئے ہیں - ایک ترقی کی رفتار جو اپنے طور پر دیکھنے کے قابل ہے۔ ہر اس شخص کے لیے جو یہ سمجھنا چاہتا ہے کہ AI ایکسلریٹر کیسے کام کرتا ہے میٹرکس سے Python میں ملٹی پلائی نیچے تاروں تک، پروجیکٹ کی اپنی فریمنگ درست ہے: پوری چیز ایک چھوٹے سے monorepo میں رہتی ہے جسے آپ آخر تک پڑھ سکتے ہیں۔

چاہے ایجنٹ کے ذریعے ڈیزائن کردہ ہارڈویئر ایک سنجیدہ مقام بن جائے یا تحقیقی تجسس بن جائے، اوپن ٹی پی یو نے کچھ ٹھوس مظاہرہ کیا ہے: وہ ٹولز جو AI ماڈلز کو سافٹ ویئر لکھنے دیتے ہیں اب ایک کام کرنے والا، تصدیق شدہ ہارڈویئر سسٹم تیار کیا ہے جو انہی ماڈلز کو چلاتا ہے۔ لوپ بند ہے، کم از کم FPGA پیمانے پر۔

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →