يتم تداول مشروع صغير ولكنه ملفت للنظر على موقع Hacker News هذا الأسبوع: openTPU، وهو مسرع مفتوح المصدر للذكاء الاصطناعي تم إنتاج تصميم أجهزته بواسطة عملاء الذكاء الاصطناعي. يصف المستودع، المنشور بموجب ترخيص Apache 2.0 على GitHub، ما يسميه مؤلفوه "مسرع الذكاء الاصطناعي مفتوح المصدر، تم تطويره بواسطة الذكاء الاصطناعي" - وعلى عكس معظم العروض التوضيحية في هذا النوع، فهو يدير نماذج إنتاج حقيقية بأوزانها الحقيقية على بطاقة مادية يمكن للمتحمسين دراستها من البداية إلى النهاية.
يطرح المشروع سؤالين، على حد تعبير الملف التمهيدي الخاص به: إلى أي مدى يمكن لوكلاء الذكاء الاصطناعي أن يصلوا في تصميم الأجهزة، وهل يمكنهم بناء الشريحة التي تدير استنتاجاتهم الخاصة؟ السؤال الثاني هو السؤال الاستفزازي. إن نظام الذكاء الاصطناعي الذي يصمم السيليكون - أو في هذه الحالة، تدفق البتات FPGA - الذي يولد الرموز المميزة الخاصة به هو عبارة عن حلقة تلتقط بالضبط الاتجاه الذي يتجه إليه خيال الصناعة. لمزيد من السياق حول هذه القصة، راجع أخبار الذكاء الاصطناعي.
ما الذي يتم تشغيله فعليًا على البطاقة
هدف الأجهزة غير جذاب وفقًا لمعايير مركز البيانات: بطاقة Inspur YPCB-00338 المبنية حول Xilinx Kintex-7 xc7k480t FPGA مع قناتي DDR3 وأقصى عرض نطاق ترددي للذاكرة يبلغ 17.1 جيجابايت/ثانية. وهذا بعيد كل البعد عن مسرع HBM، مما يجعل النتائج أكثر إثارة للاهتمام، وليس أقل.
وبحسب القياسات المنشورة للمشروع، يتم تشغيل التصميم بعشرة نماذج مفتوحة حديثة بأوزانها الحقيقية. يقوم LFM2.5-230M بفك التشفير بمعدل 59 رمزًا في الثانية في int8 و85.8 رمزًا في الثانية في 4 بت. يدير Qwen3-0.6B 21.6 رمزًا مميزًا في الثانية، بينما تتقلص النماذج الأكبر حجمًا كما هو متوقع: SmolLM3-3B بمعدل 5 رموز مميزة في الثانية int8، وPhi-4-mini (3.8B) عند 4، وQwen3.5-4B بمعدل 5.9 رمزًا مميزًا في الثانية في 4 بت. يتم أيضًا تشغيل Gemma 4 E2B وE4B، مع الحفاظ على جداول التضمين لكل طبقة موجودة على البطاقة.
ذهب الفريق إلى أبعد من ذلك من خلال نماذج مختلطة من الخبراء تتجاوز 4 جيجا بايت من DRAM للبطاقة. LFM2.5-8B-A1B — 8.5 مليار معلمة مع 1.7 مليار نشطة — يتم فك التشفير بمعدل 10.6 رمزًا مميزًا في الثانية من خلال تدفق الخبراء من وحدة التخزين المضيفة، مع وصول 98.5 بالمائة من استخدامات الخبراء إلى الفتحات الموجودة على البطاقة ونقل 5.2 ميجابايت فقط لكل رمز مميز. يعمل Qwen3.5-35B-A3B بمعدل 3.95 رمزًا مميزًا في الثانية بينما يتدفق 153 ميجابايت لكل رمز مميز عبر PCIe. ينص ملف README على أن كل تكوين يطابق رمز محاكاة المشروع للرمز المميز - وهو ادعاء بدقة البت سيتعرف عليه قراصنة الأجهزة باعتباره الجزء الصعب من المهمة.
تم تصميمه كمشروع سيليكون حقيقي
ما يفصل بين openTPU وعروض هواية FPGA النموذجية هو اكتمال المكدس. يحتوي monorepo على تصميم أجهزة SystemVerilog، ومجموعة تعليمات مخصصة، ومحاكي دقيق للبت، ولغة kernel مع مترجم خاص بها، والبرنامج المضيف الذي يقوم بتشغيل بطاقة PCIe، بما في ذلك أداة مراقبة otpu-smi بروح nvidia-smi وعرض توضيحي لـ otpu-chat.
تدير صورة الإنتاج وحدة مصفوفة انقباضية مكونة من أربعة أعمدة ومحرك تيار بسرعة 133.33 ميجاهرتز، مع معايرة وحدات تحكم ذاكرة LiteDRAM بواسطة وحدة معالجة مركزية صغيرة داخل قلب الذاكرة - تقوم البطاقة بمعايرة قناتي DDR3 في 12 ثانية دون تدخل المضيف. يقوم الإصدار الحالي، الذي تم نشره منذ 1 أكتوبر، بفك تشفير العديد من النماذج بنسبة 8 إلى 10 بالمائة أسرع من الصورة السابقة بينما يدفع استخدام DRAM إلى 91 إلى 94 بالمائة من الذروة.
يوثق المشروع أيضًا تنسيق وزن 4 بت مبني على قيم FP4 مع مقاييس كتلة ذات مستويين بمعدل 4.25 بت لكل وزن، مع الحفاظ على رأس نموذج اللغة في int8 للتأكد من الدقة. يعمل هذا التنسيق على خفض وحدات البايت لكل رمز بمقدار الثلث تقريبًا ورفع سرعة فك التشفير بنسبة 40 إلى 45 بالمائة في بعض الطرز.
يعزو ملف README نهج المشروع إلى الدروس المستفادة من مستودع سابق، بطولة القوس التلقائي، التي استكشفت البحث في هندسة الأجهزة المعتمدة على الذكاء الاصطناعي. openTPU هو تطبيق هذه الطريقة على مسرع كامل، مع التحقق من صحة تصميم الوكلاء مقابل جهاز محاكاة قبل لمس الأجهزة.
لماذا يهم
الأداء هنا لن يزعج نفيديا. يعد جهاز Kintex-7 المزود بذاكرة DDR3 فئة من الأجهزة عمرها عقد من الزمن، والنماذج التي يتم تشغيلها صغيرة الحجم. ولكن هذه هي النقطة التي يشير إليها المشروع ضمنيًا: المسرّع بأكمله - RTL، ومجموعة التعليمات، والمحاكاة، والمترجم، ومكدس المضيف - يمكن قراءته لشخص واحد، في مستودع واحد، وقد تم تصميمه جزئيًا على الأقل بواسطة وكلاء الذكاء الاصطناعي بدلاً من فريق الأجهزة.
وتتلاقى ثلاثة تيارات في هذه الفكرة. أولا، ظلت أجهزة الذكاء الاصطناعي مفتوحة المصدر في وضع حرج منذ فترة طويلة بسبب اتساع نطاق الخبرة المطلوبة؛ يعمل تدفق التصميم الذي يحركه الوكيل على تقليل هذا الحاجز. ثانيًا، يدفع الطلب على الاستدلال الباحثين نحو أجهزة غريبة ذات أغراض خاصة، ويُعد البحث الآلي في التصميم مناسبًا بشكل طبيعي لاستكشاف هذا الفضاء. ثالثًا، أصبحت زاوية الاستضافة الذاتية - بناء الذكاء الاصطناعي للآلة التي تعمل عليها - إشارة يراقبها المجتمع عن كثب، استنادًا إلى الارتفاع السريع للمشروع على موقع Hacker News، حيث جمع أكثر من 150 نقطة في غضون ساعات.
تم إنشاء المستودع في 24 سبتمبر وتلقى أحدث دفعة له في 2 أكتوبر، مع نتائج مقاسة مؤرخة مؤخرًا في 1 أكتوبر - وهي وتيرة تطوير تستحق المشاهدة في حد ذاتها. بالنسبة لأي شخص يريد أن يفهم كيفية عمل مسرع الذكاء الاصطناعي بدءًا من مصفوفة تتضاعف في لغة بايثون وصولاً إلى الأسلاك، فإن إطار المشروع دقيق: كل شيء يعيش في قطعة واحدة صغيرة يمكنك قراءتها من النهاية إلى النهاية.
سواء أصبحت الأجهزة المصممة بواسطة الوكيل مجالًا جادًا أو ظلت موضع فضول بحثي، فقد أظهرت openTPU شيئًا ملموسًا: الأدوات التي تسمح لنماذج الذكاء الاصطناعي بكتابة البرامج قد أنتجت الآن نظام أجهزة فعالًا ومعتمدًا يقوم بتشغيل تلك النماذج نفسها. الحلقة مغلقة، على الأقل بمقياس FPGA.
---
ابق على اطلاع بأخبار الذكاء الاصطناعيآخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →