इस सप्ताह हैकर न्यूज़ पर एक छोटा लेकिन आकर्षक प्रोजेक्ट प्रसारित हो रहा है: ओपनटीपीयू, एक ओपन-सोर्स एआई एक्सेलेरेटर जिसका हार्डवेयर डिज़ाइन स्वयं एआई एजेंटों द्वारा निर्मित किया गया था। गिटहब पर अपाचे 2.0 लाइसेंस के तहत प्रकाशित रिपॉजिटरी, वर्णन करती है कि इसके लेखक "एआई द्वारा विकसित एक ओपन-सोर्स एआई एक्सेलेरेटर" कहते हैं - और इस शैली के अधिकांश डेमो के विपरीत, यह एक भौतिक कार्ड पर उनके वास्तविक वजन के साथ वास्तविक उत्पादन मॉडल चलाता है जिसका उत्साही लोग शुरू से अंत तक अध्ययन कर सकते हैं।
प्रोजेक्ट अपने स्वयं के README के शब्दों में, दो प्रश्न पूछता है: AI एजेंट हार्डवेयर डिज़ाइन में कितनी दूर तक जा सकते हैं, और क्या वे उस चिप का निर्माण कर सकते हैं जो उनके स्वयं के अनुमान को चलाती है? दूसरा प्रश्न उत्तेजक है. सिलिकॉन को डिजाइन करने वाला एक एआई सिस्टम - या इस मामले में, एफपीजीए बिटस्ट्रीम - जो अपने स्वयं के टोकन उत्पन्न करता है, एक लूप है जो सटीक रूप से कैप्चर करता है जहां उद्योग की कल्पना जा रही है। For more context on this story, see our ongoing AI trends.
वास्तव में कार्ड पर क्या चलता है
हार्डवेयर लक्ष्य डेटा-सेंटर मानकों के अनुसार अस्वाभाविक है: एक इंसपुर YPCB-00338 कार्ड जो Xilinx Kintex-7 xc7k480t FPGA के आसपास दो DDR3 चैनलों और 17.1 GB/s पीक मेमोरी बैंडविड्थ के साथ बनाया गया है। यह एचबीएम-स्टैक्ड एक्सेलेरेटर से बहुत दूर है, जो परिणामों को अधिक दिलचस्प बनाता है, कम नहीं।
परियोजना के प्रकाशित मापों के अनुसार, डिज़ाइन दस आधुनिक खुले मॉडलों को उनके वास्तविक वजन के साथ चलाता है। LFM2.5-230M int8 में 59 टोकन प्रति सेकंड और 4-बिट में 85.8 टोकन प्रति सेकंड पर डिकोड होता है। Qwen3-0.6B प्रति सेकंड 21.6 टोकन का प्रबंधन करता है, जबकि बड़े मॉडल उम्मीद के मुताबिक कम हो जाते हैं: SmolLM3-3B 5 टोकन प्रति सेकंड int8 पर, Phi-4-mini (3.8B) 4 पर, और Qwen3.5-4B 4-बिट में 5.9 टोकन प्रति सेकंड पर। जेम्मा 4 ई2बी और ई4बी भी कार्ड पर अपनी प्रति-परत एम्बेडिंग टेबल को बनाए रखते हुए चलते हैं।
टीम मिश्रण-विशेषज्ञ मॉडल के साथ आगे बढ़ी जो कार्ड के 4 GiB DRAM से अधिक है। LFM2.5-8B-A1B - 1.7 बिलियन सक्रिय के साथ 8.5 बिलियन पैरामीटर - होस्ट स्टोरेज से स्ट्रीमिंग विशेषज्ञों द्वारा प्रति सेकंड 10.6 टोकन पर डिकोड किया जाता है, 98.5 प्रतिशत विशेषज्ञ उपयोग ऑन-कार्ड स्लॉट पर करते हैं और प्रति टोकन केवल 5.2 एमबी स्थानांतरित होते हैं। Qwen3.5-35B-A3B PCIe पर 153 एमबी प्रति टोकन स्ट्रीमिंग करते हुए 3.95 टोकन प्रति सेकंड पर चलता है। प्रत्येक कॉन्फ़िगरेशन, README बताता है, टोकन के लिए प्रोजेक्ट के सिम्युलेटर टोकन से मेल खाता है - थोड़ा-सटीकता का दावा है कि हार्डवेयर हैकर्स काम के कठिन हिस्से के रूप में पहचानेंगे।
एक वास्तविक सिलिकॉन प्रोजेक्ट की तरह निर्मित
ओपनटीपीयू को विशिष्ट हॉबी एफपीजीए डेमो से जो अलग करता है वह स्टैक की पूर्णता है। मोनोरेपो में SystemVerilog हार्डवेयर डिज़ाइन, एक कस्टम इंस्ट्रक्शन सेट, एक बिट-सटीक सिम्युलेटर, अपने स्वयं के कंपाइलर के साथ एक कर्नेल भाषा और PCIe कार्ड को चलाने वाला होस्ट सॉफ़्टवेयर शामिल है, जिसमें nvidia-smi की भावना में एक otpu-smi मॉनिटरिंग उपयोगिता और एक otpu-चैट डेमो शामिल है।
उत्पादन छवि एक चार-कॉलम सिस्टोलिक मैट्रिक्स इकाई और 133.33 मेगाहर्ट्ज पर एक स्ट्रीम इंजन चलाती है, जिसमें मेमोरी कोर के अंदर एक छोटे सीपीयू द्वारा लाइटड्रैम मेमोरी नियंत्रकों को कैलिब्रेट किया जाता है - कार्ड बिना किसी होस्ट भागीदारी के 12 सेकंड में दोनों डीडीआर 3 चैनलों को कैलिब्रेट करता है। 1 अक्टूबर से तैनात वर्तमान बिल्ड, पिछली छवि की तुलना में कई मॉडलों को 8 से 10 प्रतिशत तेजी से डिकोड करता है, जबकि DRAM उपयोग को 91-94 प्रतिशत के चरम पर ले जाता है।
प्रोजेक्ट सटीकता के लिए भाषा-मॉडल हेड को int8 में रखते हुए, 4.25 बिट प्रति वज़न पर दो-स्तरीय ब्लॉक स्केल के साथ FP4 मानों पर निर्मित 4-बिट वज़न प्रारूप का भी दस्तावेजीकरण करता है। प्रारूप प्रति टोकन बाइट्स को लगभग एक तिहाई कम कर देता है और कुछ मॉडलों पर डिकोड गति को 40 से 45 प्रतिशत तक बढ़ा देता है।
README पहले के रिपॉजिटरी, ऑटो-आर्क-टूर्नामेंट से सबक लेने के लिए प्रोजेक्ट के दृष्टिकोण को श्रेय देता है, जिसने एआई-संचालित हार्डवेयर आर्किटेक्चर खोज की खोज की। ओपनटीपीयू एक पूर्ण त्वरक के लिए उस पद्धति का अनुप्रयोग है, जिसमें हार्डवेयर को छूने से पहले एजेंटों के डिज़ाइन को सिम्युलेटर के विरुद्ध मान्य किया जाता है।
यह क्यों मायने रखता है
यहां का प्रदर्शन एनवीडिया को परेशान नहीं करेगा। DDR3 के साथ Kintex-7 हार्डवेयर का एक दशक पुराना वर्ग है, और इसके चलने वाले मॉडल छोटे हैं। लेकिन यह वह बिंदु है जो परियोजना स्पष्ट रूप से बताती है: संपूर्ण त्वरक - आरटीएल, अनुदेश सेट, सिम्युलेटर, कंपाइलर और होस्ट स्टैक - एक रिपॉजिटरी में एक व्यक्ति के लिए सुपाठ्य है, और इसे हार्डवेयर टीम के बजाय कम से कम आंशिक रूप से एआई एजेंटों द्वारा डिजाइन किया गया था।
उस विचार में तीन धाराएँ मिलती हैं। सबसे पहले, ओपन-सोर्स एआई हार्डवेयर लंबे समय से आवश्यक विशेषज्ञता की व्यापकता के कारण अवरुद्ध है; एक एजेंट-संचालित डिज़ाइन प्रवाह उस बाधा को कम करता है। दूसरा, अनुमान की मांग शोधकर्ताओं को विदेशी विशेष प्रयोजन हार्डवेयर की ओर धकेल रही है, और स्वचालित डिज़ाइन खोज उस स्थान की खोज के लिए स्वाभाविक रूप से उपयुक्त है। तीसरा, स्व-होस्टिंग कोण - एआई उस मशीन का निर्माण करता है जिस पर वह चलता है - एक संकेत बन गया है जिसे समुदाय बारीकी से देखता है, हैकर न्यूज पर परियोजना की तेजी से वृद्धि को देखते हुए, जहां इसने घंटों के भीतर 150 से अधिक अंक एकत्र किए।
रिपॉजिटरी 24 सितंबर को बनाई गई थी और 2 अक्टूबर को इसे नवीनतम प्रोत्साहन मिला, जिसके परिणाम हाल ही में 1 अक्टूबर को आए - एक विकास गति जो अपने आप में देखने लायक है। जो कोई भी यह समझना चाहता है कि एआई एक्सेलेरेटर पायथन में मैट्रिक्स मल्टीप्लाई से लेकर तारों तक कैसे काम करता है, उसके लिए प्रोजेक्ट की स्वयं की फ़्रेमिंग सटीक है: पूरी चीज़ एक छोटे मोनोरेपो में रहती है जिसे आप शुरू से अंत तक पढ़ सकते हैं।
चाहे एजेंट द्वारा डिज़ाइन किया गया हार्डवेयर एक गंभीर विषय बन जाए या एक शोध जिज्ञासा बनी रहे, ओपनटीपीयू ने कुछ ठोस प्रदर्शन किया है: जो उपकरण एआई मॉडल को सॉफ्टवेयर लिखने देते हैं, उन्होंने अब एक कार्यशील, सत्यापित हार्डवेयर सिस्टम तैयार किया है जो उन्हीं मॉडलों को चलाता है। लूप बंद है, कम से कम एफपीजीए पैमाने पर।
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →