या आठवड्यात हॅकर न्यूजवर एक छोटा पण धक्कादायक प्रकल्प फिरत आहे: ओपनटीपीयू, एक ओपन-सोर्स एआय प्रवेगक ज्याचे हार्डवेअर डिझाइन स्वतः एआय एजंट्सद्वारे तयार केले गेले होते. GitHub वर Apache 2.0 लायसन्स अंतर्गत प्रकाशित केलेले रेपॉजिटरी, त्याचे लेखक "AI द्वारे विकसित केलेले ओपन-सोर्स AI प्रवेगक" म्हणतात त्याचे वर्णन करते — आणि या शैलीतील बहुतेक डेमोच्या विपरीत, ते वास्तविक उत्पादन मॉडेल त्यांच्या वास्तविक वजनासह भौतिक कार्डवर चालवते ज्याचा उत्साही अभ्यास करू शकतात.

प्रकल्प स्वतःच्या README च्या शब्दात दोन प्रश्न विचारतो: हार्डवेअर डिझाइनमध्ये एआय एजंट किती दूर जाऊ शकतात आणि ते स्वतःचे अनुमान चालवणारी चिप तयार करू शकतात? दुसरा प्रश्न प्रक्षोभक आहे. सिलिकॉनची रचना करणारी AI प्रणाली — किंवा या प्रकरणात, FPGA बिटस्ट्रीम — जी स्वतःची टोकन्स व्युत्पन्न करते ती एक लूप आहे जी उद्योगाची कल्पनाशक्ती नेमकी कोठे जात आहे ते कॅप्चर करते. For more context on this story, see our ongoing more AI stories.

कार्डवर प्रत्यक्षात काय चालते

डेटा-सेंटर मानकांनुसार हार्डवेअर लक्ष्य अशोभनीय आहे: दोन DDR3 चॅनेल आणि 17.1 GB/s पीक मेमरी बँडविड्थसह Xilinx Kintex-7 xc7k480t FPGA च्या आसपास तयार केलेले Inspur YPCB-00338 कार्ड. हे HBM-स्टॅक केलेल्या प्रवेगक पासून खूप दूर आहे, जे परिणाम अधिक मनोरंजक बनवते, कमी नाही.

प्रकल्पाच्या प्रकाशित मोजमापानुसार, डिझाइन त्यांच्या वास्तविक वजनांसह दहा आधुनिक ओपन मॉडेल चालवते. LFM2.5-230M int8 मध्ये 59 टोकन प्रति सेकंद आणि 4-बिट मध्ये 85.8 टोकन प्रति सेकंद डीकोड करते. Qwen3-0.6B प्रति सेकंद 21.6 टोकन व्यवस्थापित करते, तर मोठे मॉडेल अपेक्षेप्रमाणे कमी करतात: SmolLM3-3B 5 टोकन प्रति सेकंद int8 वर, Phi-4-mini (3.8B) 4 वर आणि Qwen3.5-4B 5.9 टोकन प्रति सेकंद 4-बिटमध्ये. Gemma 4 E2B आणि E4B देखील चालतात, त्यांच्या प्रति-लेयर एम्बेडिंग टेबल्स कार्डवर राहतात.

टीम तज्ज्ञांच्या मिश्रणासह पुढे गेली जे कार्डच्या 4 GiB DRAM पेक्षा जास्त आहे. LFM2.5-8B-A1B — 1.7 बिलियन सक्रिय असलेले 8.5 अब्ज पॅरामीटर — होस्ट स्टोरेजमधील स्ट्रीमिंग तज्ञांद्वारे प्रति सेकंद 10.6 टोकन्स डीकोड करतात, 98.5 टक्के तज्ञ ऑन-कार्ड स्लॉट्स वापरतात आणि प्रति टोकन फक्त 5.2 MB हस्तांतरित करतात. Qwen3.5-35B-A3B PCIe वर 153 MB प्रति टोकन प्रवाहित करताना 3.95 टोकन प्रति सेकंदाने चालते. प्रत्येक कॉन्फिगरेशन, README म्हणते, टोकनसाठी प्रकल्पाच्या सिम्युलेटर टोकनशी जुळते — थोडा-अचूकपणाचा दावा की हार्डवेअर हॅकर्स कामाचा कठीण भाग म्हणून ओळखतील.

रिअल सिलिकॉन प्रकल्पाप्रमाणे बांधले

ओपनटीपीयूला ठराविक छंद FPGA डेमोपासून वेगळे करणारी गोष्ट म्हणजे स्टॅकची पूर्णता. मोनोरेपोमध्ये SystemVerilog हार्डवेअर डिझाइन, एक सानुकूल सूचना संच, एक बिट-अचूक सिम्युलेटर, स्वतःचे कंपाइलर असलेली कर्नल भाषा आणि PCIe कार्ड चालविणारे होस्ट सॉफ्टवेअर, nvidia-smi च्या भावनेने otpu-smi मॉनिटरिंग युटिलिटी आणि otpu-चॅट डेमो समाविष्ट आहे.

प्रोडक्शन इमेज चार कॉलम सिस्टोलिक मॅट्रिक्स युनिट आणि 133.33 MHz वर एक स्ट्रीम इंजिन चालवते, LiteDRAM मेमरी कंट्रोलर्ससह मेमरी कोरच्या आत एका लहान CPU द्वारे कॅलिब्रेट केले जाते — कार्ड दोन्ही DDR3 चॅनेल 12 सेकंदात कोणत्याही होस्ट सहभागाशिवाय कॅलिब्रेट करते. 1 ऑक्टोबरपासून उपयोजित केलेले वर्तमान बिल्ड, मागील प्रतिमेपेक्षा 8 ते 10 टक्के वेगाने अनेक मॉडेल्स डीकोड करते आणि DRAM वापराला 91-94 टक्के शिखरावर आणते.

हा प्रकल्प FP4 मूल्यांवर बनवलेले 4-बिट वेट फॉरमॅटचे दस्तऐवज देखील करतो ज्यामध्ये दोन-स्तरीय ब्लॉक स्केल 4.25 बिट प्रति वजन आहे, अचूकतेसाठी भाषा-मॉडेल हेड int8 मध्ये ठेवले आहे. फॉरमॅट प्रति टोकन बाइट्स अंदाजे एक तृतीयांश कमी करते आणि काही मॉडेल्सवर डीकोड गती 40 ते 45 टक्क्यांनी वाढवते.

README पूर्वीच्या रिपॉजिटरी, ऑटो-आर्क-टूर्नामेंटमधील धड्यांकडे प्रकल्पाच्या दृष्टिकोनाचे श्रेय देते, ज्याने AI-चालित हार्डवेअर आर्किटेक्चर शोध शोधला. ओपनटीपीयू हा त्या पद्धतीचा संपूर्ण प्रवेगकासाठी वापर आहे, ज्यात एजंट्सचे डिझाइन हार्डवेअरला स्पर्श करण्यापूर्वी सिम्युलेटरवर प्रमाणित केले जाते.

हे महत्त्वाचे का आहे

येथील कामगिरीमुळे Nvidia ला त्रास होणार नाही. DDR3 सह Kintex-7 हा हार्डवेअरचा एक दशक जुना वर्ग आहे आणि ते चालवलेली मॉडेल्स लहान आहेत. पण हाच मुद्दा प्रकल्पाने स्पष्टपणे मांडला आहे: संपूर्ण प्रवेगक — RTL, सूचना संच, सिम्युलेटर, कंपायलर आणि होस्ट स्टॅक — एका व्यक्तीसाठी, एका भांडारात सुवाच्य आहे, आणि ते हार्डवेअर टीमऐवजी AI एजंट्सद्वारे कमीत कमी काही प्रमाणात डिझाइन केले गेले होते.

त्या कल्पनेत तीन प्रवाह एकत्र येतात. प्रथम, ओपन-सोर्स एआय हार्डवेअरला आवश्यक असलेल्या निपुण रुंदीमुळे दीर्घकाळ अडथळे आले आहेत; एजंट-चालित डिझाइन प्रवाह हा अडथळा कमी करतो. दुसरे, अनुमानाची मागणी संशोधकांना विदेशी विशेष-उद्देशीय हार्डवेअरकडे ढकलत आहे आणि त्या जागेचा शोध घेण्यासाठी स्वयंचलित डिझाइन शोध हे नैसर्गिकरित्या योग्य आहे. तिसरे, सेल्फ-होस्टिंग अँगल — AI ज्यावर ते चालते ते मशीन बनवते — हा एक सिग्नल बनला आहे ज्याचा समुदाय जवळून पाहतो, हॅकर न्यूजवर प्रकल्पाच्या जलद वाढीचा आधार घेत, जिथे त्याने काही तासांत 150 पेक्षा जास्त गुण जमा केले.

रेपॉजिटरी 24 सप्टेंबर रोजी तयार करण्यात आली होती आणि 2 ऑक्टोबर रोजी त्याचे नवीनतम पुश प्राप्त झाले होते, 1 ऑक्टोबर रोजी नुकतेच मोजलेले परिणाम - स्वतःच्या अधिकारात पाहण्यासारखे एक विकास वेग. पायथनमधील मॅट्रिक्सच्या गुणाकारापासून ते वायर्सपर्यंत एआय प्रवेगक कसे कार्य करते हे समजून घेऊ इच्छिणाऱ्या प्रत्येकासाठी, प्रकल्पाची स्वतःची फ्रेमिंग अचूक आहे: संपूर्ण गोष्ट एका लहान मोनोरेपोमध्ये राहते, आपण शेवटपर्यंत वाचू शकता.

एजंट-डिझाइन केलेले हार्डवेअर एक गंभीर स्थान बनले आहे किंवा संशोधनाची उत्सुकता राहिली आहे, ओपनटीपीयूने काहीतरी ठोस दाखवून दिले आहे: एआय मॉडेल्सना सॉफ्टवेअर लिहू देणाऱ्या साधनांनी आता एक कार्यरत, सत्यापित हार्डवेअर प्रणाली तयार केली आहे जी तेच मॉडेल चालवते. लूप बंद आहे, किमान FPGA स्केलवर.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →