یک پروژه کوچک اما قابل توجه این هفته در هکر نیوز در حال پخش است: openTPU، یک شتاب دهنده هوش مصنوعی منبع باز که طراحی سخت افزاری آن توسط عوامل هوش مصنوعی تولید شده است. این مخزن که تحت مجوز Apache 2.0 در GitHub منتشر شده است، چیزی را توصیف می کند که نویسندگان آن آن را «یک شتاب دهنده AI منبع باز، توسعه یافته توسط AI» می نامند - و برخلاف اکثر نسخه های نمایشی در این سبک، مدل های تولید واقعی را با وزن واقعی خود روی یک کارت فیزیکی اجرا می کند که علاقه مندان می توانند از انتها تا انتها مطالعه کنند.

این پروژه به قول README خودش دو سوال می‌پرسد: عوامل هوش مصنوعی تا کجا می‌توانند در طراحی سخت‌افزار پیش بروند، و آیا می‌توانند تراشه‌ای بسازند که استنتاج خودشان را اجرا کند؟ سوال دوم سوال تحریک آمیز است. یک سیستم هوش مصنوعی که سیلیکونی را طراحی می‌کند - یا در این مورد، جریان بیتی FPGA - که توکن‌های خود را تولید می‌کند، حلقه‌ای است که دقیقاً جایی را که تخیل صنعت می‌رود، نشان می‌دهد. For more context on this story, see our ongoing breaking AI news.

آنچه در واقع روی کارت اجرا می شود

هدف سخت‌افزاری از نظر استانداردهای مرکز داده بسیار جذاب است: یک کارت Inspur YPCB-00338 که حول یک Xilinx Kintex-7 xc7k480t FPGA با دو کانال DDR3 و حداکثر پهنای باند حافظه 17.1 گیگابایت بر ثانیه ساخته شده است. این با یک شتاب دهنده انباشته HBM فاصله زیادی دارد، که نتایج را جالب تر می کند، نه کمتر.

با توجه به اندازه گیری های منتشر شده این پروژه، این طرح ده مدل باز مدرن را با وزن واقعی آنها اجرا می کند. LFM2.5-230M با 59 توکن در ثانیه در int8 و 85.8 توکن در ثانیه در 4 بیت رمزگشایی می کند. Qwen3-0.6B 21.6 توکن در ثانیه را مدیریت می‌کند، در حالی که مدل‌های بزرگ‌تر طبق انتظار کاهش می‌یابند: SmolLM3-3B با 5 توکن در ثانیه int8، Phi-4-mini (3.8B) با 4، و Qwen3.5-4B با 5.9 توکن در ثانیه در 4 بیت. Gemma 4 E2B و E4B نیز اجرا می شوند و میزهای تعبیه شده در هر لایه خود را روی کارت ثابت نگه می دارند.

این تیم با مدل های ترکیبی از متخصصان که بیش از 4 گیگابایت حافظه DRAM کارت بودند، پیش رفت. LFM2.5-8B-A1B - 8.5 میلیارد پارامتر با 1.7 میلیارد فعال - رمزگشایی با سرعت 10.6 توکن در ثانیه توسط متخصصان استریم از فضای ذخیره سازی میزبان، با 98.5 درصد از متخصصان از ضربه زدن به اسلات های روی کارت و تنها 5.2 مگابایت انتقال در هر توکن. Qwen3.5-35B-A3B با سرعت 3.95 توکن در ثانیه اجرا می شود در حالی که 153 مگابایت در هر توکن از طریق PCIe پخش می شود. README بیان می‌کند که هر پیکربندی با توکن شبیه‌ساز پروژه برای توکن مطابقت دارد - یک ادعای کمی دقیق که هکرهای سخت‌افزار آن را به عنوان بخش سخت کار تشخیص می‌دهند.

ساخته شده مانند یک پروژه سیلیکونی واقعی

آنچه openTPU را از دموهای سرگرمی معمولی FPGA جدا می کند، کامل بودن پشته است. monorepo شامل طراحی سخت افزار SystemVerilog، یک مجموعه دستورالعمل سفارشی، یک شبیه ساز کمی دقیق، یک زبان هسته با کامپایلر خاص خود، و نرم افزار میزبانی است که کارت PCIe را هدایت می کند، از جمله ابزار نظارت otpu-smi به روح nvidia-smi و نسخه آزمایشی otpu-chat.

تصویر تولیدی یک واحد ماتریس سیستولیک چهار ستونی و یک موتور جریانی با فرکانس 133.33 مگاهرتز را اجرا می‌کند، با کنترل‌کننده‌های حافظه LiteDRAM که توسط یک CPU کوچک در داخل هسته حافظه کالیبره شده است - کارت هر دو کانال DDR3 را در 12 ثانیه بدون دخالت میزبان کالیبره می‌کند. ساخت فعلی که از اول اکتبر به کار گرفته شده است، چندین مدل را 8 تا 10 درصد سریعتر از تصویر قبلی رمزگشایی می کند در حالی که استفاده از DRAM را به 91 تا 94 درصد اوج می رساند.

این پروژه همچنین یک فرمت وزن 4 بیتی را که بر اساس مقادیر FP4 ساخته شده است، با مقیاس های بلوک دو سطحی با 4.25 بیت در هر وزن، مستند می کند، که برای دقت، سر مدل زبان را در int8 نگه می دارد. این فرمت بایت در هر توکن را تقریباً یک سوم کاهش می دهد و سرعت رمزگشایی را در برخی مدل ها 40 تا 45 درصد افزایش می دهد.

README رویکرد پروژه را به درس‌هایی از یک مخزن قبلی، مسابقات auto-arch-turnament، که جستجوی معماری سخت‌افزار مبتنی بر هوش مصنوعی را بررسی می‌کرد، اعتبار می‌دهد. openTPU کاربرد آن روش برای یک شتاب دهنده کامل است، با طراحی عامل ها قبل از لمس سخت افزار در برابر شبیه ساز تایید شده است.

چرا مهم است

عملکرد در اینجا مشکلی برای Nvidia ایجاد نمی کند. Kintex-7 با DDR3 یک کلاس سخت افزاری ده ساله است و مدل هایی که اجرا می کند کوچک هستند. اما این نکته ای است که پروژه به طور ضمنی به آن اشاره می کند: کل شتاب دهنده - RTL، مجموعه دستورالعمل، شبیه ساز، کامپایلر و پشته میزبان - برای یک نفر در یک مخزن خوانا است، و حداقل تا حدی توسط عوامل هوش مصنوعی به جای یک تیم سخت افزاری طراحی شده است.

سه جریان در آن ایده همگرا می شوند. اولاً، سخت‌افزار AI منبع باز مدت‌هاست که به دلیل وسعت تخصص مورد نیاز، مانع شده است. یک جریان طراحی عامل محور این مانع را کاهش می دهد. دوم، تقاضای استنتاج، محققان را به سمت سخت‌افزار با هدف خاص سوق می‌دهد، و جستجوی خودکار طراحی یک مناسب طبیعی برای کاوش در آن فضا است. سوم، زاویه میزبانی خود – هوش مصنوعی ساخت ماشینی که روی آن کار می‌کند – به سیگنالی تبدیل شده است که جامعه از نزدیک آن را تماشا می‌کند، با قضاوت در مورد رشد سریع پروژه در Hacker News، جایی که بیش از 150 امتیاز را ظرف چند ساعت جمع‌آوری کرد.

این مخزن در 24 سپتامبر ایجاد شد و آخرین فشار خود را در 2 اکتبر دریافت کرد، با نتایج اندازه گیری شده به تازگی در 1 اکتبر - سرعت توسعه به خودی خود ارزش تماشا را دارد. برای هرکسی که می‌خواهد بفهمد چگونه یک شتاب‌دهنده هوش مصنوعی از ضرب ماتریس در پایتون گرفته تا سیم‌ها کار می‌کند، چارچوب‌بندی پروژه دقیق است: همه چیز در یک مونورپو کوچک زندگی می‌کند که می‌توانید آن را از انتها تا انتها بخوانید.

چه سخت‌افزار طراحی‌شده توسط عامل تبدیل به یک جایگاه جدی شود یا به یک کنجکاوی تحقیقاتی باقی بماند، openTPU چیز مشخصی را نشان داده است: ابزارهایی که به مدل‌های هوش مصنوعی اجازه می‌دهند نرم‌افزار بنویسند، اکنون یک سیستم سخت‌افزاری تأیید شده و کارآمد تولید کرده‌اند که همان مدل‌ها را اجرا می‌کند. حلقه بسته است، حداقل در مقیاس FPGA.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →