یک پروژه کوچک اما قابل توجه این هفته در هکر نیوز در حال پخش است: openTPU، یک شتاب دهنده هوش مصنوعی منبع باز که طراحی سخت افزاری آن توسط عوامل هوش مصنوعی تولید شده است. این مخزن که تحت مجوز Apache 2.0 در GitHub منتشر شده است، چیزی را توصیف می کند که نویسندگان آن آن را «یک شتاب دهنده AI منبع باز، توسعه یافته توسط AI» می نامند - و برخلاف اکثر نسخه های نمایشی در این سبک، مدل های تولید واقعی را با وزن واقعی خود روی یک کارت فیزیکی اجرا می کند که علاقه مندان می توانند از انتها تا انتها مطالعه کنند.
این پروژه به قول README خودش دو سوال میپرسد: عوامل هوش مصنوعی تا کجا میتوانند در طراحی سختافزار پیش بروند، و آیا میتوانند تراشهای بسازند که استنتاج خودشان را اجرا کند؟ سوال دوم سوال تحریک آمیز است. یک سیستم هوش مصنوعی که سیلیکونی را طراحی میکند - یا در این مورد، جریان بیتی FPGA - که توکنهای خود را تولید میکند، حلقهای است که دقیقاً جایی را که تخیل صنعت میرود، نشان میدهد. For more context on this story, see our ongoing breaking AI news.
آنچه در واقع روی کارت اجرا می شود
هدف سختافزاری از نظر استانداردهای مرکز داده بسیار جذاب است: یک کارت Inspur YPCB-00338 که حول یک Xilinx Kintex-7 xc7k480t FPGA با دو کانال DDR3 و حداکثر پهنای باند حافظه 17.1 گیگابایت بر ثانیه ساخته شده است. این با یک شتاب دهنده انباشته HBM فاصله زیادی دارد، که نتایج را جالب تر می کند، نه کمتر.
با توجه به اندازه گیری های منتشر شده این پروژه، این طرح ده مدل باز مدرن را با وزن واقعی آنها اجرا می کند. LFM2.5-230M با 59 توکن در ثانیه در int8 و 85.8 توکن در ثانیه در 4 بیت رمزگشایی می کند. Qwen3-0.6B 21.6 توکن در ثانیه را مدیریت میکند، در حالی که مدلهای بزرگتر طبق انتظار کاهش مییابند: SmolLM3-3B با 5 توکن در ثانیه int8، Phi-4-mini (3.8B) با 4، و Qwen3.5-4B با 5.9 توکن در ثانیه در 4 بیت. Gemma 4 E2B و E4B نیز اجرا می شوند و میزهای تعبیه شده در هر لایه خود را روی کارت ثابت نگه می دارند.
این تیم با مدل های ترکیبی از متخصصان که بیش از 4 گیگابایت حافظه DRAM کارت بودند، پیش رفت. LFM2.5-8B-A1B - 8.5 میلیارد پارامتر با 1.7 میلیارد فعال - رمزگشایی با سرعت 10.6 توکن در ثانیه توسط متخصصان استریم از فضای ذخیره سازی میزبان، با 98.5 درصد از متخصصان از ضربه زدن به اسلات های روی کارت و تنها 5.2 مگابایت انتقال در هر توکن. Qwen3.5-35B-A3B با سرعت 3.95 توکن در ثانیه اجرا می شود در حالی که 153 مگابایت در هر توکن از طریق PCIe پخش می شود. README بیان میکند که هر پیکربندی با توکن شبیهساز پروژه برای توکن مطابقت دارد - یک ادعای کمی دقیق که هکرهای سختافزار آن را به عنوان بخش سخت کار تشخیص میدهند.
ساخته شده مانند یک پروژه سیلیکونی واقعی
آنچه openTPU را از دموهای سرگرمی معمولی FPGA جدا می کند، کامل بودن پشته است. monorepo شامل طراحی سخت افزار SystemVerilog، یک مجموعه دستورالعمل سفارشی، یک شبیه ساز کمی دقیق، یک زبان هسته با کامپایلر خاص خود، و نرم افزار میزبانی است که کارت PCIe را هدایت می کند، از جمله ابزار نظارت otpu-smi به روح nvidia-smi و نسخه آزمایشی otpu-chat.
تصویر تولیدی یک واحد ماتریس سیستولیک چهار ستونی و یک موتور جریانی با فرکانس 133.33 مگاهرتز را اجرا میکند، با کنترلکنندههای حافظه LiteDRAM که توسط یک CPU کوچک در داخل هسته حافظه کالیبره شده است - کارت هر دو کانال DDR3 را در 12 ثانیه بدون دخالت میزبان کالیبره میکند. ساخت فعلی که از اول اکتبر به کار گرفته شده است، چندین مدل را 8 تا 10 درصد سریعتر از تصویر قبلی رمزگشایی می کند در حالی که استفاده از DRAM را به 91 تا 94 درصد اوج می رساند.
این پروژه همچنین یک فرمت وزن 4 بیتی را که بر اساس مقادیر FP4 ساخته شده است، با مقیاس های بلوک دو سطحی با 4.25 بیت در هر وزن، مستند می کند، که برای دقت، سر مدل زبان را در int8 نگه می دارد. این فرمت بایت در هر توکن را تقریباً یک سوم کاهش می دهد و سرعت رمزگشایی را در برخی مدل ها 40 تا 45 درصد افزایش می دهد.
README رویکرد پروژه را به درسهایی از یک مخزن قبلی، مسابقات auto-arch-turnament، که جستجوی معماری سختافزار مبتنی بر هوش مصنوعی را بررسی میکرد، اعتبار میدهد. openTPU کاربرد آن روش برای یک شتاب دهنده کامل است، با طراحی عامل ها قبل از لمس سخت افزار در برابر شبیه ساز تایید شده است.
چرا مهم است
عملکرد در اینجا مشکلی برای Nvidia ایجاد نمی کند. Kintex-7 با DDR3 یک کلاس سخت افزاری ده ساله است و مدل هایی که اجرا می کند کوچک هستند. اما این نکته ای است که پروژه به طور ضمنی به آن اشاره می کند: کل شتاب دهنده - RTL، مجموعه دستورالعمل، شبیه ساز، کامپایلر و پشته میزبان - برای یک نفر در یک مخزن خوانا است، و حداقل تا حدی توسط عوامل هوش مصنوعی به جای یک تیم سخت افزاری طراحی شده است.
سه جریان در آن ایده همگرا می شوند. اولاً، سختافزار AI منبع باز مدتهاست که به دلیل وسعت تخصص مورد نیاز، مانع شده است. یک جریان طراحی عامل محور این مانع را کاهش می دهد. دوم، تقاضای استنتاج، محققان را به سمت سختافزار با هدف خاص سوق میدهد، و جستجوی خودکار طراحی یک مناسب طبیعی برای کاوش در آن فضا است. سوم، زاویه میزبانی خود – هوش مصنوعی ساخت ماشینی که روی آن کار میکند – به سیگنالی تبدیل شده است که جامعه از نزدیک آن را تماشا میکند، با قضاوت در مورد رشد سریع پروژه در Hacker News، جایی که بیش از 150 امتیاز را ظرف چند ساعت جمعآوری کرد.
این مخزن در 24 سپتامبر ایجاد شد و آخرین فشار خود را در 2 اکتبر دریافت کرد، با نتایج اندازه گیری شده به تازگی در 1 اکتبر - سرعت توسعه به خودی خود ارزش تماشا را دارد. برای هرکسی که میخواهد بفهمد چگونه یک شتابدهنده هوش مصنوعی از ضرب ماتریس در پایتون گرفته تا سیمها کار میکند، چارچوببندی پروژه دقیق است: همه چیز در یک مونورپو کوچک زندگی میکند که میتوانید آن را از انتها تا انتها بخوانید.
چه سختافزار طراحیشده توسط عامل تبدیل به یک جایگاه جدی شود یا به یک کنجکاوی تحقیقاتی باقی بماند، openTPU چیز مشخصی را نشان داده است: ابزارهایی که به مدلهای هوش مصنوعی اجازه میدهند نرمافزار بنویسند، اکنون یک سیستم سختافزاری تأیید شده و کارآمد تولید کردهاند که همان مدلها را اجرا میکند. حلقه بسته است، حداقل در مقیاس FPGA.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →