פרויקט קטן אך בולט מסתובב השבוע ב-Hacker News: openTPU, מאיץ AI בקוד פתוח שעיצוב החומרה שלו הופק בעצמו על ידי סוכני AI. המאגר, שפורסם תחת רישיון Apache 2.0 ב-GitHub, מתאר את מה שכותביו מכנים "מאיץ AI בקוד פתוח, שפותח על ידי AI" - ובניגוד לרוב ההדגמות בז'אנר הזה, הוא מריץ דגמי ייצור אמיתיים עם המשקל האמיתי שלהם על כרטיס פיזי שחובבים יכולים ללמוד מקצה לקצה.

הפרויקט שואל שתי שאלות, במילים של README משלו: עד כמה סוכני בינה מלאכותית יכולים להגיע בתכנון חומרה, והאם הם יכולים לבנות את השבב שמנהל את ההסקה שלהם? השאלה השנייה היא הפרובוקטיבית. מערכת בינה מלאכותית שמעצבת את הסיליקון - או במקרה הזה, זרם הסיביות של ה-FPGA - שיוצרת אסימונים משלה היא לולאה שתופסת בדיוק לאן מועדות הדמיון של התעשייה. For more context on this story, see our ongoing breaking AI news.

מה בעצם פועל על הכרטיס

יעד החומרה אינו זוהר לפי תקני מרכז הנתונים: כרטיס Inspur YPCB-00338 בנוי סביב Xilinx Kintex-7 xc7k480t FPGA עם שני ערוצי DDR3 ורוחב פס זיכרון שיא של 17.1 GB/s. זה רחוק מאוד ממאיץ מוערם של HBM, מה שהופך את התוצאות למעניינות יותר, לא פחות.

על פי המדידות שפורסמו בפרויקט, העיצוב מריץ עשרה דגמים פתוחים מודרניים עם משקלם האמיתי. LFM2.5-230M מפענח ב-59 אסימונים לשנייה ב-int8 ו-85.8 אסימונים לשנייה ב-4 סיביות. Qwen3-0.6B מנהל 21.6 אסימונים לשנייה, בעוד שדגמים גדולים יותר מצטמצמים כצפוי: SmolLM3-3B ב-5 אסימונים לשנייה int8, Phi-4-mini (3.8B) ב-4, ו-Qwen3.5-4B ב-5.9 אסימונים לשנייה ב-4 סיביות. Gemma 4 E2B ו-E4B פועלים גם הם, ושומרים על טבלאות ההטמעה לכל שכבה שלהם בכרטיס.

הצוות הלך רחוק יותר עם דגמי תערובת של מומחים שעולים על 4 GiB של DRAM של הכרטיס. LFM2.5-8B-A1B - 8.5 מיליארד פרמטרים עם 1.7 מיליארד פעילים - מפענח בקצב של 10.6 אסימונים לשנייה על ידי הזרמת מומחים מאחסון מארח, כאשר 98.5 אחוז מהשימושים של המומחים פוגעים בחריצי כרטיס ורק 5.2 מגה-בייט הועברו לכל אסימון. Qwen3.5-35B-A3B פועל במהירות של 3.95 אסימונים לשנייה תוך הזרמת 153 מגה-בייט לכל אסימון דרך PCIe. כל תצורה, קובע ה-README, תואמת את אסימון הסימולטור של הפרויקט עבור אסימון - טענה מעט מדויקת שהאקרים לחומרה יזהו כחלק הקשה של העבודה.

בנוי כמו פרויקט סיליקון אמיתי

מה שמפריד בין openTPU להדגמות FPGA תחביבים טיפוסיים הוא השלמות של הערימה. ה-monorepo מכיל את עיצוב החומרה של SystemVerilog, ערכת הוראות מותאמת אישית, סימולטור מעט מדויק, שפת ליבה עם מהדר משלה, ואת התוכנה המארח שמניעה את כרטיס ה-PCIe, כולל כלי ניטור otpu-smi ברוח nvidia-smi והדגמת otpu-chat.

תמונת הייצור מריצה יחידת מטריצה ​​סיסטולית בת ארבע עמודות ומנוע זרימה ב-133.33 מגה-הרץ, עם בקרי זיכרון LiteDRAM מכוילים על ידי מעבד קטן בתוך ליבת הזיכרון - הכרטיס מכייל את שני ערוצי ה-DDR3 ב-12 שניות ללא מעורבות מארח. המבנה הנוכחי, שנפרס מאז 1 באוקטובר, מפענח כמה דגמים ב-8 עד 10 אחוזים מהר יותר מהתמונה הקודמת תוך שהוא דוחף את ניצול ה-DRAM ל-91-94 אחוז מהשיא.

הפרויקט מתעד גם פורמט משקל של 4 סיביות הבנוי על ערכי FP4 עם סולמות בלוק דו-מפלסי ב-4.25 סיביות למשקל, תוך שמירה על ראש מודל השפה ב-int8 לצורך דיוק. הפורמט מקצץ בייטים לכל אסימון בערך בשליש ומעלה את מהירות הפענוח ב-40 עד 45 אחוזים בדגמים מסוימים.

ה-README מזכה את הגישה של הפרויקט ללקחים ממאגר קודם, אוטו-arch-tournament, שחקר חיפוש ארכיטקטורת חומרה מונעת בינה מלאכותית. openTPU הוא היישום של שיטה זו על מאיץ שלם, כאשר העיצוב של הסוכנים מאומת מול סימולטור לפני שנוגעים אי פעם בחומרה.

למה זה חשוב

הביצועים כאן לא יטרידו את Nvidia. Kintex-7 עם DDR3 הוא סוג בן עשור של חומרה, והדגמים שהוא מריץ קטנים. אבל זו הנקודה שהפרויקט מעלה במרומז: המאיץ כולו - RTL, ערכת הוראות, סימולטור, מהדר וערימת מארח - קריא לאדם אחד, במאגר אחד, והוא תוכנן לפחות בחלקו על ידי סוכני AI ולא צוות חומרה.

שלושה זרמים מתלכדים ברעיון הזה. ראשית, חומרת AI בקוד פתוח נבלמה זה מכבר על ידי רוחב המומחיות הנדרשת; זרימת עיצוב מונעת על ידי סוכן מורידה את המחסום הזה. שנית, הביקוש להסקת מסקנות דוחף את החוקרים לעבר חומרה אקזוטית למטרות מיוחדות, וחיפוש עיצוב אוטומטי הוא התאמה טבעית לחקר החלל הזה. שלישית, זווית האירוח העצמית - בינה מלאכותית בונה את המכונה עליה היא פועלת - הפכה לאות שהקהילה צופה בה מקרוב, אם לשפוט לפי העלייה המהירה של הפרויקט ב-Hacker News, שם היא צברה יותר מ-150 נקודות בתוך שעות.

המאגר נוצר ב-24 בספטמבר וקיבל את הדחיפה האחרונה שלו ב-2 באוקטובר, עם תוצאות מדודות שתוארכו לאחרונה ל-1 באוקטובר - קצב פיתוח שכדאי לצפות בו בפני עצמו. לכל מי שרוצה להבין איך מאיץ בינה מלאכותית עובד ממכפלת מטריצה ​​ב-Python ועד לחוטים, המסגור של הפרויקט עצמו מדויק: כל העניין חי במונורופו קטן אחד שתוכלו לקרוא מקצה לקצה.

בין אם חומרה שתוכננה על ידי סוכן הופכת לנישה רצינית או שהיא נשארת סקרנות מחקרית, openTPU הוכיח משהו קונקרטי: הכלים שנותנים למודלים של AI לכתוב תוכנה יצרו כעת מערכת חומרה עובדת ומאומתת שמריצה את אותם דגמים. הלולאה סגורה, לפחות בקנה מידה FPGA.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →