פרויקט קוד פתוח סחט מודל שפה של 28.9 מיליון פרמטרים על מיקרו-בקר שעולה כ-8 דולר, ויצר טקסט כולו על השבב בערך תשעה אסימונים לשנייה ללא חיבור רשת כלל. ההדגמה, שפורסמה ב-GitHub ומטפסת במהירות בעמוד הראשון של האקר ניוז, מראה עד כמה עבר גבול הבינה המלאכותית המקומית והקטנה תוך זמן קצר בלבד.
העבודה מתרכזת ב-ESP32-S3, שבב משובץ זול הפופולרי בקרב חובבים ויצרני חומרה. הפעלת מודל של 28.9 מיליון פרמטרים על פיסת סיליקון קטנה כל כך הייתה נראית בלתי סבירה לא מזמן, והפרויקט מציע המחשה חיה של הדחיפה הרחבה יותר לכיוון AI במכשיר שאנו עוקבים אחריה ב[סיקור תעשיית AI] היומי שלנו (https://aibuzzwire.news). היכן שהענן הרגיש פעם חובה עבור כל מודל שפה אמיתי, מערכות יותר ויותר מסוגלות מוצאות בתים על הקצה.
המספרים מאחורי המבנה
הפרויקט מציג את המפרט שלו בצורה ברורה. הדגם מאחסן 28.9 מיליון פרמטרים, מתוכם כ-25 מיליון חיים בטבלת חיפוש פלאש. הוא פועל על שבב ESP32-S3 עם 512KB של SRAM מהיר, 8MB של PSRAM ו-16MB של אחסון פלאש. בפועל הוא מגיע לכ-9.5 אסימונים לשנייה מקצה לקצה, או 9.7 אסימונים לשנייה של מחשוב טהור, והדגם כולו תופס רק 14.9 מגה-בייט כאשר הוא מאוחסן בדיוק של 4 סיביות.
הבולטת ביותר היא ההשוואה שהכותב עורך לעבודות קודמות. מודל השפה האחרון שידוע לרוץ על שבב במחלקה זו החזיק רק 260,000 פרמטרים. המבנה החדש מכיל בערך פי מאה יותר, קפיצה שלא מגיעה משבב גדול יותר אלא מחשיבה מחודשת היכן הנתונים של הדגם חיים בפועל.
טריק זיכרון שהושאל מג'מה
הבעיה המרכזית היא שלמיקרו-בקר אין כמעט זיכרון מהיר. ה-ESP32-S3 מציע רק 512KB של SRAM, ובאופן קונבנציונלי יהיה צורך להגיע לכל הדגם משם, וזו הסיבה שניסיונות קודמים נתקעו בכמה מאות אלפי פרמטרים.
הדרך לעקיפת הבעיה נשענת על תצפית פשוטה. רוב הפרמטרים של מודל שפה יושבים בטבלת הטבעה, שממנה המודל קורא ולא מחושב עליה. אז במקום להכריח את הטבלה העצומה הזו של 25 מיליון שורות לזיכרון מהיר דל, הפרויקט משאיר אותו באחסון פלאש איטי ומושך רק את קומץ השורות שכל אסימון צריך, בערך 450 בתים בכל פעם. החלק הקטן של הדגם שמבצע את החישוב האמיתי נשאר בזיכרון מהיר, בעוד שחלק הארי של המשקולות פשוט מחכות בהבזק, נדגמים מעט בכל פעם.
הטכניקה הזו ידועה בשם Per-Layer Embeddings, ומקורה בדגמי Gemma של גוגל, במיוחד Gemma 3n ו- Gemma 4, שם היא תוכננה עבור טלפונים ומעבדי GPU. לדברי מחבר הפרויקט, אף אחד לא ניסה בעבר את הגישה על שבב כל כך קטן.
מה זה יכול לעשות ומה זה לא יכול
המודל הוכשר על TinyStories, מערך נתונים של סיפורי ילדים פשוטים, כך שהיכולות שלו צרות במכוון. הוא כותב סיפורים קצרים, קוהרנטיים ברובם, אבל הוא לא יענה על שאלות עובדתיות, לא יפעל לפי הוראות מורכבות, יכתוב קוד או יסביר את העולם. המחבר הוא כנה שהמגבלה הזו נובעת מחלק ההיגיון הקטן של המודל, ושטריק הזיכרון אינו משנה אותו.
מה שהופך את הפרויקט למעניין הוא אפוא לא איכות הפלט שלו אלא הארכיטקטורה שלו. ההישג הוא התאמת דגם כל כך גדול לשבב זעיר כל כך, מה שמוכיח שניתן לדחוף את אותן טכניקות להפעלת דגמים יעילים בטלפונים ובשרתים עד לחומרה שעולה פחות מסנדוויץ'.
מדוע AI במכשיר חשוב
ההשלכות מגיעות הרבה מעבר להדגמה טכנית מסודרת. מכיוון שהדגם פועל כולו על השבב, שום דבר לא נשלח לעולם לשרת. זה אומר פרטיות מוחלטת על ידי בנייה, שום נתונים לא יוצאים מהמכשיר, ואין חשבון ענן לשלם. עבור יישומים באזורים מרוחקים, התקנים בעלי הספק נמוך או הגדרות שבהן הקישוריות אינה אמינה, השילוב הזה באמת שימושי.
זה גם מצביע על עתיד שבו דגמים קטנים ומתמחים מופצים על פני מיליארדי מכשירים משובצים זולים במקום מרוכזים בקומץ מרכזי נתונים ענקיים. אותם לחצים שמניעים את העניין ב-AI מקומי במחשבים ניידים ובטלפונים, כלומר זמן אחזור נמוך יותר, עלות נמוכה יותר ופרטיות חזקה יותר, חלים ביתר שאת בקנה המידה של המיקרו-בקר.
הזמנה פתוחה להתעסק
הפרויקט שוחרר תחת רישיון MIT המתיר, והמחבר שיתף את הקוד המלא ב-GitHub יחד עם תיעוד מפורט ותוצאות בנצ'מרק. הפתיחות הזו פירושה שמפתחי חומרה אחרים יכולים ללמוד את הגישה, להתאים אותה לשבבים אחרים, או לדחוף את ספירת הפרמטרים אפילו גבוה יותר.
פורסם תחת הידית slvDev, העבודה זכתה לתהודה רבה בקרב קהילת המפתחים, אספה מאות הצבעות בעד על האקר ניוז ועוררה דיון על לאן הטכניקה עשויה להגיע. אם המגמה מתקיימת, הגבול בין "מודל שפה" לתוכנה משובצת רגילה עומד להיות מטושטש הרבה יותר.
הישאר לפני AI
מ-8 שבבים של $ 8 למרכזי נתונים של מיליארדי דולרים, השאלה היכן פועלת הבינה המלאכותית הופכת חשובה לא פחות ממה שבינה מלאכותית יכולה לעשות. שכבת החומרה מתפתחת מהר יותר ממה שרוב האנשים מבינים, והפרויקטים שנראים היום כמו קוריוזים מגדירים לרוב את המיינסטרים של מחר. קרא עוד חדשות בינה מלאכותית ב-AI Buzz Wire כדי לעקוב אחר כל פריצת דרך בתחום מחשוב קצה, יעילות מודלים ומודיעין במכשיר.
התעדכן במהפכת החומרה של AI - בקר ב-AI Buzz Wire


