פרויקט קוד פתוח לא ידוע בשם Strata עובר רגע. המנוע בעל רישיון MIT, המריץ את Qwen3.8-Flash-Next של עליבאבא - דגם של 125 מיליארד פרמטרים של תערובת של מומחים - במחשבי גיימינג רגילים, עלה לעמוד הראשון של האקר ניוז ב-4 באוקטובר עם יותר מ-640 נקודות, ומאגר ה-GitHub שלה מאז שנאסף ב-2001 כוכבים בספטמבר.
הפיתוח הוא פשוט: מודל של 125 מיליארד פרמטרים שחי בדרך כלל על שרת יכול לשוחח, לכתוב קוד, לקרוא תמונות ולהניע סוכני קידוד לחלוטין בכרטיס גרפי לצרכן, בלי ששום דבר יוצא מהמכונה.
מה השכבות באמת עושה
שכבות הוא גם מנוע הסקה וגם מתקין בלחיצה אחת עבור Windows ו-Linux. על פי התיעוד שלה, הדרישות הן צנועות בסטנדרטים של דגם חזיתי: GPU עם לפחות 12GB של VRAM מסדרות RTX 20, 30, 40 או 50 של NVIDIA או מסדרת Radeon RX 6000, 7000 או 9000 של AMD, לפחות 32GB של זיכרון RAM פנוי במערכת SSD של 80 ג'יגה-בייט.
המנוע מספק גרסאות קוונטיות של Qwen3.8-Flash-Next במספר רמות דחיסה, מ-Q2_0 עד IQ3_S, בתוספת גרסה מתמחה בקוד. זה חושף ממשקי API תואמים OpenAI ו-Anthropic ב-localhost, כלומר ניתן להפנות כלים שנבנו עבור ChatGPT או Claude - כולל סוכני קידוד כמו Claude Code, Cursor ו-Codex - אל השרת המקומי במינימום שינויים. קלט תמונה אופציונלי ותמיכה בריבוי GPU כלולים, והמתקין אפילו מציע מצב הגדרה בסיוע בינה מלאכותית המאפשר לעוזר קידוד להגדיר את המכונה מהנחיה מודבקת אחת.
מספרי המהירות
המדדים שפורסמו של הפרויקט, שנמדדו בשני מחשבים שולחניים של צרכנים, הם הסיבה להתפשטות המהדורה. ב-NVIDIA RTX 5070 עם 12GB של VRAM בשילוב עם Ryzen 5 7600 ו-64GB של RAM, מדווח Strata:
- כימת Q2_0: 94 אסימונים לשנייה ליצירה ו-2,650 אסימונים לשנייה לעיבוד מהיר במסמך של 32K אסימונים
- IQ3_S: 53 אסימונים לדור שני, עיבוד מהיר של 1,620 אסימונים לשנייה
- גרסת קודן: 55 אסימונים לדור שני
בצד AMD, RX 9070 XT עם 16GB של VRAM הצליח 60 אסימונים לשנייה ב-Q2_0. התיעוד מעריך ש-RTX 3090 עם 24GB של VRAM אמור להגיע ל-100 עד 140 אסימונים לשנייה - מהר יותר ממה שרוב האנשים יכולים לקרוא.
לשם השוואה, לפני שישה חודשים, הפעלת אפילו דגם צפוף של 70 מיליארד פרמטרים באופן מקומי במהירויות שמישות דרשה תחנת עבודה עם מאות גיגה-בייט של זיכרון מאוחד או טריקים ספקולטיביים אגרסיביים של פענוח.
מדוע דגם 125B מתאים לכרטיס משחקים
שתי פיסות טכנולוגיה מאפשרות זאת. הראשון הוא הדגם עצמו. כפי שסיקרה AI Buzz Wire בשחרורו, Qwen3.8-Flash-Next היא ארכיטקטורה של מומחים עם כ-125 מיליארד פרמטרים בסך הכל אבל רק כ-6 מיליארד פעילים לכל אסימון - כך שכל מילה שנוצרה נוגעת בחלק קטן של הרשת, וחותכת באופן דרמטי את המחשוב לכל אסימון.
השני הוא קוונטיזציה. הקביעות הקבועות מראש המהירות ביותר של Strata דוחסות את משקלי הדגם לשניים או שלושה סיביות לכל פרמטר, ומחליפות דיוק מסוים עבור טביעת רגל שמתאימה ל-12GB GPU ו-RAM מערכת. הפשרה הזו היא האזהרה העיקרית: כמות Q2 ו- IQ2 פוגעת באופן מדיד באיכות במשימות כבדות חשיבה, והקונים צריכים להתייחס למספרי מהירות הכותרות כנקודת התחלה ולא ערבות לכל עומס עבודה. דפי מידוד קהילתיים במאגר עוקבים אחר תוצאות איכות בגדלים שונים.
חלק מגל מקומי גדול יותר של AI
השכבות מגיעות בתוך מומנטום מואץ להסקה מקומית. משפחת ה-Qwen של עליבאבא הפכה לקו הדגמים המשקל הפתוח שהורדתם הכי הרבה, ל-Meta ולגוגל יש דגמים תחרותיים בקוד פתוח משלהם, וגל של כלים מאפשר כעת לצרכנים להפעיל עוזרים מסוגלים בלי מנויים או נתונים שיעזבו את המכשירים שלהם.
הפרויקט משקף גם כיצד ההגדרה של "חומרה לצרכן" משתנה. כרטיס גרפי 2026 בטווח בינוני עם 12GB של VRAM, שנשלח בעיקר למשחקים, הוא כעת מאיץ מסקנות בר-קיימא לדגם בדרגת הגודל שהגדיר מערכות גבול רק לפני שנתיים.
שכבות נותרו תוכנה מוקדמת - עוקב הבעיות של המאגר מתעד קצוות גסים במעבדי GPU ישנים יותר ובמעבדים שאינם AVX2 - אך הפרויקט הוא ברישיון MIT, חינמי ומפותח בשטח פתוח, עם תמיכה ניסיונית עבור Intel Arc, כרטיסי טסלה ו-Radeon ישנים יותר, ואסדות מרובות GPU שתועדו על ידי חברי הקהילה.
עבור מפתחים, הפתרון המעשי ביותר עשוי להיות תאימות ה-API של localhost: כל סקריפט או סוכן שנכתבו נגד OpenAI או Anthropic SDK ניתן להפנות לפריסה מקומית של Qwen על ידי שינוי כתובת URL בסיסית, מה שהופך את Strata לאפשרות חיכוך נמוכה עבור אב טיפוס רגיש לפרטיות, שימוש במצב לא מקוון, או פשוט להגביל את הוצאות ה-API.
איך לנסות את זה
תחילת העבודה אינה דורשת הפעלה מסוף עם מדריך. המתקין מספק מנהלי התקנים, משקלי דגמים והשרת המקומי במעבר אחד, והמאגר כולל קובץ התקנה שנועד להיות מודבק ישירות לתוך עוזר קידוד AI, אשר לאחר מכן מגדיר את המכונה באופן אוטונומי. ההשקות הראשונות איטיות יותר בעוד המשקולות נטענות מהדיסק; התיעוד ממליץ על SSD ומזהיר ששיחות ארוכות מעבירות יותר עבודה ל-RAM של המערכת.
הישאר לפני AIעקוב אחר AI Buzz Wire לקבלת העדכונים העדכניים ביותר על דגמי קוד פתוח, כלי בינה מלאכותית מקומיים וחומרה להסקה.
קרא עוד חדשות AI →