Reflection AI, הסטארט-אפ האמריקאי הנתמך על ידי Nvidia, הציגה את דגם המשקל הפתוח הראשון שלו ב-5 באוקטובר, מערכת דלילה של מומחים בשם Beam, שהחברה מציבה כאתגר המערבי החזק ביותר עד לגבול המשקל הפתוח שנשלט כיום על ידי מעבדות סיניות. ההכרזה, שפורסמה בבלוג של Reflection עצמה ונקלטה במהירות על ידי רויטרס, TechCrunch, Fortune ו-Semafor, מגיעה עם טוויסט: הדגם עדיין לא ניתן להורדה.

Beam עוברת מה שהחברה מתארת ​​כצוות אדום אחרון והערכות. גישה מוקדמת פתוחה באמצעות תהליך הרשמה, ורפלקשן אומרת שהיא תשחרר את המשקולות, דוח טכני, כרטיס דגם וחפצי מפתח בהמשך החודש. כשזה יקרה, Beam תהפוך לאחת מהגרסאות המשקל הפתוח הגדולות ביותר שפורסמו אי פעם על ידי מעבדה בארה"ב, והמבחן הברור ביותר עד כה אם חברה אמריקאית יכולה להתאים לקצב השחרור ולפתיחות שהפכו את הדגמים הסיניים לברירת המחדל של רוב קהילת הקוד הפתוח. לסיקור רציף של מרוץ המשקל הפתוח וכל השאר מניע את התחום, הוסף סימניה לדף הבית של חדשות הבינה המלאכותית שלנו.

המספרים מאחורי Beam

Beam הוא מודל דל של תערובת של מומחים עם 501 מיליארד פרמטרים בסך הכל, מתוכם כ-23 מיליארד פעילים לכל אסימון. רפלקשן אומר שהיא אימנה מראש את המודל על 23.8 טריליון אסימונים שנלקחו מהאינטרנט וממערכי נתונים בעלי רישיון קנייניים, בטענה שהמודל הבסיסי תואם או מתעלה על דגמי בסיס פתוחים בגודל דומה.

הטענה הייחודית יותר נוגעת למידת חיזוק. Reflection בנתה את האלגוריתמים, סביבות האימון והתשתית כדי לשמור על RL בעל מחשוב גבוה בקנה מידה, והחברה מדווחת שהרצת ה-RL שלה יצרה יותר מ-100 מיליון השקות על פני 10,500 NVIDIA GB300 GPUs במהלך ארבעה שבועות של אימון. זוהי השקעת RL גדולה בצורה יוצאת דופן עבור מהדורה בעלת משקל פתוח, ו-Reflection מזכה אותה בזכות הביצועים התחרותיים של Beam עם מה שהיא מכנה יעילות מחשוב הגבול.

אמות מידה: תחרותי, עדיין לא מוביל

טבלת המדדים שפורסמה של Reflection ממקמת את Beam בצורה יציבה בחבילת המשקל הפתוח, מאחורי הדגמים הסיניים הגדולים ביותר, אך לפני או ברמה עם מספר שמות מבוססים.

ב-SWE-Bench Pro v2-Hard, Beam משיגה 77.2, מאחורי GLM 5.3 ב-88.2 וקימי K3 ב-88.2 באותה שורה, אבל הרבה לפני Inkling ב-56.9. ב-SWE-Bench Pro v1, Beam משיגה 65.5, לפני Inkling (54.3), Nemotron 3 Ultra (46.4) ו-GLM 5.2 (62.1), בעוד Qwen 3.8-Max מציג 67.7. במדד הקידוד הסוכן של DeepSWE v1.1, Beam רושם 44.4, ברמה של 44.0 של GLM 5.2 ומאחורי GLM 5.3 (61.0), Qwen 3.8-Max (51.0) ו-DeepSeek V4.1 Flash (74.2).

המסגור של החברה עצמו הוא כנה לגבי המקום שבו Beam יושב. בפוסט בבלוג כותב Reflection כי Beam "מקדמת את גבול המשקל הפתוח המערבי" והיא "מתחרה עם דגמים פתוחים גדולים יותר כמו GLM 5.2 ומתקרבים ל-Qwen 3.8-Max במשימות קידוד ומשימות סוכן". הוא גם מודה שדגמי חזית פתוחים כמו Kimi K3 "שומרים על יכולת גולמית".

שני סייגים ראויים להדגשה. ראשית, כל מספר כאן מדווח בעצמו על ידי Reflection לפני שחרור המשקל, ואימות עצמאי יתאפשר רק לאחר שהדו"ח הטכני והמחסומים יהיו פומביים. שנית, מספר תאים בטבלה של החברה עצמה מסומנים כלא מדווחים, מה שהופך השוואות מוחלטות בין תפוחים לתפוחים לבלתי אפשריות לעת עתה.

טיעון היעילות

מה ש-Reflection מציג כיתרון האמיתי של Beam הוא לא עמדת Leaderboard גולמית אלא עלות בזמן ההסקה. מכיוון שרק 23 מיליארד מתוך 501 מיליארד הפרמטרים שלה מופעלים לכל אסימון, החברה טוענת כי Beam יכולה לספק ביצועי סוכן וקידוד קרובים לגבול בשבריר מעלות המחשוב של דגמים צפופים יותר. מיצוב זה משקף את האסטרטגיה שהפכה משפחות עם משקל פתוח סיניות לפופולריות כל כך בקרב חברות סטארט-אפ: יכולת חזקה מספיק במחירים שהופכים את הסוכנים התמידיים למשתלמים כלכלית.

אם טענת היעילות תשרוד בנצ'מרקינג עצמאי, זה יכול להיות חשוב יותר מאשר דלתות של Leaderboard. לצוותים המפעילים אלפי סוכני קידוד מקבילים אכפת יותר מהעלות למשימה שהושלמה מאשר מנקודות מידה חד ספרתיות.

זרם גיאופוליטי

הסיקור של ההשקה היה גיאופוליטי להפליא עבור מהדורת מודל קוד פתוח. רויטרס תיאר את Beam כ"מודל הבינה המלאכותית הראשון" מ-Reflection ש"לקחת על עצמו מודלים סיניים פתוחים". פורצ'ן שאל האם Beam יכולה להיות "הסיכוי הטוב ביותר של אמריקה להתחרות בסין", וסמאפור הגדירה את החברה כ"תשובה מערבית בקוד פתוח למעבדות סיניות".

המסגור הזה משקף את מצב המערכת האקולוגית בעלת המשקל הפתוח בסוף 2026: הדגמים הניתנים להורדה הניתנים ביותר הגיעו ברובם המכריע ממעבדות סיניות כולל משפחת GLM של Z.ai, קו Kimi של Moonshot, Qwen של עליבאבא ו-DeepSeek. מעבדות אמריקאיות שמרו במידה רבה על המשקולות הטובות ביותר שלהן, והימרו במקום זאת על הכנסות מ-API. השתקפות מהמרת ההיפך: שמודל חזית מערבי פתוח יכול למשוך את המערכת האקולוגית של המפתחים, ושהגיבוי של Nvidia נותן לה את מסלול המחשוב לעמוד בקצב.

מה קורה אחר כך

שחרור המשקל בהמשך החודש יענה על השאלות החשובות: איך Beam מתפקד מחוץ להערכות של Reflection, איזה רישיון מלווה את המשקולות, והאם היעילות מחזיקה מעמד בעומס עצמאי. עד אז, Beam נותרה טבלת בנצ'מרק מבטיחה, טופס הרשמה, וההבטחה המשקל הפתוח המשמעותית ביותר שמעבדה אמריקאית הבטיחה השנה.

למפתחים שמחליטים אם לעשות סטנדרטיזציה על GLM, Kimi, Qwen או לחכות ל-Beam, העצה המעשית היא להחזיק החלטות סופיות עד שינחת הדוח הטכני והערכות צד שלישי. למירוץ המשקל הפתוח יש משתתף אמריקאי חדש, ולראשונה מזה זמן מה, הוא לא מתחיל מהחלק האחורי של החפיסה.

הישאר לפני AI

גבול המשקל הפתוח זז מדי שבוע, והמעבדות משתחררות מהר יותר ממה שמישהו יכול לעקוב. קרא עוד חדשות בינה מלאכותית על AI Buzz Wire להשקות דגמים, תקלות בנצ'מרק והסיפורים העסקיים שמאחוריהם.

גלה את הפיתוחים האחרונים של AI כאן.