Fireworks Research, צוות המודלים בתוך הסטארט-אפ Fireworks AI, הציגה את Ember-1, דגם מיוחד שלדבריה מייצר את אותן תשובות כמו Kimi K3 של Moonshot AI תוך שהוא פולט בערך 40% פחות אסימונים. המודל עלה לאוויר על הפלטפורמה של Fireworks ב-23 בספטמבר, ובמהלך הימים האחרונים הוא הפך לאחת המהדורות הנדונות ביותר בקהילת המפתחים, וגרר מאות הצבעות בעד ב-Hacker News בזמן שהקודדים התלבטו אם אסימוני הנמקה הם גבול העלות הבא.

המגרש מגיע ברגע שבו שטרות מסקנות, לא יכולת דגם, מחליטים יותר ויותר מה צוותים יכולים להרשות לעצמם לשלוח. לצוותים שצופים בעומסי עבודה סוכנים צורכים תקציבים, הפיתוחים האחרונים של AI הבהירו דבר אחד: ההרגל היקר ביותר בתעשייה כרגע הוא לא אימון מודלים חזיתיים, הוא מפעיל אותם. Ember-1 הוא הניסיון של Fireworks לתקוף את הבעיה הזו ישירות, והחברה תמכה בה בסט מפורט בצורה יוצאת דופן של מדדים ומספרי ייצור.

מודלים חושבים חושבים יותר מדי

תצפית הליבה מאחורי Ember-1 היא שדגמי חשיבה כמו Kimi K3 מוציאים את רוב האסימונים שנוצרו - לפעמים יותר מ-90%, לפי Fireworks - על הנמקה פנימית ולא על התשובה עצמה. על בקשה בודדת, זה יקר. בעומסי עבודה סוכן, זה מורכב: כל סיבוב של שיחת סוכן משמיע מחדש את כל ההיגיון הקודם בחזרה למודל, כך שההקשר גדל באופן מרובע בערך עם מספר התורות, ועקבות נימוקים ארוכים מהתורים המוקדמים נקראים מחדש ומחויבים מחדש בכל שיחה שלאחר מכן.

Fireworks אומר שלקוחות אמרו להם שהם רוצים את יכולת הקידוד של Kimi K3 בעלות נמוכה יותר, אבל פשוט לדחות את מאמצי ההיגיון של הדגם לא עבד - ההגדרות הנמוכות ויתרו על יותר מדי איכות. האלטרנטיבה הייתה להכשיר מודל שמנמק בצורה יעילה יותר תוך שמירה על ההיגיון החשוב.

הדרכת הפסולת החוצה

בניין Ember-1 לקח יותר מ-50 ניסויי אימון ויותר מ-200 הערכות, שהופעלו כולו על פלטפורמת הדרכה ללא שרתים של Fireworks, על פי פוסט הבלוג של החברה. הצוות אומר שהוא פיתח אלגוריתמי אימון חדשים לאורך הדרך כדי לקצר חשיבה מבלי לאבד את הדיוק.

יש לציין שהחברה לא ניסתה לבטל את הסיטונאי של הנמקה. חלק מהדיבוריות הנראית לעין של Kimi K3 היא השתקפות עצמית פרודוקטיבית - בדיקה חוזרת של הנחה, תגובה למשוב או מעקב אחר תוצאה חזרה להחלטה קודמת עוזרת למודל להתאושש מטעויות. משטר האימונים נועד לשמר את היכולת הזו תוך חיתוך לולאות לא פרודוקטיביות.

נתוני ההכשרה התפרשו על פני מתמטיקה, קידוד, מעקב אחר הוראות, שיחה, חיפוש, שימוש בכלים והנדסת תוכנה, וכיסו הן בעיות עצמאיות והן אינטראקציות מרובה פניות. Fireworks אומרת שהיא השתמשה רק בנתונים שלה וללא נתוני לקוחות.

אמות מידה: על או ליד גבול פארטו

כדי להפוך את העלות למקרה, Fireworks חישבה את העלות לפי מדד באמצעות תמחור ה-API הציבורי של Kimi K3 - $3 למיליון אסימוני קלט לא מאוחסנים, $0.30 למיליון אסימוני קלט במטמון ו-$15 למיליון אסימוני פלט - והשוותה את Ember-1 מול K3 במאמץ הגיוני נמוך, גבוה ומקסימלי. על פני כל אמת מידה עם יותר מ-50 דגימות בדיקה, החברה מדווחת כי Ember-1 יושב על או ליד גבול Pareto, התאמה ל-K3 במאמץ מרבי עבור חלק מהעלות ושולטת בקפדנות על K3 במאמץ נמוך.

הכותרת משווה ל-K3 במאמץ מרבי, כפי שדווח על ידי Fireworks:

| בנצ'מרק | דוגמאות | K3 (מקסימום מאמץ) | אמבר-1 |
|---|---|---|---|
| ספסל טרמינל 2.1 | 89 | 80.9% | 82.0% |
| SWE-bench מאומת | 500 | 93.2% | 92.2% |
| SWE-Interact | 75 | 21.3% | 20.0% |
| DeepSWE 1.1 | 113 | 66.4% | 75.2% |
| τ²-Bench Airline | 50 | 64% | 66% |

לגבי עלות למשימה, Fireworks מדווחת כי Ember-1 קיצצה את ההוצאות ב-51.9% על טרמינל Bench 2.1, 32.5% על SWE-Interact, 23.7% על DeepSWE 1.1 ו-15.5% על SWE-bench Verified ביחס ל-K3 במאמץ מקסימלי - במקרה של DeepSWE של יותר מ-$126 הפרש של יותר מ-$126 לעבודה. תעריפים.

החברה גם העריכה את Ember-1 על ספסל המיטה של ​​Doximity, אמת מידה מאומתת על ידי רופא של 500 מקרים קליניים על פני 10 התמחויות ש-Fireworks מפעילה באמצעות אינדקס מודיעין מיוחד שהושק לאחרונה. שם, Fireworks אומר ש- Ember-1 קבע גבול פארטו חדש לגבי עלות למשימה על פני דגמים פתוחים וסגורים כאחד, כולל GPT-5.6 Sol, GPT-6 Astra ו-Claude Opus 5. הטענה הזו מגיעה מהמדד של Fireworks עצמה ולא אומתה באופן עצמאי.

תנועה חיה: פחות אסימונים, אותם ציונים

מדדים הם דבר אחד; ייצור הוא אחר. Fireworks הפעיל מבחני A/B חיים עם שני לקוחות על עומסי העבודה של קידוד הייצור שלהם ודיווח כי Ember-1 השתמש בכ-35% פחות אסימונים לכל משימה באיכות דומה. בהשוואה מדודה אחת, Kimi K3 קיבל ציון של 0.751 תוך יצירת 49,300 אסימוני פלט למשימה, מול 0.753 עבור Ember-1 על 29,900 אסימונים - הפחתה של 71.3% באסימוני חשיבה ו-39% פחות אסימונים בסך הכל. בעקבות הבדיקות, לקוח אחד העביר את Ember-1 לייצור חי עם תוכניות להגדיל אותו כדי להחליף את דגם הבסיס לחלוטין.

בתוך Fireworks עצמה, הדגם הוחלף בשקט לתהליכי הקידוד של החברה עצמה לפני ההשקה. התוצאה שהצוות אומר שהיא הכי גאה בה: אף אחד לא שם לב. מפתחים המשיכו את עבודתם מבלי לזהות את המתג תוך צריכת פחות אסימונים באופן משמעותי.

מודיעין מיוחד כאסטרטגיה

Ember-1 הוא הדגם הראשון בסדרה מתוכננת של Fireworks Research, והוא מגיע לצד מדד המודיעין המיוחד של החברה, מאמץ מידוד שהוצג מוקדם יותר החודש כדי להשוות מודלים פתוחים, סגורים ומתמחים במשימות בעולם האמיתי שנוצרו על ידי מומחים.

המחזה האסטרטגי קל לקריאה. במקום להכשיר דגם חזיתי מאפס, Fireworks לקחה מודל חזק עם משקל פתוח, אימנה לתוכו יעילות סמלית, וכעת היא מוכרת את אותה יכולת בעלות נמוכה יותר למשימה. בעוד שחרורים בעלי משקל פתוח ממעבדות כמו Moonshot ממשיכות לצמצם את פער היכולות, ספקי הסקת מסקנות מגלים שההבחנה המתמשכת עשויה להיות בעלות למשימה שהושלמה ולא במיקום המוביל - שינוי שמעדיף חברות עם תשתית הכשרה ושירות חזקה.

כדאי לציין את האזהרות בבירור: המספרים שלמעלה מגיעים מהבלוג של Fireworks עצמו, מההערכות שלה ומלקוחות משלמים משלה. שכפול עצמאי של החיסכון האסימוני על עומסי עבודה חיצוניים יהיה המבחן האמיתי. אבל אם התוצאות מתקיימות, ייתכן שהדרך המשתלמת ביותר להפעיל מודל פתוח ברמה של גבולות כבר לא היא לגרום לו לחשוב פחות - זה יכול להיות להפעיל מודל שלמד לחשוב ביעילות.
---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →