Sakana AI שבסיסה בטוקיו השיקה את Fugu, מערכת שמספקת את הביצועים של מודל AI חזיתי על ידי תיאום דינמי של דגמים רבים בו-זמנית. במקום לבנות רשת עצבית ענקית אחת, Fugu היא בעצמה מודל שפה שאומן להתקשר ל-LLMs אחרים מ"מאגרי סוכנים שניתן להחלפה", מרכיבה צוות של מודלים מיוחדים לכל משימה ומסנתז את הפלט שלהם באמצעות API אחד תואם OpenAI.
ההשקה, המכוסה על ידי THE DECODER, MarkTechPost ו-MIT Sloan Management Review, מייצגת הימור שהקפיצה הבאה בביצועי AI עשויה להגיע פחות מקנה מידה גולמי ויותר מתאום חכם יותר של הדגמים שכבר קיימים. For more context on this story, see our ongoing AI trends.
דגם אחד שיפקד על כולם
למשתמש, פוגו מתנהג כמו דגם יחיד. מתחת למכסה המנוע, הוא מטפל בבקשה בעצמו או מרכיב צוות של דגמים מיוחדים, מנהל בחירה, האצלה, בדיקה וסינתזה פנימית. Sakana AI אומר שהגישה מתבססת על עבודה קודמת כמו ALE-Agent שלה, ששם את המקום ה-21 מתוך 1,000 מומחים אנושיים בתחרות קידוד באמצעות טכניקות תזמור.
החברה משחררת שתי גרסאות. מודל ה-Fugu הבסיסי מכוון להשהייה נמוכה וביצועים יומיומיים מוצקים בכל מקרי קידוד, סקירת קוד ושימוש בצ'אטבוטים, ומאפשר לצוותים להוציא סוכנים ספציפיים מהמאגר לצורך פרטיות או תאימות. Fugu Ultra בנויה לאיכות תשובה מקסימלית בבעיות מורכבות מרובות שלבים כגון שחזור מאמרים מדעיים, ניתוח אבטחת סייבר וחיפושי פטנטים וספרות.
תביעות בנצ'מרק שמסובבות ראשים
על פי תוצאות הבנצ'מרק שפרסמו Sakana AI, Fugu Ultra מתפקד בדומה ל-Fable 5 ו-Mythos Preview של Anthropic במגוון של מדדי קידוד, הנמקה ומדע. יש לציין שאף אחד מהדגמים האנתרופיים אינו נמצא במאגר הסוכנים של פוגו מכיוון שהם אינם זמינים לציבור, כלומר פוגו הגיע לציונים דומים באמצעות מודלים אחרים.
המספרים שפורסמו מדהימים. ב-SWE-Bench Pro, Fugu Ultra השיגה 73.7, לפני Opus 4.8 ב-69.2, Gemini 3.1 Pro ב-54.2 ו-GPT 5.5 ב-58.6. ב-TerminalBench 2.1 הוא קיבל ציון 80.2 לעומת 82.1 של Opus 4.8. ב-LiveCodeBench הוא הגיע ל-93.2 מול ה-85.3 של GPT 5.5, ובבחינה האחרונה של Humanity הוא פרסם את ה-50.0, והעלה על ה-49.8 של Opus 4.8 ו-41.4 של GPT 5.5.
מבחנים בעולם האמיתי מציירים תמונה מעורבת
ביקורות מעשית מוקדמות היו פחות נלהבות מהמדדים. חוקר הבינה המלאכותית איתן מוליק כתב ב-X ש-Fugu Ultra הוא "איטי להפליא", כאשר מבחני הקידוד הרגילים שלו נמשכים 30 דקות והתוצאות היו "בסדר" אבל לא היו מ-Fable בפועל. משתמש אחר דיווח על מכסה שלמה של חמש שעות בתוכנית של 20 דולר עם הנחיה אחת, בעוד מפתחים ב-Hacker News התלוננו שהתוכנית של 200 דולר לחודש מניבה פחות משלוש שעות שבועיות של זמן שימושי.
ביקורות קוד התגלו כנקודת אור, והתאימו בערך ל-Opus 4.8 או GPT 5.5 באיכות. בדיקה אחת ראש בראש הראתה ש-Fugu Ultra מסיים משימת קידוד תוך 22 דקות תמורת 7.32 דולר, הרבה יותר מהיר וזול מ-79 הדקות של Opus 4.8 ו-37.85 דולר, אם כי המבקר העדיף את התפוקה של Opus.
Sakana AI, שנוסדה בטוקיו בשנת 2023 ומגובה על ידי Nvidia, בנתה את זהותה על מחקר AI בהשראת הטבע, תוך שימוש באלגוריתמים אבולוציוניים ורעיונות אינטליגנציה קולקטיבית כדי לסחוט יותר ביצועים ממודלים קיימים. פוגו מרחיב את הפילוסופיה הזו לשוק המסחרי, והופך את התזמור עצמו למוצר. החברה גם ממצבת את המערכת עבור קהל יפני החרד מהסתמכות יתר על ספקים בארה"ב, עם אתר דו לשוני ותמחור המיועד הן למפתחים בודדים והן לצוותים ארגוניים.
גידור נגד נעילת ספקים
מעבר לביצועים הגולמיים, Sakana AI מציגה את Fugu כאמצעי הגנה מפני תלות בכל ספק AI יחיד. החברה הצביעה על בקרות הייצוא האחרונות של ארה"ב שמשכו את דגמי Fable ו-Mythos של Anthropic משווקים זרים כהוכחה לכך שהגישה למערכות מובילות יכולה להיעלם בן לילה.
"עבור ארגון או מדינה, הסתמכות על ממשקי API של חברה אחת לתשתית, כספים או ממשל קריטיים היא פגיעות מהותית", כתבה Sakana AI בהודעתה. מכיוון שמאגר הדגמים של Fugu ניתן להחלפה מלאה, המערכת יכולה לנתב מחדש לדגמים אחרים אם ספק אחד יחשיך.
אנליסטים מזהירים שזה לא זהה לריבונות אמיתית. הביצועים של Fugu תלויים באילו דגמים יושבים בבריכה שלה, וכמה ספקים מובילים המגבילים את הגישה בו-זמנית עדיין לכווץ את האפשרויות שלה. החברה גם לא חשפה עד כמה שכבת התזמור מעלה את השימוש והעלות באסימונים. ובכל זאת, כאשר דגמי חזית הופכים לנכסים גיאופוליטיים והנעילת ספק יחיד הולכת וגדלה מסוכנת יותר, פוגו מציעה תצוגה מקדימה של תעשיית בינה מלאכותית שבה תיאום עשוי להיות חשוב כמו יכולת.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →



