Inception Labs פרסמה ביום שלישי את Mercury 2.5, גרסה חדשה של מודל שפת הדיפוזיה המסחרית שלה, שהחברה מתארת ​​כ-LLM הדיפוזיה המסוגלת ביותר בשוק, ולמיטב ידיעתה, מודל שפת הדיפוזיה הגדול ביותר שהוכשר אי פעם. על פי הודעת החברה, הדגם מספק עלייה של 40% באינטליגנציה לעומת קודמו, Mercury 2, תוך שמירה על אותו פרופיל הגשה עם חביון נמוך ובעלות נמוכה שהפך את ארכיטקטורת הדיפוזיה לאטרקטיבית עבור עומסי עבודה בנפח גבוה.

החברה, בראשות המנכ"ל סטפנו ארמון, טוענת ש-Mercury 2.5 דומה לדגמי גבול מותאמים בעלות כולל GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite ו- Claude Haiku 4.5. ההשוואות הללו מדווחות על ידי ספקים ועדיין לא אומתו על ידי אמות מידה עצמאיות, אבל הן מציבות מודל דיפוזיה - זמן רב סקרנות מחקרית - כאלטרנטיבה ייצור לבעלי התפקידים האוטורגרסיבים. לחדשות האחרונות של דגמי AI, עקוב אחר הסיקור השוטף של AI Buzz Wire. חדשות אחרונות על מודל AI

מהירות, הקשר ומחיר

המספרים בכותרות אגרסיביים. ב-Inception Labs אומרים ש-Mercury 2.5 מייצר 1,107 אסימונים בשנייה במעבדי NVIDIA זמינים באופן נרחב, עם חלון הקשר של 260,000 אסימונים. התמחור נקבע על 0.20 דולר למיליון אסימוני קלט ו-0.75 דולר למיליון אסימוני פלט, כאשר קידום השקה מוזל ב-80% ל-0.04 דולר למיליון קלט ו-0.15 דולר למיליון פלט.

בצד היכולות, המודל מגיע עם היגיון שניתן לכוונן - המאפשר למפתחים לסחור בחביון לעומק על בסיס בקשה - יחד עם קריאות לכלים מקבילות ופלט JSON מותאם לסכימה ליצירה מובנית. החברה ממסגרת את המהדורה כתוצאה ראשונה של לולאת הדרכה המונעת על ידי טלמטריית ייצור: מאז השקת Mercury 2, אלפי מפתחים בנו איתו, עשרות ארגונים פרסו אותו, והשימוש גדל ביותר מסדר גודל.

מדוע מודלים של דיפוזיה מייצרים טקסט מהר יותר

מיינסטרים LLMs מ-OpenAI, Google ו-Anthropic הם אוטורגרסיביים: הם יוצרים טקסט אחד בכל פעם, כאשר כל אסימון מותנה בכל מה שנוצר לפניו. התלות הרציפה הזו שמה רצפה קשה מתחת למהירות הדור. מודלים של שפת דיפוזיה במקום זאת מתחילים עם בלוק של רעש ומשכללים באופן איטרטיבי את כל האסימונים במקביל, מה שמאפשר תפוקה גבוהה בהרבה בחומרת GPU קונבנציונלית ברגע שהדגם מאומן להתכנס בצורה נקייה.

ההחלפה היסטורית הייתה איכותית: מודלים של דיפוזיה נגררו אחרי מודלים אוטורגרסיבים על סמך נימוקים והוראות ביצוע. הימור הליבה של Inception Labs - והטענה העומדת בבסיס Mercury 2.5 - הוא שהפער הזה הצטמצם עד לנקודה שבה הדיפוזיה מנצחת על הציר שרוב הלקוחות באמת מרגישים: חביון ועלות בנפח הייצור.

תביעות הפקה מלקוחות מוקדמים

ההכרזה נשענת במידה רבה על פריסות של לקוחות ולא על טבלאות בנצ'מרק. OpenCall, שבונה סוכני טלפון בינה מלאכותית לשיחות חיים עם לקוחות, דיווחה שהמעבר למרקורי הביא את זמן האחזור החציוני של התגובה של המודל לכ-170 אלפיות השנייה. אוליבר סילברסטיין, מייסד ומנכ"ל משותף של OpenCall, אמר שזמן התגובה של החברה ב-P99 ירד ממספר דקות לשנייה אחת, והחציון שלו מ-0.4 שניות מתחת ל-0.2 - נתונים שהוא תיאר מהירים משמעותית מכל ספק אחר שהחברה בדקה, כולל עם נימוקים מופעלים.

Augment Code, יצרנית מסייעת לקידוד בינה מלאכותית, משתמשת ב- Mercury עבור דחיסה של הקשר, ניתוב מודלים וחיפוש כלי MCP. לפי Inception Labs, העברת עומסי הדחיסה למרקורי הורידה את זמן ההשהיה של הצעד הזה ב-82%, מכ-150 שניות ל-27 שניות, והפחיתה את העלות שלו ב-90% תוך שמירה על איכות. מקרה השימוש ממחיש היכן הכלכלה נוגסת: סוכני קידוד מבצעים הרבה שיחות מודל תומכות קטנות סביב כל דור ראשי, ומתחם זמן ההשהיה והעלות בין השיחות הללו.

NVIDIA, שהחומרה שלה מפעילה את המודל, השפיעה גם היא. Shruti Koparkar, מנהל בכיר של מוצר ב-Accelerated Computing Group של NVIDIA, אמר כי ל-Inception יש מודלים מתקדמים של שפה מבוססי-דיפוזיה על תשתית AI של NVIDIA, וכי העלייה האיכותית של Mercury 2.5 עם מהירויות מתמשכות מראה באיזו מהירות מערכות חדשות יכולות להתבגר לתוך ארכיטקטורות ייצור.

תצוגות מקדימות של Mercury Voice ו-Mercury Router

לצד הדגם, Inception Labs הכריזה על תצוגות מקדימות של שני מוצרים חדשים. Mercury Voice הוא דיפוזיה LLM מותאמת לסוכני קול עם תקציבי ההשהיה המצומצמים ביותר, עם זמן פרסום עד האסימון הראשון מתחת ל-170 מילישניות. Mercury Router משתמש במודל דיפוזיה כדי להבין הנחיות נכנסות ולנתב אותן לכל דגם - פתוח או סגור - שמציע את התמהיל הטוב ביותר של איכות, מהירות ועלות, וממקם את Inception כשכבה מעל מתחרותיה כמו גם אחת מהן.

Mercury 2.5 זמין דרך ה-API של Inception עצמו וכן דרך Baseten ו-OpenRouter. פריסות ארגוניות מוסיפות קיבולת ייעודית, קנה מידה אוטומטי, בקרות תאימות ושימור נתונים שניתן להגדרה. החברה מציעה 100 מיליון אסימונים בחינם למפתחים המנסים את ה-API.

החברה גם אמרה שהיא כבר החלה להכשיר את הדגם הבא שלה - הגדול ביותר שלו עד כה, המיועד לשחרור בחודשים הקרובים - אותו היא מתארת ​​כקפיצה ביכולת שאינה מוותרת על מהירות הדיפוזיה או היעילות הסמלית. אם הטענה הזו תתקיים, הלחץ על בעלי תפקידים אוטומטיים יורגש קודם כל בשכבות הסחורות של השוק, שם המחיר והשהייה קובעים את רוב החוזים.

הישאר לפני AI

עקבו אחר ההתפתחויות האחרונות בינה מלאכותית וחדשות חדשות בבינה מלאכותית כאשר ארכיטקטורות דגמים חדשות דוהרות לייצור.

קרא עוד חדשות AI →