xAI שחררה את Grok 4.7, המודל המסוגל ביותר של החברה לעבודת קידוד וידע עד כה, לאחר שבועות של הקנטות פומביות ולפחות עיכוב אחד. הוכרז באתר החברה ביום ראשון, הדגם נוחת באותו המחיר ובמהירות ההגשה כמו קודמו Grok 4.6: 2 דולר למיליון אסימוני קלט ו-6 דולר למיליון אסימוני פלט, בערך מחצית ממחיר המחירון של ה-GPT-5.6 Sol Max של OpenAI (4$/20$) והרבה מתחת ל-Fable של Anthropic (5.1$/5.1$).

לחדשות והניתוחים החדשים של AI, בקר ב-AI Buzz Wire.

דגם בסיס גדול יותר, מאומן למשימות ארוכות

על פי ההודעה של xAI, Grok 4.7 משתמש במודל בסיס חדש וגדול יותר בהשוואה ל-Grok 4.6 והוכשר עם ריצת למידת חיזוק ארוכה יותר על תמהיל קשה יותר של משימות, המשוקללות לבעיות שלוקחות שעות רבות להשלמתן. החברה אומרת שהמודל טוב יותר באימות העבודה שלו ובניהול הקשר ארוך יותר, וכי הוא הוכשר להבין באופן מקורי את רתמת ה-Grok Bot, לשפר משימות שיחה ועבודת ידע כללית.

השחרור מגיע בעקבות ריצה רועשת. אילון מאסק אמר לראשונה בתחילת ספטמבר ש-Grok 4.7 ינחת תוך עשרה ימים, ואז הודה באמצע ספטמבר שהדגם זקוק לעוד כמה ימים של שכלול, לפי TeslaNorth.com. כעת הוא נשלח, ו-GitHub אישר באותו יום ש-Grok 4.7 זמין ב-GitHub Copilot.

תמונת הבנצ'מרק: חזקה, לא גורפת

נתוני ההשוואה שפורסמו על ידי xAI מציגים מודל שמוביל במספר קטגוריות של אופק ארוך תוך שהוא נשאר מאחורי התצורה היקרה ביותר של Anthropic באחרים:

  • CursorBench 4.0, המדגיש משימות קידוד ארוכות יותר: Grok 4.7 מקבל ציונים של 46.3%, לפני GPT-5.6 Sol Max (41.7%) ו-Grok 4.6 High (40.4%), אך מאחורי Fable 5.1 Max (51.8%).
  • Terminal-Bench 4.0, עבודה במסוף רב שעות: 38.0%, עלייה חדה מ-20.3% עבור Grok 4.6 וקצת לפני GPT-5.6 Sol Max (37.3%), אם כי Fable 5.1 Max מוביל ב-57.9%.
  • EEBench, אמת מידה להנדסת חשמל: 64.0%, זינוק גדול מ-53.0% של Grok 4.6 והגבוה ביותר מבין הדגמים הרשומים.
  • DeepSWE v1.1: 71.0% במאמץ גבוה, לעומת 65.2% עבור Grok 4.6 ו-72.7% עבור GPT-5.6 Sol Max.
  • תיק AA גרסה 1.1, עבודה משרדית מרובת שעות: 1,657, עלייה מ-1,546, וקרוב מאחורי Fable 5.1 Max ב-1,678.
  • Benchmark של הסוכן המשפטי של הארווי: 19.6%, לפני Grok 4.6 (15.8%) והרבה לפני GPT-5.6 Sol Max (2.5%) ו-Fable 5.1 Max (6.7%) במדד זה.
  • HealthBench Professional: 56.7%, שיפור ביחס ל-48.5% של Grok 4.6 אך נגרר אחרי GPT-5.6 Sol Max (60.5%) ו-Fable 5.1 Max (62.1%).

ב-GDPval, אמת מידה מקצועית שזכה ב-Elo, התרשים של xAI מציב את Grok 4.7 בהיגיון גבוה על 1,695 - עלייה מ-1,605 עבור Grok 4.6, מאחורי Fable 5.1 Max (1,735) והקדים את GPT-6 Astra Max (1,542).

המחיר הוא הסיפור

הטענה האגרסיבית ביותר בהודעה היא כלכלית ולא טכנית: xAI מתארת את Grok 4.7 מהיר פי שניים בחצי מהמחיר של דגמים דומים, וטבלת התמחור שפורסמה מגבה את השוואת הכותרת מול התצורות המובילות של שתי יריבותיה הראשיות. תמחור האסימון של Grok 4.7 של $2/$6 נותר ללא שינוי לעומת Grok 4.6, כלומר הקונים מקבלים את השיפור מדור על דור ללא עליית מחיר.

מיצוב זה מרחיב אסטרטגיה ש-XAI נקטה על פני קו Grok 4.x: התאמה או התקרבות לאיכות גבול תוך חריגה מרמות התמחור הפרימיום של OpenAI ו-Anthropic, ולאחר מכן הפצה אגרסיבית באמצעות שותפים כולל GitHub, Cursor ו-OpenRouter.

במה לצפות

האזהרה הכנה היא ש-xAI פרסמה את תרשים ההשוואה בעצמו, ואימות בלתי תלוי מאגרגטורים בהשוואה ייקח ימים. במספרים ש-xAI בחרה להדגיש, Grok 4.7 הוא עליית מדרגה אמיתית מ-Grok 4.6 - בולט ביותר ב-Terminal-Bench 4.0 ו-EEBench - אבל הוא לא מטאטא את Fable 5.1 Max, ששומר על ההובלה במדדים של קידוד ובריאות תוך עלות של פי חמישה לכל אסימון פלט.

עבור מפתחים המפעילים עומסי עבודה פעילים ארוכים של מספר שעות, המתמטיקה של מחיר-ביצועים עשויה להיות חשובה יותר מאשר מיקום גולמי של Leaderboard. Grok 4.7 זמין כעת דרך ה-API של xAI וב-GitHub Copilot.

הישאר לפני AI

לסיקור רציף של ההתפתחויות החשובות ביותר של תעשיית הבינה המלאכותית, סמן AI Buzz Wire ולעולם אל תחמיצו סיפור חדש.

קרא עוד חדשות AI