גוגל השיקה ביום שלישי את Gemini 3.8 Flash, דגם סוס העבודה החדש ביותר שלה הממוקם כמערכת ההיגיון והקידוד הטובה ביותר של החברה אך באותו מחיר כמו קודמתה, לצד גרסה מיוחדת בשם Gemini 3.8 Flash Cyber שנבנתה לעבודת אבטחת סייבר הגנתית. ההכרזה, שפורסמה בבלוג הרשמי של גוגל על ידי Tulsee Doshi, מנהלת בכירה לניהול מוצר, ו-Raluca Ada Popa, מובילת אבטחה של Gemini ב-Google DeepMind, מסמנת את שחרור הפלאש השלישי של גוגל בתוך שישה שבועות בלבד.
ההשקה נוחתת בעיצומה של עונת יציאות צפופה בצורה יוצאת דופן, וזו תשובה ישירה ללחץ התמחור והביצועים שהפעילו היריבות על קו הדגמים של גוגל. לקבלת ראייה רחבה יותר של האופן שבו מעבדות הגבול מחליפות מכות, צוות חדשות הבינה המלאכותית עוקב אחר כל מהדורת דגמים מרכזיים בזמן שהם מתרחשים.
שתי גרסאות, קרן אחת
Gemini 3.8 מגיע בשתי גרסאות הבנויות על אותה אינטליגנציה בסיסית. Gemini 3.8 Flash הוא סוס העבודה למטרות כלליות: גוגל טוענת שהיא מספקת שיפורים משמעותיים מעל 3.7 פלאש בהנדסת תוכנה, משימות סוכן והיגיון רב-שלבי בתחומים מיוחדים, באותו מחיר היכרות של $0.75 למיליון אסימוני קלט ו-$3.75 למיליון אסימוני פלט.
Gemini 3.8 Flash Cyber מתואר כמודל אבטחת הסייבר המסוגל ביותר של גוגל, עם מה שהחברה מכנה ביצועים ברמת גבול בזיהוי פגיעות ותיקון אוטומטי. בניגוד לדגם הפלאש הסטנדרטי, הוא אינו זמין באופן נרחב - גוגל מפיצה אותו לקבוצה של מגינים מהימנים באמצעות תוכנית חדשה בשם Fairwind.
על פי הפוסט בבלוג, רווחי הקידוד וההיגיון על פני הליבה המשותפת הונעו בחלקם על ידי הכשרה קפדנית בתחום התובעני של אבטחת סייבר, ושני המודלים הואצו על ידי לולאות אגנטיות ארוכות טווח שנועדו להעריך ולחדד באופן רקורסיבי את המודלים הבסיסיים.
אמות מידה: עובדים קשה יותר, לא רק גדלים
הטענות בנצ'מרק של גוגל מתמקדות בפילוסופיית עיצוב שהחברה מסכמת בפשטות: 3.8 פלאש "עובד קשה יותר". במשימות מורכבות, המודל מבצע שלבי חשיבה נוספים וקורא לכלים באופן איטרטיבי, לפעמים צורך יותר אסימונים כדי למקסם את הביצועים ברמות מאמץ גבוהות יותר. מפתחים יכולים להקטין את המאמץ כדי לצמצם את התקורה האסימון, או להישאר ב-Gemini 3.7 Flash, שנותר תמיכה מלאה לעומסי עבודה ראשונים.
תוצאות הכותרות שגוגל מצטט:
- DeepSWE v1.1 (הנדסת תוכנה לטווח ארוך): 3.8 Flash מתעלה על רוב דגמי הגבול הגדולים בפתרון אוטונומי של בעיות הנדסיות מורכבות מקצה לקצה, במה שגוגל מתארת כשבריר מהעלות.
- Vals Finance Agent V2 ו-Harvey's Legal Agent Benchmark: 3.8 פלאש מתעלה על 3.7 פלאש ומודלים גבוליים אחרים בתחומים כמותיים ומקצועיים הדורשים ניתוח ודיווח מתקדמים.
- HLE-Verified: 3.8 Flash משיג 54.9%, ש-Google מציגה כראיה להיגיון רב-שלבי בתחומי STEM, מדעי הרוח ומקצועות.
פלאש סייבר: הגנה על התקפה
גרסת הסייבר היא המהדורה היוצאת דופן יותר. גוגל אומרת שהיא העדיפה בכוונה תיקון פגיעות על פני יכולות התקפיות כמו ניצול. ב-CWE-Bench, מדד תיקון חיצוני המנוהל על ידי Collinear, Gemini 3.8 Flash Cyber זכה ב-pass@1 של 47.2% - ממש מאחורי דגם חזית מוביל ב-47.8%, לפי גוגל, אבל בעלות נמוכה משמעותית, מה שמציב אותו על גבול פארטו של המדד.
ב-CyberGym, אמת מידה סטנדרטית בתעשייה לאיתור נקודות תורפה, גוגל אומרת שמודל הסייבר מדגים גילוי פגיעות אוטונומית ברמת הגבולות, ועולה על קודמו 3.5 Flash Cyber כמו גם דגמי חזית גדולים משמעותית. בהשוואה הפנימית של גוגל המשתרעת על בסיסי קוד מורכבים ב-20 שפות תכנות, המודל הגיע לשיעור הצלחה של למעלה מ-70%.
כבר מאבטח את הקוד של Google
גוגל אומרת שמודל הסייבר כבר פרוס באופן פנימי, והדוגמאות שהוא מספק הן ספציפיות:
- צוות האבטחה של Chrome מצא ש-3.8 Flash Cyber יצר פי 2.6 יותר תיקונים נכונים לפגיעויות של Chrome מאשר הדגמים המסחריים הטובים ביותר, שהם הרבה יותר גדולים.
- בחברת האבטחה Wiz, המודל השיג ריקול גבוה ב-7.5 עד 9.7 נקודות אחוז במדד בדיקות חדירה פנימיות בעלות נמוכה פי 2.3 עד 5.2 בהשוואה לדגמי חזית מובילים אחרים.
- צוות מחקר הפגיעות בענן של גוגל השתמש במודל כדי למצוא פגיעות בסיסית קריטית תוך פחות משעתיים - סוג של פגיעות שהמחקר והגילוי שלה, מציינת גוגל, נמשכים בדרך כלל חודשים.
משמעות הדבר עבור המפתחים והשוק
עבור מפתחים, הטקטיקה המעשית היא יציבות המחירים בקצה הנמוך של הגבול. החזקת 3.8 פלאש בתמחור ההיכרות של 3.7 שומר על העלות של מודל קידוד וסוכן תחרותי על 0.75$/3.75$ למיליון אסימונים, פלח שבו מתמודדים במשקל פתוח ומעבדות יריבות חותרים תחת מכהנים כל השנה. המסר של גוגל הוא שהקונים כבר לא צריכים לבחור בין עלות ליכולת בשכבת סוס העבודה.
מודל ההפצה של תוכנית Fairwind עבור Flash Cyber מובהק באותה מידה. מעבדות ברמה הקדמית מתייחסות יותר ויותר ליכולת אבטחת סייבר עילית כאל משהו שיש להסגר במקום לשלוח בצורה רחבה - מספקות כלים הגנתיים מתקדמים למגנים שנבדקו תוך הגבלת הפוטנציאל לשימוש לרעה התקפי. ההחלטה של גוגל לתעדף מדדי תיקון על פני יכולות ניצול בהכשרת המודל פועלת לפי אותו היגיון.
גם הקצב בולט. שלוש מהדורות פלאש בשישה שבועות - 3.7 פלאש לפני שלושה שבועות, עכשיו 3.8 - מראה שגוגל חוזרת על קו הביניים שלה הרבה יותר מהר מאשר מחזורי השחרור השנתי של לפני שנתיים. הלחץ התחרותי מהשקת ה-GPT-6 של OpenAI וגל דגמי המשקל הפתוח הנעים במהירות מסין דחסו את קווי הזמן של כולם, וברור שגוגל בוחרת מהירות בשכבת סוס העבודה בעוד שדגמי החזית שלה נושאים את דגל המחקר.
האם גישת "עובדת קשה יותר" של 3.8 פלאש - הוצאת יותר אסימונים על חשיבה רב-שלבית חרוצה - מוכיחה את עצמה יעילה יותר בפועל מאשר קנה המידה של המודל הגולמי יופיע בחשבונות המפתחים במהלך החודשים הקרובים. המדדים של גוגל עצמה מראים שהמסחר יכול להעדיף חריצות; השוק ייתן את פסק דינו שטר API אחד בכל פעם.
הישאר לפני AI
כל השקת דגם, אמת מידה ושינוי במחיר, במעקב בזמן שהוא קורה - קרא עוד חדשות AI →
