Z.ai, חברת הבינה המלאכותית המבוססת בבייג'ינג, הידועה גם בשם Zhipu, פרסמה את GLM-5.3, איטרציה חדשה של מודל הדגל שלה שלדבריה היא מערכת המשקל הפתוח המסוגלת ביותר עד כה להנדסת תוכנה - וכזו שפיתחה באופן בלתי צפוי כישורי אבטחת סייבר אדירים. הוכרז ב-14 באוגוסט ומפורט בפוסט בבלוג של החברה, GLM-5.3 בנוי על אותו דגם בסיס של כ-700 מיליארד פרמטרים כמו קודמו GLM-5.2, שיצא ביוני. כל שיפור, אומרת החברה, מגיע מפוסט אימון ולא מבסיס גדול יותר. המהדורה היא האחרונה בגל של דגמים סיניים בעלי משקל פתוח שמטרתם להתחרות על מערכות סגורות מ-Anthropic ו-OpenAI. עבור דגם AI Buzz Wire, GLM-5.3 הוא איתות ברור לכך שגבול המשקל הפתוח סוגר את פער הקידוד מהר יותר ממה שרבים ציפו.

רווחים שנבנו כולו על פוסט אימון

Z.ai בוטה לגבי הגישה שלו עם GLM-5.3: "הגדלה שלאחר האימון היא כל מה שעשינו." החברה העבירה את מחסנית למידה החיזוק שהציגה עם GLM-5.2 - כולל IndexShare לעיבוד יעיל של הקשר ארוך, SAO ללמידת חיזוק במשימות ארוכות אופק, ומסגרת קוד פתוח בשם slime לאימון אסינכרוני בקנה מידה גדול. במהלך החודש האחרון הוא פשוט הכניס יותר סביבות, משימות מגוונות יותר ועוד מחשוב לתוך הערימה הזו.

התמורה מופיעה על פני מדדי קידוד. ב-Terminal Bench 3.0, GLM-5.3 קופץ מהציון של GLM-5.2 של 4.6 ל-28.3 - שיפור של יותר משישה. הוא מפרסם תוצאות עדכניות בקוד פתוח ב-Terminal Bench 3.0 ובבחינה האחרונה של הסוכנים, ומשתפר מ-23.8 ל-28.5 במדד ALE-CLI של יכולת סוכן. Z.ai מדווחת על שיפור של 50% בהשוואה ל-GLM-5.2 ב-Z.ai Code Bench הפנימי שלה, אמת מידה פרטית שנועדה להעריך סוכני קידוד בסביבות פיתוח מציאותיות ולהפחית את הסיכון לזיהום ממערכות בדיקות ציבוריות.

באופן מכריע, הרווחים מגיעים עם יעילות סמלית טובה יותר, לא רק עם תוצאות טובות יותר. במאמץ גבוה, GLM-5.3 מגיע להשלמת 31.4% במדד הביתי בכ-50,000 אסימוני פלט למשימה, שלדברי Z.ai עולה על קלוד אופוס 4.8 של Anthropic ב-29.5% עם 120,000 אסימונים. GLM-5.3 עדיין עוקב אחרי קלוד פייבל 5 המתקדם יותר של אנתרופיק, שמגיע ל-39.5% במאמץ מרבי.

קפיצת מדרגה בלתי צפויה ביכולת הסייבר

התוצאה הבולטת ביותר מ-GLM-5.3 היא לא בקידוד אלא באבטחה. כאשר Z.ai הגדיל את קנה המידה שלאחר האימון והכניס נתונים וסביבות של גילוי פגיעות לתוך תמהיל האימונים, היא ציפתה שהמודל ישתפר במציאת פגמים והנמקה לגביהם. מה שהפתיע את הצוות היה כמה מהר התפתחה היכולת הזו.

GLM-5.3 לא רק הפך טוב יותר באיתור באגים מבודדים; הוא החל להגיב על פני מספר שלבים של ניצול, ויצר תוכניות קוהרנטיות לשרשראות תקיפה שלמות. ב-CyberGym, אמת מידה שבודקת אם מודל יכול לזהות ולאמת פגיעויות מקוד מקור של קופסא לבנה, GLM-5.3 מקבל ציונים של 84.5%, לעומת 77.2% של GLM-5.2. זו התוצאה הטובה ביותר במדד, לפני Mythos 5 ב-83.8% ו-GPT-5.6 Sol ב-83.6%. ב-ExploitBench, שדורש חשיבה מעמיקה יותר לגבי פגיעויות אמיתיות וניצול שלהן, GLM-5.3 יותר מכפיל את הציון של GLM-5.2 ומגיע ל-54.4% - אם כי הוא נשאר הרבה מאחורי Mythos 5 ב-78.0% ו-GPT-5.6 Sol ב-76.5%.

Z.ai מבחין בדפוס עקבי: ככל שהמדד נמצא במעלה שרשרת הניצול, כך הרווח על GLM-5.2 גדול יותר - וגם הפער הנותר לגבול הסגור גדול יותר. "היכולת צומחת הכי מהר בדיוק איפה שאנחנו הכי רחוקים מאחור", מציינים בחברה.

גילויי פגיעות בעולם האמיתי

כישורי הסייבר אינם מוגבלים לאמות מידה. Z.ai מדווחת שמאז GLM-5.2, היא עובדת עם מספר צוותי אבטחה בסין כדי לבדוק את הדגמים שלה מול בסיסי קוד אמיתיים. לאחר סקירת מומחים, סינון ומניעת כפילות, המודל זיהה 2,436 פגיעויות ב-269 פרויקטים, כולל 1,097 בעיות בחומרה בינונית עד גבוהה. הממצאים משתרעים על גרעיני מערכת, מערכות הפעלה, מנועי דפדפן, תשתית קוד פתוח, יישומי אינטרנט ופרוטוקולי רשת - שרבים מהם נעלמו מעיניהם במשך שנים או אפילו עשרות שנים, כאשר העתיקים ביותר מתוארכים ל-40 שנה בערך.

התוצאות הללו מהדהדות את עבודתה שאנתרופיק תיארה במחקר אבטחה מרובה-סוכנים משלה, שבו נעשה שימוש בנחילי סוכנים מתואמים כדי לחפש נקודות תורפה בתוכנת קוד פתוח בקנה מידה.

משקולות פתוחות - באיחור

Z.ai אומר שהיא תשחרר את המשקולות GLM-5.3 בעוד שבועיים, לאחר שהערכת הבטיחות וההתקשות יסתיימו. עיכוב מכוון זה משקף מתח שעובר בהודעה: מודל שמפתח יכולות סייבר התקפיות חזקות מהר יותר ממה שצפו יוצריו הוא בדיוק מסוג המערכת שמעלה שאלות לגבי שחרור אחראי. החברה מדגישה כי עקביות ההדרכה וההפצה שלה שופרה לרמה גבוהה של דיוק מספרי, וכי חלק ניכר מהקושי בקנה מידה עבר מהמודל עצמו לעיצוב של סביבות משימות מציאותיות וניתנות לאימות.

התמונה התחרותית ברורה. GLM-5.3 מצמצם את המרחק לגבול הסגור במשימות קידוד ומשימות סוכניות תוך שהוא תובע את ההובלה המוחלטת על רף אחד מרכזי של גילוי פגיעות. הוא עושה זאת כמודל בעל משקל פתוח - כלומר, לאחר שחרורו, המשקולות יהיו זמינות בחופשיות לכל אחד להוריד, ללמוד ולהתבסס עליהם. האם הפתיחות הזו מאיצה את ההתקדמות או מעוררת חששות ביטחוניים חדשים הוא ויכוח ש-GLM-5.3 כמעט מובטח שיתחיל להתעורר מחדש.

הישאר לפני AI

לגרסה העדכנית ביותר של דגמי AI, קרבות בנצ'מרק וניתוחי תעשייה, סימני AI Buzz Wire.

קרא עוד חדשות AI →