סטארט-אפ חדש של בינה מלאכותית שהוקמה על ידי חוקר לשעבר של OpenAI השיק את מה שהיא מכנה מודל חדש לגמרי - כזה שלא יכול לכתוב לך מאמר, ואומר שזה בדיוק העניין.
TypeSafe AI הודיעה ביום שלישי על שחרורו של "דגם System One" הראשון שלה, בשם Jev, זמין מיד בגישה מוקדמת. החברה נוסדה על ידי דיוגו אלמיידה, שלדבריו המחקר מאחורי ההוראה של ChatGPT צמח מתוך עבודה שהוא תרם לה ב-OpenAI. אחרי שנתיים בהתגנבות, הוא טוען שהקיבעון של התעשייה בצ'אט הסתיר היכן האוטומציה נכשלת בפועל. For more context on this story, see our ongoing artificial intelligence updates.
"דוגמניות היו על אנושיות בצ'אט כבר שנים, אז איפה כל האוטומציה?" כתב אלמיידה בפוסט ההשקה. "זו הייתה שאלת הנהיגה שלי בארבע השנים האחרונות."
מהו בעצם דגם 'System One'
השם שואל מההבחנה של הפסיכולוגיה בין חשיבה מהירה, אינסטינקטיבית לבין חשיבה אטית ומכוונת. במקום שבו מודלים של שפה גדולים יוצרים טקסט אסימון אחר אסימון - גמיש, כללי ונוטה לשטויות בטוחות מדי פעם - ה-Jev של TypeSafe בנוי לעשות משהו צר יותר: לקחת מצב לא מובנה כקלט ולהחזיר החלטות מובנות, עם הסתברויות מכוילות מצורפות.
החברה מתארת את Jev כ"קריאה לפונקציית גבול-מודיעין: מצב לא מובנה, החלטות הסתברותיות מוקלדות החוצה". מכיוון שהפלטים האפשריים מוגדרים מראש והמודל אף פעם לא יוצר מחרוזות בצורה חופשית, TypeSafe טוענת שהוא לא יכול לייצר שגיאות סוג - מאפיין שלדבריה מובטח מבחינה מתמטית ולא סביר סטטיסטית - ואינו יכול להזות באופן שבו מודלים יוצרי טקסט יכולים.
הארכיטקטורה יוצאת מהפרקטיקה המיינסטרימית בשלוש דרכים, על פי פוסט ההשקה: ארכיטקטורת מודל חדשה, דגימה מקבילה שמפיקה את כל התפוקות בשאילתה בודדת ולא ברצף, ושיטת הדרכה שהחברה מכנה Reinforcement Learning for Calibrated Decisions (RLCD), אשר מבצעת אופטימיזציה להסתברויות כנות מבחינה אפיסטמית או פלט כנות מבחינה אנושית.
התביעות: מהר יותר פי 100, חלק מהעלות
המספרים ש- TypeSafe מפרסמת הם אגרסיביים. החברה טוענת ש-Jev מספקת מודיעין הדומה ל-LLMs קיימות במה שהיא מכנה משימות בצורת "System One" - סיווג, ניתוב, ניקוד, מיצוי והחלטות הסתעפות - תוך תגובה של 70 עד 500 אלפיות השנייה, כנגד זמני תגובה מקצה לקצה של 3 עד 329 שניות עבור דגמי חזית. זה מסתדר פי 40 עד פי 200 מהר יותר, אומרת החברה.
התמחור הוא לא שגרתי באופן דומה: 0.042 דולר למיליון אסימוני קלט, עם אסימוני פלט חופשיים, מכיוון שהתפוקות מחושבות במקביל ולא נוצרות אסימון אחר אסימון. החברה הודתה בהודעתה כי היא עדיין לא יכולה להוכיח שהתמחור בר קיימא בקנה מידה.
"תביעות חריגות דורשות ראיות יוצאות דופן", נכתב בפוסט, לפני שהוא מציע אילו ראיות יש לו.
הקבלות - ומה הספקנים אומרים
TypeSafe פרסמה הדגמה זה לצד זה המשווה את Jev ל-GPT-5.6 Terra, שהיא מתארת אותו כדגם הגבול הדומה ביותר במודיעין דומה, ואומרת שהמחלוקת היחידה בריצה המוקלטת הייתה כרוכה בשיחת שיפוט מעורפלת באמת. היא גם הציגה מתודולוגיה חדשה של "הערכת זרימת עבודה" המודדת מודלים מול הקונצנזוס של המודלים החיצוניים הגדולים ביותר - Astra של OpenAI ו-Anthropic's Fable - בתוך גרף מחשוב קבוע, ולטענתה Jev "מחזיקה בגבול פארטו בכמעט 2 סדרי גודל".
יש לציין כי החברה פרסמה פוסט נלווה שכותרתו "antibenchmaxxing" המסביר מדוע היא נמנעת מבנצ'מרקים מסורתיים, בטענה שמודל המיועד להחלטות מובנות בתוך זרימות עבודה של תוכנה מתנגד להשוואה גלובלית משמעותית.
התגובה ב-Hacker News, שם ההשקה גררה מאות נקודות בתוך שעות, נעה בין התרגשות אמיתית לספקנות נוקבת. מספר מגיבים ציינו שהראיות הציבוריות מורכבות בעיקר מסרטוני הדגמה - כולל סרטוני הדגמה המציגים את הדגם המניע לולאת משחק של Doom - במקום הערכות צד שלישי שניתנות לשחזור. אחרים טענו שהגישה מובן בצורה הטובה ביותר כמסווג מהיר במיוחד, באיכות גבולית, שימושי לחלק של עומסי עבודה ולא תחליף ללימודי LLM.
אפילו צופים אוהדים מסגרו את נטל ההוכחה בצורה ברורה. "כן, הם מדברים כספקנים אבל לא מציעים המון ראיות, מלבד כמה סרטונים של הדגמות", כתב אחד המגיבים. "הדגמה חיה תהיה הרבה יותר משכנעת."
למה זה משנה בכל מקרה
המגרש נוחת על נקודת כאב אמיתית. חלק גדול מקריאות LLM לייצור בתוכנה מסחרית אינן מחוללות כלל - הן שיפוט בינארי, הקצאות קטגוריות והחלטות ניתוב עטופים בפרוזה. אם מודל יכול לבצע את השיחות האלה בביטחון מכויל ב-70 אלפיות שניות ולמעשה אפס עלות פלט, הכלכלה של תוכנה המופעלת בינה מלאכותית משתנה במידה ניכרת: ממשקי משתמש בזמן אמת הופכים למעשיים, ושלבי צינור שהיו יקרים מדי לאוטומציה עם LLMs הופכים זולים מספיק כדי לרוץ בכל מקום.
מקרי השימוש המוצעים של TypeSafe כוללים סיווג וניתוב נתונים, אימות ושמירה על פלטי LLM, זיהוי פריצות מאסר וניתוח צמצום מפות על מערכי נתונים גדולים - עומסי עבודה שבהם הקוד שמסביב יכול להגביל את חופש המודל ולתפוס שגיאות.
החברה כנה לגבי השאלות הפתוחות: הבדיקות שפורסמו בוצעו ממחשבים ניידים בחוף המערבי של ארה"ב, וקיימות התמחור לטווח ארוך נותרה בלתי מוכחת. אם טענות המודיעין של Jev שורדות מגע עם בדיקות עצמאיות יקבעו אם "מודלים של System One" יהפכו לקטגוריה או קוריוז.
גישה מוקדמת פתוחה כעת דרך אתר האינטרנט של החברה.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →