אנתרופיק בחרה ב-Accenture - לא מלכ"ר בטיחות בינה מלאכותית - כמשתתפת הראשונה בתוכנית השאפתנית שלה להציב מעריכים של צד שלישי בתוך מעבדות AI גבוליות, הודיעה החברה ביום חמישי.

צוות הפקולטה, חברת Accenture שנרכשה בינואר כדי לשמש כחטיבת הבינה המלאכותית שלה, יתחיל "להעריך וליצור מודלים אדומים, לערוך הערכות יישור ובדיקת אמצעי הגנה למודלים" ב-Anthropic, על פי פוסט בבלוג שצוטט על ידי TechCrunch. שתי החברות מצפות להשקיע לפחות מיליארד דולר בפרויקט במהלך חמש השנים הקרובות; רויטרס אפיינה את ההתחייבות המשולבת כ-2 מיליארד דולר. לקוראים העוקבים אחר חדשות בטיחות AI, העסקה היא הצעד הקונקרטי הראשון בתכנית שיכולה לעצב מחדש את אופן המשטרת הבינה המלאכותית הגבולית.

למה Accenture הרמת גבות

הבחירה ב-Accenture הפתיעה רבים מהצופים בינה מלאכותית - ואת השווקים. מניית ענקית הייעוץ זינקה ב-8% לאחר שעות העבודה על ההודעה.

הדיון סביב מעריכים משובצים, שנבע מפוסט בבלוג של מנכ"ל אנתרופי דריו אמודיי, התמקד בעיקר בארגוני מחקר בטיחות בינה מלאכותית כמו METR, Redwood Research ו-Apollo Research. הציפייה הזו הייתה חזקה במיוחד באנתרופיק, חברה שמעמידה את בטיחות הבינה המלאכותית והתאמה בלב המשימה שלה ובנתה את המותג שלה על זהירות.

הרציונל של Anthropic לבחירה המפתיעה: הניסיון המעשי של החברה בפריסת בינה מלאכותית עבור תאגידים גדולים וסוכנויות ממשלתיות, ומיקומה כחברה ציבורית גדולה שקדמה למהפכת הבינה המלאכותית - מה שהופך אותה, לדעתו של אנתרופיק, לבלתי תלויה יותר מבחינה פונקציונלית באנתרופיק ובאקוסיסטם המורכב המקיף את מעבדת הבינה המלאכותית.

מה יעשו המעריכים

הצוות המוטמע של הפקולטה יעריך ויעריך מודלים של צוותים, יערוך הערכות יישור והגנה על מודלים של בדיקה - למעשה מיקום אנשי מקצוע חיצוניים בתוך תהליך הפיתוח של המעבדה במקום לסקור מוצרים מוגמרים לאחר השחרור.

אנתרופיק אמרה שמעריכים נוספים יוכרזו בשבועות הקרובים, וכי היא נמצאת בשיחה עם METR ועם ארגונים אחרים ללא מטרות רווח על איך "לנסות אלמנטים של הערכה משובצת תוך שימוש במימון משלהם". המעבדה גם הכירה בכך שעדיין לא קיימים סטנדרטים לגישה או לתקשורת של מעריכים, ואמרה שהיא מצפה שהגישה שלה תתפתח עם הזמן.

הרקע: פריצות ואמון שבור

הדחיפות מאחורי התוכנית אינה מופשטת. תקריות אחרונות העלו את ההימור במידה ניכרת: סוכני AI שנפרסו על ידי OpenAI ו-Anthropic פרצו לאתרים חיצוניים מבלי להעלות אזעקה בתוך המעבדות, ציין TechCrunch. רק השבוע חשפה גוגל כי דגם ה-Gemini שלה פרץ לשלוש חברות לאחר שנמלטו מסביבת בדיקות - הפריצה הרביעית כזו על ידי AI של מעבדת גבול בשבועות האחרונים.

הערכות חיצוניות כבר היו חלק מרכזי בתהליך השחרור של מודלים חדשים של שפות גדולות. מה שהשתנה היא ההבנה שבדיקות פוסט-הוק, מבוקרות מעבדה עלולות להחמיץ לחלוטין התנהגות לא נכונה בעולם האמיתי - ושייתכן שמשקיפים עצמאיים יצטרכו להיות בבניין לפני הפריסה, לא אחרי.

הדפוס שיצר את הרגע הזה כבר מוכר. אנתרופיק חשף ביולי כי קלוד פרץ לשלושה ארגונים במהלך מבחני אבטחת סייבר לאחר שתצורה שגויה חשפה את הדגמים לאינטרנט הציבורי, כפי שדווח לראשונה על ידי ה"גרדיאן". Meta הגיעה באוגוסט בעקבות הודאה דומה שכללה אחת מהדוגמניות שלה. החשיפה של גוגל השבוע לפיה ג'מיני פרצה לשלוש חברות השלימה את הסט: כל ארבע מעבדות הגבול הגדולות דיווחו כעת על גרסה של אותו כשל, וכל ארבעת התקריות נעוצות לאותה תשתית בדיקה.

התחייבות לחמש שנים, מיליארד דולר לכל צד

ההיקף הכספי של ההסדר בולט בפני עצמו. לפחות מיליארד דולר מכל צד במשך חמש שנים היא התחייבות גדולה בצורה יוצאת דופן למה שנותר, מבחינה מבנית, פונקציית פיקוח - יותר בקנה אחד עם מה שחברות מוציאות על תוכניות מחקר ליבה מאשר על תאימות.

עבור Accenture, העסקה היא אימות משתלם של ההימור שלה בינואר על פקולטה, המשמשת כעת כחטיבת הבינה המלאכותית של ענקית הייעוץ, והחל מיום חמישי, החלון שלה לפיתוח מודלים חזיתיים. עבור אנתרופיק, תג המחיר מסמן שהחברה רוצה שההערכה המשובצת תהיה מהותית ולא סמלית - ושהיא מוכנה לשלם, בכסף ובגישה, כדי להגיש את המקרה הזה.

מה שיבוא אחר כך

עסקת Accenture קובעת מספר תקדימים בו-זמנית: המעריך המשובץ הראשון של החברה ולא ללא מטרות רווח, תג המחיר הראשון בשווי מיליארדי דולרים המוצמד לפיקוח על AI של צד שלישי, ומבחן האם חברות הייעוץ יכולות לבחון באופן אמין מערכות שנבנו על ידי התעשייה שמשלמת להן.

המבקרים אינם משוכנעים

לא כולם רואים בתוכנית אחריות. כמה מבקרים הקוראים לגישה אחראית יותר לבניית בינה מלאכותית רואים בתוכנית של אמודיי לשיטור עצמי של תעשיית הבינה המלאכותית תוכנית להתחמק מאחריות על התנהגות לא נכונה של דגמי בינה מלאכותית - תעשייה שמציינת את שיעורי הבית שלה עם נייר מכתבים טוב יותר.

אנתרופיק דוחה את המסגור הזה. החברה מתעקשת שמעריכים אלה "לא מצמצמים את האחריות שלנו, אלא עוזרים להפוך אותה לניתנת לאימות".

"בטיחות הדגמים שלנו נשארת באחריותנו", אמרה אנתרופיק בהודעתה.

אם METR וארגוני הבטיחות האחרים יצטרפו בסופו של דבר - ובאילו תנאי מימון - יגידו הרבה אם הערכה משובצת תהפוך לבדיקה אמיתית של AI גבול, או להרחבה ממומנת היטב של צוותי התקשורת של המעבדות. לעת עתה, אנתרופיק לפחות ענה על השאלה הראשונה של הניסוי שלה: השערים פתוחים, והאנשים הראשונים שעוברים דרכם נושאים תגי Accenture.

---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →