אנתרופיק פרסמה השבוע מבט ראשון מסוגו בתוך צינור הפיתוח שלה, וחשפה כי מודל קלוד שלה "מוביל" כעת 26% מעבודות המחקר והפיתוח בינה מלאכותית בחברה - עלייה של פחות מ-1% בפברואר 2026. הנתונים הופיעו בפוסט בבלוג של החברה שכותרתו "מדידות להבנת קצב הפיתוח של בינה מלאכותית ב-AI", שדווחו על ידי 17 מעבדות בינה מלאכותית בספטמבר. רויטרס, הוושינגטון פוסט, ושקעים אחרים.

הפוסט הוא בחלקו תרגיל שקיפות ובחלקו טיעון: אנתרופיק רוצה שמעבדות גבול אחרות יפרסמו את אותם סוגי מספרים, כדי שהציבור והממשלות יוכלו לעקוב אחרי כמה מהר AI מקבל את המפתחות לבניית בינה מלאכותית. For more context on this story, see our ongoing more AI stories.

שלושה מספרים למעקב אחר פיתוח בינה מלאכותית

החברה הציעה שלוש מדידות שלדבריה מאירות את קצב הפיתוח בתוך מעבדות גבול: כמה ממחקר ופיתוח בינה מלאכותית מבוצעת על ידי בינה מלאכותית עצמה, כמה טוב מפקחים על הפעולות של סוכני בינה מלאכותית, וכיצד מוקצה המחשוב בין עבודת יכולת ועבודת בטיחות.

מספר הכותרת מגיע ממה שאנתרופיק מכנה אינדקס האוטומציה של המו"פ שלה. החברה קיטלגה כל סוג של עבודת מחקר ופיתוח בינה מלאכותית שבוצעה בחברה, דירגה עד כמה כל משימה אוטומטית כרגע, ואגרה את התוצאות באמצעות סולם שפותח על ידי קבוצת המחקר Epoch AI. קנה המידה עובר מ-AL0 (ללא מעורבות בינה מלאכותית) ל-AL5 (AI פועל באופן אוטונומי לחלוטין, ללא אדם בלולאה), כאשר AL3 פירושו AI "משתף פעולה" בנתחים גדולים של עבודה תחת כיוון אנושי צמוד ו-AL4 אומר AI "מוביל", שמשלים את רוב המשימה מקצה לקצה מהנחיה ברמה גבוהה בזמן שאדם מפקח.

נכון לאוגוסט 2026, דיווחה אנתרופיק, קלוד מוביל 26% מעבודות המחקר והפיתוח בבינה מלאכותית של החברה. שיעור העבודה ברמת "AI משתף פעולה" או מעל 90%. קלוד אינו פועל באופן אוטונומי לחלוטין עבור כל תת-קבוצה נמדדת של עבודת מחקר ופיתוח בינה מלאכותית.

30,000 סוכנים, מוניטור אחד

המדידה השנייה נוגעת לפיקוח. אנתרופיק חשפה כי נכון לאוגוסט 2026 היו כ-30,000 סוכנים שעושים עבודת מחקר והנדסה בחברה בכל עת בפלטפורמה הפנימית הנפוצה ביותר שלה.

כל פעולה שסוכנים אלה נוקטים עוברת דרך מוניטור מקוון לפני שהיא מבוצעת, בדרך כלל תוך שניות, לפי הפוסט. אנתרופיק אומרת שהיא ניתחה יותר ממיליארד החלטות מסוכני המחקר וההנדסה שלה במהלך חודש אוגוסט ומצאה שחלק הפעילויות שנחסמו או הסלימו על ידי המוניטור היה 0.002%.

על הקצאת מחשוב, המדידה השלישית, החברה אמרה שבמהלך השבוע הנבדק, כ-6% מהחישובים שהועברו למחקר ופיתוח בינה מלאכותית הוקצו לבטיחות.

בניית יורש משלו - עם בני אדם בפיקוח

המסגור חשוב לא פחות מהדמויות. המודלים של אנתרופיק משתתפים יותר ויותר בבניית הדור הבא של אותם מודלים - מה שהחוקרים מכנים שיפור עצמי רקורסיבי, ומה שהכותרת של הוושינגטון פוסט תיארה בצורה בוטה יותר כצ'טבוט "המשתלט על עבודת בניית היורש שלו".

אנתרופיק מקפידה למתוח קו בין "מוביל AI" ל"AI מחליף". ב-AL4, אדם עדיין מפקח ויכול להתערב; החברה דיווחה במפורש שאף תת-קבוצה מדודה של עבודת המו"פ שלה לא פועלת ב-AL5. אבל המסלול תלול: מעבר מפחות מ-1% ל-26% בתוך כשבעה חודשים מצביע על כך שהנתח של עבודה בהובלת בינה מלאכותית עשוי לעבור חצי הרבה לפני סוף העשור אם המגמות הנוכחיות יימשכו.

למתודולוגיה יש גבולות אמיתיים, ואנתרופיק אומר זאת. דירוגי האוטומציה שלה הופקו על ידי דגימה של רישומי העבודה של החברה עצמה - כולל הודעות Slack ותיעוד פנימי - ושגם בני אדם וגם מודל שופט ידרגו את האוטומטיות של כל משימה. במבחן עיוור, הצוות דירג משימות מבלי לדעת אילו ראיות אספו הדוגמניות. החברה דיווחה כי שופט הדוגמניות שלה הסכים עם בני אדם בערך באותה תדירות שבני אדם הסכימו זה עם זה: ההסכמה המדויקת בין מודל לאדם הייתה 59%, בעוד שהסכמה בין אדם לאדם הייתה רק 35%, ודירוג הדוגמניות והאדם נחתו בטווח של רמה אחת זה מזה 97% מהזמן.

החברה גם הכירה בסיכון ההתייחסות העצמית במתודולוגיה שלה: אנתרופיק השתמשה במודלים משלה כדי לעזור להעריך את המערכות שלה, מה שעשוי לומר שמודל השופט עושה את אותם סוגי שגיאות כמו המודל שהיא בודקת. אימות צד שלישי, הוא טוען, הוא התשובה האמיתית.

עיניים מבחוץ מגיעות

לשם כך, אנתרופיק אומרת שהיא מתכננת להטמיע מעריכים עצמאיים של צד שלישי ממספר ארגונים בתוך החברה, לתת להם גישה לתהליכים פנימיים, מערכות ונתונים הדומים לאלו שיש לצוותי הערכת סיכונים פנימיים. העמותה החיצונית למחקר בינה מלאכותית METR חיברה בעבר את פלטפורמת הניטור הלא מקוונת של Anthropic.

החשיפה מגיעה על רקע ויכוח הולך וגובר על הקצב. מנכ"ל אנתרופי דריו אמודי קרא לתאם על האטת הגבול, והחברה מציינת כי המספרים שלה היו צפויים להשתנות אם תיאום כזה קיים. השבוע, Anthropic ו-OpenAI היו גם נושא למכתב פומבי של מומחי בטיחות שטענו כי המעבדות זקוקות למעריכי בטיחות בלתי תלויים באמת.

השאלה אם היריבות עוקבות אחר ההובלה של אנתרופיק היא השאלה הפתוחה. החברה טוענת שכל מפתח חזית יכול לפרסם את הצעדים הללו באופן קבוע תוך שימוש במתודולוגיה ציבורית. עד שהם עושים זאת, המספרים הציבוריים היחידים על כמה מהר בינה מלאכותית בונה בינה מלאכותית מגיעים מהמעבדות עצמן.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →