סוכני בינה מלאכותית יכולים כעת להשלים 16 אחוז ממשרות פרילנסר אמיתיות ברמת איכות שלקוחות משלמים יקבלו, על פי התוצאות האחרונות ממדד העבודה מרחוק - יותר מפי ארבעה מהשיעור שנרשם רק לפני שמונה חודשים. הממצא מספק את אחד המדדים הקונקרטיים ביותר עד כה לגבי המהירות שבה מערכות בינה מלאכותית אוטונומיות פולשות לעבודה יצירתית וטכנית מקצועית.

אינדקס העבודה מרחוק (RLI), שפותח על ידי המרכז לבטיחות בינה מלאכותית בשיתוף עם Scale Labs, עוקב אחר התדירות שבה סוכני בינה מלאכותית יכולים לסיים פרויקטים עצמאיים בעלי ערך מסחרי באיכות מקצועית. המדד מכסה תחומים הכוללים עיצוב תלת מימד ו-CAD, ארכיטקטורה, עיצוב גרפי, וידאו ואנימציה, הפקת אודיו, ניתוח נתונים ופיתוח אפליקציות אינטרנט. הוא מעריך 240 פרויקטים בשווי כולל של $144,000, שמקורם ב-358 פרילנסרים מאומתים. מעריכים אנושיים מציינים כל תוצאה מול תקן זהב שנוצר על ידי איש מקצוע בתשלום, ומציע תמונת מצב אמפירית של היכולות הגדלות של תעשיית הבינה המלאכותית.

המספרים: גבול שיותר מפי ארבעה

כאשר המדד הושק לראשונה, סוכן הבינה המלאכותית הטוב ביותר ביצע אוטומטית רק 2.5 אחוז מהפרויקטים. לפי התוצאות האחרונות, דגם ה-Fable 5 של אנתרופיק מגיע כעת ל-16.1 אחוזים - הציון הגבוה ביותר שנרשם אי פעם במדד. זה בערך כפול מ-8.3 אחוזים של Opus 4.8 והרבה לפני 6.3 אחוזים של GPT-5.5.

כל שלושת דגמי החזית ניצחו כל מערכת שנבדקה בעבר. המנהיג הקודם, אופוס 4.6 שפועל במסגרת Claude Cowork, עמד על 4.17 אחוזים. גבול יכולת האוטומציה גדל פי ארבעה תוך פחות משמונה חודשים, על פי מחברי המדד.

עם זאת, התוצאות אינן נעות לפי תאריכי השחרור. בטבלת ה-Scale Labs המלאה, ה-Gemini 3 Pro החדש יותר נוחת ליד התחתית ב-1.25 אחוז בלבד, אחרי מערכות ישנות הרבה יותר. זה מצביע על כך שיכולת המודל הגולמי אינה מתורגמת אוטומטית לסוג של שימוש בכלים וכישורי חשיבה הדרושים למשימות מקצועיות מורכבות.

כיצד פועל המדד

כדי לאפשר למודלים להפגין את מלוא יכולתם, הצוות מריץ אותם באותם כלי פיתוח בהם משתמשים המהנדסים ביום יום, כולל קלוד קוד ו- Codex CLI. סביבות אלו הורחבו עם היכולת להפעיל תוכניות גרפיות ישירות.

כל סוכן בינה מלאכותית עובד בתוך מכונת לינוקס וירטואלית עמוסה בלמעלה מ-30 יישומים מקצועיים, כולל בלנדר ליצירת מודלים תלת מימדיים, GIMP לעריכת תמונות ו-Audacity להפקת אודיו. לפרויקטים ניתן זמן חישוב של עד 24 שעות - הרבה יותר מאינטראקציה צ'אטבוט טיפוסית.

ההגדרה משתמשת גם בלולאת ביקורת: סוכן AI שני סוקר את הפלט בצורה קריטית כמו לקוח תובעני, והסוכן הראשון משנה את עבודתו על סמך המשוב הזה. זה משקף את התהליך האיטרטיבי שעוקבים אחריו פרילנסרים אנושיים בעת חידוד התוצרים.

איפה הבינה המלאכותית עדיין נופלת

למרות ההתקדמות המהירה, סוכני AI עדיין לא מצליחים לפגוע באיכות המקצועית ברוב המכריע של הפרויקטים. פוסט הבלוג של ה-benchmark מדגיש דוגמאות ספציפיות שבהן אפילו התפוקה של הדגם העליון לא תעבור כעבודה מוגמרת.

במשימה של עיצוב טבעת, Fable 5 הפיק תוצאה שהייתה בבירור טובה יותר מניסיונות AI קודמים, אך עדיין נראתה לא מקצועית בבדיקה מדוקדקת. בפרויקט ארכיטקטורה, GPT-5.5 זייף רינדור מושך באמצעות מחולל תמונות בעוד שמודל התלת-ממד הבסיסי שלו נותר פגום - קיצור דרך שלקוח משלם יגלה רק על ידי פתיחת קבצי המקור.

אחת המשימות המורכבות יותר ב-benchmark מבקשת מהסוכן ליצור תוכנית קומה במידות גדולות, אפשרויות פריסת רהיטים ועיבודי אמבטיה פוטו-ריאליסטיים מתוך תוכנית קדסטרלית סרוקה, תמונות אתר ומדידות. זרימת עבודה רב-שלבית זו, הדורשת דיוק טכני ושיקול דעת יצירתי, נותרה אתגר משמעותי עבור המערכות הנוכחיות.

שופטי AI מדרגים בנדיבות מדי

צוות המחקר בדק גם האם ניתן להחליף הערכה אנושית יקרה על ידי שופטי AI. התשובה הייתה נחרצת: מעריכים בינה מלאכותית דירגו את הדגמים החדשים בנדיבות רבה מדי. עבור GPT-5.5, הציון של שופט ה-AI היה גבוה מדי כמעט פי שלושה. עבור Opus 4.8, זה היה בערך פי שניים וחצי גבוה מדי.

בעוד שהשופט האוטומטי אכן קיבל את סדר הדירוג הכללי נכון, המספרים בפועל נופחו באופן משמעותי. המרכז לבטיחות בינה מלאכותית הסביר את הנימוק: כדי לשפוט בצורה הוגנת עבודה שנמסרה, על מעריך לפתוח את הקבצים בתוכנה המקצועית הנכונה, להפעיל את התוכנה כראוי ולגבש פסק דין כפי שלקוח משלם היה עושה. סוג זה של שימוש מעשי בתוכנה הוא בדיוק מה שסוכני AI הנוכחיים נאבקים בו.

האירוניה מאלפת: שופט AI נתקל באותן מגבלות כמו עובדי AI שהוא אמור להעריך. העיבוד המזויף של GPT-5.5 הוא דוגמה לכך - לתפוס את ההונאה מצריך פתיחת מודל התלת-ממד ובדיקת הגיאומטריה בפועל, משימה שהשופט בינה מלאכותית לא יכול היה לבצע בצורה מהימנה.

האזהרה: הגבלות ממשלתיות

אזהרה חשובה אחת חלה על הציון המוביל של פייבל 5. ניתן היה להעריך רק 218 מתוך 240 הפרויקטים לפני שממשלת ארצות הברית הגבילה את הגישה למודל. אפילו בתרחיש הגרוע ביותר, שבו Fable 5 נכשל בכל פרויקט שנותר, קצב האוטומציה שלו עדיין יהיה 14.6 אחוז - גבוה מכל דגם אחר שנבדק.

ההגבלות הממשלתיות, הקשורות לדאגות הביטחון הלאומי לגבי המודלים מסוג Mythos, הגבילו את חלון ההערכה אך לא ערערו את הממצא הבסיסי: סוכני בינה מלאכותית מתקרבים במהירות לנקודה שבה הם יכולים להתמודד עם חלק משמעותי מעבודת הפרילנס המקצועית.

עבור פרילנסרים, המגמה מפוכחת אך עדיין לא קטסטרופלית. בינה מלאכותית עדיין נכשלת ב-84 אחוז מהפרויקטים, והדוגמאות של המדד מראות שאפילו תפוקות מוצלחות דורשות לעתים קרובות עדכון מקצועי. אבל עם קצב האוטומציה יותר מפי ארבעה בתוך פחות משנה, המסלול ברור. השאלה היא כבר לא אם סוכני בינה מלאכותית יתחרו על עבודה עצמאית, אלא באיזו מהירות הם יסגרו את הפער הנותר.

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →