Microsoft Research פרסמה את Orchard, מסגרת קוד פתוח לבנייה, הדרכה והערכת סוכני AI אוטונומיים שלדבריה מאפשרת למודלים קטנים יחסית במשקל פתוח לגשת לביצועים של מערכות חזיתיות יותר מפי עשרה מגודלן. הפרויקט, המפורט בפוסט בבלוג ב-3 באוגוסט 2026, הוא ההצעה השאפתנית ביותר של החברה עד כה לתת לקהילת המחקר הרחבה יותר את סוג התשתית שנשארה, עד כה, ברובה נעולה בתוך מעבדות קנייניות.
המהדורה מגיעה כאשר תעשיית הבינה המלאכותית עוברת מתשובות סטטיות לשאלות לסוכנים שיכולים לתכנן, לנמק ולפעול בסביבות מרובות שלבים. למידע נוסף על איך התחום מתקדם לעבר מערכות אוטונומיות, עיין ב[הסיקור האחרון של תעשיית הבינה המלאכותית] (https://aibuzzwire.news).
מהו פרדס בעצם
במרכז הפרויקט נמצא Orchard Env, שירות סביבה קל משקל מבוסס Kubernetes המספק רכיבים ניתנים לשימוש חוזר ומבודדים להפעלת סוכנים בקנה מידה. לפי מיקרוסופט, אותו שירות יכול לתמוך בסוכני הנדסת תוכנה, סוכני גלישה באינטרנט וסוכנים עוזרים אישיים ללא שינוי. הוא מטפל בכל דבר, החל מאיסוף נתוני הכשרה ועד השקות והערכה של חיזוקים.
ההחלטה הארכיטקטונית המרכזית היא שסביבת זמן הריצה מטופלת כשירות עצמאי שניתן לשימוש חוזר במקום תשתית המוטמעת במסגרת הדרכה ספציפית. מכיוון ש-Orchard Env יושב על Kubernetes, הוא יכול ליצור, לנהל ולהסיר אלפי מכולות מבודדות במקביל. צוותים יכולים להציג מדדים חדשים, מערכות סוכנים או אלגוריתמי אימון מבלי לבנות מחדש את התשתית הבסיסית מאפס.
אימון בתוך רתמות אמיתיות
אחד המאפיינים הבולטים של Orchard הוא היכולת שלו להכשיר סוכנים ישירות בתוך רתמות הפריסה שבהן ישתמשו בפועל בייצור. הסוכנים המוכשרים ביותר של היום מרצים רק לעתים רחוקות כדוגמנית חשופה. הם פועלים באמצעות רתמות מתוחכמות כגון Codex, OpenClaw ו-ZeroClaw המנהלות חשיבה מרובה פניות, שימוש בכלים וחיבורים למערכות חיצוניות.
כלי הדרכה פתוחים בדרך כלל אינם יכולים להתמודד עם הרתמות הממלכתיות ומרובי התהליכים הללו, מה שמאלץ את החוקרים להתאמן על סטנד-אין פשוט ולאחר מכן לפרוס בסביבה האמיתית, מה שיוצר חוסר התאמה בין אימון לפריסה. Orchard סוגר את הפער הזה: פרוקסי קל משקל מתעד את קריאות הדגם של הרתמה עצמה כנתוני אימון בזמן שכל השקה פועלת במיכל משלה, מה שמאפשר לסוכן לעבור הכשרה מקצה לקצה ישירות ברתמה שבה הוא ישתמש בייצור.
שלושה מתכונים ספציפיים לתחום
כדי להדגים את הגישה, מיקרוסופט פרסמה שלושה תהליכי עבודה להדרכה.
Orchard-SWE: הנדסת תוכנה
Orchard-SWE מכוון לאחת ההגדרות התובעניות ביותר עבור סוכנים אוטונומיים: חשיבה מרובת שלבים על פני בסיסי קוד אמיתיים. הוא נבנה באמצעות מסגרת ה-Mini-SWE-Agent והוערך ב-SWE-bench Verified, אמת מידה שבודקת את יכולתו של מודל לנווט, לאבחן ולתקן בסיסי קוד בעולם האמיתי.
כדי להכשיר את המערכת, מיקרוסופט זקקה 107,000 אינטראקציות עם סוכנים משני דגמים מתקדמים במשקל פתוח, MiniMax-M2.5 ו-Qwen3.5-397B, המכסים מגוון רחב של בעיות GitHub. באמצעות טכניקה הנקראת כוונון עדין בפיקוח הקצאת אשראי, המערכת לומדת מהחלקים היצרניים של ניסיונות חלקיים במקום להשליך אותם לחלוטין.
התוצאות מעבירות את המודל מקו הבסיס של 61.4% ב-SWE-bench Verified ל-69.1% עם למידת חיזוק, ו-69.7% עם טכניקות תגמול צפופות. עם דירוג מחדש של מודל הערך, הנתון מגיע ל-73.0% - מצב חדש של מודלים של קוד פתוח בגודל דומה, תוך שימוש בכ-3 מיליארד פרמטרים פעילים בלבד.
Orchard-GUI: ניווט באינטרנט
Orchard-GUI מכשיר מודל שפת ראייה של 4 מיליארד פרמטרים כסוכן דפדפן. למרות השימוש בכמות קטנה יחסית של פיקוח - 400 הדגמות מזוקקות בשילוב עם 2,200 משימות הדרכה פתוחות - המודל השיג 74.1% ב-WebVoyager, 67.0% ב-Online-Mind2Web ו-64.0% ב-DeepShop, בממוצע של 68.4%. מיקרוסופט אומרת שהתוצאות הללו מציבות אותה בין סוכני האינטרנט החזקים ביותר בקוד פתוח עד כה.
פרדס-טופר: משימות עוזר אישי
Orchard-Claw מתמקדת במשימות פרודוקטיביות יומיומיות כמו קריאה וניסוח מיילים, ניהול לוחות שנה וחיפוש מידע. אומן על 200 משימות סינתטיות בלבד והוערך על פי מדד Claw-Eval, הוא השלים 59.6% מהמשימות שניתנו עד שלושה ניסיונות, ועלה ל-73.9% בשילוב עם מערכת סוכני ZeroClaw החזקה יותר.
מדוע חשובות התוצאות של מודל קטן
המספרים בנצ'מארק בולטים מכיוון שהם מגיעים מדגמים עם בערך 3 עד 4 מיליארד פרמטרים פעילים - קטנים בהרבה ממערכות הגבולות של OpenAI, Anthropic וגוגל השולטות בטבלאות המובילות. הטענה של מיקרוסופט היא שתשתית ההדרכה והסביבה הנכונות יכולות לסגור חלק גדול מהפער, ולהפוך מערכות אגנטיות מסוגלות לנגישות לחוקרים ולארגונים שאינם יכולים להרשות לעצמם להכשיר או להפעיל את המודלים הקנייניים הגדולים ביותר.
לצד המודלים וזרימות העבודה, מיקרוסופט פרסמה את נתוני ההדרכה ושיטות ההערכה ששימשו לבנייתם, במטרה מוצהרת לעזור לקהילת המחקר הרחבה יותר לבנות וללמוד מערכות אגנטיות פתוחות. את העבודה הובילו Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng ו-Jianfeng Gao מ-Microsoft Research.
הישאר לפני AI
מהדורת Orchard של מיקרוסופט מאותתת שהתשתית שמאחורי הבינה המלאכותית הסוכנת הגבולית מתחילה להפוך לדמוקרטית. קרא עוד חדשות בינה מלאכותית וקרא עוד חדשות בינה מלאכותית →
