مایکروسافت ریسرچ Orchard را منتشر کرده است، یک چارچوب متن باز برای ساخت، آموزش و ارزیابی عوامل هوش مصنوعی مستقل که به گفته این شرکت به مدل های نسبتاً کوچک وزن باز اجازه می دهد تا عملکرد سیستم های مرزی را بیش از ده برابر اندازه خود داشته باشند. این پروژه که در یک پست وبلاگی در 3 آگوست 2026 به تفصیل شرح داده شد، بلندپروازانه ترین پیشنهاد شرکت تا کنون برای ارائه زیرساختی به جامعه تحقیقاتی گسترده تر است که تاکنون عمدتاً در داخل آزمایشگاه های اختصاصی قفل شده است.
این نسخه زمانی منتشر میشود که صنعت هوش مصنوعی از پاسخگویی به پرسشهای ایستا به سمت عواملی میرود که میتوانند در محیطهای چند مرحلهای برنامهریزی، استدلال و عمل کنند. برای اطلاعات بیشتر در مورد چگونگی حرکت این رشته به سمت سیستمهای مستقل، به [آخرین پوشش صنعت هوش مصنوعی] ما (https://aibuzzwire.news) مراجعه کنید.
باغ در واقع چیست
در مرکز این پروژه Orchard Env قرار دارد، یک سرویس محیطی سبک وزن مبتنی بر Kubernetes که اجزای قابل استفاده مجدد و ایزوله را برای اجرای عوامل در مقیاس فراهم می کند. به گفته مایکروسافت، همین سرویس می تواند از عوامل مهندسی نرم افزار، عوامل مرورگر وب و عوامل دستیار شخصی بدون تغییر پشتیبانی کند. همه چیز از جمعآوری دادههای آموزشی گرفته تا راهاندازیهای یادگیری تقویتی و ارزیابی را مدیریت میکند.
تصمیم کلیدی معماری این است که محیط زمان اجرا به عنوان یک سرویس مستقل و قابل استفاده مجدد به جای زیرساخت تعبیه شده در یک چارچوب آموزشی خاص در نظر گرفته شود. از آنجایی که Orchard Env روی Kubernetes قرار دارد، می تواند هزاران کانتینر مجزا را به صورت موازی ایجاد، مدیریت و حذف کند. تیمها میتوانند معیارها، سیستمهای عامل یا الگوریتمهای آموزشی جدیدی را بدون بازسازی زیرساختهای اساسی از ابتدا معرفی کنند.
آموزش داخل مهارهای واقعی
یکی از ویژگیهای متمایز Orchard توانایی آن در آموزش عوامل مستقیماً در داخل مهارهای استقرار است که آنها واقعاً در تولید استفاده خواهند کرد. تواناترین ماموران امروزی به ندرت به عنوان یک مدل ساده عمل می کنند. آنها از طریق مهارهای پیچیده ای مانند Codex، OpenClaw و ZeroClaw عمل می کنند که استدلال چند چرخشی، استفاده از ابزار و اتصالات به سیستم های خارجی را مدیریت می کنند.
ابزارهای آموزشی باز معمولاً نمی توانند این مهارهای چند فرآیندی را مدیریت کنند، و محققان را وادار می کند تا روی یک پایه ساده آموزش ببینند و سپس در محیط واقعی مستقر شوند، که باعث ایجاد عدم تطابق بین آموزش و استقرار می شود. Orchard این شکاف را برطرف میکند: یک پراکسی سبک، فراخوانیهای مدل خود مهار را بهعنوان دادههای آموزشی ضبط میکند، در حالی که هر رول اوت در ظرف خودش اجرا میشود، و به یک عامل اجازه میدهد مستقیماً در مهاری که در تولید استفاده میکند آموزش ببیند.
سه دستور العمل مخصوص دامنه
برای نشان دادن این رویکرد، مایکروسافت سه گردش کار آموزشی را منتشر کرد.
Orchard-SWE: مهندسی نرم افزار
Orchard-SWE یکی از سختترین تنظیمات را برای عوامل مستقل هدف قرار میدهد: استدلال چند مرحلهای بر روی پایگاههای کد واقعی. این با استفاده از چارچوب Mini-SWE-Agent ساخته شد و بر روی SWE-bench Verified ارزیابی شد، معیاری که توانایی یک مدل را برای پیمایش، تشخیص و تعمیر پایگاههای کد دنیای واقعی آزمایش میکند.
برای آموزش این سیستم، مایکروسافت 107000 تعامل عامل را از دو مدل پیشرفته وزن باز MiniMax-M2.5 و Qwen3.5-397B تقطیر کرد که طیف گسترده ای از مشکلات GitHub را پوشش می دهد. سیستم با استفاده از تکنیکی به نام تنظیم دقیق نظارت شده با تخصیص اعتبار، از بخشهای سازنده تلاشهای جزئی به جای دور انداختن کامل آنها یاد میگیرد.
نتایج مدل را از یک خط پایه 61.4٪ در SWE-bench Verified به 69.1٪ با یادگیری تقویتی، و 69.7٪ با تکنیک های پاداش متراکم منتقل می کند. با رتبه بندی مجدد مدل ارزش، این رقم به 73.0٪ می رسد - یک وضعیت جدید در بین مدل های منبع باز با اندازه قابل مقایسه، که تنها از حدود 3 میلیارد پارامتر فعال استفاده می کند.
Orchard-GUI: ناوبری وب
Orchard-GUI یک مدل زبان بینایی با 4 میلیارد پارامتر را به عنوان عامل مرورگر آموزش می دهد. علیرغم استفاده از مقدار نسبتاً کمی نظارت - 400 نمایش مقطر همراه با 2200 کار آموزشی پایان باز - این مدل به 74.1٪ در WebVoyager، 67.0٪ در Online-Mind2Web و 64.0٪ در DeepShop، به طور متوسط 68.4٪ دست یافت. مایکروسافت می گوید این نتایج آن را در میان قوی ترین عوامل وب منبع باز تا به امروز قرار می دهد.
Orchard-Claw: وظایف دستیار شخصی
Orchard-Claw روی کارهای بهره وری روزمره مانند خواندن و تهیه پیش نویس ایمیل ها، مدیریت تقویم ها و جستجوی اطلاعات تمرکز دارد. تنها روی 200 کار مصنوعی آموزش دیده و بر اساس معیار Claw-Eval ارزیابی شده است، 59.6% از کارهای انجام شده را تا سه بار انجام داده است، که در صورت جفت شدن با سیستم عامل قوی تر ZeroClaw به 73.9% افزایش می یابد.
چرا نتایج مدل کوچک مهم است
اعداد معیار قابل توجه هستند زیرا از مدلهایی با تقریباً 3 تا 4 میلیارد پارامتر فعال میآیند - بسیار کوچکتر از سیستمهای مرزی OpenAI، Anthropic و Google که بر تابلوهای امتیازات غالب هستند. استدلال مایکروسافت این است که زیرساخت و محیط آموزشی مناسب میتواند بسیاری از شکافها را بپوشاند و سیستمهای عاملی توانمند را برای محققان و سازمانهایی که توانایی پرداخت هزینه آموزش یا اجرای بزرگترین مدلهای اختصاصی را ندارند، در دسترس قرار دهد.
در کنار مدلها و گردشهای کاری، مایکروسافت دادههای آموزشی و روشهای ارزیابی مورد استفاده برای ساخت آنها را با هدف کمک به جامعه تحقیقاتی گستردهتر در ساخت و مطالعه سیستمهای عامل باز منتشر کرد. این کار توسط Baolin Peng، Wenlin Yao، Qianhui Wu، Hao Cheng و Jianfeng Gao از تحقیقات مایکروسافت هدایت شد.
از هوش مصنوعی جلوتر بمانید
انتشار Orchard مایکروسافت نشان می دهد که زیرساخت پشت هوش مصنوعی عامل مرزی شروع به دموکراتیک شدن کرده است. بیشتر بخوانید [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) و [اطلاعات بیشتر اخبار هوش مصنوعی →] (https://aibuzzwire.news)
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →