مایکروسافت ریسرچ Orchard را منتشر کرده است، یک چارچوب متن باز برای ساخت، آموزش و ارزیابی عوامل هوش مصنوعی مستقل که به گفته این شرکت به مدل های نسبتاً کوچک وزن باز اجازه می دهد تا عملکرد سیستم های مرزی را بیش از ده برابر اندازه خود داشته باشند. این پروژه که در یک پست وبلاگی در 3 آگوست 2026 به تفصیل شرح داده شد، بلندپروازانه ترین پیشنهاد شرکت تا کنون برای ارائه زیرساختی به جامعه تحقیقاتی گسترده تر است که تاکنون عمدتاً در داخل آزمایشگاه های اختصاصی قفل شده است.

این نسخه زمانی منتشر می‌شود که صنعت هوش مصنوعی از پاسخگویی به پرسش‌های ایستا به سمت عواملی می‌رود که می‌توانند در محیط‌های چند مرحله‌ای برنامه‌ریزی، استدلال و عمل کنند. برای اطلاعات بیشتر در مورد چگونگی حرکت این رشته به سمت سیستم‌های مستقل، به [آخرین پوشش صنعت هوش مصنوعی] ما (https://aibuzzwire.news) مراجعه کنید.

باغ در واقع چیست

در مرکز این پروژه Orchard Env قرار دارد، یک سرویس محیطی سبک وزن مبتنی بر Kubernetes که اجزای قابل استفاده مجدد و ایزوله را برای اجرای عوامل در مقیاس فراهم می کند. به گفته مایکروسافت، همین سرویس می تواند از عوامل مهندسی نرم افزار، عوامل مرورگر وب و عوامل دستیار شخصی بدون تغییر پشتیبانی کند. همه چیز از جمع‌آوری داده‌های آموزشی گرفته تا راه‌اندازی‌های یادگیری تقویتی و ارزیابی را مدیریت می‌کند.

تصمیم کلیدی معماری این است که محیط زمان اجرا به عنوان یک سرویس مستقل و قابل استفاده مجدد به جای زیرساخت تعبیه شده در یک چارچوب آموزشی خاص در نظر گرفته شود. از آنجایی که Orchard Env روی Kubernetes قرار دارد، می تواند هزاران کانتینر مجزا را به صورت موازی ایجاد، مدیریت و حذف کند. تیم‌ها می‌توانند معیارها، سیستم‌های عامل یا الگوریتم‌های آموزشی جدیدی را بدون بازسازی زیرساخت‌های اساسی از ابتدا معرفی کنند.

آموزش داخل مهارهای واقعی

یکی از ویژگی‌های متمایز Orchard توانایی آن در آموزش عوامل مستقیماً در داخل مهارهای استقرار است که آنها واقعاً در تولید استفاده خواهند کرد. تواناترین ماموران امروزی به ندرت به عنوان یک مدل ساده عمل می کنند. آنها از طریق مهارهای پیچیده ای مانند Codex، OpenClaw و ZeroClaw عمل می کنند که استدلال چند چرخشی، استفاده از ابزار و اتصالات به سیستم های خارجی را مدیریت می کنند.

ابزارهای آموزشی باز معمولاً نمی توانند این مهارهای چند فرآیندی را مدیریت کنند، و محققان را وادار می کند تا روی یک پایه ساده آموزش ببینند و سپس در محیط واقعی مستقر شوند، که باعث ایجاد عدم تطابق بین آموزش و استقرار می شود. Orchard این شکاف را برطرف می‌کند: یک پراکسی سبک، فراخوانی‌های مدل خود مهار را به‌عنوان داده‌های آموزشی ضبط می‌کند، در حالی که هر رول اوت در ظرف خودش اجرا می‌شود، و به یک عامل اجازه می‌دهد مستقیماً در مهاری که در تولید استفاده می‌کند آموزش ببیند.

سه دستور العمل مخصوص دامنه

برای نشان دادن این رویکرد، مایکروسافت سه گردش کار آموزشی را منتشر کرد.

Orchard-SWE: مهندسی نرم افزار

Orchard-SWE یکی از سخت‌ترین تنظیمات را برای عوامل مستقل هدف قرار می‌دهد: استدلال چند مرحله‌ای بر روی پایگاه‌های کد واقعی. این با استفاده از چارچوب Mini-SWE-Agent ساخته شد و بر روی SWE-bench Verified ارزیابی شد، معیاری که توانایی یک مدل را برای پیمایش، تشخیص و تعمیر پایگاه‌های کد دنیای واقعی آزمایش می‌کند.

برای آموزش این سیستم، مایکروسافت 107000 تعامل عامل را از دو مدل پیشرفته وزن باز MiniMax-M2.5 و Qwen3.5-397B تقطیر کرد که طیف گسترده ای از مشکلات GitHub را پوشش می دهد. سیستم با استفاده از تکنیکی به نام تنظیم دقیق نظارت شده با تخصیص اعتبار، از بخش‌های سازنده تلاش‌های جزئی به جای دور انداختن کامل آن‌ها یاد می‌گیرد.

نتایج مدل را از یک خط پایه 61.4٪ در SWE-bench Verified به 69.1٪ با یادگیری تقویتی، و 69.7٪ با تکنیک های پاداش متراکم منتقل می کند. با رتبه بندی مجدد مدل ارزش، این رقم به 73.0٪ می رسد - یک وضعیت جدید در بین مدل های منبع باز با اندازه قابل مقایسه، که تنها از حدود 3 میلیارد پارامتر فعال استفاده می کند.

Orchard-GUI: ناوبری وب

Orchard-GUI یک مدل زبان بینایی با 4 میلیارد پارامتر را به عنوان عامل مرورگر آموزش می دهد. علیرغم استفاده از مقدار نسبتاً کمی نظارت - 400 نمایش مقطر همراه با 2200 کار آموزشی پایان باز - این مدل به 74.1٪ در WebVoyager، 67.0٪ در Online-Mind2Web و 64.0٪ در DeepShop، به طور متوسط ​​68.4٪ دست یافت. مایکروسافت می گوید این نتایج آن را در میان قوی ترین عوامل وب منبع باز تا به امروز قرار می دهد.

Orchard-Claw: وظایف دستیار شخصی

Orchard-Claw روی کارهای بهره وری روزمره مانند خواندن و تهیه پیش نویس ایمیل ها، مدیریت تقویم ها و جستجوی اطلاعات تمرکز دارد. تنها روی 200 کار مصنوعی آموزش دیده و بر اساس معیار Claw-Eval ارزیابی شده است، 59.6% از کارهای انجام شده را تا سه بار انجام داده است، که در صورت جفت شدن با سیستم عامل قوی تر ZeroClaw به 73.9% افزایش می یابد.

چرا نتایج مدل کوچک مهم است

اعداد معیار قابل توجه هستند زیرا از مدل‌هایی با تقریباً 3 تا 4 میلیارد پارامتر فعال می‌آیند - بسیار کوچک‌تر از سیستم‌های مرزی OpenAI، Anthropic و Google که بر تابلوهای امتیازات غالب هستند. استدلال مایکروسافت این است که زیرساخت و محیط آموزشی مناسب می‌تواند بسیاری از شکاف‌ها را بپوشاند و سیستم‌های عاملی توانمند را برای محققان و سازمان‌هایی که توانایی پرداخت هزینه آموزش یا اجرای بزرگترین مدل‌های اختصاصی را ندارند، در دسترس قرار دهد.

در کنار مدل‌ها و گردش‌های کاری، مایکروسافت داده‌های آموزشی و روش‌های ارزیابی مورد استفاده برای ساخت آنها را با هدف کمک به جامعه تحقیقاتی گسترده‌تر در ساخت و مطالعه سیستم‌های عامل باز منتشر کرد. این کار توسط Baolin Peng، Wenlin Yao، Qianhui Wu، Hao Cheng و Jianfeng Gao از تحقیقات مایکروسافت هدایت شد.

از هوش مصنوعی جلوتر بمانید

انتشار Orchard مایکروسافت نشان می دهد که زیرساخت پشت هوش مصنوعی عامل مرزی شروع به دموکراتیک شدن کرده است. بیشتر بخوانید [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) و [اطلاعات بیشتر اخبار هوش مصنوعی →] (https://aibuzzwire.news)

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →