تیم Ornith Ornith-1.5 را منتشر کرده است، خانواده‌ای از مدل‌های زبانی با وزن باز که حول یک ایده غیرعادی ساخته شده‌اند: این مدل وظایف آموزشی خود را ایجاد می‌کند، داربست‌های خود را طراحی می‌کند و از تلاش‌های راه‌حل خود در یک حلقه به‌طور مداوم یاد می‌گیرد. طبق ارزیابی‌های خود تیم، پرچم‌دار Ornith-1.5-397B امتیاز 86.1 را در Terminal-Bench 2.1 (Terminus-2) کسب می‌کند که آن را با کلود Opus 4.8 Anthropic در 85.0 برابری می‌کند و از هر مدل منبع باز دیگری با اندازه قابل مقایسه جلوتر است.

این نسخه که این هفته در وبلاگ Ornith و در Hugging Face تحت مجوز MIT منتشر شد، آخرین مزیت در مسابقه هوش مصنوعی منبع باز است که به طور منظم نتایجی را ایجاد کرده است که زمانی بدون بودجه آزمایشگاه مرزی غیرممکن تصور می شد. برای توسعه‌دهندگان و شرکت‌هایی که [آخرین اخبار مدل هوش مصنوعی] (https://aibuzzwire.news) را ردیابی می‌کنند، اهمیت دو چندان است: برابری معیار با یک مدل بسته پیشرو، و دستورالعمل آموزشی که نشان می‌دهد توسعه مدل باز به کجا می‌رود.

سه سایز، یک دستور

Ornith-1.5 در سه پیکربندی عرضه می‌شود: یک پرچم‌دار ترکیبی از متخصصان با پارامتر 397B، یک MoE 35B که تنها 3B پارامتر در هر توکن فعال می‌کند، و یک مدل فشرده 9B متراکم با یک نوع کوانتیزه شده "Mobile" که برای اجرای مستقیم روی دستگاه‌های iPhone و Android طراحی شده است. هر سه در Hugging Face در کنار ساخت‌های GGUF، MLX و NVFP4 موجود هستند و کارت‌های مدل نشان می‌دهند که خانواده بر اساس معماری Qwen3.5 MoE ساخته شده‌اند.

اصل و نسب اینجا مهم است. Ornith-1.0 که در اوایل سال جاری منتشر شد، رویکرد "خودداربستی" را برای کدنویسی عاملی رایج کرد و به یک موفقیت آرام تبدیل شد - ساخت 9B GGUF آن بیش از پنج میلیون بار در Hugging Face ثبت کرده است. Ornith-1.5 این چارچوب را از بهینه سازی داربست ها و روکش ها به یک خط لوله خود-بهبود کامل گسترش می دهد.

حلقه خود-بهبودی، توضیح داده شد

در یک خط لوله متعارف پس از آموزش، یادگیری تقویتی در برابر مجموعه ثابتی از وظایف تعیین شده توسط انسان اجرا می شود. Ornith-1.5 در عوض از خود مدل می‌خواهد که وظایف جدید را پیشنهاد کند، یک داربست ویژه کار ایجاد کند - دستورالعمل‌ها، ابزارها و استراتژی تجزیه که برای حمله به مشکل استفاده می‌شود - و سپس راه‌حل‌هایی را تولید کند که توسط داربستی که به تازگی ساخته شده امتیازدهی می‌شوند. پاداش در هر سه مرحله با استفاده از GRPO منتشر می شود، بنابراین سیستم به طور همزمان یاد می گیرد که وظایف بهتر، داربست های بهتر و راه حل های بهتر بنویسد.

پاداش تولید وظیفه قلب طراحی است. هر کار پیشنهادی بر اساس سه سیگنال ضربی امتیازدهی می‌شود: اعتبار (آیا داربست به درستی اجرا و ارزیابی می‌شود؟)، دشواری مرزی (آیا نرخ موفقیت تجربی مدل نزدیک به هدف تقریباً 20 درصد است، وظایف چالش‌انگیز اما قابل یادگیری نگه‌داشته می‌شود؟)، و تازگی (آیا به اندازه کافی با همه چیز در بافری از وظایف تولید شده قبلی متفاوت است؟). از آنجایی که دشواری با نرخ موفقیت فعلی خود مدل اندازه گیری می شود، برنامه درسی به طور خودکار با بهبود مدل افزایش می یابد.

این تیم همچنین اقدامات ضد هک صریح را در طول ارزیابی گزارش می‌دهد: تاریخچه git از تصاویر مخزن حذف می‌شود، بنابراین مدل‌ها نمی‌توانند راه‌حل‌های قبلی را بازیابی کنند، و دسترسی به شبکه برای جلوگیری از واکشی پاسخ‌های خارجی توسط مدل‌ها غیرفعال است. همه نتایج در پنج دوره مستقل به طور میانگین محاسبه می شوند.

اعداد

در کدنویسی عاملی، نتایج خود گزارش شده پرچمدار در بالای زمینه منبع باز دسته بندی می شود. در Terminal-Bench 2.1 از مهار Terminus-2، Ornith-1.5-397B 86.1 از Claude Opus 4.8 (85.0)، DeepSeek-V4-Flash-0731 (82.7) و GLM-5.2 (81) عبور می کند. Ornith-1.5 در همان معیاری که از مهار کلود کد عبور می کند، 85.2 را در مقابل 78.9 Opus 4.8 قرار می دهد. در SWE-bench Verified، این دو عملاً در 86.0 و 85.8 مساوی هستند و Kimi K3 کمی جلوتر با 86.2 است.

شکاف‌ها در سوئیت‌های سخت‌تر نمایندگی افزایش می‌یابد. در DeepSWE، Ornith-1.5-397B امتیاز 56.0 را کسب می کند - بالاتر از GLM-5.2 که 46.2 است، هرچند پشت سر Opus 4.8 (59.0) و Kimi K3 (67.5). چشمگیرترین جهش نسلی است: Ornith-1.0 فقط امتیاز 8.0 را در DeepSWE کسب کرد، به این معنی که تکرار جدید بهبود هفت برابری را در خانواده معیار مشابه ارائه می دهد.

مدل های کوچکتر داستان خودشان را می گویند. Ornith-1.5-35B-A3B، با فعال کردن تنها 3B پارامتر در هر توکن، امتیاز 68.5 را در Terminal-Bench 2.1 (Claude Code) در مقابل 43.4 برای Gemma 4-31B Google و 51.7 برای Meta's Muse Glimmer. مدل 9B به 47.0 در Terminal-Bench 2.1، 70.6 در SWE-bench Verified و 86.4 در GPQA Diamond می رسد - اعدادی که یک مدل کلاس تلفن را در فاصله قابل توجهی از رقبای کلاس دسکتاپ قرار می دهند.

هشدارها و زمینه

اینها معیارهایی هستند که توسط توسعه‌دهندگان اجرا می‌شوند، نه نتایج حسابرسی مستقل، و مدل‌های مقایسه توسط تیم Ornith تحت تنظیمات مهار خود ارزیابی شدند. آزمایشگاه های رقیب نیز برای مبادلات مختلف تنظیم می شوند. رهبری Kimi K3 در DeepSWE نشان می دهد که مرز کار نرم افزار عاملی هنوز مورد بحث است. اما شفافیت جدول کامل انتشار - میانگین‌های پنج‌بار اجرا، پیکربندی‌های مهار منتشر شده، پادمان‌های افشا شده - تولید مثل مستقل را به‌طور غیرعادی ساده می‌کند.

واکنش جامعه قابل توجه بوده است. اعلامیه انتشار در عرض چند ساعت بیش از صد نکته را در هکر نیوز به خود جلب کرد و بحث کمتر بر روی ادعاهای معیار متمرکز بود تا روش بهبود خود، که بسیاری از نظر دهندگان آن را یکی از معتبرتر پیاده‌سازی‌های باز تولید وظایف به سبک بازگشتی توصیف کردند.

برای اکوسیستم متن‌باز، Ornith-1.5 در لحظه‌ای فرود می‌آید که مدل‌های باز از آزمایشگاه‌های چین و تیم‌های مستقل غربی، شکاف را با مرزهای بسته در کدنویسی و وظایف عاملی پر می‌کنند. یک خانواده دارای مجوز MIT که با یک مدل بسته پیشرو در Terminal-Bench مطابقت دارد - و یک نوع 9B آماده برای تلفن ارسال می‌کند - این شکاف را بیشتر کاهش می‌دهد و این کار را با یک روش آموزشی انجام می‌دهد که هر کسی می‌تواند آن را بازرسی، تکثیر و گسترش دهد.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →