تیم Ornith Ornith-1.5 را منتشر کرده است، خانوادهای از مدلهای زبانی با وزن باز که حول یک ایده غیرعادی ساخته شدهاند: این مدل وظایف آموزشی خود را ایجاد میکند، داربستهای خود را طراحی میکند و از تلاشهای راهحل خود در یک حلقه بهطور مداوم یاد میگیرد. طبق ارزیابیهای خود تیم، پرچمدار Ornith-1.5-397B امتیاز 86.1 را در Terminal-Bench 2.1 (Terminus-2) کسب میکند که آن را با کلود Opus 4.8 Anthropic در 85.0 برابری میکند و از هر مدل منبع باز دیگری با اندازه قابل مقایسه جلوتر است.
این نسخه که این هفته در وبلاگ Ornith و در Hugging Face تحت مجوز MIT منتشر شد، آخرین مزیت در مسابقه هوش مصنوعی منبع باز است که به طور منظم نتایجی را ایجاد کرده است که زمانی بدون بودجه آزمایشگاه مرزی غیرممکن تصور می شد. برای توسعهدهندگان و شرکتهایی که [آخرین اخبار مدل هوش مصنوعی] (https://aibuzzwire.news) را ردیابی میکنند، اهمیت دو چندان است: برابری معیار با یک مدل بسته پیشرو، و دستورالعمل آموزشی که نشان میدهد توسعه مدل باز به کجا میرود.
سه سایز، یک دستور
Ornith-1.5 در سه پیکربندی عرضه میشود: یک پرچمدار ترکیبی از متخصصان با پارامتر 397B، یک MoE 35B که تنها 3B پارامتر در هر توکن فعال میکند، و یک مدل فشرده 9B متراکم با یک نوع کوانتیزه شده "Mobile" که برای اجرای مستقیم روی دستگاههای iPhone و Android طراحی شده است. هر سه در Hugging Face در کنار ساختهای GGUF، MLX و NVFP4 موجود هستند و کارتهای مدل نشان میدهند که خانواده بر اساس معماری Qwen3.5 MoE ساخته شدهاند.
اصل و نسب اینجا مهم است. Ornith-1.0 که در اوایل سال جاری منتشر شد، رویکرد "خودداربستی" را برای کدنویسی عاملی رایج کرد و به یک موفقیت آرام تبدیل شد - ساخت 9B GGUF آن بیش از پنج میلیون بار در Hugging Face ثبت کرده است. Ornith-1.5 این چارچوب را از بهینه سازی داربست ها و روکش ها به یک خط لوله خود-بهبود کامل گسترش می دهد.
حلقه خود-بهبودی، توضیح داده شد
در یک خط لوله متعارف پس از آموزش، یادگیری تقویتی در برابر مجموعه ثابتی از وظایف تعیین شده توسط انسان اجرا می شود. Ornith-1.5 در عوض از خود مدل میخواهد که وظایف جدید را پیشنهاد کند، یک داربست ویژه کار ایجاد کند - دستورالعملها، ابزارها و استراتژی تجزیه که برای حمله به مشکل استفاده میشود - و سپس راهحلهایی را تولید کند که توسط داربستی که به تازگی ساخته شده امتیازدهی میشوند. پاداش در هر سه مرحله با استفاده از GRPO منتشر می شود، بنابراین سیستم به طور همزمان یاد می گیرد که وظایف بهتر، داربست های بهتر و راه حل های بهتر بنویسد.
پاداش تولید وظیفه قلب طراحی است. هر کار پیشنهادی بر اساس سه سیگنال ضربی امتیازدهی میشود: اعتبار (آیا داربست به درستی اجرا و ارزیابی میشود؟)، دشواری مرزی (آیا نرخ موفقیت تجربی مدل نزدیک به هدف تقریباً 20 درصد است، وظایف چالشانگیز اما قابل یادگیری نگهداشته میشود؟)، و تازگی (آیا به اندازه کافی با همه چیز در بافری از وظایف تولید شده قبلی متفاوت است؟). از آنجایی که دشواری با نرخ موفقیت فعلی خود مدل اندازه گیری می شود، برنامه درسی به طور خودکار با بهبود مدل افزایش می یابد.
این تیم همچنین اقدامات ضد هک صریح را در طول ارزیابی گزارش میدهد: تاریخچه git از تصاویر مخزن حذف میشود، بنابراین مدلها نمیتوانند راهحلهای قبلی را بازیابی کنند، و دسترسی به شبکه برای جلوگیری از واکشی پاسخهای خارجی توسط مدلها غیرفعال است. همه نتایج در پنج دوره مستقل به طور میانگین محاسبه می شوند.
اعداد
در کدنویسی عاملی، نتایج خود گزارش شده پرچمدار در بالای زمینه منبع باز دسته بندی می شود. در Terminal-Bench 2.1 از مهار Terminus-2، Ornith-1.5-397B 86.1 از Claude Opus 4.8 (85.0)، DeepSeek-V4-Flash-0731 (82.7) و GLM-5.2 (81) عبور می کند. Ornith-1.5 در همان معیاری که از مهار کلود کد عبور می کند، 85.2 را در مقابل 78.9 Opus 4.8 قرار می دهد. در SWE-bench Verified، این دو عملاً در 86.0 و 85.8 مساوی هستند و Kimi K3 کمی جلوتر با 86.2 است.
شکافها در سوئیتهای سختتر نمایندگی افزایش مییابد. در DeepSWE، Ornith-1.5-397B امتیاز 56.0 را کسب می کند - بالاتر از GLM-5.2 که 46.2 است، هرچند پشت سر Opus 4.8 (59.0) و Kimi K3 (67.5). چشمگیرترین جهش نسلی است: Ornith-1.0 فقط امتیاز 8.0 را در DeepSWE کسب کرد، به این معنی که تکرار جدید بهبود هفت برابری را در خانواده معیار مشابه ارائه می دهد.
مدل های کوچکتر داستان خودشان را می گویند. Ornith-1.5-35B-A3B، با فعال کردن تنها 3B پارامتر در هر توکن، امتیاز 68.5 را در Terminal-Bench 2.1 (Claude Code) در مقابل 43.4 برای Gemma 4-31B Google و 51.7 برای Meta's Muse Glimmer. مدل 9B به 47.0 در Terminal-Bench 2.1، 70.6 در SWE-bench Verified و 86.4 در GPQA Diamond می رسد - اعدادی که یک مدل کلاس تلفن را در فاصله قابل توجهی از رقبای کلاس دسکتاپ قرار می دهند.
هشدارها و زمینه
اینها معیارهایی هستند که توسط توسعهدهندگان اجرا میشوند، نه نتایج حسابرسی مستقل، و مدلهای مقایسه توسط تیم Ornith تحت تنظیمات مهار خود ارزیابی شدند. آزمایشگاه های رقیب نیز برای مبادلات مختلف تنظیم می شوند. رهبری Kimi K3 در DeepSWE نشان می دهد که مرز کار نرم افزار عاملی هنوز مورد بحث است. اما شفافیت جدول کامل انتشار - میانگینهای پنجبار اجرا، پیکربندیهای مهار منتشر شده، پادمانهای افشا شده - تولید مثل مستقل را بهطور غیرعادی ساده میکند.
واکنش جامعه قابل توجه بوده است. اعلامیه انتشار در عرض چند ساعت بیش از صد نکته را در هکر نیوز به خود جلب کرد و بحث کمتر بر روی ادعاهای معیار متمرکز بود تا روش بهبود خود، که بسیاری از نظر دهندگان آن را یکی از معتبرتر پیادهسازیهای باز تولید وظایف به سبک بازگشتی توصیف کردند.
برای اکوسیستم متنباز، Ornith-1.5 در لحظهای فرود میآید که مدلهای باز از آزمایشگاههای چین و تیمهای مستقل غربی، شکاف را با مرزهای بسته در کدنویسی و وظایف عاملی پر میکنند. یک خانواده دارای مجوز MIT که با یک مدل بسته پیشرو در Terminal-Bench مطابقت دارد - و یک نوع 9B آماده برای تلفن ارسال میکند - این شکاف را بیشتر کاهش میدهد و این کار را با یک روش آموزشی انجام میدهد که هر کسی میتواند آن را بازرسی، تکثیر و گسترش دهد.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →