أصدر فريق Ornith Ornith-1.5، وهي عائلة من نماذج اللغة ذات الوزن المفتوح المبنية على فكرة غير عادية: يقوم النموذج بإنشاء مهام التدريب الخاصة به، ويصمم سقالاته الخاصة، ويتعلم من محاولات الحل الخاصة به في حلقة مستمرة التشغيل. وفقًا لتقييمات الفريق الخاصة، حصل الرائد Ornith-1.5-397B على 86.1 في Terminal-Bench 2.1 (Terminus-2)، مما يجعله على قدم المساواة مع Anthropic's Claude Opus 4.8 عند 85.0 وقبل كل نموذج مفتوح المصدر آخر بحجم مماثل.
يعد هذا الإصدار، الذي نُشر هذا الأسبوع على مدونة Ornith وعلى Hugging Face بموجب ترخيص من معهد ماساتشوستس للتكنولوجيا، أحدث طلقة في سباق الذكاء الاصطناعي مفتوح المصدر الذي أدى بانتظام إلى نتائج كان يُعتقد في السابق أنها مستحيلة دون ميزانية المختبر الحدودي. بالنسبة للمطورين والمؤسسات التي تتابع آخر أخبار نماذج الذكاء الاصطناعي، فإن الأهمية ذات شقين: التكافؤ المعياري مع نموذج مغلق رائد، ووصفة تدريب تشير إلى الاتجاه التالي لتطوير النموذج المفتوح.
ثلاثة أحجام، وصفة واحدة
يتم شحن Ornith-1.5 في ثلاثة تكوينات: نموذج رئيسي مكون من 397B من الخبراء، و35B MoE يقوم بتنشيط 3B من المعلمات فقط لكل رمز، ونموذج مضغوط كثيف 9B مع متغير "محمول" مكمّم مصمم للتشغيل مباشرة على أجهزة iPhone وAndroid. الثلاثة متاحة على Hugging Face جنبًا إلى جنب مع إصدارات GGUF وMLX وNVFP4، وتشير بطاقات النموذج إلى أن العائلة مبنية على بنية Qwen3.5 MoE.
النسب مهم هنا قام Ornith-1.0، الذي تم إصداره في وقت سابق من هذا العام، بنشر نهج "السقالات الذاتية" في البرمجة الوكيلية وحقق نجاحًا كبيرًا - فقد سجل إصداره 9B GGUF أكثر من خمسة ملايين عملية تنزيل على Hugging Face. يعمل Ornith-1.5 على توسيع هذا الإطار من تحسين السقالات وعمليات الطرح إلى خط أنابيب كامل للتحسين الذاتي.
شرح حلقة التحسين الذاتي
في المسار التقليدي لمرحلة ما بعد التدريب، يتعارض التعلم المعزز مع مجموعة ثابتة من المهام التي ينسقها الإنسان. بدلاً من ذلك، يقوم Ornith-1.5 النموذج نفسه باقتراح مهام جديدة، وإنشاء سقالة خاصة بالمهمة - التعليمات والأدوات واستراتيجية التحليل المستخدمة لمهاجمة المشكلة - ثم إنتاج عمليات طرح الحلول التي يتم تسجيلها بواسطة السقالة التي تم بناؤها للتو. يتم نشر المكافأة مرة أخرى خلال المراحل الثلاث باستخدام GRPO، بحيث يتعلم النظام في الوقت نفسه كتابة مهام أفضل، وسقالات أفضل، وحلول أفضل.
إن مكافأة توليد المهام هي جوهر التصميم. يتم تسجيل كل مهمة مقترحة على ثلاث إشارات مضاعفة: الصلاحية (هل يتم تنفيذ السقالة وتقييمها بشكل صحيح؟)، والصعوبة الحدودية (هل معدل النجاح التجريبي للنموذج يقترب من هدف يبلغ حوالي 20 بالمائة، مما يجعل المهام صعبة ولكن قابلة للتعلم؟)، والجدة (هل تختلف بما فيه الكفاية عن كل شيء في منطقة مؤقتة من المهام التي تم إنشاؤها مسبقًا؟). نظرًا لأن الصعوبة يتم قياسها مقابل معدل النجاح الحالي للنموذج، فإن المنهج يتصاعد تلقائيًا مع تحسن النموذج.
أبلغ الفريق أيضًا عن إجراءات صريحة لمكافحة القرصنة أثناء التقييم: يتم تجريد سجل git من صور المستودع بحيث لا تتمكن النماذج من استعادة الحلول السابقة، ويتم تعطيل الوصول إلى الشبكة لمنع النماذج من جلب الإجابات الخارجية. يتم حساب متوسط جميع النتائج على مدى خمسة أشواط مستقلة.
الأرقام
فيما يتعلق بالتشفير الوكيل، تتجمع النتائج المبلغ عنها ذاتيًا للرائد في الجزء العلوي من الحقل مفتوح المصدر. في Terminal-Bench 2.1 الذي يمر عبر حزام Terminus-2، يتفوق Ornith-1.5-397B's 86.1 على Claude Opus 4.8 (85.0)، وDeepSeek-V4-Flash-0731 (82.7)، وGLM-5.2 (81). على نفس المعيار الذي تم تشغيله من خلال أداة Claude Code، سجل Ornith-1.5 85.2 مقابل 78.9 لـ Opus 4.8. في SWE-bench Verified، يتعادل الاثنان فعليًا عند 86.0 و85.8، مع تقدم Kimi K3 قليلاً عند 86.2.
تتسع الفجوات في الأجنحة العميلة الأكثر صعوبة. في DeepSWE، سجل Ornith-1.5-397B 56.0 - متقدمًا على GLM-5.2 الذي حصل على 46.2، على الرغم من أنه خلف Opus 4.8 (59.0) وKimi K3 (67.5). القفزة الأكثر لفتًا للانتباه هي القفزة بين الأجيال: فقد سجل Ornith-1.0 8.0 نقاط فقط في DeepSWE، مما يعني أن التكرار الجديد يقدم تحسنًا بمقدار سبعة أضعاف على نفس عائلة المعايير.
النماذج الأصغر تحكي قصتها الخاصة. Ornith-1.5-35B-A3B، الذي يقوم بتنشيط معلمات 3B فقط لكل رمز، حصل على 68.5 على Terminal-Bench 2.1 (Claude Code) مقابل 43.4 لـ Gemma 4-31B من Google و51.7 لـ Meta's Muse Glimmer-30B، وسجل 79.0 على SWE-bench Verified. يصل الطراز 9B إلى 47.0 على Terminal-Bench 2.1، و70.6 على SWE-bench Verified، و86.4 على GPQA Diamond - وهي أرقام تضع طراز فئة الهاتف على مسافة مذهلة من المنافسين من فئة أجهزة الكمبيوتر المكتبية.
التحذيرات والسياق
هذه معايير يديرها المطورون، وليست نتائج مدققة بشكل مستقل، وقد تم تقييم نماذج المقارنة من قبل فريق Ornith ضمن إعدادات الحزام الخاصة به. كما تقوم المختبرات المتنافسة أيضًا بضبط المقايضات المختلفة؛ يشير تقدم Kimi K3 في DeepSWE إلى أن حدود العمل البرمجي الوكيل لا تزال محل نزاع. لكن شفافية الجدول الكامل للإصدار - متوسطات التشغيل الخمسة، وتكوينات الحزام المنشورة، والضمانات المكشوف عنها - تجعل الاستنساخ المستقل واضحًا بشكل غير عادي.
وكانت استجابة المجتمع كبيرة. اجتذب إعلان الإصدار أكثر من مائة نقطة على Hacker News في غضون ساعات، مع تركيز المناقشة بشكل أقل على المطالبات المعيارية بقدر ما ركزت على منهجية التحسين الذاتي، والتي وصفها العديد من المعلقين بأنها واحدة من التطبيقات المفتوحة الأكثر مصداقية لتوليد المهام ذات النمط العودي.
بالنسبة للنظام البيئي مفتوح المصدر، يأتي Ornith-1.5 في وقت كانت فيه النماذج المفتوحة من المختبرات الصينية والفرق الغربية المستقلة تسد الفجوة مع الحدود المغلقة في مهام البرمجة والوكلاء. إن عائلة مرخصة من معهد ماساتشوستس للتكنولوجيا تتطابق مع نموذج مغلق رائد على Terminal-Bench - وتشحن متغير 9B جاهز للهاتف - تعمل على تضييق هذه الفجوة بشكل أكبر، وتفعل ذلك باستخدام طريقة تدريب يمكن لأي شخص فحصها وإعادة إنتاجها وتوسيعها.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →