أطلقت شركة Cognition، الشركة التي تقف وراء مهندس برمجيات Devin AI، SWE-2 يوم الخميس، ووصفته بأنه نموذج البرمجة الأكثر تقدمًا حتى الآن. في منشور بالمدونة نُشر في 10 سبتمبر، قالت الشركة إن النموذج الجديد يدفع ما تسميه حدود باريتو من حيث القدرة والتكلفة، حيث سجل 50.0% على معيار FrontierCode 1.1 الرئيسي بينما يكلف 64% أقل من Fable 5.1، النموذج الإنساني الذي يتقدم عليه بنقطة واحدة فقط بنسبة 50.9%.

يتم الإطلاق بعد يوم واحد فقط من تأكيد Cognition جولة تمويل بقيمة 2 مليار دولار بتقييم 48 مليار دولار، وهو يشير إلى مدى قوة استثمار شركة البرمجة الوكيلة الناشئة في تطوير نموذجها الخاص بدلاً من الاعتماد فقط على نماذج حدودية تابعة لجهات خارجية. للحصول على تغطية مستمرة لسباق برمجة الذكاء الاصطناعي وكل شيء آخر يحرك الصناعة، ضع إشارة مرجعية على AI Buzz Wire، مصدرك اليومي لأخبار الذكاء الاصطناعي العاجلة.

حيث وصل SWE-2 إلى المعايير

وفقًا لنتائج Cognition المنشورة، حقق SWE-2 نسبة 50.0% على FrontierCode 1.1 Main، متقدمًا على Grok 4.6 بنسبة 48.0% وGPT-5.6 Sol بنسبة 47.5%، وعلى مسافة قريبة من GPT-6 Astra، الذي يتصدر المجال بنسبة 53.3%. في معيار DeepSWE 1.1، يصل SWE-2 إلى 73.0%، في المرتبة الثانية بعد Astra التي تبلغ 74.1% بين قوائم نماذج الإدراك.

يأتي أقوى عرض في Terminal-Bench 2.1، حيث سجل SWE-2 92.8%، وهو أعلى رقم في جدول مقارنة Cognition ويتقدم على Fable 5.1 بنسبة 91.4% وGPT-6 Astra بنسبة 89.9%. تتغير الصورة على Terminal-Bench 4 الأصعب، حيث تمكن SWE-2 من تحقيق 27.3% مقابل 57.9% لـ GPT-6 Astra و55.8% لـ Fable 5.1، وهو تذكير بأن تصميم الكفاءة أولاً للنموذج يترك مساحة رأسية في أعلى مستوى من صعوبة المهمة.

يلخص Cognition الموقف بصراحة: في FrontierCode 1.1 Main وDeepSWE 1.1، يتفوق SWE-2 على طرازه السابق SWE-1.7 وGrok 4.6 من حيث النتيجة والتكلفة، ويطابق GPT-5.6 Sol وFable 5/5.1 بجزء صغير من سعرهما، ويأتي ضمن بضع نقاط من GPT-6 Astra بربع التكلفة.

ما بعد التدريب من Kimi K3 بمقياس متعدد تريليونات

لم يتم بناء SWE-2 من الصفر. قامت شركة Cognition بتدريب النموذج من Kimi K3 بعد ذلك، وهو نموذج أساسي يحتوي على 2.8 تريليون معلمة من Moonshot AI والذي خضع بالفعل لتعلم معزز مكثف للتشفير الوكيل. علاوة على هذا الأساس، تقول Cognition إن عملية RL الخاصة بها أضافت من خمس إلى ست نقاط على العديد من المعايير وغيرت حدود أداء التكلفة لشركة K3 بالكامل.

تقول الشركة إن SWE-2 هي المرة الأولى التي تقوم فيها بتوسيع نطاق التعلم المعزز ليشمل نظام متعدد تريليونات المعلمات، بناءً على البنية التحتية للتدريب والوصفة التي تم تطويرها لـ SWE-1.7. الإضافة الرئيسية هي خوارزمية RL التي تدرب جميع مستويات جهد التفكير في جولة واحدة، بدلاً من التعامل مع الجهد المنخفض والمتوسط ​​والعالي كأهداف تدريب منفصلة.

عقوبات التكلفة تشكل الحدود بأكملها

الفكرة المركزية في تدريب SWE-2 هي عقوبة التكلفة الخطية المطبقة على كل مستوى جهد ضمن تشغيل RL واحد، مع ضبط كل عقوبة على المنحدر المحلي لحدود باريتو للنموذج الأساسي. يقول Cognition إن هذا النهج، المشتق من المبادئ الأولى، يعمل على تطوير حدود أداء التكلفة للنموذج بالكامل مع الحفاظ على شكله ويعكس تكاليف المستخدم الحقيقية بشكل مباشر قدر الإمكان في التدريب.

قامت الشركة أيضًا بتفصيل خط أساس للمكافأة المرجحة بالطول استخدمته منذ SWE-1.6، والذي يُنسب إليه الفضل في تحقيق الاستقرار بشكل كبير في التدريب، إلى جانب التحسينات على خدمة طرح RL التي تتضمن نموذج مسودة عبر الإنترنت لزيادة إنتاجية فك التشفير. بفضل نواة NVFP4 وFP8 والتدريب المراعي للتكميم، تقول Cognition إنها خفضت الاستخدام الإجمالي للذاكرة على الرغم من أن النموذج الأساسي يحتوي على ما يقرب من ثلاثة أضعاف معلمات سابقه.

توسع خط بيانات التدريب أيضًا: ضاعف Cognition عدد بيئات RL ثلاث مرات، وأضاف تراكبات تتبع التعليمات، وقام ببناء دولاب الموازنة مدعومًا بنقاط تفتيش SWE-2 السابقة التي تعمل بشكل متكرر على تقوية أدوات التحقق المستخدمة لتسجيل النموذج.

الكفاءة بقدر الذكاء

يؤطر الإدراك مكاسب SWE-2 بأنها مرتبطة ارتباطًا وثيقًا بالكفاءة. وتقول الشركة إن الحكم الهندسي الأقوى يسمح للوكيل بكتابة حلول أكثر اكتمالاً مع عدد أقل من التحويلات والقراءات الزائدة عن الحاجة. في FrontierCode 1.1 Main، سجل تكوين SWE-2 متوسط ​​الجهد أعلى من SWE-1.7 مع أخذ دورات أقل بنسبة 58% وتكلفة أقل بنسبة 81%.

هذا التأطير مهم بالنسبة لأعمال Cognition. يتم بيع Devin كمهندس برمجيات مستقل، وتكلفة الاستدلال هي مدخل مباشر للتسعير والهوامش. إن النموذج الذي يتمتع بجودة متجاورة مع قطع المنعطفات والرموز المميزة لكل مهمة يغير اقتصاديات كل جلسة Devin التي تخدمها الشركة.

التوفر

يتوفر SWE-2 بدءًا من اليوم في Devin Desktop وDevin CLI، مع بدء طرحه على Devin Web وFusion، وفقًا للشركة. يقول Cognition أنه يجب على المستخدمين رؤية النموذج يظهر عبر الأسطح خلال الأيام القادمة.

ماذا يعني ذلك بالنسبة لسوق نماذج الترميز

يشدد الإصدار الحزمة المزدحمة بالفعل خلف GPT-6 Astra. تمتلك Cognition الآن نموذجًا يتبادل الضربات مع العروض المقدمة من Anthropic وOpenAI وxAI بتكلفة أقل بشكل ملحوظ، كما أنها تتحكم في المجموعة الكاملة من المنتج إلى المنتج الوكيل. سيواجه المنافسون ضغوطًا للاستجابة للسعر بقدر ما يتعلق بالقدرة، خاصة بالنسبة للمهام كبيرة الحجم ومتوسطة الصعوبة حيث تكون تكلفة SWE-2 هي الأقوى.

بالنسبة لمشتري أدوات برمجة الذكاء الاصطناعي، فإن الفكرة العملية هي أن مساعدة البرمجة على المستوى الحدودي لم تعد تتطلب تسعيرًا على المستوى الحدودي. بالنسبة لبقية الصناعة، يعد SWE-2 دليلاً على أن كفاءة ما بعد التدريب والبنية التحتية، وليس فقط مقياس النموذج الأساسي، أصبحت رافعة تنافسية حاسمة.

---

ابقَ في طليعة الذكاء الاصطناعي

احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →