Cognition، شرکت سازنده نرم افزار Devin AI، SWE-2 را روز پنجشنبه راه اندازی کرد و آن را به عنوان پیشرفته ترین مدل کدنویسی خود توصیف کرد. در یک پست وبلاگی که در 10 سپتامبر منتشر شد، این شرکت اعلام کرد که مدل جدید آنچه را که مرز پارتو از توانایی و هزینه می‌نامد، با امتیاز 50.0 درصد در معیار اصلی FrontierCode 1.1 در حالی که هزینه آن 64 درصد کمتر از Fable 5.1 است، مدل Anthropic که تنها یک امتیاز بالاتر از آن با 50.9 درصد قرار دارد، دارد.

این راه‌اندازی تقریباً یک روز پس از تأیید اعتبار 2 میلیارد دلاری Cognition با ارزش‌گذاری 48 میلیارد دلاری انجام می‌شود و نشان می‌دهد که استارت‌آپ کدنویسی عاملی به‌جای تکیه بر مدل‌های مرزی شخص ثالث، چقدر تهاجمی در توسعه مدل خود سرمایه‌گذاری می‌کند. برای پوشش مداوم مسابقه کدنویسی هوش مصنوعی و هر چیز دیگری که صنعت را به حرکت در می‌آورد، [AI Buzz Wire] (https://aibuzzwire.news)، منبع روزانه خود را برای اخبار هوش مصنوعی نشانک‌گذاری کنید.

جایی که SWE-2 در معیارها قرار می گیرد

بر اساس نتایج منتشر شده توسط Cognition، SWE-2 50.0% را در FrontierCode 1.1 Main قرار می دهد، جلوتر از Grok 4.6 با 48.0% و GPT-5.6 Sol با 47.5% و در فاصله قابل توجهی از GPT-6 Astra که با 53.3% پیشتاز میدان است. در بنچمارک DeepSWE 1.1، SWE-2 به 73.0 درصد می رسد، پس از Astra که 74.1 درصد در بین لیست مدل های Cognition رتبه دوم را دارد.

قوی ترین نمایش در Terminal-Bench 2.1 است، جایی که SWE-2 امتیاز 92.8% را به خود اختصاص داده است، بالاترین رقم در جدول مقایسه Cognition و بالاتر از Fable 5.1 با 91.4% و GPT-6 Astra با 89.9%. تصویر در ترمینال-بنچ 4 سخت‌تر تغییر می‌کند، جایی که SWE-2 27.3% در مقابل 57.9% برای GPT-6 Astra و 55.8% برای Fable 5.1 را مدیریت می‌کند.

Cognition موقعیت یابی را به صراحت خلاصه می کند: در FrontierCode 1.1 Main و DeepSWE 1.1، SWE-2 مدل قبلی خود SWE-1.7 و Grok 4.6 را هم از نظر امتیاز و هم از نظر هزینه شکست می دهد، با GPT-5.6 Sol و Fable 5/5.1 با کسری از قیمت GPT در کسری از قیمت GPT مطابقت دارد و در یک چهارم قیمت GPT به دست می آید.

پس از آموزش از Kimi K3 در مقیاس چند تریلیون

SWE-2 از ابتدا ساخته نشده است. Cognition این مدل را از Kimi K3، یک مدل پایه 2.8 تریلیون پارامتری از Moonshot AI که قبلاً تحت یادگیری تقویتی گسترده برای کدگذاری عاملی قرار گرفته بود، پس از آموزش آموزش داد. علاوه بر این پایه، Cognition می‌گوید که فرآیند RL آن پنج تا شش امتیاز را در بسیاری از معیارها اضافه کرد و کل مرز عملکرد هزینه K3 را تغییر داد.

این شرکت می‌گوید SWE-2 اولین باری است که یادگیری تقویتی را به رژیم چند تریلیون پارامتری، بر اساس زیرساخت آموزشی و دستور العمل توسعه‌یافته برای SWE-1.7، مقیاس‌بندی کرده است. نکته کلیدی یک الگوریتم RL است که به جای اینکه تلاش کم، متوسط ​​و زیاد را به عنوان اهداف آموزشی جداگانه در نظر بگیرد، تمام سطوح استدلال-تلاش را در یک اجرا آموزش می دهد.

جریمه های هزینه کل مرز را شکل می دهد

یک ایده اصلی در آموزش SWE-2 یک جریمه هزینه خطی در هر سطح تلاش در یک اجرای RL است که هر جریمه با شیب محلی مرز پارتو مدل پایه تنظیم می شود. Cognition می‌گوید این رویکرد، که از اصول اولیه مشتق شده است، تمام مرزهای هزینه-عملکرد مدل را ارتقا می‌دهد و در عین حال شکل آن را حفظ می‌کند و هزینه‌های واقعی کاربر را تا حد امکان به طور مستقیم در آموزش منعکس می‌کند.

این شرکت همچنین یک پایه پاداش وزنی را که از زمان SWE-1.6 استفاده کرده است، شرح داده است، که آن را با آموزش تثبیت‌کننده قابل‌توجهی، همراه با پیشرفت‌هایی در سرویس عرضه RL که شامل یک مدل پیش‌نویس آنلاین برای افزایش توان رمزگشایی می‌شود، اعتبار می‌دهد. با هسته‌های NVFP4 و FP8 و آموزش‌های آگاه از کوانتیشن، Cognition می‌گوید با وجود داشتن پارامترهای مدل پایه تقریباً سه برابر مدل قبلی، استفاده کلی از حافظه را کاهش داده است.

خط لوله داده‌های آموزشی نیز گسترش یافت: شناخت، تعداد محیط‌های RL را سه برابر کرد، پوشش‌هایی را که دستورالعمل‌ها را دنبال می‌کردند، اضافه کرد، و یک چرخ لنگر با نقاط بازرسی قبلی SWE-2 ساخت که به‌طور مکرر تأییدکننده‌های مورد استفاده برای امتیاز دادن به مدل را سخت‌تر می‌کرد.

کارایی به اندازه هوش

Cognition دستاوردهای SWE-2 را به عنوان ارتباط نزدیکی با کارایی چارچوب بندی می کند. این شرکت می‌گوید که قضاوت مهندسی قوی‌تر به نماینده اجازه می‌دهد راه‌حل‌های کامل‌تری را با انحراف‌های کمتر و خواندن اضافی بنویسد. در FrontierCode 1.1 Main، پیکربندی با تلاش متوسط ​​SWE-2 امتیاز بالاتری نسبت به SWE-1.7 دارد، در حالی که 58 درصد نوبت کمتری دارد و 81 درصد هزینه کمتری دارد.

این چارچوب برای کسب و کار Cognition اهمیت دارد. دوین به عنوان یک مهندس نرم افزار مستقل فروخته می شود و هزینه استنتاج ورودی مستقیمی به قیمت گذاری و حاشیه سود است. مدلی که کیفیت مرزی را حفظ می کند در حالی که نوبت ها و نشانه ها را در هر کار برش می دهد، اقتصاد هر جلسه Devin را که شرکت ارائه می دهد تغییر می دهد.

در دسترس بودن

به گفته این شرکت، SWE-2 از امروز در Devin Desktop و Devin CLI در دسترس است و به گفته این شرکت، عرضه آن در Devin Web و Fusion در حال انجام است. Cognition می گوید که کاربران باید ببینند که این مدل در سراسر سطوح در روزهای آینده ظاهر می شود.

چه معنایی برای بازار مدل کدنویسی دارد

انتشار، بسته‌ای که از قبل شلوغ شده است را در پشت GPT-6 Astra محکم می‌کند. Cognition اکنون صاحب مدلی است که با پیشنهادات Anthropic، OpenAI و xAI با هزینه‌ی قابل‌توجهی پایین‌تر معامله می‌کند و مجموعه کامل را از محصول مدل به نمایندگی کنترل می‌کند. رقبا برای پاسخگویی به قیمت و توانایی، به ویژه برای کارهای با حجم بالا و سختی متوسط ​​که در آن مشخصات هزینه SWE-2 قوی ترین است، با فشار مواجه خواهند شد.

برای خریداران ابزارهای کدنویسی هوش مصنوعی، نکته مهم این است که کمک به کدگذاری سطح مرزی دیگر نیازی به قیمت گذاری در سطح مرزی ندارد. برای بقیه صنعت، SWE-2 شواهدی است که نشان می دهد کارآیی پس از آموزش و زیرساخت، نه فقط مقیاس مدل پایه، به یک اهرم رقابتی تعیین کننده تبدیل شده است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →