Cognition، شرکت سازنده نرم افزار Devin AI، SWE-2 را روز پنجشنبه راه اندازی کرد و آن را به عنوان پیشرفته ترین مدل کدنویسی خود توصیف کرد. در یک پست وبلاگی که در 10 سپتامبر منتشر شد، این شرکت اعلام کرد که مدل جدید آنچه را که مرز پارتو از توانایی و هزینه مینامد، با امتیاز 50.0 درصد در معیار اصلی FrontierCode 1.1 در حالی که هزینه آن 64 درصد کمتر از Fable 5.1 است، مدل Anthropic که تنها یک امتیاز بالاتر از آن با 50.9 درصد قرار دارد، دارد.
این راهاندازی تقریباً یک روز پس از تأیید اعتبار 2 میلیارد دلاری Cognition با ارزشگذاری 48 میلیارد دلاری انجام میشود و نشان میدهد که استارتآپ کدنویسی عاملی بهجای تکیه بر مدلهای مرزی شخص ثالث، چقدر تهاجمی در توسعه مدل خود سرمایهگذاری میکند. برای پوشش مداوم مسابقه کدنویسی هوش مصنوعی و هر چیز دیگری که صنعت را به حرکت در میآورد، [AI Buzz Wire] (https://aibuzzwire.news)، منبع روزانه خود را برای اخبار هوش مصنوعی نشانکگذاری کنید.
جایی که SWE-2 در معیارها قرار می گیرد
بر اساس نتایج منتشر شده توسط Cognition، SWE-2 50.0% را در FrontierCode 1.1 Main قرار می دهد، جلوتر از Grok 4.6 با 48.0% و GPT-5.6 Sol با 47.5% و در فاصله قابل توجهی از GPT-6 Astra که با 53.3% پیشتاز میدان است. در بنچمارک DeepSWE 1.1، SWE-2 به 73.0 درصد می رسد، پس از Astra که 74.1 درصد در بین لیست مدل های Cognition رتبه دوم را دارد.
قوی ترین نمایش در Terminal-Bench 2.1 است، جایی که SWE-2 امتیاز 92.8% را به خود اختصاص داده است، بالاترین رقم در جدول مقایسه Cognition و بالاتر از Fable 5.1 با 91.4% و GPT-6 Astra با 89.9%. تصویر در ترمینال-بنچ 4 سختتر تغییر میکند، جایی که SWE-2 27.3% در مقابل 57.9% برای GPT-6 Astra و 55.8% برای Fable 5.1 را مدیریت میکند.
Cognition موقعیت یابی را به صراحت خلاصه می کند: در FrontierCode 1.1 Main و DeepSWE 1.1، SWE-2 مدل قبلی خود SWE-1.7 و Grok 4.6 را هم از نظر امتیاز و هم از نظر هزینه شکست می دهد، با GPT-5.6 Sol و Fable 5/5.1 با کسری از قیمت GPT در کسری از قیمت GPT مطابقت دارد و در یک چهارم قیمت GPT به دست می آید.
پس از آموزش از Kimi K3 در مقیاس چند تریلیون
SWE-2 از ابتدا ساخته نشده است. Cognition این مدل را از Kimi K3، یک مدل پایه 2.8 تریلیون پارامتری از Moonshot AI که قبلاً تحت یادگیری تقویتی گسترده برای کدگذاری عاملی قرار گرفته بود، پس از آموزش آموزش داد. علاوه بر این پایه، Cognition میگوید که فرآیند RL آن پنج تا شش امتیاز را در بسیاری از معیارها اضافه کرد و کل مرز عملکرد هزینه K3 را تغییر داد.
این شرکت میگوید SWE-2 اولین باری است که یادگیری تقویتی را به رژیم چند تریلیون پارامتری، بر اساس زیرساخت آموزشی و دستور العمل توسعهیافته برای SWE-1.7، مقیاسبندی کرده است. نکته کلیدی یک الگوریتم RL است که به جای اینکه تلاش کم، متوسط و زیاد را به عنوان اهداف آموزشی جداگانه در نظر بگیرد، تمام سطوح استدلال-تلاش را در یک اجرا آموزش می دهد.
جریمه های هزینه کل مرز را شکل می دهد
یک ایده اصلی در آموزش SWE-2 یک جریمه هزینه خطی در هر سطح تلاش در یک اجرای RL است که هر جریمه با شیب محلی مرز پارتو مدل پایه تنظیم می شود. Cognition میگوید این رویکرد، که از اصول اولیه مشتق شده است، تمام مرزهای هزینه-عملکرد مدل را ارتقا میدهد و در عین حال شکل آن را حفظ میکند و هزینههای واقعی کاربر را تا حد امکان به طور مستقیم در آموزش منعکس میکند.
این شرکت همچنین یک پایه پاداش وزنی را که از زمان SWE-1.6 استفاده کرده است، شرح داده است، که آن را با آموزش تثبیتکننده قابلتوجهی، همراه با پیشرفتهایی در سرویس عرضه RL که شامل یک مدل پیشنویس آنلاین برای افزایش توان رمزگشایی میشود، اعتبار میدهد. با هستههای NVFP4 و FP8 و آموزشهای آگاه از کوانتیشن، Cognition میگوید با وجود داشتن پارامترهای مدل پایه تقریباً سه برابر مدل قبلی، استفاده کلی از حافظه را کاهش داده است.
خط لوله دادههای آموزشی نیز گسترش یافت: شناخت، تعداد محیطهای RL را سه برابر کرد، پوششهایی را که دستورالعملها را دنبال میکردند، اضافه کرد، و یک چرخ لنگر با نقاط بازرسی قبلی SWE-2 ساخت که بهطور مکرر تأییدکنندههای مورد استفاده برای امتیاز دادن به مدل را سختتر میکرد.
کارایی به اندازه هوش
Cognition دستاوردهای SWE-2 را به عنوان ارتباط نزدیکی با کارایی چارچوب بندی می کند. این شرکت میگوید که قضاوت مهندسی قویتر به نماینده اجازه میدهد راهحلهای کاملتری را با انحرافهای کمتر و خواندن اضافی بنویسد. در FrontierCode 1.1 Main، پیکربندی با تلاش متوسط SWE-2 امتیاز بالاتری نسبت به SWE-1.7 دارد، در حالی که 58 درصد نوبت کمتری دارد و 81 درصد هزینه کمتری دارد.
این چارچوب برای کسب و کار Cognition اهمیت دارد. دوین به عنوان یک مهندس نرم افزار مستقل فروخته می شود و هزینه استنتاج ورودی مستقیمی به قیمت گذاری و حاشیه سود است. مدلی که کیفیت مرزی را حفظ می کند در حالی که نوبت ها و نشانه ها را در هر کار برش می دهد، اقتصاد هر جلسه Devin را که شرکت ارائه می دهد تغییر می دهد.
در دسترس بودن
به گفته این شرکت، SWE-2 از امروز در Devin Desktop و Devin CLI در دسترس است و به گفته این شرکت، عرضه آن در Devin Web و Fusion در حال انجام است. Cognition می گوید که کاربران باید ببینند که این مدل در سراسر سطوح در روزهای آینده ظاهر می شود.
چه معنایی برای بازار مدل کدنویسی دارد
انتشار، بستهای که از قبل شلوغ شده است را در پشت GPT-6 Astra محکم میکند. Cognition اکنون صاحب مدلی است که با پیشنهادات Anthropic، OpenAI و xAI با هزینهی قابلتوجهی پایینتر معامله میکند و مجموعه کامل را از محصول مدل به نمایندگی کنترل میکند. رقبا برای پاسخگویی به قیمت و توانایی، به ویژه برای کارهای با حجم بالا و سختی متوسط که در آن مشخصات هزینه SWE-2 قوی ترین است، با فشار مواجه خواهند شد.
برای خریداران ابزارهای کدنویسی هوش مصنوعی، نکته مهم این است که کمک به کدگذاری سطح مرزی دیگر نیازی به قیمت گذاری در سطح مرزی ندارد. برای بقیه صنعت، SWE-2 شواهدی است که نشان می دهد کارآیی پس از آموزش و زیرساخت، نه فقط مقیاس مدل پایه، به یک اهرم رقابتی تعیین کننده تبدیل شده است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →