یک معیار جدید به نام Real-SWE چگونگی سنجش توانایی کدنویسی توسط صنعت هوش مصنوعی را به چالش می کشد و اولین نتایج برای آزمایشگاه های مرزی فروتن هستند. Anthropic's Fable 5.1، که در مهار کلود کد اجرا می‌شود، با رزولوشن 38.8 درصد در کارهایی که از پایگاه‌های کد سازمانی خصوصی و واقعی گرفته می‌شوند، پیشتاز می‌شود. هیچ مدل تست شده 40 درصد پاک نمی شود.

این معیار که در این ماه توسط Specific Labs منتشر شد، مدل‌های هوش مصنوعی مرزی را بر روی پایگاه‌های کد تولید خصوصی که این تیم از شرکت‌های واقعی مجوز داده بودند، ارزیابی می‌کند. سازندگان آن استدلال می‌کنند که کارهای تولید شده توسط متخصصان یا مصنوعی، هر چند به خوبی طراحی شده باشند، به معنای واقعی کلمه کار مهندسین شرکت‌های واقعی نیستند. For more context on this story, see our ongoing latest AI developments.

چرا پایگاه های کد خصوصی تصویر را تغییر می دهند

به گفته نویسندگان آن، Real-SWE با معیارهای ثابت مانند SWE-bench در دو محور متفاوت است: مصنوع کدگذاری اساسی و ویژگی دستورالعمل. هر کار از یک سیستم اختصاصی می آید که کد و راه حل های آن در اینترنت عمومی در دسترس نیست، به این معنی که نمایندگان نمی توانند به پاسخ های حفظ شده از مخازن عمومی تکیه کنند.

وظایف همچنین پیامدهای تجاری را به همراه دارد. وظایف نمونه معیار شامل دریافت درست صورت‌حساب، محاسبه مالیات، و مهاجرت مشتریان است - تغییراتی که بر نحوه اداره یک کسب‌وکار تأثیر می‌گذارد، اغلب در چندین سرویس. هر شرکتی قراردادها و روش های خاص خود را برای نوشتن کد دارد، و نمایندگان باید آن هنجارها را درک کنند و تغییراتی را ایجاد کنند که با آنچه قبلاً وجود دارد کار کند.

"آیا یک عامل برنامه نویسی واقعاً می تواند کار یک مهندس نرم افزار را در دنیای واقعی انجام دهد؟" مقدمه معیار می پرسد. تابلوی امتیازات در حال حاضر پاسخ این است: در بهترین حالت فقط یک سوم مواقع.

تابلوی امتیازات کامل

آزمایشگاه های خاص هشت ترکیب مدل مرزی و مهار را ارزیابی کردند و نرخ وضوح را به صورت پاس @ 1 به طور میانگین در هشت دور مستقل در هر کار، با فاصله اطمینان 95 درصد اندازه گیری کردند:

1. افسانه 5.1 (کد کلود) — 38.8٪
2. GPT-6 Astra (Codex CLI) — 33.8٪
3. فلش Gemini 3.8 (Gemini CLI) — 31.2%
4. GLM 5.3 (Claude Code) — 28.8%
5. (تساوی) Grok 4.6 (Grok Build) — 23.8%
5. (کراوات) Muse Spark 1.3 (Muse Code) — 23.8%
7. Kimi K3 (کد کیمی) — 18.8٪
8. GPT-5.6 Sol (Codex CLI) — 16.2%

نتایج در آخر هفته به طور گسترده در هکر نیوز مورد بحث قرار گرفت، جایی که معیار چند صد رای موافق و یک بحث پر جنب و جوش در مورد اینکه آیا ارزیابی پایگاه کد خصوصی معیار مناسبی برای پیشرفت عامل است یا خیر، به دست آورد.

گسترش باریک اما معنادار در بالا

شکاف بین چهار سیستم برتر به دلیل آنچه در مورد چشم انداز رقابتی فعلی می گوید قابل توجه است. برتری پنج امتیازی Fable 5.1 نسبت به OpenAI's GPT-6 Astra در معیاری که در آن هر وظیفه یک مشکل واقعی تولید است، معنادار است. رتبه سوم Gemini 3.8 Flash بسیار قابل توجه است، زیرا این مدل به عنوان یک اسب کار سریع و کم هزینه به جای یک سیستم استدلال پرچمدار قرار می گیرد. GLM 5.3 Z.ai که از طریق Claude Code ارزیابی می‌شود و در فاصله پنج نقطه‌ای از پیشرو قرار می‌گیرد، نشان می‌دهد که مدل‌های وزن باز چگونه در کار مهندسی عملی رقابتی شده‌اند.

به همان اندازه گویای گسترش در پایین است. GPT-5.6 Sol، نسخه قبلی OpenAI، کمتر از نیمی از کارها را نسبت به Fable 5.1 حل می کند - یادآور این است که مرز چقدر سریع جابجا شده است، و چقدر تند افت می تواند یک نسل به عقب باشد.

هارنس ها به اندازه مدل ها اهمیت دارند

یکی از انتخاب‌های روش‌شناسی معیار جلب توجه است: Real-SWE به‌جای ارزیابی مدل‌ها به صورت مجزا، از مهارهای بومی - Claude Code، Codex CLI، Gemini CLI، Grok Build - استفاده می‌کند تا نشان دهد که مهندسان سازمانی واقعاً چگونه در عمل کار می‌کنند. تابلوی امتیازات به صراحت ترکیبات مدل و مهار را رتبه بندی می کند و اذعان می کند که داربست، دسترسی ابزار و حلقه های تکرار اکنون از قابلیت مدل در استقرار واقعی جدایی ناپذیر هستند.

این چارچوب برای شرکت هایی که سیستم ها را انتخاب می کنند اهمیت دارد. همان مدل بسته به مهار عاملی که در اطراف آن پیچیده شده است، می تواند عملکرد بسیار متفاوتی داشته باشد و خریدارانی که دستیارهای کدنویسی را بر روی اعداد معیار عمومی ارزیابی می کنند، ممکن است تصویری تحریف شده از نحوه رفتار آن سیستم ها در پایگاه های کد خود دریافت کنند.

چه معنایی برای صنعت دارد

معیارها بارها به اشباع بودن متهم شده‌اند، با مدل‌های مرزی نمرات تقریباً عالی در آزمایش‌های عمومی که به داده‌های آموزشی نشت می‌کنند. طراحی Real-SWE سعی می‌کند با هر دو مشکل به طور همزمان مقابله کند: کد خصوصی و دارای مجوز است، وظایف، محصولات کاری اصیل تیم‌های مهندسی هستند، و دستورالعمل‌ها به جای بیان‌های مشکل صیقلی، ویژگی‌های نامرتب بلیط‌های واقعی را منعکس می‌کنند.

غذای آماده کننده سطح مطلق است. حتی بهترین سیستم، کمتر از چهار مورد از هر ده کار واقعی سازمانی را در اولین تلاش حل می‌کند، به طور متوسط ​​در هشت اجرا. با وجود تمام پیشرفت‌هایی که در کدنویسی عاملی صورت گرفته است، این معیار نشان می‌دهد که مهندسی نرم‌افزار مستقل در سیستم‌های تولید واقعی یک فعالیت تحت نظارت باقی می‌ماند - فعالیتی که در آن مهندسان انسانی بسیار بیشتر از آنچه که دموی فروشنده نشان می‌دهند، بررسی، هدایت و تعمیر می‌کنند.

برای شرکت‌هایی که از میان دستیاران کدنویسی انتخاب می‌کنند، معیار یک چک‌لیست عملی ارائه می‌دهد: ترجیح دادن سیستم‌هایی که بر اساس کد خصوصی ارزیابی می‌شوند، بر فواصل اطمینان به جای اعداد سرفصل تک‌بار اصرار دارند، و کیفیت مهار وزن به اندازه قابلیت مدل خام. اولین تابلوی امتیازات Real-SWE آخرین حرف نخواهد بود - اما مستقیم‌ترین پاسخی است که تاکنون به سؤالی که هر رهبر مهندسی درباره کدنویسی عاملی می‌پرسد است.

برای اطلاعات بیشتر در مورد عوامل کدنویسی، نسخه‌های مدل و تحقیقاتی که به آنها شکل می‌دهد، آخرین اخبار هوش مصنوعی را دنبال کنید تا دور بعدی نتایج معیار قرار بگیرد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →