یک معیار جدید به نام Real-SWE چگونگی سنجش توانایی کدنویسی توسط صنعت هوش مصنوعی را به چالش می کشد و اولین نتایج برای آزمایشگاه های مرزی فروتن هستند. Anthropic's Fable 5.1، که در مهار کلود کد اجرا میشود، با رزولوشن 38.8 درصد در کارهایی که از پایگاههای کد سازمانی خصوصی و واقعی گرفته میشوند، پیشتاز میشود. هیچ مدل تست شده 40 درصد پاک نمی شود.
این معیار که در این ماه توسط Specific Labs منتشر شد، مدلهای هوش مصنوعی مرزی را بر روی پایگاههای کد تولید خصوصی که این تیم از شرکتهای واقعی مجوز داده بودند، ارزیابی میکند. سازندگان آن استدلال میکنند که کارهای تولید شده توسط متخصصان یا مصنوعی، هر چند به خوبی طراحی شده باشند، به معنای واقعی کلمه کار مهندسین شرکتهای واقعی نیستند. For more context on this story, see our ongoing latest AI developments.
چرا پایگاه های کد خصوصی تصویر را تغییر می دهند
به گفته نویسندگان آن، Real-SWE با معیارهای ثابت مانند SWE-bench در دو محور متفاوت است: مصنوع کدگذاری اساسی و ویژگی دستورالعمل. هر کار از یک سیستم اختصاصی می آید که کد و راه حل های آن در اینترنت عمومی در دسترس نیست، به این معنی که نمایندگان نمی توانند به پاسخ های حفظ شده از مخازن عمومی تکیه کنند.
وظایف همچنین پیامدهای تجاری را به همراه دارد. وظایف نمونه معیار شامل دریافت درست صورتحساب، محاسبه مالیات، و مهاجرت مشتریان است - تغییراتی که بر نحوه اداره یک کسبوکار تأثیر میگذارد، اغلب در چندین سرویس. هر شرکتی قراردادها و روش های خاص خود را برای نوشتن کد دارد، و نمایندگان باید آن هنجارها را درک کنند و تغییراتی را ایجاد کنند که با آنچه قبلاً وجود دارد کار کند.
"آیا یک عامل برنامه نویسی واقعاً می تواند کار یک مهندس نرم افزار را در دنیای واقعی انجام دهد؟" مقدمه معیار می پرسد. تابلوی امتیازات در حال حاضر پاسخ این است: در بهترین حالت فقط یک سوم مواقع.
تابلوی امتیازات کامل
آزمایشگاه های خاص هشت ترکیب مدل مرزی و مهار را ارزیابی کردند و نرخ وضوح را به صورت پاس @ 1 به طور میانگین در هشت دور مستقل در هر کار، با فاصله اطمینان 95 درصد اندازه گیری کردند:
1. افسانه 5.1 (کد کلود) — 38.8٪
2. GPT-6 Astra (Codex CLI) — 33.8٪
3. فلش Gemini 3.8 (Gemini CLI) — 31.2%
4. GLM 5.3 (Claude Code) — 28.8%
5. (تساوی) Grok 4.6 (Grok Build) — 23.8%
5. (کراوات) Muse Spark 1.3 (Muse Code) — 23.8%
7. Kimi K3 (کد کیمی) — 18.8٪
8. GPT-5.6 Sol (Codex CLI) — 16.2%
نتایج در آخر هفته به طور گسترده در هکر نیوز مورد بحث قرار گرفت، جایی که معیار چند صد رای موافق و یک بحث پر جنب و جوش در مورد اینکه آیا ارزیابی پایگاه کد خصوصی معیار مناسبی برای پیشرفت عامل است یا خیر، به دست آورد.
گسترش باریک اما معنادار در بالا
شکاف بین چهار سیستم برتر به دلیل آنچه در مورد چشم انداز رقابتی فعلی می گوید قابل توجه است. برتری پنج امتیازی Fable 5.1 نسبت به OpenAI's GPT-6 Astra در معیاری که در آن هر وظیفه یک مشکل واقعی تولید است، معنادار است. رتبه سوم Gemini 3.8 Flash بسیار قابل توجه است، زیرا این مدل به عنوان یک اسب کار سریع و کم هزینه به جای یک سیستم استدلال پرچمدار قرار می گیرد. GLM 5.3 Z.ai که از طریق Claude Code ارزیابی میشود و در فاصله پنج نقطهای از پیشرو قرار میگیرد، نشان میدهد که مدلهای وزن باز چگونه در کار مهندسی عملی رقابتی شدهاند.
به همان اندازه گویای گسترش در پایین است. GPT-5.6 Sol، نسخه قبلی OpenAI، کمتر از نیمی از کارها را نسبت به Fable 5.1 حل می کند - یادآور این است که مرز چقدر سریع جابجا شده است، و چقدر تند افت می تواند یک نسل به عقب باشد.
هارنس ها به اندازه مدل ها اهمیت دارند
یکی از انتخابهای روششناسی معیار جلب توجه است: Real-SWE بهجای ارزیابی مدلها به صورت مجزا، از مهارهای بومی - Claude Code، Codex CLI، Gemini CLI، Grok Build - استفاده میکند تا نشان دهد که مهندسان سازمانی واقعاً چگونه در عمل کار میکنند. تابلوی امتیازات به صراحت ترکیبات مدل و مهار را رتبه بندی می کند و اذعان می کند که داربست، دسترسی ابزار و حلقه های تکرار اکنون از قابلیت مدل در استقرار واقعی جدایی ناپذیر هستند.
این چارچوب برای شرکت هایی که سیستم ها را انتخاب می کنند اهمیت دارد. همان مدل بسته به مهار عاملی که در اطراف آن پیچیده شده است، می تواند عملکرد بسیار متفاوتی داشته باشد و خریدارانی که دستیارهای کدنویسی را بر روی اعداد معیار عمومی ارزیابی می کنند، ممکن است تصویری تحریف شده از نحوه رفتار آن سیستم ها در پایگاه های کد خود دریافت کنند.
چه معنایی برای صنعت دارد
معیارها بارها به اشباع بودن متهم شدهاند، با مدلهای مرزی نمرات تقریباً عالی در آزمایشهای عمومی که به دادههای آموزشی نشت میکنند. طراحی Real-SWE سعی میکند با هر دو مشکل به طور همزمان مقابله کند: کد خصوصی و دارای مجوز است، وظایف، محصولات کاری اصیل تیمهای مهندسی هستند، و دستورالعملها به جای بیانهای مشکل صیقلی، ویژگیهای نامرتب بلیطهای واقعی را منعکس میکنند.
غذای آماده کننده سطح مطلق است. حتی بهترین سیستم، کمتر از چهار مورد از هر ده کار واقعی سازمانی را در اولین تلاش حل میکند، به طور متوسط در هشت اجرا. با وجود تمام پیشرفتهایی که در کدنویسی عاملی صورت گرفته است، این معیار نشان میدهد که مهندسی نرمافزار مستقل در سیستمهای تولید واقعی یک فعالیت تحت نظارت باقی میماند - فعالیتی که در آن مهندسان انسانی بسیار بیشتر از آنچه که دموی فروشنده نشان میدهند، بررسی، هدایت و تعمیر میکنند.
برای شرکتهایی که از میان دستیاران کدنویسی انتخاب میکنند، معیار یک چکلیست عملی ارائه میدهد: ترجیح دادن سیستمهایی که بر اساس کد خصوصی ارزیابی میشوند، بر فواصل اطمینان به جای اعداد سرفصل تکبار اصرار دارند، و کیفیت مهار وزن به اندازه قابلیت مدل خام. اولین تابلوی امتیازات Real-SWE آخرین حرف نخواهد بود - اما مستقیمترین پاسخی است که تاکنون به سؤالی که هر رهبر مهندسی درباره کدنویسی عاملی میپرسد است.
برای اطلاعات بیشتر در مورد عوامل کدنویسی، نسخههای مدل و تحقیقاتی که به آنها شکل میدهد، آخرین اخبار هوش مصنوعی را دنبال کنید تا دور بعدی نتایج معیار قرار بگیرد.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →