ស្តង់ដារថ្មីដែលហៅថា Real-SWE កំពុងប្រឈមនឹងរបៀបដែលឧស្សាហកម្ម AI វាស់ស្ទង់សមត្ថភាពសរសេរកូដ ហើយលទ្ធផលដំបូងគឺមានភាពរាបទាបសម្រាប់មន្ទីរពិសោធន៍ព្រំដែន។ Anthropic's Fable 5.1 ដែលកំពុងដំណើរការនៅខាងក្នុង Claude Code harness ដឹកនាំក្រុមប្រឹក្សាភិបាលជាមួយនឹងអត្រាដំណោះស្រាយ 38.8% លើកិច្ចការដែលទាញចេញពីមូលដ្ឋានកូដសហគ្រាសក្នុងពិភពពិតឯកជន។ គ្មានគំរូដែលបានធ្វើតេស្តនោះច្បាស់ជា ៤០ ភាគរយទេ។
ស្តង់ដារដែលបានចេញផ្សាយក្នុងខែនេះដោយ Specific Labs វាយតម្លៃគំរូ AI ព្រំដែននៅលើមូលដ្ឋានកូដផលិតកម្មឯកជនដែលក្រុមការងារទទួលបានអាជ្ញាប័ណ្ណពីក្រុមហ៊ុនពិត។ អ្នកបង្កើតរបស់វាប្រកែកថា ការងារដែលបង្កើតឡើងដោយអ្នកជំនាញ ឬសំយោគ ទោះជាត្រូវបានរចនាយ៉ាងល្អ មិនមែនជាការងារដែលវិស្វករនៅក្រុមហ៊ុនពិតប្រាកដធ្វើនោះទេ។ For more context on this story, see our ongoing more AI stories.
ហេតុអ្វីបានជាកូដមូលដ្ឋានឯកជនផ្លាស់ប្តូររូបភាព
Real-SWE ខុសពីស្តង់ដារដែលបានបង្កើតឡើងដូចជា SWE-bench នៅលើអ័ក្សពីរ នេះបើយោងតាមអ្នកនិពន្ធរបស់វា៖ វត្ថុបុរាណនៃការសរសេរកូដមូលដ្ឋាន និងភាពជាក់លាក់នៃការណែនាំ។ កិច្ចការនីមួយៗបានមកពីប្រព័ន្ធកម្មសិទ្ធិដែលលេខកូដ និងដំណោះស្រាយមិនមាននៅលើអ៊ីនធឺណិតសាធារណៈ ដែលមានន័យថាភ្នាក់ងារមិនអាចពឹងផ្អែកលើចម្លើយដែលទន្ទេញចាំដែលទាញចេញពីឃ្លាំងសាធារណៈបានទេ។
កិច្ចការក៏នាំឲ្យមានផលវិបាកដល់អាជីវកម្មដែរ។ ភារកិច្ចឧទាហរណ៍របស់តារាងពិន្ទុរួមមានការទទួលបានសិទ្ធិចេញវិក្កយបត្រ ការគណនាពន្ធ និងការផ្ទេរអតិថិជន — ការផ្លាស់ប្តូរដែលប៉ះពាល់ដល់របៀបដែលអាជីវកម្មដំណើរការ ជាញឹកញាប់នៅលើសេវាកម្មជាច្រើន។ ក្រុមហ៊ុននីមួយៗមានអនុសញ្ញា និងវិធីសរសេរកូដរៀងៗខ្លួន ហើយភ្នាក់ងារត្រូវតែយល់អំពីបទដ្ឋានទាំងនោះ និងធ្វើការផ្លាស់ប្តូរដែលដំណើរការជាមួយអ្វីដែលមានរួចហើយ។
"តើភ្នាក់ងារសរសេរកូដពិតជាអាចធ្វើការងាររបស់វិស្វករកម្មវិធីនៅក្នុងពិភពពិតបានទេ?" សេចក្តីណែនាំរបស់គោលដៅសួរ។ តារាងពិន្ទុណែនាំចម្លើយសម្រាប់ពេលនេះគឺ៖ ប្រហែលមួយភាគបីនៃពេលវេលាល្អបំផុត។
តារាងពិន្ទុពេញ
មន្ទីរពិសោធន៍ជាក់លាក់បានវាយតម្លៃការរួមបញ្ចូលគ្នារវាងម៉ូដែល និងខ្សែព្រំដែនចំនួនប្រាំបី ដោយវាស់អត្រាដំណោះស្រាយជា pass@1 ជាមធ្យមលើការរត់ឯករាជ្យចំនួនប្រាំបីក្នុងមួយកិច្ចការ ជាមួយនឹងចន្លោះពេលទំនុកចិត្ត 95 ភាគរយ៖
1. Fable 5.1 (Claude Code) — 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. Gemini 3.8 Flash (Gemini CLI) — 31.2%
4. GLM 5.3 (Claude Code) — 28.8%
5. (ស្មើ) Grok 4.6 (Grok Build) — 23.8%
5. (ស្មើ) Muse Spark 1.3 (Muse Code) — 23.8%
7. Kimi K3 (Kimi Code) — 18.8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%
លទ្ធផលត្រូវបានពិភាក្សាយ៉ាងទូលំទូលាយនៅលើព័ត៌មានរបស់ Hacker កាលពីចុងសប្តាហ៍ ដែលគោលពិន្ទុបានទាក់ទាញសំឡេងគាំទ្ររាប់រយ និងការជជែកដេញដោលយ៉ាងរស់រវើកអំពីថាតើការវាយតម្លៃមូលដ្ឋានកូដឯកជនគឺជាផ្លូវត្រឹមត្រូវសម្រាប់ដំណើរការភ្នាក់ងារ។
ការរីករាលដាលតូចចង្អៀត ប៉ុន្តែមានអត្ថន័យនៅកំពូល
គម្លាតរវាងប្រព័ន្ធកំពូលទាំងបួនគឺគួរឱ្យកត់សម្គាល់សម្រាប់អ្វីដែលវានិយាយអំពីទិដ្ឋភាពប្រកួតប្រជែងបច្ចុប្បន្ន។ ការនាំមុខ 5 ពិន្ទុរបស់ Fable 5.1 លើ OpenAI's GPT-6 Astra មានអត្ថន័យនៅលើស្តង់ដារមួយដែលរាល់កិច្ចការគឺជាបញ្ហាផលិតកម្មពិតប្រាកដ។ Gemini 3.8 Flash ទទួលបានចំណាត់ថ្នាក់លេខ 3 គឺមានភាពទាក់ទាញ ចាប់តាំងពីម៉ូដែលនេះត្រូវបានដាក់ជាម៉ាស៊ីនធ្វើការលឿន និងមានតម្លៃទាប ជាជាងប្រព័ន្ធហេតុផលដ៏ល្បីមួយ។ GLM 5.3 របស់ Z.ai ដែលត្រូវបានវាយតម្លៃតាមរយៈ Claude Code ការចុះចតក្នុងរង្វង់ប្រាំចំណុចនៃអ្នកដឹកនាំគូសបញ្ជាក់ពីរបៀបដែលគំរូទម្ងន់បើកចំហដែលមានការប្រកួតប្រជែងបានក្លាយទៅជាការងារវិស្វកម្មជាក់ស្តែង។
ការប្រាប់ស្មើគ្នាគឺការរីករាលដាលនៅខាងក្រោម។ GPT-5.6 Sol ដែលជាការចេញផ្សាយ OpenAI មុននេះ ដោះស្រាយកិច្ចការតិចជាងពាក់កណ្តាលដូច Fable 5.1 ដែលជាការរំលឹកអំពីល្បឿននៃការផ្លាស់ប្តូរព្រំដែន ហើយតើការទម្លាក់ចេញអាចគ្រាន់តែជាជំនាន់គំរូមួយត្រឡប់មកវិញ។
ខ្សែពាក់សំខាន់ដូចម៉ូដែល
ជម្រើសនៃវិធីសាស្រ្តស្តង់ដារមួយគឺទាក់ទាញការយកចិត្តទុកដាក់៖ ជាជាងការវាយតម្លៃគំរូក្នុងភាពឯកោ ក្រុមហ៊ុន Real-SWE ប្រើខ្សែពីកំណើត — Claude Code, Codex CLI, Gemini CLI, Grok Build — ដើម្បីឆ្លុះបញ្ចាំងពីរបៀបដែលវិស្វករសហគ្រាសពិតជាធ្វើការក្នុងការអនុវត្តជាក់ស្តែង។ តារាងពិន្ទុបានចាត់ថ្នាក់យ៉ាងច្បាស់លាស់នូវការរួមបញ្ចូលគ្នារវាងម៉ូដែល និងខ្សែ ដោយទទួលស្គាល់ថា ការដាក់រន្ទា ការចូលប្រើឧបករណ៍ និងរង្វិលជុំម្តងទៀតឥឡូវនេះមិនអាចបំបែកចេញពីសមត្ថភាពគំរូនៅក្នុងការដាក់ឱ្យប្រើប្រាស់ជាក់ស្តែង។
ស៊ុមនោះមានសារៈសំខាន់សម្រាប់សហគ្រាសជ្រើសរើសប្រព័ន្ធ។ ម៉ូដែលដូចគ្នាអាចដំណើរការខុសគ្នាខ្លាំង អាស្រ័យលើខ្សែភ្នាក់ងារដែលរុំជុំវិញវា ហើយអ្នកទិញដែលវាយតម្លៃអ្នកជំនួយការសរសេរកូដលើលេខស្តង់ដារសាធារណៈអាចនឹងទទួលបានរូបភាពដែលបង្ខូចទ្រង់ទ្រាយនៃរបៀបដែលប្រព័ន្ធទាំងនោះនឹងមានឥរិយាបទនៅលើមូលដ្ឋានកូដផ្ទាល់ខ្លួនរបស់ពួកគេ។
តើវាមានន័យយ៉ាងណាសម្រាប់ឧស្សាហកម្ម
Benchmarks ត្រូវបានគេចោទប្រកាន់ម្តងហើយម្តងទៀតអំពីភាពឆ្អែត ដោយម៉ូដែលជួរមុខប្រកាសពិន្ទុជិតគ្រប់លក្ខណៈលើការធ្វើតេស្តសាធារណៈដែលលេចធ្លាយទៅក្នុងទិន្នន័យបណ្តុះបណ្តាល។ ការរចនារបស់ Real-SWE ព្យាយាមទប់ទល់នឹងបញ្ហាទាំងពីរក្នុងពេលតែមួយ៖ លេខកូដមានលក្ខណៈឯកជន និងមានអាជ្ញាប័ណ្ណ ការងារគឺជាផលិតផលការងារពិតប្រាកដរបស់ក្រុមវិស្វកម្ម ហើយការណែនាំឆ្លុះបញ្ចាំងពីភាពរញ៉េរញ៉ៃនៃសំបុត្រពិតប្រាកដ ជាជាងការបញ្ជាក់អំពីបញ្ហា។
ការយកចេញដោយមានការភ្ញាក់ផ្អើលគឺជាកម្រិតដាច់ខាត។ សូម្បីតែប្រព័ន្ធល្អបំផុតដោះស្រាយតិចជាងបួនក្នុងដប់កិច្ចការសហគ្រាសពិតប្រាកដនៅលើការប៉ុនប៉ងលើកដំបូង ជាមធ្យមជាងប្រាំបីដំណើរការ។ សម្រាប់វឌ្ឍនភាពទាំងអស់នៃការសរសេរកូដភ្នាក់ងារ ស្តង់ដារណែនាំថាវិស្វកម្មកម្មវិធីស្វយ័តលើប្រព័ន្ធផលិតកម្មពិតប្រាកដនៅតែជាសកម្មភាពត្រួតពិនិត្យ - មួយដែលវិស្វករមនុស្សពិនិត្យមើល ប្តូរទិស និងជួសជុលញឹកញាប់ជាងការបង្ហាញរបស់អ្នកលក់។
សម្រាប់សហគ្រាសដែលជ្រើសរើសក្នុងចំណោមអ្នកជំនួយការសរសេរកូដ ស្តង់ដារផ្តល់នូវបញ្ជីត្រួតពិនិត្យជាក់ស្តែងមួយ៖ ចូលចិត្តប្រព័ន្ធដែលវាយតម្លៃលើលេខកូដឯកជន ទទូចលើចន្លោះពេលទំនុកចិត្តជាជាងលេខចំណងជើងដែលដំណើរការតែមួយ និងគុណភាពនៃទម្ងន់ធ្ងន់ដូចសមត្ថភាពគំរូដើម។ តារាងពិន្ទុដំបូងរបស់ Real-SWE នឹងមិនមែនជាពាក្យចុងក្រោយទេ ប៉ុន្តែវាគឺជាចម្លើយផ្ទាល់បំផុតចំពោះសំណួរដែលអ្នកដឹកនាំវិស្វកម្មទាំងអស់កំពុងសួរអំពីការសរសេរកូដភ្នាក់ងារ។
សម្រាប់ព័ត៌មានបន្ថែមអំពីភ្នាក់ងារសរសេរកូដ ការចេញផ្សាយគំរូ និងការស្រាវជ្រាវដែលកំណត់ពួកវា សូមតាមដានព័ត៌មាន AI ចុងក្រោយបង្អស់ នៅពេលដែលលទ្ធផលគោលបន្ទាប់មកដល់។
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →