ស្តង់ដារថ្មីដែលហៅថា Real-SWE កំពុងប្រឈមនឹងរបៀបដែលឧស្សាហកម្ម AI វាស់ស្ទង់សមត្ថភាពសរសេរកូដ ហើយលទ្ធផលដំបូងគឺមានភាពរាបទាបសម្រាប់មន្ទីរពិសោធន៍ព្រំដែន។ Anthropic's Fable 5.1 ដែលកំពុងដំណើរការនៅខាងក្នុង Claude Code harness ដឹកនាំក្រុមប្រឹក្សាភិបាលជាមួយនឹងអត្រាដំណោះស្រាយ 38.8% លើកិច្ចការដែលទាញចេញពីមូលដ្ឋានកូដសហគ្រាសក្នុងពិភពពិតឯកជន។ គ្មាន​គំរូ​ដែល​បាន​ធ្វើ​តេស្ត​នោះ​ច្បាស់​ជា ៤០ ភាគរយ​ទេ។

ស្តង់ដារដែលបានចេញផ្សាយក្នុងខែនេះដោយ Specific Labs វាយតម្លៃគំរូ AI ព្រំដែននៅលើមូលដ្ឋានកូដផលិតកម្មឯកជនដែលក្រុមការងារទទួលបានអាជ្ញាប័ណ្ណពីក្រុមហ៊ុនពិត។ អ្នកបង្កើតរបស់វាប្រកែកថា ការងារដែលបង្កើតឡើងដោយអ្នកជំនាញ ឬសំយោគ ទោះជាត្រូវបានរចនាយ៉ាងល្អ មិនមែនជាការងារដែលវិស្វករនៅក្រុមហ៊ុនពិតប្រាកដធ្វើនោះទេ។ For more context on this story, see our ongoing more AI stories.

ហេតុអ្វីបានជាកូដមូលដ្ឋានឯកជនផ្លាស់ប្តូររូបភាព

Real-SWE ខុសពីស្តង់ដារដែលបានបង្កើតឡើងដូចជា SWE-bench នៅលើអ័ក្សពីរ នេះបើយោងតាមអ្នកនិពន្ធរបស់វា៖ វត្ថុបុរាណនៃការសរសេរកូដមូលដ្ឋាន និងភាពជាក់លាក់នៃការណែនាំ។ កិច្ចការនីមួយៗបានមកពីប្រព័ន្ធកម្មសិទ្ធិដែលលេខកូដ និងដំណោះស្រាយមិនមាននៅលើអ៊ីនធឺណិតសាធារណៈ ដែលមានន័យថាភ្នាក់ងារមិនអាចពឹងផ្អែកលើចម្លើយដែលទន្ទេញចាំដែលទាញចេញពីឃ្លាំងសាធារណៈបានទេ។

កិច្ចការ​ក៏​នាំ​ឲ្យ​មាន​ផល​វិបាក​ដល់​អាជីវកម្ម​ដែរ។ ភារកិច្ចឧទាហរណ៍របស់តារាងពិន្ទុរួមមានការទទួលបានសិទ្ធិចេញវិក្កយបត្រ ការគណនាពន្ធ និងការផ្ទេរអតិថិជន — ការផ្លាស់ប្តូរដែលប៉ះពាល់ដល់របៀបដែលអាជីវកម្មដំណើរការ ជាញឹកញាប់នៅលើសេវាកម្មជាច្រើន។ ក្រុមហ៊ុននីមួយៗមានអនុសញ្ញា និងវិធីសរសេរកូដរៀងៗខ្លួន ហើយភ្នាក់ងារត្រូវតែយល់អំពីបទដ្ឋានទាំងនោះ និងធ្វើការផ្លាស់ប្តូរដែលដំណើរការជាមួយអ្វីដែលមានរួចហើយ។

"តើភ្នាក់ងារសរសេរកូដពិតជាអាចធ្វើការងាររបស់វិស្វករកម្មវិធីនៅក្នុងពិភពពិតបានទេ?" សេចក្តី​ណែនាំ​របស់​គោល​ដៅ​សួរ។ តារាងពិន្ទុណែនាំចម្លើយសម្រាប់ពេលនេះគឺ៖ ប្រហែលមួយភាគបីនៃពេលវេលាល្អបំផុត។

តារាងពិន្ទុពេញ

មន្ទីរពិសោធន៍ជាក់លាក់បានវាយតម្លៃការរួមបញ្ចូលគ្នារវាងម៉ូដែល និងខ្សែព្រំដែនចំនួនប្រាំបី ដោយវាស់អត្រាដំណោះស្រាយជា pass@1 ជាមធ្យមលើការរត់ឯករាជ្យចំនួនប្រាំបីក្នុងមួយកិច្ចការ ជាមួយនឹងចន្លោះពេលទំនុកចិត្ត 95 ភាគរយ៖

1. Fable 5.1 (Claude Code) — 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. Gemini 3.8 Flash (Gemini CLI) — 31.2%
4. GLM 5.3 (Claude Code) — 28.8%
5. (ស្មើ) Grok 4.6 (Grok Build) — 23.8%
5. (ស្មើ) Muse Spark 1.3 (Muse Code) — 23.8%
7. Kimi K3 (Kimi Code) — 18.8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%

លទ្ធផលត្រូវបានពិភាក្សាយ៉ាងទូលំទូលាយនៅលើព័ត៌មានរបស់ Hacker កាលពីចុងសប្តាហ៍ ដែលគោលពិន្ទុបានទាក់ទាញសំឡេងគាំទ្ររាប់រយ និងការជជែកដេញដោលយ៉ាងរស់រវើកអំពីថាតើការវាយតម្លៃមូលដ្ឋានកូដឯកជនគឺជាផ្លូវត្រឹមត្រូវសម្រាប់ដំណើរការភ្នាក់ងារ។

ការរីករាលដាលតូចចង្អៀត ប៉ុន្តែមានអត្ថន័យនៅកំពូល

គម្លាតរវាងប្រព័ន្ធកំពូលទាំងបួនគឺគួរឱ្យកត់សម្គាល់សម្រាប់អ្វីដែលវានិយាយអំពីទិដ្ឋភាពប្រកួតប្រជែងបច្ចុប្បន្ន។ ការនាំមុខ 5 ពិន្ទុរបស់ Fable 5.1 លើ OpenAI's GPT-6 Astra មានអត្ថន័យនៅលើស្តង់ដារមួយដែលរាល់កិច្ចការគឺជាបញ្ហាផលិតកម្មពិតប្រាកដ។ Gemini 3.8 Flash ទទួលបានចំណាត់ថ្នាក់លេខ 3 គឺមានភាពទាក់ទាញ ចាប់តាំងពីម៉ូដែលនេះត្រូវបានដាក់ជាម៉ាស៊ីនធ្វើការលឿន និងមានតម្លៃទាប ជាជាងប្រព័ន្ធហេតុផលដ៏ល្បីមួយ។ GLM 5.3 របស់ Z.ai ដែលត្រូវបានវាយតម្លៃតាមរយៈ Claude Code ការចុះចតក្នុងរង្វង់ប្រាំចំណុចនៃអ្នកដឹកនាំគូសបញ្ជាក់ពីរបៀបដែលគំរូទម្ងន់បើកចំហដែលមានការប្រកួតប្រជែងបានក្លាយទៅជាការងារវិស្វកម្មជាក់ស្តែង។

ការប្រាប់ស្មើគ្នាគឺការរីករាលដាលនៅខាងក្រោម។ GPT-5.6 Sol ដែលជាការចេញផ្សាយ OpenAI មុននេះ ដោះស្រាយកិច្ចការតិចជាងពាក់កណ្តាលដូច Fable 5.1 ដែលជាការរំលឹកអំពីល្បឿននៃការផ្លាស់ប្តូរព្រំដែន ហើយតើការទម្លាក់ចេញអាចគ្រាន់តែជាជំនាន់គំរូមួយត្រឡប់មកវិញ។

ខ្សែពាក់សំខាន់ដូចម៉ូដែល

ជម្រើសនៃវិធីសាស្រ្តស្តង់ដារមួយគឺទាក់ទាញការយកចិត្តទុកដាក់៖ ជាជាងការវាយតម្លៃគំរូក្នុងភាពឯកោ ក្រុមហ៊ុន Real-SWE ប្រើខ្សែពីកំណើត — Claude Code, Codex CLI, Gemini CLI, Grok Build — ដើម្បីឆ្លុះបញ្ចាំងពីរបៀបដែលវិស្វករសហគ្រាសពិតជាធ្វើការក្នុងការអនុវត្តជាក់ស្តែង។ តារាងពិន្ទុបានចាត់ថ្នាក់យ៉ាងច្បាស់លាស់នូវការរួមបញ្ចូលគ្នារវាងម៉ូដែល និងខ្សែ ដោយទទួលស្គាល់ថា ការដាក់រន្ទា ការចូលប្រើឧបករណ៍ និងរង្វិលជុំម្តងទៀតឥឡូវនេះមិនអាចបំបែកចេញពីសមត្ថភាពគំរូនៅក្នុងការដាក់ឱ្យប្រើប្រាស់ជាក់ស្តែង។

ស៊ុមនោះមានសារៈសំខាន់សម្រាប់សហគ្រាសជ្រើសរើសប្រព័ន្ធ។ ម៉ូដែលដូចគ្នាអាចដំណើរការខុសគ្នាខ្លាំង អាស្រ័យលើខ្សែភ្នាក់ងារដែលរុំជុំវិញវា ហើយអ្នកទិញដែលវាយតម្លៃអ្នកជំនួយការសរសេរកូដលើលេខស្តង់ដារសាធារណៈអាចនឹងទទួលបានរូបភាពដែលបង្ខូចទ្រង់ទ្រាយនៃរបៀបដែលប្រព័ន្ធទាំងនោះនឹងមានឥរិយាបទនៅលើមូលដ្ឋានកូដផ្ទាល់ខ្លួនរបស់ពួកគេ។

តើវាមានន័យយ៉ាងណាសម្រាប់ឧស្សាហកម្ម

Benchmarks ត្រូវ​បាន​គេ​ចោទ​ប្រកាន់​ម្តង​ហើយ​ម្តង​ទៀត​អំពី​ភាព​ឆ្អែត ដោយ​ម៉ូដែល​ជួរ​មុខ​ប្រកាស​ពិន្ទុ​ជិត​គ្រប់​លក្ខណៈ​លើ​ការ​ធ្វើ​តេស្ត​សាធារណៈ​ដែល​លេច​ធ្លាយ​ទៅ​ក្នុង​ទិន្នន័យ​បណ្តុះបណ្តាល។ ការរចនារបស់ Real-SWE ព្យាយាមទប់ទល់នឹងបញ្ហាទាំងពីរក្នុងពេលតែមួយ៖ លេខកូដមានលក្ខណៈឯកជន និងមានអាជ្ញាប័ណ្ណ ការងារគឺជាផលិតផលការងារពិតប្រាកដរបស់ក្រុមវិស្វកម្ម ហើយការណែនាំឆ្លុះបញ្ចាំងពីភាពរញ៉េរញ៉ៃនៃសំបុត្រពិតប្រាកដ ជាជាងការបញ្ជាក់អំពីបញ្ហា។

ការ​យក​ចេញ​ដោយ​មាន​ការ​ភ្ញាក់​ផ្អើល​គឺ​ជា​កម្រិត​ដាច់​ខាត។ សូម្បីតែប្រព័ន្ធល្អបំផុតដោះស្រាយតិចជាងបួនក្នុងដប់កិច្ចការសហគ្រាសពិតប្រាកដនៅលើការប៉ុនប៉ងលើកដំបូង ជាមធ្យមជាងប្រាំបីដំណើរការ។ សម្រាប់វឌ្ឍនភាពទាំងអស់នៃការសរសេរកូដភ្នាក់ងារ ស្តង់ដារណែនាំថាវិស្វកម្មកម្មវិធីស្វយ័តលើប្រព័ន្ធផលិតកម្មពិតប្រាកដនៅតែជាសកម្មភាពត្រួតពិនិត្យ - មួយដែលវិស្វករមនុស្សពិនិត្យមើល ប្តូរទិស និងជួសជុលញឹកញាប់ជាងការបង្ហាញរបស់អ្នកលក់។

សម្រាប់សហគ្រាសដែលជ្រើសរើសក្នុងចំណោមអ្នកជំនួយការសរសេរកូដ ស្តង់ដារផ្តល់នូវបញ្ជីត្រួតពិនិត្យជាក់ស្តែងមួយ៖ ចូលចិត្តប្រព័ន្ធដែលវាយតម្លៃលើលេខកូដឯកជន ទទូចលើចន្លោះពេលទំនុកចិត្តជាជាងលេខចំណងជើងដែលដំណើរការតែមួយ និងគុណភាពនៃទម្ងន់ធ្ងន់ដូចសមត្ថភាពគំរូដើម។ តារាងពិន្ទុដំបូងរបស់ Real-SWE នឹងមិនមែនជាពាក្យចុងក្រោយទេ ប៉ុន្តែវាគឺជាចម្លើយផ្ទាល់បំផុតចំពោះសំណួរដែលអ្នកដឹកនាំវិស្វកម្មទាំងអស់កំពុងសួរអំពីការសរសេរកូដភ្នាក់ងារ។

សម្រាប់ព័ត៌មានបន្ថែមអំពីភ្នាក់ងារសរសេរកូដ ការចេញផ្សាយគំរូ និងការស្រាវជ្រាវដែលកំណត់ពួកវា សូមតាមដានព័ត៌មាន AI ចុងក្រោយបង្អស់ នៅពេលដែលលទ្ធផលគោលបន្ទាប់មកដល់។

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →