ភ្នាក់ងារ AI ឥឡូវនេះអាចបញ្ចប់ការងារឯករាជ្យពិតប្រាកដចំនួន 16 ភាគរយនៅកម្រិតគុណភាពដែលអតិថិជនបង់ប្រាក់នឹងទទួលយក នេះបើយោងតាមលទ្ធផលចុងក្រោយពីសន្ទស្សន៍ការងារពីចម្ងាយ - ច្រើនជាងបួនដងនៃអត្រាដែលបានកត់ត្រាកាលពីប្រាំបីខែមុន។ ការរកឃើញនេះផ្តល់នូវវិធានការជាក់ស្តែងបំផុតមួយ ដែលមិនទាន់ដឹងពីរបៀបដែលប្រព័ន្ធ AI ស្វយ័តកំពុងរំលោភបំពានលើការងារច្នៃប្រឌិត និងបច្ចេកទេសប្រកបដោយវិជ្ជាជីវៈ។

សន្ទស្សន៍ការងារពីចម្ងាយ (RLI) ដែលបង្កើតឡើងដោយមជ្ឈមណ្ឌលសម្រាប់សុវត្ថិភាព AI សហការជាមួយ Scale Labs តាមដានថាតើភ្នាក់ងារ AI អាចបញ្ចប់គម្រោងឯករាជ្យដែលមានតម្លៃពាណិជ្ជកម្មតាមគុណភាពវិជ្ជាជីវៈញឹកញាប់ប៉ុណ្ណា។ ស្តង់ដារគ្របដណ្តប់លើវិស័យនានា រួមទាំងការរចនា 3D និង CAD ស្ថាបត្យកម្ម ការរចនាក្រាហ្វិក វីដេអូ និងចលនា ការផលិតអូឌីយ៉ូ ការវិភាគទិន្នន័យ និងការអភិវឌ្ឍន៍កម្មវិធីគេហទំព័រ។ វាវាយតម្លៃគម្រោងចំនួន 240 ដែលមានតម្លៃសរុប $144,000 ដែលមានប្រភពមកពីអ្នកឯករាជ្យដែលបានផ្ទៀងផ្ទាត់ចំនួន 358 ។ អ្នកវាយតម្លៃមនុស្សដាក់ពិន្ទុលើលទ្ធផលនីមួយៗធៀបនឹងស្តង់ដារមាសដែលបង្កើតឡើងដោយអ្នកជំនាញដែលមានប្រាក់ខែ ដោយផ្តល់នូវរូបថតជាក់ស្តែងនៃសមត្ថភាពដែលកំពុងរីកចម្រើនរបស់ [AI Industry's] (https://aibuzzwire.news)។

លេខ៖ ព្រំដែនដែលច្រើនជាងបួនដង

នៅពេលដែលស្តង់ដារដាក់ឱ្យដំណើរការជាលើកដំបូង ភ្នាក់ងារ AI ដ៏ល្អបំផុតបានដំណើរការដោយស្វ័យប្រវត្តិត្រឹមតែ 2.5 ភាគរយនៃគម្រោងប៉ុណ្ណោះ។ យោងតាមលទ្ធផលចុងក្រោយ ម៉ូដែល Anthropic's Fable 5 ឥឡូវនេះទទួលបាន 16.1 ភាគរយ ដែលជាពិន្ទុខ្ពស់បំផុតមិនធ្លាប់មាននៅលើសន្ទស្សន៍។ នោះគឺប្រហែលពីរដងនៃ Opus 4.8 របស់ 8.3 ភាគរយ ហើយល្អជាង GPT-5.5 របស់ 6.3 ភាគរយ។

ម៉ូដែល Frontier ទាំងបីបានយកឈ្នះរាល់ប្រព័ន្ធដែលបានសាកល្បងពីមុន។ អ្នកដឹកនាំមុន Opus 4.6 ដែលដំណើរការលើក្របខ័ណ្ឌ Claude Cowork បានអង្គុយនៅ 4.17 ភាគរយ។ ព្រំដែននៃសមត្ថភាពស្វ័យប្រវត្តិកម្មមានច្រើនជាងបួនដងក្នុងរយៈពេលតិចជាងប្រាំបីខែនេះបើយោងតាមអ្នកនិពន្ធរបស់គោល។

ទោះជាយ៉ាងណាក៏ដោយ លទ្ធផលមិនផ្លាស់ទីក្នុង lockstep ជាមួយនឹងកាលបរិច្ឆេទចេញផ្សាយនោះទេ។ នៅលើតារាងពិន្ទុពេញរបស់ Scale Labs Gemini 3 Pro ថ្មីជាងនេះទៅជិតបាតត្រឹមតែ 1.25 ភាគរយប៉ុណ្ណោះ ដែលតាមពីក្រោយប្រព័ន្ធចាស់ៗជាច្រើន។ នេះបង្ហាញថាសមត្ថភាពគំរូឆៅមិនបកប្រែដោយស្វ័យប្រវត្តិទៅជាប្រភេទនៃការប្រើប្រាស់ឧបករណ៍ និងជំនាញហេតុផលដែលត្រូវការសម្រាប់ការងារដែលមានជំនាញវិជ្ជាជីវៈស្មុគស្មាញនោះទេ។

របៀប Benchmark ដំណើរការ

ដើម្បីអនុញ្ញាតឱ្យម៉ូដែលបង្ហាញសមត្ថភាពពេញលេញរបស់ពួកគេ ក្រុមការងារដំណើរការពួកវានៅក្នុងឧបករណ៍អភិវឌ្ឍន៍ដូចគ្នាដែលវិស្វករប្រើប្រាស់ប្រចាំថ្ងៃ រួមទាំង Claude Code និង Codex CLI ផងដែរ។ បរិស្ថានទាំងនេះត្រូវបានពង្រីកជាមួយនឹងសមត្ថភាពក្នុងការដំណើរការកម្មវិធីក្រាហ្វិកដោយផ្ទាល់។

ភ្នាក់ងារ AI នីមួយៗដំណើរការនៅក្នុងម៉ាស៊ីនលីនុចនិម្មិតដែលផ្ទុកដោយកម្មវិធីជំនាញជាង 30 រួមទាំង Blender សម្រាប់ម៉ូដែល 3D, GIMP សម្រាប់កែសម្រួលរូបភាព និង Audacity សម្រាប់ការផលិតសំឡេង។ គម្រោងត្រូវបានផ្តល់ឱ្យរហូតដល់ 24 ម៉ោងនៃពេលវេលាគណនា - យូរជាងអន្តរកម្ម chatbot ធម្មតា។

ការរៀបចំនេះក៏ប្រើរង្វិលជុំរិះគន់ផងដែរ៖ ភ្នាក់ងារ AI ទីពីរពិនិត្យមើលលទ្ធផលយ៉ាងធ្ងន់ធ្ងរដូចអតិថិជនដែលទាមទារ ហើយភ្នាក់ងារទីមួយនឹងកែប្រែការងាររបស់ខ្លួនដោយផ្អែកលើមតិកែលម្អនោះ។ នេះឆ្លុះបញ្ចាំងពីដំណើរការដដែលៗដែលអ្នកឯករាជ្យរបស់មនុស្សធ្វើតាមនៅពេលធ្វើការចម្រាញ់ទំនិញដែលអាចចែកចាយបាន។

កន្លែងដែល AI នៅតែធ្លាក់ចុះ

ទោះបីជាមានការរីកចម្រើនយ៉ាងឆាប់រហ័សក៏ដោយ ភ្នាក់ងារ AI នៅតែបរាជ័យក្នុងការវាយលុកគុណភាពវិជ្ជាជីវៈលើគម្រោងភាគច្រើន។ ការបង្ហោះប្លក់របស់គោលបង្ហាញពីឧទាហរណ៍ជាក់លាក់ដែលសូម្បីតែលទ្ធផលរបស់ម៉ូដែលកំពូលនឹងមិនឆ្លងកាត់ជាការងារដែលបានបញ្ចប់។

នៅលើភារកិច្ចរចនាចិញ្ចៀន Fable 5 បានបង្កើតលទ្ធផលដែលច្បាស់ជាងការប៉ុនប៉ង AI ពីមុន ប៉ុន្តែនៅតែមើលទៅមិនមានជំនាញវិជ្ជាជីវៈលើការត្រួតពិនិត្យយ៉ាងជិតស្និទ្ធ។ នៅលើគម្រោងស្ថាបត្យកម្ម GPT-5.5 បានក្លែងបន្លំការបង្ហាញដ៏ទាក់ទាញដោយប្រើម៉ាស៊ីនបង្កើតរូបភាព ខណៈដែលគំរូ 3D មូលដ្ឋានពិតប្រាកដរបស់វានៅតែមានកំហុស ដែលជាផ្លូវកាត់ដែលអតិថិជនបង់ប្រាក់នឹងរកឃើញដោយគ្រាន់តែបើកឯកសារប្រភពប៉ុណ្ណោះ។

កិច្ចការស្មុគ្រស្មាញមួយក្នុងចំនោមកិច្ចការដែលមានលក្ខណៈស្មុគ្រស្មាញជាងនេះទៅទៀតនៅក្នុងតារាងពិន្ទុស្នើឱ្យភ្នាក់ងារបង្កើតផែនការជាន់ដែលមានវិមាត្រ ជម្រើសប្លង់គ្រឿងសង្ហារឹម និងការបង្ហាញបន្ទប់ទឹកជាក់ស្តែងពីផែនការសុរិយោដីដែលបានស្កេន រូបថតគេហទំព័រ និងការវាស់វែង។ ដំណើរការការងារពហុជំហាននេះ ដែលទាមទារទាំងភាពជាក់លាក់បច្ចេកទេស និងការវិនិច្ឆ័យប្រកបដោយភាពច្នៃប្រឌិត នៅតែជាបញ្ហាប្រឈមដ៏សំខាន់សម្រាប់ប្រព័ន្ធបច្ចុប្បន្ន។

ចៅក្រម AI វាយតម្លៃដោយសប្បុរសពេក

ក្រុមស្រាវជ្រាវក៏បានធ្វើតេស្តផងដែរថាតើការវាយតម្លៃរបស់មនុស្សមានតម្លៃថ្លៃអាចត្រូវបានជំនួសដោយចៅក្រម AI ដែរឬទេ។ ចម្លើយគឺច្បាស់លាស់៖ អ្នកវាយតម្លៃ AI បានវាយតម្លៃម៉ូដែលថ្មីយ៉ាងសប្បុរសពេកហើយ។ សម្រាប់ GPT-5.5 ពិន្ទុរបស់ចៅក្រម AI គឺខ្ពស់ពេកជិតបីដង។ សម្រាប់ Opus 4.8 វាមានប្រហែល 2 ដងកន្លះខ្ពស់ពេក។

ខណៈ​ដែល​ចៅក្រម​ស្វ័យប្រវត្តិ​បាន​ទទួល​លំដាប់​ថ្នាក់​រួម​ត្រឹម​ត្រូវ លេខ​ពិត​ប្រាកដ​បាន​កើន​ឡើង​យ៉ាង​ខ្លាំង។ មជ្ឈមណ្ឌលសម្រាប់សុវត្ថិភាព AI បានពន្យល់ពីហេតុផល៖ ដើម្បីវិនិច្ឆ័យការងារដោយយុត្តិធម៌ អ្នកវាយតម្លៃត្រូវតែបើកឯកសារនៅក្នុងកម្មវិធីដែលមានជំនាញវិជ្ជាជីវៈត្រឹមត្រូវ ដំណើរការកម្មវិធីនោះឱ្យបានត្រឹមត្រូវ និងបង្កើតការវិនិច្ឆ័យដូចអតិថិជនដែលបង់ប្រាក់។ ប្រភេទនៃការប្រើប្រាស់កម្មវិធីដោយដៃនោះ គឺជាអ្វីដែលភ្នាក់ងារ AI បច្ចុប្បន្នតស៊ូជាមួយភាគច្រើន។

គួរឱ្យអស់សំណើចគឺជាការណែនាំ៖ ចៅក្រម AI រត់ចូលទៅក្នុងដែនកំណត់ដូចគ្នានឹងបុគ្គលិក AI ដែលវាត្រូវបានគេសន្មត់ថាវាយតម្លៃ។ ការបង្ហាញក្លែងក្លាយរបស់ GPT-5.5 គឺជាករណីមួយ — ការចាប់យកការបោកប្រាស់តម្រូវឱ្យបើកគំរូ 3D និងពិនិត្យមើលធរណីមាត្រពិតប្រាកដ ដែលជាភារកិច្ចដែលចៅក្រម AI មិនអាចអនុវត្តបានដោយភាពជឿជាក់។

The Caveat: ការរឹតបន្តឹងរបស់រដ្ឋាភិបាល

ការព្រមានដ៏សំខាន់មួយត្រូវបានអនុវត្តចំពោះពិន្ទុនាំមុខរបស់ Fable 5 ។ មានតែគម្រោងចំនួន 218 នៃគម្រោងចំនួន 240 ប៉ុណ្ណោះដែលអាចត្រូវបានគេវាយតម្លៃ មុនពេលដែលរដ្ឋាភិបាលសហរដ្ឋអាមេរិកដាក់កម្រិតលើការចូលប្រើគំរូនេះ។ សូម្បីតែនៅក្នុងសេណារីយ៉ូករណីដ៏អាក្រក់បំផុត ដែល Fable 5 បរាជ័យរាល់គម្រោងដែលនៅសេសសល់ អត្រាស្វ័យប្រវត្តិកម្មរបស់វានឹងនៅតែ 14.6 ភាគរយ - ខ្ពស់ជាងម៉ូដែលផ្សេងទៀតដែលបានសាកល្បង។

ការរឹតបន្តឹងរបស់រដ្ឋាភិបាលដែលភ្ជាប់ទៅនឹងការព្រួយបារម្ភអំពីសន្តិសុខជាតិអំពីម៉ូដែល Mythos-class បានដាក់កម្រិតលើបង្អួចវាយតម្លៃ ប៉ុន្តែមិនបានធ្វើឱ្យខូចដល់ការរកឃើញជាមូលដ្ឋាននោះទេ៖ ភ្នាក់ងារ AI កំពុងខិតជិតដល់ចំណុចដែលពួកគេអាចគ្រប់គ្រងចំណែកដ៏មានអត្ថន័យនៃការងារឯករាជ្យអាជីព។

សម្រាប់​អ្នក​ឯករាជ្យ និន្នាការ​នេះ​កំពុង​មាន​ភាព​ស្ងប់ស្ងាត់ ប៉ុន្តែ​មិន​ទាន់​មាន​មហន្តរាយ​នៅ​ឡើយ​ទេ។ AI នៅតែបរាជ័យលើគម្រោងចំនួន 84 ភាគរយ ហើយឧទាហរណ៍របស់គោលបង្ហាញថា សូម្បីតែលទ្ធផលជោគជ័យ ជារឿយៗទាមទារការពិនិត្យឡើងវិញប្រកបដោយវិជ្ជាជីវៈ។ ប៉ុន្តែជាមួយនឹងអត្រាស្វ័យប្រវត្តិកម្មច្រើនជាងបួនដងក្នុងរយៈពេលតិចជាងមួយឆ្នាំ គន្លងគឺច្បាស់។ សំណួរគឺមិនមានទៀតទេថាតើភ្នាក់ងារ AI នឹងប្រកួតប្រជែងសម្រាប់ការងារឯករាជ្យ ប៉ុន្តែតើពួកគេនឹងបិទគម្លាតដែលនៅសល់បានលឿនប៉ុណ្ណា។

នាំមុខ AI

ទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។

អានព័ត៌មាន AI បន្ថែម →