អ្នកស្រាវជ្រាវ Nvidia បានបង្កើតប្រព័ន្ធភ្នាក់ងារដែលជំរុញឱ្យ Anthropic's Claude Opus 5 ទទួលបានពិន្ទុ 100% ដ៏ល្អឥតខ្ចោះនៅលើ ARC-AGI-3 ដែលជាស្តង់ដារនៃហេតុផលអន្តរកម្មដែលទាមទារបំផុតមួយនៅក្នុង AI ដោយប្រើគំរូដូចគ្នាដែលមានពិន្ទុ 30% នៅពេលដែលវាដំណើរការដោយខ្លួនឯង។ លទ្ធផលដែលបានចេញផ្សាយកាលពីថ្ងៃសុក្រនៅលើប្លុកបច្ចេកទេសរបស់ Nvidia គឺជាភស្តុតាងដ៏រឹងមាំបំផុតដែលថាកម្មវិធីដែលរុំជុំវិញគំរូព្រំដែនមានសារៈសំខាន់ដូចម៉ូដែលខ្លួនវាដែរ។ សម្រាប់នរណាម្នាក់ដែលតាមដាន [ការអភិវឌ្ឍន៍ AI ចុងក្រោយបំផុត] (https://aibuzzwire.news) វាជាការផ្លាស់ប្តូរមួយនៅក្នុងកន្លែងដែលអត្ថប្រយោជន៍ប្រកួតប្រជែងនៅក្នុងភ្នាក់ងារ AI ពិតរស់នៅ។

ប្រព័ន្ធនេះត្រូវបានគេហៅថា AVO ដែលខ្លីសម្រាប់ប្រតិបត្តិករបំរែបំរួល Agentic ហើយវាគឺជា Nvidia ទទួលយកស្ថាបត្យកម្មគោលបំណងទូទៅសម្រាប់ភ្នាក់ងារស្វយ័តជើងមេឃវែង - AI ដែលអាចបន្តការងារជាច្រើនម៉ោងឬច្រើនថ្ងៃជំនួសឱ្យការឆ្លើយសំណួរតែមួយ។ នៅលើឈុតសាធារណៈ ARC-AGI-3 AVO បានកត់ត្រាពិន្ទុ 100.00 RHAE នៅទូទាំង 25 បរិយាកាសហ្គេម ដោយបំពេញគ្រប់កម្រិត 183 ក្នុងសកម្មភាពបរិស្ថាន 6,624 ដោយប្រើ Claude Opus 5 ជាគំរូផ្នែកខាងក្រោយរបស់វា។

អ្វីដែល ARC-AGI-3 ពិតជាធ្វើតេស្ត

ARC-AGI-3 គឺ​ជា​គំរូ​ហេតុផល​អន្តរកម្ម​ដែល​បង្កើត​ឡើង​ដោយ​មូលនិធិ​រង្វាន់ ARC។ ភ្នាក់ងារ​ត្រូវ​បាន​ទម្លាក់​ទៅ​ក្នុង​បរិយាកាស​ដូច​ហ្គេម​ដែល​មិន​ស្គាល់​ដោយ​គ្មាន​ការ​ណែនាំ គ្មាន​ច្បាប់​ដែល​បាន​ចែង​ និង​គ្មាន​គោលដៅ​ដែល​បាន​បញ្ជាក់។ វាត្រូវតែស្វែងយល់តាមរយៈការសាកល្បង និងកំហុស សន្និដ្ឋានពីរបៀបដែលបរិស្ថានដំណើរការ ស្វែងយល់ថាតើ "ឈ្នះ" មានន័យយ៉ាងណា ហើយបន្ទាប់មកធ្វើសកម្មភាពប្រកបដោយប្រសិទ្ធភាពគ្រប់គ្រាន់ដើម្បីឈានទៅវគ្គបន្ត។

សូចនាករពិន្ទុគោលរបស់ Relative Human Action Efficiency (RHAE) រួមបញ្ចូលការបញ្ចប់ភារកិច្ចជាមួយនឹងសកម្មភាពមួយចំនួនដែលភ្នាក់ងារខ្ជះខ្ជាយទាក់ទងទៅនឹងអ្នកលេងមនុស្សដំបូង។ នោះធ្វើឱ្យវាក្លាយជាការសាកល្បងដ៏ឃោរឃៅនៃស្វ័យភាពដែលមាននិរន្តរភាព៖ ភ្នាក់ងារត្រូវតែចងចាំនូវអ្វីដែលវាបានរៀន ងើបឡើងវិញពីកំហុស និងកំណត់ថវិកាសកម្មភាពរបស់ខ្លួនដោយប្រុងប្រយ័ត្នពេញមួយការរត់។

លេខចំណងជើងរបស់ Nvidia ទទួលបានបរិបទពីការប្រៀបធៀប។ VISTA ដែលជាខ្សែអន្តរកម្មផ្ទាល់ពីមុនដែលធ្លាប់ប្រើ Claude Opus 5 បានបញ្ចប់កម្រិតកំណត់សាធារណៈចំនួន 183 ដូចគ្នានៅក្នុងសកម្មភាពបរិស្ថាន 7,542 ។ AVO ត្រូវការសកម្មភាពតិចជាង 12% ដើម្បីបញ្ចប់ការងារនេះបើយោងតាមការបង្ហោះប្លុករបស់ Nvidia ។

ពីខឺណែល GPU ទៅហ្គេមមិនស្គាល់

AVO មិនត្រូវបានបង្កើតឡើងសម្រាប់ល្បែងផ្គុំរូបទេ។ Nvidia បានបង្ហាញជាលើកដំបូងនូវស្ថាបត្យកម្មនៅលើ GPU-kernel optimization ដែលជាដែនដែលការផ្លាស់ប្តូរកូដតូចអាចបំបែកភាពត្រឹមត្រូវ ឥរិយាបថនៃការចងចាំ និងការបញ្ចូលក្នុងវិធីដែលមិនអាចទាយទុកជាមុនបាន។ នៅក្នុងការសិក្សាមួយផ្តោតទៅលើខឺណែល AVO បានដំណើរការជាបន្តបន្ទាប់រយៈពេលប្រាំពីរថ្ងៃ ស្វែងរកទិសដៅបង្កើនប្រសិទ្ធភាពជាង 500 និងបានប្តេជ្ញាចិត្តកំណែ 40 ខឺណែល។ នៅលើប្រព័ន្ធ NVIDIA DGX B200 លទ្ធផលនៃខឺណែលយកចិត្តទុកដាក់ពហុក្បាលបានដំណើរការ cuDNN រហូតដល់ 3.5% និង FlashAttention-4 រហូតដល់ 10.5% ។ បន្ទាប់មកភ្នាក់ងារបានកែសម្រួលខឺណែលដែលបានវិវត្តរបស់វាទៅជាការចាប់អារម្មណ៍ជាក្រុមក្នុងរយៈពេលប្រហែល 30 នាទីនៃការងារស្វ័យភាពបន្ថែម។

រង្វិលជុំស្នូលដូចគ្នា — ពិនិត្យ រៀបចំផែនការ អនុវត្ត សាកល្បង វាយតម្លៃ — បន្ទាប់មកត្រូវបានចង្អុលបង្ហាញនៅ ARC-AGI-3 ដោយគ្រាន់តែផ្លាស់ប្តូរចំណុចប្រទាក់ភារកិច្ចប៉ុណ្ណោះ។ យន្តការចំនួនពីរបានដំណើរការ។ ទីមួយគឺអង្គចងចាំជាប់លាប់ ដែលរក្សាទុកការអនុវត្តពីមុន លទ្ធផលវាយតម្លៃ លទ្ធផលនៃអ្នកចងក្រង និងទម្រង់កម្មវិធី និងហេតុផលប្រមូលផ្តុំ ដូច្នេះភ្នាក់ងារអាចបន្តពីស្ថានភាពបច្ចុប្បន្នរបស់វា ជាជាងបង្កើតបរិបទឡើងវិញពីទទេ។ ទីពីរគឺជាអ្នកគ្រប់គ្រង ដែលជាភ្នាក់ងារទីពីរដែលឃ្លាំមើលគន្លងទាំងមូល និងធ្វើអន្តរាគមន៍នៅពេលដំណើរការរីកចម្រើន។

អ្នកគ្រប់គ្រងគឺជាអ្នកទម្លាយ

TechCrunch ដែលបានសម្ភាសលោក Adel El Hallak របស់ Nvidia ដែលជាអនុប្រធានផ្នែកផលិតផលនៅក្នុងអង្គភាព AI របស់ក្រុមហ៊ុនបានគូសបញ្ជាក់ពីអ្នកគ្រប់គ្រងថាជាធាតុផ្សំសំខាន់បំផុត។ El Hallak បានប្រាប់ការបោះពុម្ពផ្សាយថា "វាស្ទើរតែដើរតួដូចជា CEO ក្នុងការរុញច្រានភ្នាក់ងារ នៅពេលដែលវាចេញពីទិសដៅ ឬចាប់ផ្តើមស្វែងរកផ្លូវដែលអាចនាំទៅដល់ទីបញ្ចប់ ឬរុករកឡើងវិញនូវផ្លូវដែលវាបានដើរពីមុនមក" El Hallak បានប្រាប់ការបោះពុម្ពផ្សាយ។

គម្លាតនៃការអនុវត្តគឺស្រឡះ។ ការធ្វើតេស្តរបស់ Nvidia បានរកឃើញថា Claude Opus 5 ដោយគ្មានខ្សែស្មុគ្រស្មាញបានគ្រប់គ្រងពិន្ទុ 30% លើ ARC-AGI-3 ដែលជាលទ្ធផលល្អបំផុតក្នុងចំណោមម៉ូដែលទទេដែលបានសាកល្បង ប៉ុន្តែគ្មានកន្លែងណានៅជិតការរត់ពេញលេញនោះទេ។ ម៉ូដែលរបស់ OpenAI ទទួលបានពិន្ទុក្រោម 10% នៅលើគោល ហើយក្រុមហ៊ុនបានបោះពុម្ពផ្សាយការស្រាវជ្រាវផ្ទាល់របស់ខ្លួនកាលពីខែមុនដែលបង្ហាញថាការកែប្រែការកំណត់ខ្សែពីរបានបង្កើនពិន្ទុបីដង។ គ្មាន​ការ​កំណត់​រចនា​សម្ព័ន្ធ​សម្រាប់​តែ​ម៉ូដែល​បាន​មក​ជិត 100% ដែល AVO សម្រេច​បាន​ទេ។

គួរកត់សម្គាល់ថា ការកំណត់រចនាសម្ព័ន្ធ AVO ដំណើរការក្នុងទម្រង់សម្រាប់តែអត្ថបទ៖ ការសង្កេតនីមួយៗត្រូវបានផ្គត់ផ្គង់ជាក្រឡាអត្ថបទ 64x64 ពិតប្រាកដ ដោយគ្មានរូបភាព ឬនិមិត្តសញ្ញារូបភាពដែលបានផ្ញើទៅម៉ូដែលនោះទេ។ អំណាចនៃហេតុផលបានមកពីរង្វិលជុំជុំវិញគំរូ មិនមែនមកពីការយល់ឃើញច្រើនបែបនោះទេ។

ហេតុអ្វីបានជាឧស្សាហកម្មភ្នាល់លើខ្សែ

ការរកឃើញដីចំពេលមានរលកនៃភស្តុតាងដែលថាហេដ្ឋារចនាសម្ព័ន្ធភ្នាក់ងារមិនមែនជាសមត្ថភាពគំរូឆៅ គឺជាឧបសគ្គបច្ចុប្បន្នសម្រាប់ AI ស្វយ័ត។ Databricks បានបោះពុម្ភផ្សាយការស្រាវជ្រាវគោលនៅក្នុងខែកក្កដាដែលបង្ហាញថា harness ប៉ះពាល់យ៉ាងខ្លាំងទាំងការអនុវត្ត និងតម្លៃ។ លោក Ali Ghodsi នាយកប្រតិបត្តិក្រុមហ៊ុន Databricks បានប្រាប់ TechCrunch ថា "អ្នកអាចជ្រើសរើសម៉ូដែលដូចគ្នា ប៉ុន្តែខ្សែផ្សេងគ្នា ហើយអ្នកទទួលបានការចំណាយកាន់តែច្រើន ប្រសិនបើអ្នកប្រើខ្សែខុស" ។ "នោះខ្លួនឯងអាច 2x ការចំណាយរបស់អ្នក" ។

El Hallak បានកំណត់អំណះអំណាងទូលំទូលាយរបស់ Nvidia ទាក់ទងនឹងការបើកចំហរ។ គាត់បាននិយាយថា "យើងជឿជាក់លើការមានភ្នាក់ងារបើកចំហ - ដែលជាកន្លែងដែលអ្នកមានការគ្រប់គ្រងលើខ្សែ ឆ្លងកាត់ហេដ្ឋារចនាសម្ព័ន្ធ ឆ្លងកាត់ពេលដំណើរការ - គឺជាអ្វីដែលតម្រូវឱ្យយើងដឹកនាំប្រព័ន្ធអេកូឆ្ពោះទៅមុខ និងមានសុវត្ថិភាព" ។ Nvidia មានបំណែកនៃបច្ចេកវិទ្យា harness ទំហំបើកចំហក្រោមម៉ាក NeMo របស់ខ្លួន ហើយការស្រាវជ្រាវ AVO ត្រូវបានចងក្រងជាឯកសារនៅក្នុងក្រដាសមួយនៅលើ arXiv ។

ស្តង់ដារដែលមានប្រវត្តិ

ARC-AGI-3 បានក្លាយជាចំណុចប្រទាក់ក្រឡាក្នុងការប្រជែងគ្នានៅមន្ទីរពិសោធន៍ព្រំដែន។ OpenAI ពីមុនបានអះអាងពីលទ្ធផលដ៏រឹងមាំសម្រាប់ម៉ូដែល GPT-5.6 Sol របស់ខ្លួននៅលើតារាងពិន្ទុ ដោយគូរការពិនិត្យលើការកំណត់ការវាយតម្លៃដែលបានប្រើ។ លទ្ធផលរបស់ Nvidia មានការជជែកវែកញែកក្នុងន័យមួយ - វាមិនទាមទារម៉ូដែលឆ្លាតជាងនេះទេ មានតែភ្នាក់ងារដែលមានវិស្វកម្មប្រសើរជាងមុននៅជុំវិញម៉ូដែលដែលមានស្រាប់។

សារសម្រាប់អ្នកអភិវឌ្ឍន៍ និងសហគ្រាសដែលបង្កើតផលិតផលភ្នាក់ងារគឺដោយផ្ទាល់៖ ការជ្រើសរើសគំរូនៅតែជាបញ្ហា ប៉ុន្តែការរចនាប្រព័ន្ធឥឡូវនេះសម្រេចថាតើគំរូព្រំដែនផ្តល់លទ្ធផលខាងមុខឬអត់។ ដូចដែល Nvidia ដាក់វា ការវាយតម្លៃគំរូមិនដូចគ្នានឹងការវាយតម្លៃភ្នាក់ងារទេ ហើយតារាងគោលនៃឆ្នាំ 2026 កំពុងផ្តល់រង្វាន់កាន់តែខ្លាំងឡើងដល់វិស្វករដែលសាងសង់រន្ទា។

នាំមុខ AI

ស្ថាបត្យកម្មភ្នាក់ងារកំពុងដំណើរការលឿនជាងពេលណាទាំងអស់ ហើយគម្លាតរវាងខ្សែល្អ និងខ្សែអាក្រក់ឥឡូវនេះត្រូវបានវាស់ជាពិន្ទុគោល និងប្រាក់ដុល្លារពិត។ [តាមដាន AI Buzz Wire] (https://aibuzzwire.news) សម្រាប់ការគ្របដណ្តប់ប្រចាំថ្ងៃ ដែលត្រូវបានផ្ទៀងផ្ទាត់ប្រភពនៃការស្រាវជ្រាវ AI ស្តង់ដារ និងការចាប់ផ្តើមផលិតផល។

អានព័ត៌មានស្រាវជ្រាវ AI បន្ថែម →