OpenAI កំពុងរុញត្រឡប់មកវិញបន្ទាប់ពី Claude Opus 5 របស់ Anthropic បានគ្របដណ្តប់លើស្តង់ដារ ARC-AGI-3 ដោយបានចេញផ្សាយលទ្ធផលដែលបង្ហាញពីគំរូ GPT-5.6 Sol ផ្ទាល់ខ្លួនរបស់វាដែលឈានដល់ 38.3 ភាគរយ — ផ្តល់ឱ្យអ្នកនូវការកំណត់ដែលចូលចិត្តរបស់ OpenAI ជាជាងខ្សែសាកល្បងផ្លូវការ។

វិវាទដែលបានកើតឡើងនៅថ្ងៃទី 30 ខែកក្កដា ឆ្នាំ 2026 កាត់ចេញពីបេះដូងនៃបញ្ហាដែលកំពុងកើនឡើងនៅក្នុងការវាយតម្លៃ AI៖ ស្តង់ដារលែងវាស់វែងគ្រាន់តែជាគំរូប៉ុណ្ណោះ ប៉ុន្តែរន្ទាបច្ចេកទេសទាំងមូលបានរុំព័ទ្ធវា។ សម្រាប់ការវិភាគកាន់តែស៊ីជម្រៅនៃ [ការអភិវឌ្ឍន៍ AI ចុងក្រោយបំផុត] (https://aibuzzwire.news) និងការចេញផ្សាយគំរូ AI Buzz Wire កំពុងតាមដានរឿងនេះ។

លេខនិងចាប់

OpenAI បានរាយការណ៍ថា GPT-5.6 Sol ឈានដល់ 38.3 ភាគរយនៅលើ ARC-AGI-3 ដោយបានឆ្លងកាត់ Claude Opus 5 របស់ Anthropic ដែលមានពិន្ទុ 30.2 ភាគរយបន្ទាប់ពីបានបំបែកកំណត់ត្រាគោលបួនដងពីមុន។ ការព្រមានគឺសំខាន់: តួលេខ 38.3 ភាគរយអាស្រ័យលើលក្ខណៈពិសេសជាក់លាក់ពីរនៃ Responses API របស់ OpenAI ។

ទីមួយគឺ Retained Reasoning ដែលរក្សាខ្សែសង្វាក់នៃការគិតរបស់គំរូរវាងជំហានជាជាងការបោះបង់វាចោលបន្ទាប់ពីសកម្មភាពនីមួយៗ។ ទីពីរគឺ ការបង្រួម ដែលសង្ខេបបរិបទចាស់ៗជំនួសឱ្យការកាត់វា ដែលអនុញ្ញាតឱ្យគំរូបន្តធ្វើការលើបញ្ហាយូរដោយមិនបាត់បង់ហេតុផលពីមុន។

ដំណើរការតាមរយៈខ្សែស្ដង់ដារផ្លូវការរបស់ ARC Prize ដែលជៀសវាងការកំណត់ជាក់លាក់របស់អ្នកផ្តល់សេវា ដើម្បីធានាបាននូវការប្រៀបធៀបពីផ្លែប៉ោមទៅផ្លែប៉ោម — GPT-5.6 Sol គ្រប់គ្រងត្រឹមតែ 7.8 ភាគរយប៉ុណ្ណោះ។ ហេតុផល OpenAI អះអាងថា ការរៀបចំជាផ្លូវការបានបោះបង់ការវែកញែករបស់គំរូបន្ទាប់ពីគ្រប់ជំហាន ដោយធ្វើឱ្យដំណើរការលើការងារដែលទាមទារការគិតច្រើនជំហានប្រកបដោយនិរន្តរភាព។

ស្ដង់ដារដែលបង្កើតឡើងសម្រាប់ភាពបរិសុទ្ធ

ARC-AGI-3 ត្រូវបានរចនាឡើងដោយ François Chollet និងក្រុម ARC Prize ដើម្បីស៊ើបអង្កេតសមត្ថភាពរបស់គំរូក្នុងការដោះស្រាយល្បែងផ្គុំរូបហេតុផលប្រលោមលោកដែលវាមិនធ្លាប់ឃើញពីមុនមក ដែលជាការសាកល្បងនៃភាពវៃឆ្លាតទូទៅជាជាងការទន្ទេញចាំចំណេះដឹង។ ដើម្បីរក្សាការប្រៀបធៀបដោយស្មើភាព ខ្សែផ្លូវការមានចេតនាដកចេញនូវលក្ខណៈពិសេសជាក់លាក់របស់អ្នកផ្តល់សេវា ដោយវាស់ស្ទង់សមត្ថភាពគំរូឆៅនៅក្នុងបរិយាកាសអព្យាក្រឹត។

ទឡ្ហីករណ៍របស់ OpenAI គឺថាអព្យាក្រឹតភាពនេះអាចក្លាយជាជនពិការ។ ក្រុមហ៊ុនអះអាងថា ខ្សែសង្វាក់ផ្លូវការពឹងផ្អែកលើ "OpenAI-style completions API" ចាស់ដែលខ្វះសមត្ថភាពដែល Claude API ផ្តល់ជូនរួចហើយ ដោយដាក់ OpenAI ប្រកបដោយប្រសិទ្ធភាពនូវគុណវិបត្តិរចនាសម្ព័ន្ធទាក់ទងនឹង Anthropic ក្នុងការប្រៀបធៀបដើម។

សរុបមក OpenAI កំពុងនិយាយថា៖ អ្នកបានវាស់គំរូរបស់យើងជាមួយនឹងដៃម្ខាងចងនៅខាងក្រោយខ្នងរបស់វា។

ការឆ្លើយតបរបស់ Chollet

សហស្ថាបនិករង្វាន់ ARC លោក François Chollet បានឆ្លើយតបដោយការគូសបន្ទាត់ច្បាស់លាស់រវាងការដំឡើងតេស្តពីរប្រភេទ។ លោក​បាន​បន្ត​ថា ខ្សែ "ផលិត​តាម​បំណង​ដើម្បី​ដោះស្រាយ​គោល​ឬ​ដែល​មាន​ចំណេះ​ដឹង​អំពី​ទម្រង់​គោល" គឺ​នៅ​មាន​ដែន​កំណត់។ ប៉ុន្តែការកំណត់ API គោលបំណងទូទៅ "ដែលមិនត្រូវបានបង្កើតឡើងសម្រាប់ ARC-AGI-3 ហើយដែលមានសម្រាប់អ្នកប្រើប្រាស់ API ទាំងអស់" គឺជាហ្គេមយុត្តិធម៌។

ជាធរមាន Chollet បានទទួលស្គាល់ថាពិន្ទុ GPT-5.6 Sol ផ្ទាល់របស់ ARC Prize ធ្វើឱ្យ OpenAI មានគុណវិបត្តិ។ លោកបានកត់សម្គាល់ថាអង្គការមាន "ការត្រលប់មកវិញជាច្រើនជាមួយ OpenAI អំពីរបៀបធ្វើតេស្តម៉ូដែលរបស់ពួកគេឱ្យល្អបំផុត ជាពិសេសទាក់ទងនឹងការបង្រួម" ហើយបានស្វាគមន៍ក្រុមហ៊ុន "ចាប់ផ្តើមស្វែងរកចម្លើយ" ។

Chollet បាន​លើក​ឡើង​នូវ​ការ​ព្រួយ​បារម្ភ​មួយ​ដែល​នៅ​សេសសល់។ អ្នកផ្តល់សេវាផ្សេងគ្នាដោយប្រើការកំណត់ផ្សេងគ្នាបង្កើតនូវអ្វីដែលគាត់ហៅថា "បញ្ហាស្មើគ្នាដែលអាចកើតមាន" ប៉ុន្តែគាត់ចាត់ទុកថាអាចទទួលយកបាន "ដរាបណាការកំណត់ និងការចំណាយត្រូវបានរាយការណ៍យ៉ាងច្បាស់។"

ហេតុអ្វីរឿងនេះសំខាន់លើសពីតារាងពិន្ទុ

វគ្គនេះគូសបញ្ជាក់ពីភាពតានតឹងដែលកំពុងផ្លាស់ប្តូររបៀបដែលឧស្សាហកម្ម AI វាយតម្លៃវឌ្ឍនភាព។ ដោយសារម៉ូដែលត្រូវបានដាក់ពង្រាយកាន់តែខ្លាំងឡើងតាមរយៈ APIs ដែលសំបូរទៅដោយលក្ខណៈពិសេស ជាជាងជាប្រព័ន្ធឯកត្តជន បន្ទាត់រវាងសមត្ថភាពដែលមានស្រាប់របស់ម៉ូដែល និងវិស្វកម្មនៅជុំវិញវានៅតែមិនច្បាស់។ ស្តង់ដារដែលមិនអើពើនឹងរន្ទាអាចធ្វើឲ្យដំណើរការជាក់ស្តែងក្នុងពិភពពិត។ មួយដែលទទួលយកវាអាចផ្តល់រង្វាន់ដល់ក្រុមហ៊ុនសម្រាប់ការលេងហ្គេមសាកល្បង។

ការជជែកដេញដោល ARC-AGI-3 ទំនងជាមិនមែនជាចុងក្រោយទេ។ នៅពេលដែលគំរូព្រំដែនដាក់ចង្កោមនៅជិតកំពូលនៃស្តង់ដារដែលបានបង្កើតឡើង ការខ្វែងគំនិតគ្នាលើអ្វីដែលរាប់ថាជាការវាស់វែងដោយយុត្តិធម៌ - ហើយខ្សែរនៃខ្សែដែលត្រូវកំណត់ស្តង់ដារ - នឹងកាន់តែកើនឡើង។

នាំមុខ AI

ចង់តាមដាន [ព័ត៌មាន AI ថ្មីៗ] (https://aibuzzwire.news) លើម៉ូដែល ស្តង់ដារ និងមន្ទីរពិសោធន៍ដែលសាងសង់ពួកវាទេ? AI Buzz Wire បានគ្របដណ្តប់អ្នក។

អានព័ត៌មាន AI បន្ថែម