ក្រុមហ៊ុន Benchmarking ការវិភាគសិប្បនិម្មិតបានចេញផ្សាយកំណែ 4.2 នៃសន្ទស្សន៍ភាពវៃឆ្លាតរបស់ខ្លួននៅថ្ងៃទី 4 ខែកញ្ញា ឆ្នាំ 2026 ដែលជាការអាប់ដេតបណ្តោះអាសន្នដែលដំណើរការឡើងវិញពីរបៀបដែលគំរូ AI ព្រំដែនត្រូវបានវាស់វែង ហើយយោងទៅតាមតារាងពិន្ទុថ្មី Anthropic's Claude Fable 5.1 ទទួលបានចំណាត់ថ្នាក់កំពូលជាមួយនឹង OpenAI's GPT-6 Astra-5 ពិន្ទុទីពីរបន្ទាប់ពី GPT-6 Astra-5 របស់ OpenAI ។
ការអាប់ដេតនេះកើតឡើងត្រឹមតែប្រាំបីខែប៉ុណ្ណោះបន្ទាប់ពី Index v4 បានដាក់ឱ្យដំណើរការក្នុងខែមករា ដែលជាការប្រែក្លាយយ៉ាងឆាប់រហ័សខុសពីធម្មតាដែលក្រុមហ៊ុនសន្មតថាជាល្បឿននៃការចេញផ្សាយព្រំដែនថ្មីៗ។ ក្រុមហ៊ុនបានសរសេរនៅក្នុងសេចក្តីប្រកាសរបស់ខ្លួនថា "ជាមួយនឹងព្រំដែនផ្លាស់ប្តូរយ៉ាងឆាប់រហ័សនៅក្នុងសប្តាហ៍កន្លងមកនេះ យើងមានអារម្មណ៍ថាវាមានសារៈសំខាន់ក្នុងការផ្តល់នូវការធ្វើបច្ចុប្បន្នភាពបណ្តោះអាសន្នភ្លាមៗ ដើម្បីធានាថាសន្ទស្សន៍របស់យើងនៅតែពាក់ព័ន្ធ និងមានប្រយោជន៍ដូចដែលធ្លាប់មាន"។
ចំណាត់ថ្នាក់ចំណងជើង
យោងតាមលទ្ធផលដែលបានបោះពុម្ពផ្សាយ Claude Fable 5.1 របស់ Anthropic នាំមុខសន្ទស្សន៍បន្ទាប់មកដោយ OpenAI's GPT-6 Astra ដែលបានធ្វើឱ្យប្រសើរឡើងបួនពិន្ទុលើស GPT-5.6 Sol ។ Meta ជាប់ចំណាត់ថ្នាក់ជាមន្ទីរពិសោធន៍ខ្លាំងបំផុតទីបីនៅលើតារាងពិន្ទុតាមពីក្រោយដោយ SpaceXAI, Moonshot/Kimi, Z.AI និង Google ។
Anthropic និង OpenAI ក៏ចែករំលែករូបភាពប្រសិទ្ធភាពនៃការចំណាយដែលបានធ្វើបច្ចុប្បន្នភាពផងដែរ៖ ក្រុមហ៊ុនទាំងពីរ រួមជាមួយនឹង Meta និង Z.AI កាន់កាប់ Index's "Cost per Task" Pareto frontier ដែលមានន័យថាគ្មានមន្ទីរពិសោធន៍ផ្សេងទៀតដែលផ្តល់ភាពឆ្លាតវៃកាន់តែប្រសើរឡើងសម្រាប់តម្លៃដូចគ្នាក្នុងមួយកិច្ចការដែលបានបញ្ចប់នោះទេ។
នៅលើប្រសិទ្ធភាពសញ្ញាសម្ងាត់ ការវិភាគសិប្បនិម្មិតបានរកឃើញថា GPT-6 Astra "មានប្រសិទ្ធភាពជាងសញ្ញាសម្ងាត់ស្ទើរតែគ្រប់ម៉ូដែលផ្សេងទៀតនៅជិតព្រំដែនស៊ើបការណ៍" ជាមួយនឹង Claude Fable 5.1, Grok 4.5 និង Gemini 3.5 Flash-Lite អង្គុយនៅចុងទាំងពីរនៃខ្សែកោង។ ទោះយ៉ាងណា ក្រុមហ៊ុនបានកត់សម្គាល់នៅក្នុងការវិភាគដៃគូថា ការប្រើប្រាស់សញ្ញាសម្ងាត់ទាបរបស់ Astra គឺលើសពីតម្លៃដែលខ្ពស់ជាងរបស់វា ដែលជាការរំលឹកថាប្រសិទ្ធភាពឆៅ និងការចំណាយសរុបមិនតែងតែផ្លាស់ទីជាមួយគ្នានោះទេ។
តើមានអ្វីផ្លាស់ប្តូរនៅក្នុង v4.2
ការផ្លាស់ប្តូររចនាសម្ព័ន្ធដ៏សំខាន់បំផុតគឺការជំរុញដោយចេតនាប្រឆាំងនឹងការលេងហ្គេមគោល។ សែសិបភាគរយនៃទម្ងន់របស់សន្ទស្សន៍ឥឡូវនេះបានមកពីសំណុំតេស្តឯកជនដែលទុកចោល - ចែករំលែកទ្វេដងនៅក្នុង v4.1 - រួមទាំង AA-Briefcase, AA-Omniscience និងដំណោះស្រាយសម្រាប់ CritPt ។ ក្រុមហ៊ុនបាននិយាយថាតួលេខនេះនឹងកើនឡើងបន្ថែមទៀតនៅក្នុង Index v5 ។
ការវាយតម្លៃថ្មីចំនួនពីរ បន្តការអាប់ដេត៖
- AA-Briefcase ដែលជាស្តង់ដារការងារចំណេះដឹងភ្នាក់ងារក្នុងផ្ទះជាមួយនឹងសំណុំតេស្តឯកជនដែលទុកចោល។ គំរូត្រូវបានវាយតម្លៃលើគម្រោងដែលមានជំនាញវិជ្ជាជីវៈរយៈពេលច្រើនសប្តាហ៍ ដែលនីមួយៗមានកិច្ចការភ្ជាប់ជាច្រើន និងឯកសារប្រភពបញ្ចូលរាប់ពាន់ ហើយត្រូវបានចាត់ថ្នាក់តាមរយៈការរួមបញ្ចូលគ្នានៃពិន្ទុរូបិយវត្ថុ និងការប្រៀបធៀបជាគូ ដែលគ្របដណ្តប់លើភាពជោគជ័យនៃកិច្ចការដែលអាចផ្ទៀងផ្ទាត់បាន គុណភាពវិភាគ និងគុណភាពនៃការបង្ហាញ។
- GDP.pdf បង្កើតឡើងដោយ Surge AI ដែលសាកល្បងហេតុផលវេនតែមួយឆ្លងកាត់ឯកសារដែលមានជំនាញវិជ្ជាជីវៈ៖ 100 PDFs លាតសន្ធឹងលើដែនដប់ ដោយមានភស្តុតាងចែកចាយនៅទូទាំង 4,592 ទំព័រនៃអត្ថបទ តារាង តារាង និងលេខយោង។ ការឆ្លើយតបត្រូវបានចាត់ថ្នាក់ធៀបនឹងលក្ខណៈវិនិច្ឆ័យអាតូមិកដែលសរសេរដោយអ្នកជំនាញចំនួន 1,275 ហើយចំណងជើងថា All-pass Rate ផ្តល់កិត្តិយសដល់កិច្ចការមួយនៅពេលដែលលក្ខណៈវិនិច្ឆ័យនីមួយៗពេញចិត្ត។
ស្តង់ដារដ៏យូរអង្វែងមួយកំពុងស្ថិតនៅលើផ្លូវចេញ៖ GPQA Diamond ដែលជាការធ្វើតេស្តហេតុផលវិទ្យាសាស្ត្រកម្រិតបញ្ចប់ការសិក្សាត្រូវបានដកចេញព្រោះវាត្រូវបានឆ្អែតដោយប្រសិទ្ធភាពដោយគំរូព្រំដែន។
ក្រុមហ៊ុនក៏បានធ្វើឱ្យប្រសើរឡើងនូវហេដ្ឋារចនាសម្ព័ន្ធការចាត់ថ្នាក់របស់ខ្លួន ដោយបញ្ចេញ AA-LCR v1.1 ជាមួយនឹងប្រព័ន្ធផ្តល់ចំណាត់ថ្នាក់ថ្មី និងគ្រាប់ចុចចម្លើយដែលបានកែ កំណត់ឡើងវិញនូវមាត្រដ្ឋាន Elo សម្រាប់ GDPval-AA v2 និង AA-Briefcase ដូច្នេះការវាយតម្លៃនៅតែមានស្ថេរភាពនៅពេលដែលម៉ូដែលថ្មីមកដល់ ហើយការធ្វើឱ្យប្រអប់ខ្សាច់ដាក់ចំណាត់ថ្នាក់របស់ SciCode រឹងរូសមិនរាប់បញ្ចូលកូដដែលយឺតយ៉ាវនោះទេ។
អ្វីដែលការធ្វើតេស្តថ្មីបង្ហាញ
លទ្ធផលលើការវាយតម្លៃថ្មីផ្តល់នូវរូបភាពលម្អិតបន្ថែមទៀតនៃកន្លែងដែលមន្ទីរពិសោធន៍ព្រំដែនពិតជាឈរ។
នៅលើ AA-Briefcase, Anthropic's Claude Fable 5.1 និង Opus 5 នាំមុខ បន្ទាប់មកដោយ OpenAI's GPT-6 Astra និង Meta's Muse Spark 1.3 ។ GPT-6 Astra ទទួលបានពិន្ទុប្រហែល 85 Elo ខាងលើ GPT-5.6 Sol លើការវាយតម្លៃដូចគ្នា ដែលជាការកើនឡើងយ៉ាងខ្លាំងរវាងជំនាន់ OpenAI ជាបន្តបន្ទាប់។
នៅលើ GDP.pdf រូបភាពត្រឡប់៖ OpenAI នាំមុខជាមួយ GPT-6 Astra នៅ 33.2% All-pass Rate បន្ទាប់មក GPT-5.6 Sol នៅ 28.2% និង Claude Fable 5.1 នៅ 26.2% ។ ភាពខុសគ្នានេះបង្ហាញពីការសំយោគឯកសារវែងៗលើបរិបទធំ ៗ នៅតែជាចំណុចខ្លាំងដែលទាក់ទងសម្រាប់ម៉ូដែលថ្មីបំផុតរបស់ OpenAI ទោះបីជាគំរូរបស់ Anthropic ដឹកនាំសន្ទស្សន៍រួម និងការងារភ្នាក់ងារក៏ដោយ។
ហេតុអ្វីបានជាការធ្វើតេស្តឯកជនកំណត់បញ្ហា
ការផ្លាស់ប្តូរឆ្ពោះទៅរកការវាយតម្លៃដែលទុកចោល ឆ្លុះបញ្ចាំងពីបញ្ហាភាពជឿជាក់កាន់តែទូលំទូលាយនៅក្នុងការវាយតម្លៃ AI ។ ដោយសារគំរូបានស្រូបយកទិន្នន័យតេស្តជាសាធារណៈកាន់តែច្រើន មន្ទីរពិសោធន៍ និងអ្នកសង្កេតការណ៍ឯករាជ្យមានការព្រួយបារម្ភកាន់តែខ្លាំងឡើងថា ពិន្ទុចំណងជើងនៅលើតារាងស្តង់ដារល្បី ឆ្លុះបញ្ចាំងពីការទន្ទេញចាំ ឬការបណ្តុះបណ្តាលគោលដៅជាជាងសមត្ថភាពពិតប្រាកដ។ តាមរយៈការរក្សាចំណែកការកើនឡើងនៃការធ្វើតេស្តរបស់វាកំណត់លក្ខណៈឯកជន និងដាក់ទម្ងន់ឱ្យពួកគេកាន់តែខ្លាំង ការវិភាគសិប្បនិម្មិតកំពុងព្យាយាមរក្សាសញ្ញាដែលតារាងពិន្ទុសាធារណៈបាននឹងកំពុងបាត់បង់។
ក្រុមហ៊ុនបាននិយាយថា ខ្លួនបាននិងកំពុងបង្កើតធាតុនៃ Index v5 "អស់ជាច្រើនខែ" ហើយបានរក្សាការអាប់ដេតឡើងវិញដោយចេតនា ដើម្បីរក្សាសន្ទស្សន៍ស្ថិរភាពតាមរយៈរលកនៃការចាប់ផ្តើមម៉ូដែលសំខាន់ៗនាពេលថ្មីៗនេះ។ លើសពីការចេញផ្សាយ v4.2 បណ្តោះអាសន្ន វាគ្រោងនឹងបង្កើនការអាប់ដេតបន្ថែមទៀតនាពេលអនាគតដ៏ខ្លីនេះ នៅពេលដែលវាបញ្ចប់ការផ្លាស់ប្តូរ v5 ។
សម្រាប់អ្នកទិញជ្រើសរើសរវាងម៉ូដែល Frontier ការអនុវត្តជាក់ស្តែងពី v4.2 គឺថាកំពូលនៃទីផ្សារនៅតែជាការប្រណាំងសេះពីររវាង Anthropic និង OpenAI ដោយមាន Meta បិទគម្លាត ហើយការវាយតម្លៃដែលបានរចនាឡើងដើម្បីធន់នឹងការលេងហ្គេមឥឡូវនេះកំពុងធ្វើការងារច្រើនជាងមុន។ អ្នកប្រើប្រាស់ដែលតាមដានការសម្រេចចិត្តជ្រើសរើសម៉ូដែលអាចធ្វើតាមការវិវឌ្ឍន៍ AI ចុងក្រោយបង្អស់ នៅពេលដែលការចេញផ្សាយ v5 ខិតជិតមកដល់។
នាំមុខ AI
ការអាប់ដេត Benchmark ដូចកម្មវិធីមួយនេះ ផ្លាស់ប្តូររបៀបដែលអ្នកវិនិច្ឆ័យឧស្សាហកម្មរីកចម្រើន។ អានព័ត៌មាន AI បន្ថែម ហើយបន្តនាំមុខរាល់ការចេញផ្សាយម៉ូដែល។
អានព័ត៌មាន AI បន្ថែម →