ស្តង់ដារថ្មីកំពុងប្រឈមនឹងរបៀបដែលឧស្សាហកម្ម AI វាស់ស្ទង់សមត្ថភាពវិទ្យាសាស្ត្រ ហើយលទ្ធផលដំបូងរបស់វាកំពុងបន្ទាបខ្លួនសម្រាប់មន្ទីរពិសោធន៍ព្រំដែន។ Terminal-Bench-Science 0.1 ដែលបានបើកដំណើរការនៅសប្តាហ៍នេះដោយអ្នកស្រាវជ្រាវនៅសាកលវិទ្យាល័យ Stanford និងក្រុមនៅពីក្រោយការសរសេរកូដ Terminal-Bench ដ៏ពេញនិយម វាយតម្លៃភ្នាក់ងារ AI លើលំហូរការងារស្រាវជ្រាវវិទ្យាសាស្ត្រពិតប្រាកដដែលរួមចំណែកដោយអ្នកវិទ្យាសាស្ត្រដែលកំពុងធ្វើការ — និងគំរូខ្លាំងបំផុតដែលត្រូវបានសាកល្បងគឺ Claude Opus 5 ដែលដំណើរការតាមរយៈ Claude Code បានបញ្ចប់កិច្ចការត្រឹមតែ 30% ប៉ុណ្ណោះ។

ទំព័រប្រកាសរបស់តារាងពិន្ទុពិពណ៌នាអំពីគោលការណ៍ណែនាំរបស់វាដោយត្រង់ៗ៖ អ្នកវិទ្យាសាស្ត្រ មិនមែនអ្នកបង្កើតគំរូ ឬអ្នកលក់ទិន្នន័យ គួរតែកំណត់របារសម្រាប់សមត្ថភាពវិទ្យាសាស្ត្រនៅក្នុង AI ។ គម្រោងនេះត្រូវបានសាងសង់ឡើងដោយសហការជាមួយអ្នកជំនាញដែនមកពីស្ថាប័នស្រាវជ្រាវជុំវិញពិភពលោក ហើយការចេញផ្សាយលើកដំបូងរបស់វារួមមាន 70 កិច្ចការដែលគ្របដណ្តប់លើវិទ្យាសាស្ត្រជីវិត រូបវិទ្យា វិទ្យាសាស្ត្រផែនដី គណិតវិទ្យា និងវិស្វកម្ម។

តើវាខុសគ្នាយ៉ាងណាពីសៀវភៅសិក្សាគោល

ការវាយតម្លៃ AI បែបវិទ្យាសាស្ត្រភាគច្រើនសាកល្បងចំណេះដឹង៖ សំណួរពហុជ្រើសរើស បញ្ហាសៀវភៅសិក្សា លំហាត់ស្តង់ដារ។ Terminal-Bench-Science ជំនួសឱ្យការវាស់វែងថាតើភ្នាក់ងារអាចអនុវត្តលំហូរការងារដែលទាមទារតាមបច្ចេកទេស និងប្រើប្រាស់ពេលវេលាដែលបំពេញថ្ងៃរបស់អ្នកស្រាវជ្រាវពិតប្រាកដ — ប្រភេទនៃការងារដែលមិនមានការប្រឡង។ កិច្ចការដំណើរការក្នុងបរិយាកាសជាក់ស្តែង ហើយការចាត់ថ្នាក់គឺផ្អែកលើវត្ថុបុរាណជាក់ស្តែង៖ ការវិភាគ ការក្លែងធ្វើ ភស្តុតាង កូដ និងផលិតផលទិន្នន័យ ពិនិត្យដោយការធ្វើតេស្តជាក់លាក់នៃកិច្ចការដែលអាចផលិតឡើងវិញបាន ជាជាងការវិនិច្ឆ័យគំរូ ឬការដាក់ពិន្ទុពហុជម្រើស។

ការរចនានោះឆ្លុះបញ្ចាំងពីទ្រឹស្តីនៃអ្វីដែលអ្នកជំនួយ AI នៅទីបំផុតគួរធ្វើសម្រាប់វិទ្យាសាស្ត្រ។ ជាជាងការជំនួសការវិនិច្ឆ័យបែបវិទ្យាសាស្ត្រ អ្នកនិពន្ធនៃគោលការជជែកវែកញែក ភ្នាក់ងារគួរតែកាន់កាប់ស្រទាប់ប្រតិបត្តិ — ដំណើរការការពិសោធន៍នៅក្នុងស៊ីលីកូ ដំណើរការទិន្នន័យ ពិនិត្យមើលភស្តុតាង — ដើម្បីដោះលែងអ្នកវិទ្យាសាស្ត្រសម្រាប់ផ្នែកនៃការស្រាវជ្រាវដែលការវិនិច្ឆ័យរបស់មនុស្សមានសារៈសំខាន់បំផុត៖ កំណត់សំណួរ បង្កើតសម្មតិកម្ម និងការបកស្រាយលទ្ធផល។

គម្រោង​នេះ​ក៏​ត្រូវ​បាន​សាងសង់​យ៉ាង​ច្បាស់លាស់​ជា​គោលដៅ​ផ្លាស់ទី​ផង​ដែរ​។ កន្លែងដែលការវាយតម្លៃជាច្រើនត្រូវបានចេញផ្សាយម្តង និងបោះបង់ចោល — សេចក្តីប្រកាសនេះហៅបញ្ហានេះថាជាបញ្ហា "ឯកសារដើម្បីបោះពុម្ព" — Terminal-Bench-Science ត្រូវបានរចនាឡើងជាគំរូបន្តដែលវិវឌ្ឍតាមព្រំដែន ដោយមានការចេញផ្សាយជាប្រចាំដែលមានគោលបំណងរក្សាការវាយតម្លៃមុនពេលវឌ្ឍនភាពគំរូ និងការពារអតិផរណាពិន្ទុដែលជំរុញដោយភាពកខ្វក់។

តារាងអ្នកដឹកនាំដំបូង៖ ផ្លូវវែងឆ្ងាយដែលអាចទុកចិត្តបាន។

តារាងពិន្ទុ v0.1 ដែលទាក់ទាញការចាប់អារម្មណ៍យ៉ាងខ្លាំងនៅពេលដែលវាបានទៅដល់ Hacker News ក្នុងសប្តាហ៍នេះបង្ហាញពីការធ្លាក់ចុះយ៉ាងខ្លាំងពីកំពូល៖

  • Claude Opus 5 (Claude Code): 30.0%
  • GPT-5.6 Sol (Codex): 22.4%
  • Claude Fable 5 (Claude Code): 21.4%
  • Claude Opus 4.8 (Claude Code): 10.5%
  • GPT-5.6 Terra (Codex): 8.6%
  • GLM 5.3 (Claude Code): 8.1%
  • Kimi K3 (Claude Code): 7.1%
  • Grok 4.6 (Grok Build): 7.1%
  • GPT-5.6 Luna (Codex): 3.3%

លទ្ធផលបង្ហាញថាលំហូរការងារវិទ្យាសាស្ត្រនៅតែពិបាកខ្លាំងសម្រាប់ភ្នាក់ងារជាងវិស្វកម្មផ្នែកទន់ ដែលជាកន្លែងដែល Terminal-Bench ដើម និងស្តង់ដារការសរសេរកូដគូប្រជែងបានឃើញពិន្ទុកើនឡើងយ៉ាងឆាប់រហ័ស។ អត្រាដំណោះស្រាយ 30% សម្រាប់ប្រព័ន្ធដែលមានល្អបំផុតមានន័យថានៅលើកិច្ចការស្រាវជ្រាវពិតប្រាកដចំនួន 7 ក្នុងចំណោមដប់ សូម្បីតែភ្នាក់ងារកម្រិតកំពូលដែលផ្គូផ្គងជាមួយនឹងខ្សែដ៏រឹងមាំមិនអាចផលិតការងារត្រឹមត្រូវដែលអាចផ្ទៀងផ្ទាត់បាន។

ការរីករាលដាលនៅក្នុងគ្រួសារគំរូក៏ជាការណែនាំផងដែរ។ គម្លាតរវាង Claude Opus 5 និង Claude Opus 4.8 — ជិតម្ភៃពិន្ទុ — ហើយរវាងវ៉ារ្យ៉ង់ GPT-5.6 Sol, Terra និង Luna បង្ហាញថាតើគុណភាពលទ្ធផលប៉ុន្មានអាស្រ័យលើអន្តរកម្មនៃគំរូ និងភ្នាក់ងារ មិនមែនភាពវៃឆ្លាតគំរូឆៅតែម្នាក់ឯងនោះទេ។ រាល់ធាតុដែលមានពិន្ទុខ្ពស់ប្រើខ្សែកូដភ្នាក់ងារ (Claude Code, Codex, Grok Build) ដែលពង្រឹងការយល់ស្របដែលកំពុងកើតឡើងដែលថារន្ទាគឺសម្រេចចិត្តដូចទម្ងន់មូលដ្ឋាន។

ហេតុអ្វីបានជាអ្នកវិទ្យាសាស្ត្របង្កើតស្តង់ដារផ្ទាល់ខ្លួនរបស់ពួកគេ។

ការដាក់កម្រិតស្តង់ដារមានអំណះអំណាងក្នុងស្ថាប័នដ៏ស្រាល។ សេចក្តីប្រកាសបាននិយាយថា "ភាគហ៊ុននៅក្នុងវិទ្យាសាស្រ្តគឺខ្ពស់ពេក" ហើយការវាយតម្លៃរបស់វាត្រូវតែឆ្លុះបញ្ចាំងពីអាទិភាពរបស់សហគមន៍វិទ្យាសាស្ត្រជាជាងផលប្រយោជន៍ខាងក្រៅ។ គម្រោងនេះផ្តល់ឱ្យអ្នកស្រាវជ្រាវដែលកំពុងធ្វើការនូវយន្តការផ្ទាល់មួយដើម្បីអ៊ិនកូដកិច្ចការដែលពួកគេពិតជាត្រូវការដោយស្វ័យប្រវត្តិ ហើយដើម្បីរក្សាការអះអាងរបស់អ្នកលក់អំពី "ការពន្លឿនការរកឃើញតាមបែបវិទ្យាសាស្ត្រ" ប្រឆាំងនឹងស្តង់ដារដែលអាចផ្ទៀងផ្ទាត់បាន។

នោះសំខាន់ព្រោះគម្លាតរវាងទីផ្សារ និងការពិតមានផលវិបាកពិតប្រាកដ។ ប្រសិនបើមន្ទីរពិសោធន៍ព្រំដែនអះអាងថាភ្នាក់ងាររបស់ពួកគេអាចពន្លឿនការស្រាវជ្រាវខណៈពេលដែលឯករាជ្យ ការវាយតម្លៃដែលរចនាដោយអ្នកជំនាញបង្ហាញអត្រាដំណោះស្រាយលេខមួយខ្ទង់ទៅ 30% ការសម្រេចចិត្តផ្តល់មូលនិធិ ផែនការជួល និងគោលការណ៍មន្ទីរពិសោធន៍ដែលបានបង្កើតឡើងនៅលើការអះអាងទាំងនោះទទួលកំហុស។ ស្តង់ដារដែលគ្រប់គ្រងដោយសហគមន៍ជាបន្តបន្ទាប់គឺជាការកែតម្រូវមួយ៖ ពួកគេបំប្លែងការទាមទារមិនច្បាស់លាស់ទៅជាលេខដែលអាចផលិតឡើងវិញបាន។

សញ្ញាសម្រាប់ស្ថាប័នស្រាវជ្រាវ

សម្រាប់សាកលវិទ្យាល័យ មន្ទីរពិសោធន៍ជាតិ និងក្រុម R&D ដែលថ្លឹងថ្លែងថាពេលណាត្រូវដាក់ពង្រាយភ្នាក់ងារ ស្តង់ដារផ្តល់នូវអ្វីដែលអ្នកលក់បង្ហាញមិនអាចធ្វើបាន៖ ការវាស់វែងដែលរក្សាដោយសហគមន៍អំពីកន្លែងដែលខ្សែភាពជឿជាក់ពិតប្រាកដស្ថិតនៅ។ អត្រាដំណោះស្រាយក្នុងវ័យជំទង់ ឬម្ភៃមានន័យថាប្រព័ន្ធទាំងនេះត្រូវបានចាត់ទុកយ៉ាងល្អបំផុតនាពេលបច្ចុប្បន្ននេះក្នុងនាមជាជំនួយការដែលត្រូវការការពិនិត្យឡើងវិញ មិនមែនជាអ្នកប្រតិបត្តិស្វយ័តនៃបំពង់ពិសោធន៍នោះទេ។ ប្រភេទភារកិច្ច — វិសាលភាពជីវិត រូបវិទ្យា ផែនដី គណិតវិទ្យា និងវិទ្យាសាស្ត្រវិស្វកម្ម — ក៏ផ្តល់ឱ្យអ្នកឯកទេសដែននូវគំរូមួយសម្រាប់ការរួមចំណែកលំហូរការងារពីវិស័យដែលស្តង់ដារទូទៅមើលរំលង។

បរិបទឧស្សាហកម្មកាន់តែទូលំទូលាយពង្រឹងថាហេតុអ្វីបានជាពេលវេលាសំខាន់។ វិទ្យាសាស្រ្តបានក្លាយជាករណីប្រើប្រាស់ដែលត្រូវបានផ្សព្វផ្សាយយ៉ាងខ្លាំងបំផុតសម្រាប់ AI ព្រំដែនជាមួយនឹងមន្ទីរពិសោធន៍ដែលបង្ហាញពីការរួមចំណែកដល់ការរកឃើញសម្ភារៈ វិទ្យាសាស្ត្រប្រូតេអ៊ីន និងគណិតវិទ្យា។ ការទាមទារទាំងនោះពិបាកធ្វើសវនកម្ម៖ លទ្ធផលវិទ្យាសាស្ត្រយឺតក្នុងការធ្វើឱ្យមានសុពលភាព ហើយភាពរីករាយមានចលនាលឿនជាងការចម្លង។ ស្តង់ដារដែលដាក់ចំណាត់ថ្នាក់វត្ថុបុរាណដែលអាចផ្ទៀងផ្ទាត់បាននៅលើលំហូរការងារពិតផ្តល់ឱ្យស្ថាប័នស្រាវជ្រាវនូវវិធីមួយដើម្បីបំបែកសមត្ថភាពដែលបានបង្ហាញចេញពីល្ខោនបង្ហាញ និងដើម្បីតាមដាន ចេញផ្សាយដោយការចេញផ្សាយ ថាតើការរីកចំរើនផ្នែកវិទ្យាសាស្ត្រកំពុងរួមបញ្ចូលគ្នាយ៉ាងឆាប់រហ័សដូចនៅក្នុងវិស្វកម្មផ្នែកទន់ ដែល Terminal-Bench បានបង្កើតឈ្មោះដំបូង។

សម្រាប់ឧស្សាហកម្ម AI សារនៃ v0.1 គឺមានលក្ខណៈទ្វេរដង។ ព្រំដែនកំពុងរីកចម្រើនយ៉ាងច្បាស់ — ប៉ម 30% របស់ Opus 5 ជាង 10.5% របស់ Opus 4.8 ចាស់ — ប៉ុន្តែពិដាននៅតែឆ្ងាយពីភាពជឿជាក់ដែលមន្ទីរពិសោធន៍ត្រូវការ។ អ្នករចនាម៉ូដស្តង់ដារនិយាយថាការចេញផ្សាយជាទៀងទាត់នឹងតាមដានយ៉ាងពិតប្រាកដថាតើគម្លាតនោះបិទលឿនប៉ុណ្ណា។ អ្នកវិទ្យាសាស្ត្រកំពុងមើល [និន្នាការ AI ដែលកំពុងរីកចម្រើន] (https://aibuzzwire.news) នៅក្នុងឧបករណ៍ស្រាវជ្រាវភ្នាក់ងារឥឡូវនេះមាន yardstick ដែលពួកគេសាងសង់ដោយខ្លួនឯង។

---

ស្នាក់នៅមុន AI

ទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។

អានព័ត៌មាន AI បន្ថែម →