ក្រុមស្រាវជ្រាវមកពី FAIR នៅ Meta សាកលវិទ្យាល័យ Oxford និងសាកលវិទ្យាល័យ University College London បានបង្ហាញ AI Research Preference Models (RPMs) ដែលជាវិធីសាស្រ្តក្នុងការសម្រេចចិត្តថាតើការពិសោធន៍ម៉ាស៊ីនមួយណាដែលភ្នាក់ងារស្រាវជ្រាវស្វយ័តគួរតែដំណើរការ។ ជំនួសឱ្យការទស្សន៍ទាយពីរបៀបដែលការពិសោធន៍នឹងរកបានពិន្ទុ RPM ចាត់ចំណាត់ថ្នាក់បេក្ខជនដែលមិនបានប្រតិបត្តិ ហើយជ្រើសរើសអ្នកដែលជោគជ័យបំផុត ការផ្លាស់ប្តូរក្រុមនិយាយថាដោះស្រាយបញ្ហាលំបាកពិតប្រាកដនៅក្នុងការស្រាវជ្រាវដែលជំរុញដោយ AI: verification compute នេះបើយោងតាមរបាយការណ៍របស់ MarkTechPost ស្តីពីការងារ។

គំនិតនេះកើតឡើងនៅពេលភ្នាក់ងារស្រាវជ្រាវអាចស្នើ អនុវត្ត និងដាក់ពិន្ទុលើការពិសោធន៍របស់ពួកគេរួចហើយ។ ការបង្កើតគំនិតមានតម្លៃថោក; ការប្រតិបត្តិមិនមែនទេ។ ការបណ្តុះបណ្តាលបេក្ខជនតែម្នាក់អាចប្រើប្រាស់ពេលវេលា GPU ជាច្រើនម៉ោងទៅមួយថ្ងៃ ដូច្នេះភ្នាក់ងារមួយជៀសមិនរួចស្នើការពិសោធន៍ច្រើនជាងដែលវាអាចមានលទ្ធភាពដំណើរការ។ បេក្ខភាពណាដែលទទួលការប្រតិបត្តិគឺដូចដែលក្រុមរៀបចំវា ជាគន្លឹះពិតប្រាកដលើដំណើរការស្រាវជ្រាវ។ សម្រាប់មន្ទីរពិសោធន៍មើលវិក្កយបត្រគណនារបស់ពួកគេកើនឡើង ស៊ុមនោះពិតជាមូលហេតុដែលការងារនេះកំពុងទាក់ទាញការយកចិត្តទុកដាក់លើការអភិវឌ្ឍន៍ AI ចុងក្រោយបង្អស់នៅក្នុងស្វ័យប្រវត្តិកម្មស្រាវជ្រាវ។

ហេតុអ្វីបានជាការជ្រើសរើសពិសោធន៍គឺជាឧបសគ្គ

ក្រុមបានរកឃើញថាគំរូភាសាមិនគួរឱ្យទុកចិត្តក្នុងការព្យាករណ៍ម៉ែត្រដាច់ខាត ឬលទ្ធផលនៃការអនុវត្ត។ គំរូមិនអាចមើលការពិសោធន៍របស់បេក្ខជន និងអាចទស្សន៍ទាយបានត្រឹមត្រូវអំពីពិន្ទុដែលវានឹងសម្រេចបាន។ អ្វីដែលវាអាចធ្វើបាន អ្នកស្រាវជ្រាវបានរកឃើញ គឺវិនិច្ឆ័យថាតើបេក្ខជនពីររូបណាជាការភ្នាល់ល្អជាង — ការប្រៀបធៀបដែលទាក់ទងគ្នាជាជាងការទស្សន៍ទាយដាច់ខាត។ RPMs ត្រូវបានបង្កើតឡើងទាំងស្រុងជុំវិញភាពខុសគ្នានោះ៖ ពួកគេមិនដែលព្យាករណ៍ពិន្ទុទេ ពួកគេគ្រាន់តែដាក់ចំណាត់ថ្នាក់ប៉ុណ្ណោះ។

ប្រព័ន្ធនេះដំណើរការនៅខាងក្នុង AIRA-dojo ដែលជារន្ទាស្វែងរកដើមឈើវិវត្តន៍ប្រភពបើកចំហដែលបង្កើតការពិសោធន៍សិក្សាដោយម៉ាស៊ីនតាមរយៈការជ្រើសរើសមាតាបិតាលោភលន់ និងប្រតិបត្តិករសេចក្តីព្រាង កែលម្អ និងបំបាត់កំហុស ដោយប្រគល់ថ្នាំងដែលមានសុពលភាពខ្ពស់បំផុតនៅចុងបញ្ចប់។ ស្តង់ដារ AIRS-Bench ក៏ជាប្រភពបើកចំហផងដែរ។ ទាំងរន្ទា និងគំរូចំណូលចិត្តប្រើ Qwen3.6-27B ជាឆ្អឹងខ្នងរបស់ពួកគេ ដែលក្រុមកត់សម្គាល់ថាជាទម្ងន់បើកចំហ។

របៀបដែលការប្រកួតធ្លាក់ចេញដំណើរការ

ជាជាងបង្កើតការពិសោធន៍កុមារមួយ ហើយអនុវត្តវា ភ្នាក់ងារអនុវត្តប្រតិបត្តិករ 15 ដងស្របគ្នាដើម្បីបង្កើតបេក្ខជនដែលមិនបានប្រតិបត្តិចំនួន 15 ។ បន្ទាប់មក RPM ប្រៀបធៀបពួកវាជាគូក្នុងការប្រកួតជម្រុះ ហើយមានតែអ្នកឈ្នះប៉ុណ្ណោះដែលត្រូវបានប្រតិបត្តិ។ ការប្រៀបធៀបនីមួយៗត្រូវបានផ្អែកលើថ្នាំងបរិបទដែលប្រមូលបានដោយជំហានដំបូងដ៏ធំទូលាយនៃមែកធាងដែលបានរុករក ដោយបេក្ខជននីមួយៗត្រូវបានបង្ហាញជាមួយនឹងពិន្ទុសុពលភាពនៃបុព្វបុរសរបស់វា ដូច្នេះចៅក្រមហេតុផលពីប្រវត្តិស្វែងរកពិតប្រាកដរបស់ភ្នាក់ងារជាជាងនៅក្នុងកន្លែងទំនេរ។

ក្រដាសពិពណ៌នាអំពីវ៉ារ្យ៉ង់ពីរដែលមានថវិកាគណនាខុសៗគ្នា៖

  • RPM សម្រាប់តែការសន្និដ្ឋាន — LLM-as-a-judge ដែលប្រៀបធៀបផែនការបេក្ខជន លេខកូដ និងប្រវត្តិស្វែងរកក្នុងសំបុត្រតែមួយ។ ការជម្រុញរបស់វាត្រូវបានធ្វើឱ្យប្រសើរឡើងជាមួយនឹង MIPROv2 ពីក្របខណ្ឌ DSPy ហើយបានបង្រួបបង្រួមលើអ្វីដែលក្រុមហៅថា តារាងអ្នកស៊ើបអង្កេតបឋម៖ វាអត់ធ្មត់លើកំហុសដែលអាចជួសជុលបាន ផ្តល់រង្វាន់ដល់ការពង្រីក និងដាក់ពិន័យលើទិសដៅស្រាវជ្រាវដែលមិនត្រូវការ។ ភាពត្រឹមត្រូវនៃការប្រៀបធៀបក្រៅបណ្តាញបានវាស់វែងពី 57.7 ទៅ 59.0 ភាគរយ។
  • Agentic RPM — ចៅក្រមដូចគ្នាបូកនឹងប្រអប់ខ្សាច់ដែលក្លូនបរិស្ថានរបស់ភ្នាក់ងារ រួមទាំង H200 GPU តែមួយជាមួយនឹងឧបករណ៍កំណត់ចំពោះ Python, Bash និងសកម្មភាពដំណោះស្រាយដាក់ស្នើ។ វាដំណើរការការពិសោធន៍សាកល្បងខ្នាតតូច បន្ទាប់មកគំរូមតិកែលម្អ ស្នើការពិសោធន៍បន្ទាប់ដែលមានព័ត៌មានច្រើនបំផុត ឬបញ្ចប់រង្វិលជុំ។ អ្នកបើកយន្តហោះត្រូវបានកំណត់ត្រឹម 30 ជាមួយនឹងកម្រិត 60 វិនាទី ហើយថវិកាពេលវេលាដែលនៅសល់គឺហួសកម្រិតដោយចេតនា — 2,700 វិនាទីបានរាយការណ៍ធៀបនឹង 300 ពិតប្រាកដ — ដូច្នេះភ្នាក់ងារមិនបញ្ឈប់ការបង្កើនប្រសិទ្ធភាពមុននោះទេ។

ចៅក្រម​ម្នាក់​ប្រៀប​ដូច​ជា​អ្នក​ស៊ើប​អង្កេត​សំខាន់

ស៊ុមអ្នកស៊ើបអង្កេតសំខាន់គឺជាផ្នែកដែលគួរឱ្យចាប់អារម្មណ៍។ ជាជាងផ្តល់រង្វាន់ដល់បេក្ខជនដែលមើលទៅគួរអោយចាប់អារម្មណ៍ជាអតិបរមា កញ្ចក់រង្វិលដែលបានកែលម្អបង្ហាញពីរបៀបដែលអ្នកស្រាវជ្រាវដែលមានបទពិសោធន៍មួយបានសាកល្បងគំនិត៖ កូដកំហុសដែលអាចជួសជុលបាន វាយកូដប៉ូឡូញដែលកំពុងស្វែងរកទីបញ្ចប់ ហើយទិសដៅដែលចម្លងមែកធាងដែលមានស្រាប់មានតម្លៃតិចជាងរឿងប្រលោមលោក។ តារាងពិន្ទុដែលបានរៀនតាមរយៈការបង្កើនប្រសិទ្ធភាពភ្លាមៗ ជាជាងការលៃតម្រូវដោយដៃ គឺជាអ្វីដែលនាំឱ្យមានភាពប្រសើរឡើង នេះបើតាមការពន្យល់របស់ក្រុម។

លទ្ធផល Benchmark នៅលើ AIRS-Bench

ការវាយតម្លៃបានគ្របដណ្តប់លើ 20 អត្ថបទសាធារណៈ និងកិច្ចការតារាង ដោយកិច្ចការនីមួយៗបានផ្តល់រយៈពេល 24 ម៉ោងលើ H200 តែមួយ និង 10 គ្រាប់ចៃដន្យ។ សំខាន់ ឆ្អឹងខ្នង Qwen3.6-27B ដូចគ្នាបានដំណើរការទាំងប្រតិបត្តិករពិសោធន៍ និងគំរូចំណូលចិត្ត ដូច្នេះការទទួលបានមកពីស្រទាប់ជ្រើសរើសជាជាងគំរូចៅក្រមខ្លាំងជាង។ ពិន្ទុធម្មតាជាមធ្យម៖

  • គ្មាន RPM (ជ្រើសរើសដោយចៃដន្យ): 0.684
  • Inference- only RPM: 0.711
  • ភ្នាក់ងារ RPM: 0.729
  • សុពលភាព oracle (ពិដាន): 0.748
  • តេស្ត oracle (ពិដាន): 0.759

ប្រូបាប៊ីលីតេនៃការធ្វើឱ្យប្រសើរឡើងលើការជ្រើសរើសដោយចៃដន្យគឺ 0.5923 សម្រាប់វ៉ារ្យ៉ង់តែការសន្និដ្ឋាន និង 0.5913 សម្រាប់ភ្នាក់ងារដែលមាន 95 ភាគរយនៃចន្លោះពេលទំនុកចិត្តទាបនៃ 0.5066 និង 0.5018 — លើសពីកម្រិត 0.5 សម្រាប់សារៈសំខាន់ស្ថិតិ។ ទោះបីជាក្រុមនេះអាចផ្លាស់ប្តូរបានតិចតួចក៏ដោយ។

ប្រសិទ្ធភាពគឺជាលទ្ធផលជាក់ស្តែងជាង។ RPM តែមួយគត់បានឈានដល់ពិន្ទុចុងក្រោយរបស់បន្ទាត់មូលដ្ឋានចៃដន្យនៃ 0.684 ក្នុងរយៈពេល 14.88 ម៉ោង ការបង្កើនល្បឿន 1.61x ខណៈពេលដែលវ៉ារ្យ៉ង់ភ្នាក់ងារត្រូវការ 15.50 ម៉ោង ការបង្កើនល្បឿន 1.55x ។ សូម្បី​តែ​ការ​គណនា​ប្រាក់​លើស​នៃ​ការ​សន្និដ្ឋាន​របស់​ចៅក្រម​ដែល​រៀបចំ​ដោយ​ខ្លួន​ឯង​ក៏​ដោយ ក៏​ចំនួន​ដែល​ត្រូវ​បាន​កែ​តម្រូវ​នៅ​តែ​អំណោយ​ផល។

ទម្ងន់បើកចំហ និងការព្រមានដោយស្មោះត្រង់

ក្រុមនេះគឺនៅខាងមុខថា RPMs អាចប្រើបានតែផ្នែកខ្លះប៉ុណ្ណោះនៅថ្ងៃនេះ។ សមាសធាតុគឺបើកចំហ — ឆ្អឹងខ្នងដែលបានហ្វឹកហាត់ជាមុនដែលបង្កកដោយមិនមានការកែតម្រូវ រន្ទាប្រភពបើកចំហ និងគំរូស្តង់ដារ និងគំរូឆ្អឹងខ្នងដែលមានទម្ងន់បើកចំហ — ប៉ុន្តែតម្រូវការប្រអប់ខ្សាច់របស់ភ្នាក់ងារវ៉ារ្យ៉ង់ និងការសាកល្បងសាកល្បងរបស់វាមានន័យថា មន្ទីរពិសោធន៍ភាគច្រើននឹងចាប់ផ្តើមជាមួយនឹងកំណែនៃការសន្និដ្ឋានតែប៉ុណ្ណោះ។ អ្នកស្រាវជ្រាវក៏កត់សម្គាល់ផងដែរថាជំហាន Debug ត្រឡប់ទៅការជ្រើសរើសចៃដន្យនៅក្នុងភ្នាក់ងារចម្លង ព្រោះពេលវេលាសាកល្បងប្រកួតប្រជែងជាមួយនាឡិកាផ្ទាល់របស់ភ្នាក់ងារ។

សារៈសំខាន់ធំជាងនេះអាចជាទិសដៅ។ នៅពេលដែលភ្នាក់ងារស្រាវជ្រាវស្វយ័តផ្លាស់ទីពីការបង្ហាញទៅកាន់ការប្រើប្រាស់ប្រចាំថ្ងៃនៅក្នុងមន្ទីរពិសោធន៍ឧស្សាហកម្ម ធនធានដែលខ្វះខាតគឺលែងជាគំនិតទៀតហើយ ក្រៅពីម៉ោង GPU និងវិធីសាស្រ្តដែលរុញច្រានឱ្យមានការរីកចំរើនកាន់តែច្រើនចេញពីបរិវេណថវិកាគណនាថេរតាមពេលវេលា។ ចំណាត់ថ្នាក់មុនពេលដំណើរការគឺជាគំនិតដ៏សាមញ្ញមួយ ហើយលេខ AIRS-Bench បង្ហាញថាវាជាគំនិតដែលដំណើរការបានល្អគ្រប់គ្រាន់សម្រាប់បញ្ហា។

[បន្តទៅមុខនៃ AI] (https://aibuzzwire.news)

បន្តជាមួយនឹងការស្រាវជ្រាវដែលកំពុងបង្កើតគំរូនៅថ្ងៃស្អែកនៅ AI Buzz Wire

អានព័ត៌មាន AI បន្ថែម →