Sakana AI បានបោះពុម្ភផ្សាយ "Beyond Imitation" ដែលជាឯកសារស្រាវជ្រាវនៅក្នុងទិនានុប្បវត្តិ Transactions on Machine Learning Research (TMLR) ដែលពិពណ៌នាអំពីប្រព័ន្ធត្រួតពិនិត្យមិត្តភ័ក្តិដែលគាំទ្រ LLM ដែលបង្កើតឡើងជុំវិញការរកឃើញកំហុសជាជាងការក្លែងបន្លំការវាយតម្លៃរបស់មនុស្ស។ MarkTechPost បានរាយការណ៍នៅថ្ងៃទី 10 ខែតុលា។ សំណួរកណ្តាលដែលមន្ទីរពិសោធន៍ដែលមានមូលដ្ឋាននៅទីក្រុងតូក្យូបានកំណត់ដើម្បីឆ្លើយ៖ ជំនួសឱ្យការពិនិត្យឡើងវិញលើការវាយតម្លៃលើការវាយតម្លៃរបស់មនុស្ស។ វារកឃើញកំហុសដាំ?
ក្រុមការងារបានដឹកជញ្ជូនវត្ថុបុរាណចំនួនពីរ៖ សន្ទស្សន៍ភាពផ្ទុយគ្នាសម្រាប់ការវាស់វែងការរកឃើញកំហុស និងប្រព័ន្ធត្រួតពិនិត្យពហុស្រទាប់ (MLR) ដែលដឹកនាំរាល់ការធ្វើតេស្តមូលដ្ឋាន។ លទ្ធផលបានមកដល់ចំពេលមានការចាប់អារម្មណ៍កាន់តែខ្លាំងឡើងក្នុងការប្រើប្រាស់ AI ដើម្បីបង្កើនការពិនិត្យឡើងវិញពីមិត្តភ័ក្តិ ដែលជាដំណើរការដែលស្ថិតក្រោមភាពតានតឹងពីការកើនឡើងនៃការដាក់ស្នើ។ សម្រាប់ព័ត៌មានបន្ថែមអំពីរបៀបដែល AI កំពុងរៀបចំការស្រាវជ្រាវឡើងវិញដោយខ្លួនឯង សូមតាមដាន [ការវិវឌ្ឍន៍ AI ចុងក្រោយបំផុត] (https://aibuzzwire.news) របស់យើង។
គំរូនៃកំហុសដែលបានដាំ
Contradiction Benchmark បង្កើតកំហុសទៅក្នុងឯកសារពិត ហើយពិនិត្យមើលថាតើអ្នកត្រួតពិនិត្យចាប់ពួកគេឬអត់។ អ្នកស្រាវជ្រាវបានប្រមូលឯកសារដែលមានអាជ្ញាប័ណ្ណ CC ចំនួន 257 ពី ACL, AISTATS, CVPR, និង ICML 2025 បូកនឹង NeurIPS 2024 បន្ទាប់មកប្រើ Gemini 2.5 Pro ដើម្បីបង្កើតក្រាហ្វចំណេះដឹងនៃការទាមទារ ភស្តុតាង និងវិធីសាស្រ្តរបស់ក្រដាសនីមួយៗ។
ភាពធ្ងន់ធ្ងរត្រូវបានកំណត់ជារចនាសម្ព័ន្ធ៖ ចម្ងាយថ្នាំងពី "ការទាមទារចម្បង" របស់ក្រដាសកំណត់ថាតើកំហុសកណ្តាលស្ថិតនៅកម្រិតណា។ ចម្ងាយសូន្យប៉ះនឹងការទាមទារស្នូល; ចម្ងាយធំជាងនេះប៉ះនឹងព័ត៌មានលម្អិត។ GPT-4.1 បន្ទាប់មកសរសេរឡើងវិញនូវថ្នាំងមួយក្នុងមួយចម្ងាយទៅជាភាពផ្ទុយគ្នា ដោយបង្កើតបាន 1,164 ចំណុចទិន្នន័យសរុប។ ចៅក្រម o3 ពិន្ទុរាល់ការពិនិត្យឡើងវិញដប់ដង។ នៅលើក្រដាសស្អាត ចៅក្រមបានឈានដល់ភាពត្រឹមត្រូវ 99.9% ហើយវាបង្ហាញពីភាពរសើប 86.8% លើការចាប់ដែលបានបញ្ជាក់ដោយដៃ មានន័យថា ពិន្ទុរកឃើញដែលបានរាយការណ៍ប្រហែលជាមានលក្ខណៈអភិរក្ស។
របៀបដែលការពិនិត្យពហុស្រទាប់ដំណើរការ
MLR គឺជាប្រព័ន្ធភ្នាក់ងារដែលយល់អំពីក្រដាសមួយមុននឹងរិះគន់វា ដែលប្រមូលផ្តុំពីភ្នាក់ងារឯកទេសចំនួនបីដែលដំណើរការលើម៉ូដែល Claude ដែលមិនមាននៅលើធ្នើ - មិនមានចង្កោម GPU និងមិនត្រូវការការលៃតម្រូវ៖
- ភ្នាក់ងារឧបសម្ព័ន្ធ (Claude Haiku 3.5)៖ សង្ខេបការពិសោធន៍ និងព័ត៌មានលម្អិតនៃការអនុវត្តពីឧបសម្ព័ន្ធ។
- ភ្នាក់ងារពិនិត្យអក្សរសិល្ប៍ (Claude Sonnet 4 ជាជម្រើស)៖ ប្រើការស្វែងរកតាមគេហទំព័រ ដើម្បីដាក់ក្រដាសនៅក្នុងបរិបទនៃការងារមុន។
- ភ្នាក់ងារពិនិត្យ (Claude Sonnet 4)៖ ដំណើរការខ្សែសង្វាក់ប្រអប់បញ្ចូលបីដងដែលត្រូវបានបំផុសគំនិតដោយអ្នកវិទ្យាសាស្ត្រកុំព្យូទ័រ S. Keshav's "Three-Pass Approach" ដែលល្បីល្បាញជាដំបូង គ្រោងកម្រិតខ្ពស់ បន្ទាប់មកអានលម្អិតនូវចំណុចខ្សោយ ការសន្មត់ និងចន្លោះប្រហោង ហើយទីបំផុតការបញ្ចូលភាពទន់ខ្សោយរបស់ភ្នាក់ងារទាំងអស់ទៅជាលទ្ធផល សំណួរ ពិន្ទុ និងចំណុចខ្លាំង។
PDF ត្រូវបានបញ្ជូនទៅម៉ូដែលដោយផ្ទាល់ ដូច្នេះតួលេខ និងសមីការអាចបន្តដំណើរការបាន។ ប្រព័ន្ធនេះអានរហូតដល់ 10 ទំព័រនៃអត្ថបទសំខាន់ៗ ហើយ Sakana ប៉ាន់ប្រមាណតម្លៃប្រហែល $0.47 ក្នុងមួយការពិនិត្យ។
លទ្ធផល៖ ការរចនា និងការជ្រើសរើសម៉ូដែលទាំងពីរបញ្ហា
MLR បានដឹកនាំប្រព័ន្ធទាំងបួនដែលត្រូវបានសាកល្បងនៅលើគោល។ ជាមួយនឹងការពិនិត្យឯករាជ្យចំនួន 4 វាបានចាប់យក 73.43% នៃការទាមទារស្នូល (ចម្ងាយ - សូន្យ) ផ្ទុយ និង 40.95% សរុប។ មូលដ្ឋានដ៏ល្អបំផុត ដែលជាប្រព័ន្ធមួយហៅថា AgentReview គ្រប់គ្រងបានត្រឹមតែ 14.81% លើការទាមទារស្នូលប៉ុណ្ណោះ។ សូម្បីតែការពិនិត្យ MLR តែមួយបានចាប់បាន 60.79% នៃកំហុសក្នុងការទាមទារស្នូល។
ការសិក្សា ablation បំបែកការរួមចំណែកនៃការរចនាពីជម្រើសនៃគំរូ។ ការប្តូរ GPT-4.1 សម្រាប់ Claude Sonnet 4 នៅខាងក្នុងបំពង់ពិនិត្យដែលមានស្រាប់បានលើកការរកឃើញការទាមទារស្នូលពី 14.56% ទៅ 35.40% ខណៈពេលដែលការរចនាពហុភ្នាក់ងាររបស់ MLR បានបន្ថែមប្រហែល 25 ភាគរយបន្ថែមទៀតនៅលើកំពូលសម្រាប់ការពិនិត្យឡើងវិញតែមួយ។ ភាពត្រឹមត្រូវនៃការរកឃើញធ្លាក់នៅពេលដែលកំហុសផ្លាស់ទីឆ្ងាយពីការទាមទារចម្បង ដែលអ្នកនិពន្ធនិយាយថាគាំទ្រការវាយតម្លៃកម្រិតធ្ងន់ធ្ងរ។
រូបភាពកាន់តែងងឹតលើទិន្នន័យពិភពពិត។ នៅលើ WithdrarXiv-Check សំណុំនៃ 211 ពិតជាបានដកក្រដាស arXiv វិញ MLR ទទួលបានពិន្ទុ 26.07% លើការផ្គូផ្គង "ស្រដៀងគ្នា" និង 16.11% លើការផ្គូផ្គងពិតប្រាកដ ហើយប្រព័ន្ធនេះនៅតែងាយរងគ្រោះក្នុងការលាក់បាំងការចាក់បញ្ចូលក្នុងអត្ថបទសាត្រាស្លឹករឹត។ ម្យ៉ាងវិញទៀត ការអានឯកសារដកថយពិតប្រាកដ គឺពិបាកជាងការចាប់យកភាពផ្ទុយគ្នាសំយោគទៅទៀត។
តើវាមានន័យយ៉ាងណាសម្រាប់ការពិនិត្យឡើងវិញពីមិត្តភ័ក្តិ
ការអនុវត្តជាក់ស្តែងបំផុតរបស់ការសិក្សាអាចមានភាពទាក់ទាញតិចបំផុតរបស់វា៖ ទាំងការរចនាប្រព័ន្ធ និងជម្រើសគំរូផ្លាស់ប្តូរការរកឃើញកំហុសជាសំខាន់ ហើយអ្នកត្រួតពិនិត្យដែលបានអានមុននឹងធ្វើការវិនិច្ឆ័យរកឃើញកំហុសធ្ងន់ធ្ងរជាងអ្វីដែលត្រូវគ្នានឹងលំនាំលើអត្ថបទពិនិត្យរបស់មនុស្ស។ ភាពខុសគ្នានោះមានសារៈសំខាន់ ពីព្រោះការងារមុនភាគច្រើនលើការពិនិត្យដោយជំនួយ AI បានធ្វើឱ្យប្រសើរសម្រាប់ការយល់ស្របជាមួយនឹងការវិនិច្ឆ័យរបស់មនុស្ស - ជាម៉ែត្រដែលផ្តល់រង្វាន់ដល់ការអនុលោមតាមទំនុកចិត្តជាជាងការពិនិត្យពិតប្រាកដ។
លទ្ធផលរបស់ Sakana មិនបង្ហាញថា AI ត្រៀមខ្លួនរួចជាស្រេចដើម្បីជំនួសអាជ្ញាកណ្តាលរបស់មនុស្សនោះទេ ដែលជាប្រព័ន្ធដែលខកខានកំហុសភាគច្រើននៅលើក្រដាសដែលដកមកវិញពិតប្រាកដ ហើយអាចត្រូវបានរៀបចំដោយការបំផុសគំនិតដែលបានបង្កប់ត្រូវបានចាត់ទុកថាល្អបំផុតជាស្រទាប់ជំនួយ មិនមែនអាជ្ញាធរទេ។ កំហុសសំយោគរបស់តារាងពិន្ទុក៏ស្អាតជាងភាពមិនច្បាស់លាស់នៃស្ថិតិ និងការបកស្រាយដែលប្រកួតប្រជែងដែលគ្របដណ្តប់ការខ្វែងគំនិតគ្នាពិតប្រាកដនៅក្នុងការពិនិត្យមើលដោយមិត្តភ័ក្តិ ដូច្នេះការអនុវត្តលើភាពផ្ទុយគ្នាដែលបានដាំគួរតែត្រូវបានអានជាពិដាន មិនមែនជាការសន្យានោះទេ។
ប៉ុន្តែនៅប្រហែល $0.47 ក្នុងមួយការត្រួតពិនិត្យ ជាមួយនឹងអត្រាការរកឃើញកំហុសខ្ពស់បំផុតនៃប្រព័ន្ធណាមួយដែលបានសាកល្បងនោះ MLR ចង្អុលទៅកាន់រយៈពេលជិតមួយដែលអ្នកត្រួតពិនិត្យ AI គ្រប់គ្រងអេក្រង់ដំបូងសម្រាប់ការផ្ទុយគ្នា ខណៈពេលដែលអ្នកត្រួតពិនិត្យរបស់មនុស្សផ្តោតលើការវិនិច្ឆ័យហៅម៉ាស៊ីននៅតែមិនអាចបង្កើតបាន។ សារព័ត៌មាន និងអ្នករៀបចំសន្និសិទដែលកំពុងពិសោធន៍ជាមួយការពិនិត្យឡើងវិញដែលគាំទ្រដោយ LLM ឥឡូវនេះមានទាំងស្តង់ដារសាធារណៈ និងជាមូលដ្ឋានដ៏រឹងមាំដើម្បីវាស់ស្ទង់ប្រព័ន្ធរបស់ពួកគេប្រឆាំងនឹង — ហើយប្រសិនបើគម្លាតរវាង 73.43% និង 14.81% កើនឡើងនោះ សញ្ញាច្បាស់ថាការអានស្ថាបត្យកម្មមានសារៈសំខាន់ជាងទំហំគំរូដើម។
---
ស្នាក់នៅមុន AIទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។
អានព័ត៌មាន AI បន្ថែម →