មន្ទីរពិសោធន៍ AI វិមជ្ឈការ Prime Intellect បានបោះពុម្ពផ្សាយលទ្ធផលនៃការពិសោធន៍ខ្នាតធំដែលសាកល្បងថាតើម៉ូដែល AI ព្រំដែននាពេលបច្ចុប្បន្ននេះ អាចធ្វើការស្រាវជ្រាវម៉ាស៊ីនសិក្សាដោយស្វ័យភាពបានដល់កម្រិតណា ហើយអ្វីដែលល្អបំផុតក្នុងចំណោមពួកវាបានមកជិតគួរឱ្យកត់សម្គាល់ក្នុងការផ្គូផ្គងកំណត់ត្រាពិភពលោករបស់មនុស្សនៅលើស្តង់ដារសហគមន៍ដ៏ល្បីល្បាញមួយ។
គម្រោងនេះត្រូវបានគេដាក់ឈ្មោះថា NanoGPT Speedrun Frontier និងបានបោះពុម្ពផ្សាយនៅថ្ងៃទី 22 ខែសីហា មាន 153 ដំណើរការស្វយ័តនៅទូទាំង 18 ម៉ូដែលព្រំដែនដែលព្យាយាម nanoGPT optimizer speedrun ដែលជាការប្រកួតប្រជែងដែលអ្នកស្រាវជ្រាវស្វែងរកវិធីដ៏មានប្រសិទ្ធភាពបំផុតក្នុងការបណ្តុះបណ្តាលគំរូភាសាតូចមួយទៅកាន់គោលដៅគុណភាពថេរ។ រឿងនេះបានឡើងលើទំព័រមុខរបស់ Hacker News យ៉ាងឆាប់រហ័ស ដែលជាកន្លែងដែលវាបានទាក់ទាញមតិរាប់សិបដែលជជែកវែកញែកអំពីអ្វីដែលលទ្ធផលនិយាយអំពីសមត្ថភាពរបស់ AI សម្រាប់ការរកឃើញតាមបែបវិទ្យាសាស្ត្រពិតប្រាកដ។ For more context on this story, see our ongoing more AI stories.
តើអ្វីទៅជា NanoGPT Speedrun តាមពិតទៅ
ស្តង់ដារបានមកពីឃ្លាំង modded-nanogpt ដែលរក្សាដោយ Keller Jordan និងបញ្ជីដ៏វែងនៃអ្នករួមចំណែកសហគមន៍។ បញ្ហាប្រឈមគឺសាមញ្ញក្នុងការបញ្ឆោត៖ ដោយប្រើ 8 NVIDIA H100 GPUs បណ្តុះបណ្តាលគំរូភាសាដែលឈានដល់ការខាតបង់ 3.28 ឆ្លងអេនត្រូពីលើសំណុំសុពលភាពរបស់ FineWeb — កម្រិតការអនុវត្តការចម្លង GPT-2 ដើមរបស់ Andrej Karpathy ឈានដល់បន្ទាប់ពី 45 នាទី — លឿនតាមដែលអាចធ្វើទៅបាន។
តាមរយៈការចូលរួមចំណែករបស់សហគមន៍រាប់រយក្នុងរយៈពេលពីរឆ្នាំមកនេះ កំណត់ត្រារបស់មនុស្សត្រូវបានទម្លាក់មកត្រឹមក្រោម 75 វិនាទី និងក្រោម 400 លានរូបសញ្ញាបណ្តុះបណ្តាល ដែលជាការកែលម្អច្រើនជាង 30 ដងលើរូបមន្តដើម។ ដំណោះស្រាយដែលឈ្នះបានអានដូចជាកាតាឡុកនៃវិស្វកម្ម ML ទំនើប៖ ឧបករណ៍បង្កើនប្រសិទ្ធភាព Muon, ការបង្កប់រ៉ូតារីងជាមួយ QK-Norm, ការធ្វើឱ្យសកម្ម ReLU-squared, FP8 quantization លើការយកចិត្តទុកដាក់ និង MLP ឆ្លងកាត់, Flash Attention 3 ជាមួយនឹងទម្រង់បង្អួចរអិល និងបច្ចេកទេសរាប់សិបផ្សេងទៀតដាក់នៅពីលើគ្នាទៅវិញទៅមក។
ការធ្វើតេស្តរបស់ Prime Intellect បានប្រើផ្លូវធ្វើឱ្យប្រសើររបស់គោលដែល - ក្នុងមួយឯកសាររបស់ឃ្លាំង - កាត់បន្ថយចំនួនជំហានបណ្តុះបណ្តាលដែលត្រូវការដើម្បីឈានដល់ការបាត់បង់គោលដៅ អាស្រ័យទៅតាមស្ថាបត្យកម្មថេរ សំណុំទិន្នន័យ និងទំហំបាច់ ជាមួយនឹងថវិកានាឡិកាជញ្ជាំងគ្មានដែនកំណត់ប្រកបដោយប្រសិទ្ធភាព។ នោះធ្វើឱ្យវាក្លាយជាការធ្វើតេស្តដ៏បរិសុទ្ធនៃការរកឃើញក្បួនដោះស្រាយជាជាងល្បឿនផ្នែករឹងឆៅ។
របៀបដែលការពិសោធន៍ដំណើរការ
គំរូនីមួយៗក្នុងចំណោម 18 ត្រូវបានផ្តល់ភារកិច្ចដោយស្វ័យភាព៖ ស្នើការផ្លាស់ប្តូររូបមន្តបណ្តុះបណ្តាល ដំណើរការការពិសោធន៍ ពិនិត្យលទ្ធផល និងធ្វើម្តងទៀត — ជាមួយនឹងស្គ្រីបផ្ទៀងផ្ទាត់ថេរ និងគ្រាប់ពូជចៃដន្យថេរ ធានាថាការកែលម្អដែលបានអះអាងគឺពិតប្រាកដជាជាងការរត់សំណាង។ ដូចដែលអ្នកអត្ថាធិប្បាយរបស់ Hacker News ម្នាក់បានសង្ខេបវា ម៉ូដែលទាំងនោះត្រូវបានស្នើឱ្យស្រាវជ្រាវពីរបៀបកែលម្អការបណ្តុះបណ្តាលគំរូតូចមួយ ព្យាយាមផ្លាស់ប្តូរម្តងហើយម្តងទៀត សាកល្បងពួកវា និងប្រើប្រាស់លទ្ធផលដើម្បីសម្រេចថាតើត្រូវសាកល្បងអ្វីបន្ទាប់ទៀត។
ម៉ូដែលបានដំណើរការតាមរយៈខ្សែភ្នាក់ងារជាច្រើន - រួមមាន Claude-code, OpenAI's codex, kimi-code, grok-cli, qwen-code និងភ្នាក់ងារបឋមផ្ទាល់របស់ Prime Intellect ហើយក្រុមការងារបានតាមដានរាល់ការប្រើប្រាស់សញ្ញាសម្ងាត់ ការសាកល្បងចំនួន ការហៅឧបករណ៍ និងពេលវេលាភ្នាក់ងារដែលកន្លងផុតទៅ។ សរុបមក ការពិសោធន៍បានប្រើប្រាស់សញ្ញាសម្ងាត់រាប់រយលានក្នុងមួយម៉ូដែលកំពូល និងរាប់ពាន់លាននៅទូទាំងក្រឡាចត្រង្គពេញលេញ។
តារាងអ្នកដឹកនាំ៖ រឿងនិទានទី ៥ ដឹកនាំកញ្ចប់
លទ្ធផលចំណងជើង៖ គំរូដែលបានកំណត់ថាជា Fable 5 ដែលដំណើរការតាមរយៈខ្សែកូដ claude បានបិទ 81.7 ភាគរយនៃគម្លាតរវាងរូបមន្តមូលដ្ឋាន និងកំណត់ត្រារបស់មនុស្ស ជាមួយនឹងលទ្ធផលដែលមានសុពលភាពល្អបំផុត 2,726 នៅលើតារាងពិន្ទុ។ ការទៅដល់ទីនោះបានចំណាយពេល 8.7 ថ្ងៃនៃភ្នាក់ងារកើនឡើង ប្រហែល 800 លានសញ្ញាសម្ងាត់ ការពិសោធន៍ 811 និងការហៅឧបករណ៍ប្រហែល 3,000 ។
កញ្ចប់ដេញតាមត្រូវបានដឹកនាំដោយ Opus 5 ដែលបានបិទ 53.6 ភាគរយនៃគម្លាត តាមដានយ៉ាងជិតស្និទ្ធដោយ Kimi K3 នៅ 52.2 ភាគរយនៅពេលដែលជំរុញដោយខ្សែភ្នាក់ងារសំខាន់របស់ Prime Intellect (និង 45.8 ភាគរយតាមរយៈ kimi-code) ។ Opus 4.8 គ្រប់គ្រង 39.4 ភាគរយ វ៉ារ្យ៉ង់ GPT-5.6 ជាច្រើនបានចុះចតនៅចន្លោះប្រហែល 11 ទៅ 36 ភាគរយ Sonnet 5 បានបិទ 26.8 ភាគរយ និង Grok 4.5 និង Qwen3.8 Max នីមួយៗឈានដល់ប្រហែល 24.6 ភាគរយ។
លើសពីនេះ DeepSeek V4 Pro បានបិទ 12.3 ភាគរយនៃគម្លាត GPT-5.5 ឈានដល់ 8.1 ភាគរយ ហើយ Kimi K2.7 ចាស់បានបញ្ចប់នៅ 7.2 ភាគរយ។ គួរកត់សម្គាល់ថាម៉ូដែលមួយដែលបានចេញផ្សាយនាពេលថ្មីៗនេះ — GLM 5.3 — នៅតែដំណើរការនៅពេលបោះផ្សាយដោយមិនទាន់មានកំណត់ត្រាដែលមានសុពលភាពនៅឡើយ ដែលជាការរំលឹកថាស្តង់ដារដាក់ទណ្ឌកម្មលើម៉ូដែលដែលមិនអាចធ្វើឱ្យមានសុពលភាពនៃការកែលម្អផ្ទាល់ខ្លួនរបស់ពួកគេ។
ហេតុអ្វីវាសំខាន់
លក្ខណៈវិនិច្ឆ័យចូលចិត្តបញ្ហានេះ ពីព្រោះពួកគេវាស់វែងអ្វីមួយដែលក្រុមប្រឹក្សាភិបាលសរសេរកូដមិនអាច៖ សមត្ថភាពក្នុងការដំណើរការរង្វិលជុំស្រាវជ្រាវពិតប្រាកដ - សម្មតិកម្ម ការពិសោធន៍ ការវិភាគ ការពិនិត្យឡើងវិញ - ក្នុងរយៈពេលជាច្រើនថ្ងៃជាជាងនាទី។ សមត្ថភាពនោះគឺជាមូលដ្ឋានគ្រឹះនៃវិស័យដែលកំពុងរីកចម្រើននៃការស្រាវជ្រាវ AI ស្វយ័ត ដែលភ្នាក់ងារត្រូវបានបំពេញភារកិច្ចមិនសរសេរកូដទៅជា spec នោះទេ ប៉ុន្តែជាមួយនឹងការរកឃើញនូវអ្វីដែលគ្មាននរណាម្នាក់បានបង្ហាញពួកគេ។
ការរីករាលដាលនៃលទ្ធផលគឺជាព័ត៌មាន។ ស្ទើរតែគ្រប់ម៉ូដែលនៅក្នុងការពិសោធន៍បានរកឃើញគំនិតឈ្នះៗស្នូលដូចគ្នា យោងទៅតាមការសរសេររបស់គម្រោង — អ្វីដែលបំបែកការរត់ល្អបំផុតគឺជាអ្វីដែលការពិសោធន៍បន្សល់ទុក៖ ភ្នាក់ងារខ្លាំងជាងបានរក្សាសញ្ញាខ្សោយនៅក្នុងលទ្ធផលដែលមិនមានសំឡេងយូរគ្រប់គ្រាន់ដើម្បីធ្វើសុពលភាពពួកវា និងយល់ពីទិន្នន័យពិសោធន៍ផ្ទាល់របស់ពួកគេកាន់តែប្រសើរ។
ការព្រមានពីសហគមន៍
អ្នកអត្ថាធិប្បាយរបស់ Hacker News បានលើកឡើងនូវចំណុចវិធីសាស្រ្តយុត្តិធម៌។ ការកំណត់ការខិតខំប្រឹងប្រែង និងខ្សែមានភាពខុសប្លែកគ្នាលើម៉ូដែលនានា — Fable 5 ដំណើរការលើការកំណត់ហេតុផលខ្ពស់ ខណៈដែល Opus 5 ដំណើរការលើអតិបរមា — ហើយលេខនព្វន្ធនៃ 153 រត់លើម៉ូដែល 18 មានន័យថាម៉ូដែលមួយចំនួនបានទទួលការប៉ុនប៉ងច្រើនជាងអ្នកដទៃ។ ថាតើចំណាត់ថ្នាក់របស់ម៉ូដែលឆ្លុះបញ្ចាំងពីសមត្ថភាពស្រាវជ្រាវឆៅរបស់វា ឬគុណភាពនៃខ្សែរបស់វានៅតែជាសំណួរបើកចំហ។
ទោះយ៉ាងណាទិសដៅនៃការធ្វើដំណើរគឺច្បាស់លាស់។ នៅពេលដែលដៃមនុស្សលឿនបំផុតបានចំណាយពេលជាច្រើនឆ្នាំនៃកិច្ចខិតខំប្រឹងប្រែងរួមគ្នាដើម្បីឈានដល់កំណត់ត្រាបច្ចុប្បន្ន ភ្នាក់ងារស្វយ័តដ៏ល្អបំផុតឥឡូវនេះកំពុងបិទគម្លាតភាគច្រើនក្នុងរយៈពេលត្រឹមតែមួយសប្តាហ៍នៃម៉ោងគណនា។ សំណួរបន្ទាប់ - ថាតើម៉ូដែលណាមួយអាចបិទ 18.3 ភាគរយដែលនៅសល់ - អាចត្រូវបានឆ្លើយលឿនជាងការរំពឹងទុក។
សម្រាប់ព័ត៌មានបន្ថែមអំពីស្តង់ដារ និងការស្រាវជ្រាវដែលកំណត់ព្រំដែននៃ AI សូមតាមដានការផ្សាយបន្តរបស់ AI Buzz Wire ។
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →