Jev ដែលជា "គំរូការសម្រេចចិត្ត" មិនមែន LLM ពីក្រុមហ៊ុន Startup TypeSafe AI បានបញ្ចប់ Pokémon Red ដោយបានប្រយុទ្ធពី Pallet Town ទៅកាន់ Hall of Fame ក្នុងរយៈពេល 37 ម៉ោង និង 40 នាទីនៃការលេងក្នុងតម្លៃកុំព្យូទ័រសរុបប្រហែល $1.65 នេះបើយោងតាមគេហទំព័ររបស់គម្រោង។

ដំណើរការដែលបង្កើតឡើងដោយអ្នកអភិវឌ្ឍន៍ Christian Mathiesen ត្រូវបានផ្សាយបន្តផ្ទាល់ជាមួយនឹងសញ្ញាសម្ងាត់ និងការចំណាយលើការបង្ហាញ និងប្រភពបើកចំហនៅលើ GitHub ។ វាបានបាញ់ទៅលើទំព័រមុខរបស់ Hacker News កាលពីចុងសប្តាហ៍ ដោយបានទាក់ទាញសំឡេងគាំទ្ររាប់រយ និងការពិភាក្សាយ៉ាងរស់រវើកអំពីអ្វីដែលវានិយាយអំពីអនាគតរបស់ភ្នាក់ងារ AI ។ Tom's Hardware បានគ្របដណ្តប់លើសមិទ្ធិផលនេះ ដោយកត់សម្គាល់ថាម៉ាស៊ីនដែលមិនមែនជា LLM បានទទួលជោគជ័យដែល chatbots បែបប្រពៃណីបានជាប់គាំងអស់ជាច្រើនខែ ហើយថា Claude Opus 5 បានបង្វឹកម៉ូដែលនេះតាមរយៈការបញ្ចប់របស់វា។

ដំណើរការដោយលេខ

ស្ថិតិពីការតាមដានផ្ទាល់របស់គម្រោងបង្ហាញថាដំណើរការនេះមិនធម្មតាសម្រាប់ប្រព័ន្ធ AI៖

  • ពេលវេលាសរុប៖ ៣៧ ម៉ោង ៤០ នាទី។
  • ការ​សម្រេច​ចិត្ត​បាន​ធ្វើ​ឡើង​: 16,150
  • និមិត្តសញ្ញាបញ្ចូល៖ ប្រហែល 39.2 លាន
  • តម្លៃសរុប Jev៖ ប្រហែល $1.65
  • ពេលវេលាសម្រេចចិត្តធម្មតា៖ 0.4 វិនាទី
  • អ្នកប្រឆាំងបានប្រយុទ្ធ៖ ប្រមាណ ១.៦៦០
  • ជូតក្រុម៖ ១៦
  • ឥស្សរជន ៤ ព្យាយាម៖ ១៥
  • ផ្លូវពិបាកបំផុត៖ ផ្លូវជ័យជំនះ

ក្រុម Hall of Fame ចុងក្រោយ៖ Charizard នៅកម្រិត 83 គាំទ្រដោយ Graveler (62), Nidoqueen (45), Beedrill (44), Haunter (39) និង Primeape (29)។

សេដ្ឋកិច្ចគឺជាចំណងជើង។ ការសម្រេចចិត្តមួយម៉ឺនប្រាំមួយពាន់សម្រាប់តម្លៃកាហ្វេតិចជាងមួយគឺមានភាពខុសប្លែកគ្នាយ៉ាងខ្លាំងជាមួយនឹងភ្នាក់ងារលេងហ្គេមដែលមានមូលដ្ឋានលើ LLM ដែលអាចដុតបានរាប់សិបដុល្លារជាសញ្ញាសម្ងាត់ក្នុងវគ្គវែង។ Mathiesen បាននិយាយថាគាត់បានជ្រើសរើស Pokémon បន្ទាប់ពីបានសន្និដ្ឋានថា Jev អាចសម្រេចចិត្តយ៉ាងឆាប់រហ័ស ប៉ុន្តែមិនទាន់លឿនគ្រប់គ្រាន់ក្នុងការលេង Doom នោះទេ។

ហេតុអ្វីបានជា Pokémon Red ពិបាកសម្រាប់ AI

Pokémon Red បានក្លាយជាគោលមិនទំនងសម្រាប់ភ្នាក់ងារ AI ។ Game Boy បុរាណឆ្នាំ 1996 ទាមទារការរៀបចំផែនការជើងមេឃដ៏វែង៖ កម្រិតកិន គ្រប់គ្រងពិធីជប់លៀងដែលមានប្រាំមួយនាក់ រុករករូងភ្នំដែលមានរាងដូចភ្នំភ្លើងដោយគ្មានផែនទី និងតាមដាននៅពេលដែលធាតុសំខាន់មួយត្រូវបានខកខាន។ ភ្នាក់ងារគំរូភាសាបានវង្វេងជារង្វង់ ជាប្រវត្តិសាស្ត្រ បានជាប់គាំងនៅក្នុងរូងភ្នំ និងបានដុតបំផ្លាញថវិកាដ៏ច្រើនសន្ធឹកសន្ធាប់លើសកម្មភាពដែលលែងត្រូវការតទៅទៀត។

Jev ប្រើវិធីសាស្រ្តផ្សេងគ្នាជាមូលដ្ឋាន។ ជាជាងបង្កើតអត្ថបទ គំរូត្រឡប់ការសម្រេចចិត្តដែលបានក្រិតតាមខ្នាតដោយផ្ទាល់ — ការរចនា TypeSafe AI បានធ្វើទីផ្សារជាជម្រើស "System One" ចំពោះការវែកញែកដោយចេតនា និងភាសាធ្ងន់នៃម៉ូដែលធំៗ។ យោងតាមការគ្របដណ្តប់លើម៉ូដែលមុនរបស់ Tom's Hardware ក្រុមហ៊ុនអះអាងថា Jev លឿនជាងប្រហែល 193 ដង និងថោកជាងជម្រើស LLM ដល់ទៅ 445 ដងលើកិច្ចការសម្រេចចិត្ត។

ការចាប់បាន អ្នកអភិវឌ្ឍន៍បានទទួលស្គាល់ថា Jev ត្រូវការជំនួយ។ Per Tom's Hardware, Claude Opus 5 បានបង្វឹកគំរូនៃការសម្រេចចិត្តតាមរយៈចុងបញ្ចប់របស់វា ដែលជាវិធីសាស្រ្តកូនកាត់ដែលគំរូភាសាធំមួយផ្តល់នូវការណែនាំជាយុទ្ធសាស្រ្ត ខណៈដែលម៉ូដែលលឿន និងថោកអនុវត្តការសម្រេចចិត្តបុគ្គលរាប់ពាន់។ ទំព័រគម្រោងបានកត់សម្គាល់ថា Jev "គ្រាន់តែដឹងថាកន្លែងដែលត្រូវទៅបន្ទាប់ព្រោះវាមានការណែនាំ" ។

តើវាមានន័យយ៉ាងណាសម្រាប់ភ្នាក់ងារ AI

លទ្ធផលគឺជាចំណុចទិន្នន័យនៅក្នុងអំណះអំណាងដែលកំពុងកើនឡើងដែលថាអនាគតនៃភ្នាក់ងារ AI មិនមែនជាគំរូដ៏ធំដែលធ្វើអ្វីគ្រប់យ៉ាងនោះទេ ប៉ុន្តែការបែងចែកកម្លាំងពលកម្ម៖ ម៉ូដែលឯកទេសដែលមានល្បឿនលឿន តម្លៃថោក គ្រប់គ្រងការសម្រេចចិត្តប្រេកង់ខ្ពស់ ជាមួយនឹងគំរូហេតុផលយឺតៗឈានជើងចូលតែនៅពេលដែលស្ថានភាពមានភាពមិនច្បាស់លាស់។

សម្រាប់ប្រព័ន្ធគ្រប់គ្រងមនុស្សយន្ត ការលេងហ្គេម និងពេលវេលាជាក់ស្តែង — ដែនដែលការសម្រេចចិត្តត្រូវតែមកដល់គិតជាមិល្លីវិនាទី ហើយថវិកាត្រូវបានវាស់ជាសេន — ស្ថាបត្យកម្មនោះមានភាពទាក់ទាញ។ មនុស្សយន្តឃ្លាំង NPC លេងហ្គេម ឬប្រព័ន្ធពាណិជ្ជកម្មមិនអាចមានលទ្ធភាពធ្វើដំណើរទៅមកតាមរចនាប័ទ្ម GPT រយៈពេល 2 វិនាទីសម្រាប់រាល់សកម្មភាពខ្នាតតូច។

អ្នកសង្ស័យលើព័ត៌មាន Hacker បានចង្អុលបង្ហាញពីការព្រមាននៃការរត់នេះ៖ ហ្គេមនេះមានអាយុកាលរាប់ទសវត្សរ៍ ហើយត្រូវបានចងក្រងជាឯកសារយ៉ាងល្អិតល្អន់ គំរូគ្រូបង្វឹកបានលើកទម្ងន់ជាយុទ្ធសាស្ត្រ ហើយការប៉ុនប៉ងចំនួន 15 Elite Four បង្ហាញពីការសាកល្បង និងកំហុសជាច្រើន។ ទាំង​នោះ​គឺ​ជា​ចំណុច​យុត្តិធម៌ — ប៉ុន្តែ​ពួក​គេ​នឹក​ឃើញ​សញ្ញា​គួរ​ឱ្យ​ចាប់​អារម្មណ៍​ជាង​នេះ។ ការសម្រេចចិត្តល្អចំនួន 16 ពាន់នៅ $0.0001 នីមួយៗគឺពិតជាតម្លៃដែលភ្នាក់ងារស្វយ័តត្រូវការប្រសិនបើពួកគេតែងតែដំណើរការក្នុងទំហំ។

TypeSafe AI ដែលបង្កើតឡើងដោយអតីតអ្នកស្រាវជ្រាវ OpenAI RLHF បានដាក់ Jev ជាការបំពេញបន្ថែមលើគំរូភាសាជាជាងការជំនួស។ គម្រោង Pokémon — កូដ ស្ទ្រីម និងការវិភាគតម្លៃសាធារណៈទាំងអស់ — គឺជាការបង្ហាញដ៏រស់រវើកបំផុតដែលមិនទាន់ដឹងពីអ្វីដែលជង់ទីមួយអាចធ្វើការសម្រេចចិត្តបាន។

កូដប្រភពពេញលេញមាននៅលើ GitHub ហើយការរត់ដែលបានបញ្ចប់អាចមើលបាននៅលើ YouTube រួមទាំងរាល់ការលុបនៅលើ Victory Road។

នាំមុខ AI

អនុវត្តតាម AI Buzz Wire សម្រាប់ការអភិវឌ្ឍន៍ AI ចុងក្រោយបង្អស់។

អានព័ត៌មាន AI បន្ថែម →