GPT-6 Astra របស់ OpenAI បានបង្ហោះលទ្ធផលចុងក្រោយបង្អស់នៅលើ ARC-AGI-3 ដែលជាស្តង់ដារហេតុផលអរូបីដែលត្រូវបានរចនាឡើងដើម្បីវាស់ស្ទង់ការស៊ើបការណ៍សម្ងាត់ភ្នាក់ងារ នេះបើយោងតាមលទ្ធផលដែលបានចេញផ្សាយកាលពីថ្ងៃពុធដោយមូលនិធិរង្វាន់ ARC ។ ម៉ូដែលនេះទទួលបានពិន្ទុ 62.7% លើខ្សែពាក់កណ្តាលឯកជនដែលកំណត់នៅក្រោមខ្សែស្តង់ដាររបស់គ្រឹះ ហើយ 99.9% នៅពេលវាយតម្លៃជាមួយនឹងខ្សែអាដាប់ធ័រអ្នកផ្តល់សេវា ដែលរក្សាស្ថានភាពហេតុផលខាងក្នុងរបស់គំរូរវាងសំណើ។
លទ្ធផលបានមកដល់មួយថ្ងៃបន្ទាប់ពី OpenAI បានចាប់ផ្តើមការចេញផ្សាយជាដំណាក់កាលនៃ Astra ដែលជាគំរូស្មាតហ្វូនដែលក្រុមហ៊ុនបានកំណត់ថាជាការចាប់ផ្តើមនៃយុគសម័យថ្មី។ សម្រាប់អ្នកអានដែលកំពុងព្យាយាមរក្សាពិន្ទុ ខណៈដែលការវាយតម្លៃស្តង់ដារពាណិជ្ជកម្មរបស់មន្ទីរពិសោធន៍ព្រំដែនមានការប៉ះទង្គិច ទំព័រ [ការវិវឌ្ឍន៍ AI ចុងក្រោយបំផុត] (https://aibuzzwire.news) តាមដានរាល់ការចេញផ្សាយសំខាន់ៗ ដូចដែលវាកើតឡើង។
ខ្សែពីរ ពិន្ទុខុសគ្នាខ្លាំង
គម្លាតរវាងលេខចំណងជើងពីររបស់ Astra គឺជាព័ត៌មានលម្អិតដ៏សំខាន់បំផុតនៅក្នុងរបាយការណ៍។ រង្វាន់ ARC វាយតម្លៃភ្នាក់ងារនៅក្រោមខ្សែផ្សេងៗគ្នា ហើយនីមួយៗផ្លាស់ប្តូរអ្វីដែលគំរូត្រូវបានអនុញ្ញាតឱ្យធ្វើជាមួយនឹងបរិបទរបស់វា។
នៅក្រោមខ្សែស្ដង់ដារ គំរូមួយអាចផ្ទុកចំណាំទៅមុខ ដែលវាជ្រើសរើសរក្សាទុក ដូចដែលវាដំណើរការតាមរយៈបរិស្ថាន។ ជាមួយនឹងការរៀបចំនោះ Astra នៅការខិតខំប្រឹងប្រែងរកហេតុផលអតិបរមាទទួលបាន 62.7% ក្នុងតម្លៃសរុប 26,098 ដុល្លារសម្រាប់ការវាយតម្លៃដំណើរការ។ ផ្ទុយទៅវិញ ការដំណើរការខ្សែដូចគ្នាជាមួយនឹងការវែកញែកបានបិទផលិតបានត្រឹមតែ 35.2% ខណៈពេលដែលមានតម្លៃកាន់តែច្រើន — $49,791 — ដោយសារតែម៉ូដែលនេះត្រូវការសកម្មភាពជាច្រើនទៀតដើម្បីដំណើរការ។
ខ្សែអាដាប់ធ័រអ្នកផ្តល់សេវាគឺកាន់តែសប្បុរស៖ វារក្សាស្ថានភាពហេតុផលស្រអាប់របស់ម៉ូដែលរវាងសំណើ និងប្រើការបង្រួមសម្រាប់ការសន្ទនាយូរជាងមុន ដោយអនុញ្ញាតឱ្យ Astra ប្រើឡើងវិញនូវការងារពីមុន។ នៅក្រោមខ្សែនោះ Astra ទទួលបានពិន្ទុ 99.9% នៅការខិតខំប្រឹងប្រែងដោយហេតុផលខ្ពស់សម្រាប់ $18,817 និង 98.6% នៅការខិតខំប្រឹងប្រែងអតិបរមាសម្រាប់ $17,332 ។ សូម្បីតែការកំណត់ហេតុផលទាបបំផុតឈានដល់ 96.7% ។
ម្យ៉ាងវិញទៀត ភាពខុសគ្នារវាងពិន្ទុមួយផ្នែក និងពិន្ទុជិតល្អឥតខ្ចោះ មិនមែនជាសមត្ថភាពឆៅតែម្នាក់ឯងនោះទេ - វាគឺជាចំនួននៃស្ថានភាពការងាររបស់គំរូដែលនៅរស់រានមានជីវិតរវាងជំហាន។
ការវាយដំមនុស្សលើប្រសិទ្ធភាពសកម្មភាព
ARC-AGI-3 ត្រូវបានបង្កើតឡើងជុំវិញបរិយាកាសហ្គេមបែបប្រលោមលោក អរូបី និងវេន។ ភ្នាក់ងារត្រូវតែរុករកដោយគ្មានការណែនាំ សន្និដ្ឋានពីរបៀបដែលពិភពលោកដំណើរការ កំណត់គោលដៅពីរង្វាន់តិចតួច និងរៀបចំផែនការសកម្មភាពច្រើនជំហាន។ បរិស្ថានត្រូវបានក្រិតតាមខ្នាត ដើម្បីឱ្យមនុស្សអាចដោះស្រាយបាន 100% ដែលធ្វើឱ្យការអនុវត្តរបស់មនុស្សក្លាយជាវិធានការណ៍គោល។
Astra មិនត្រឹមតែដោះស្រាយកម្រិតភាគច្រើនប៉ុណ្ណោះទេ វាបានដោះស្រាយពួកគេយ៉ាងមានប្រសិទ្ធភាព។ យោងទៅតាមរង្វាន់ ARC ម៉ូដែលនេះបានប្រើសកម្មភាពតិចជាងកម្រិតមធ្យមរបស់មនុស្សដែលបានសាកល្បងលើ 96% នៃកម្រិត ដែលលើសពីកម្រិតមូលដ្ឋានរបស់មនុស្សក្នុងប្រសិទ្ធភាពសកម្មភាពនៅទូទាំងឈុត។
សេដ្ឋកិច្ចនៃការប្រៀបធៀបគឺស្រឡះ។ អ្នកចូលរួមសាកល្បងមនុស្សត្រូវបានបង់ 115 ដុល្លារក្នុងមួយវគ្គ 90 នាទី បូក 5 ដុល្លារក្នុងមួយហ្គេមដែលបានបញ្ចប់ ដោយធ្វើការប្រហែល 12.78 ដុល្លារក្នុងមួយហ្គេមដែលបានព្យាយាម។ ការរត់ការវាយតម្លៃ Astra ពេញលេញមានតម្លៃ 5 តួលេខ អាស្រ័យលើការកំណត់។ ប៉ុន្តែ ARC Prize បានកត់សម្គាល់ពីភាពជ្រីវជ្រួញដែលផ្ទុយស្រឡះ៖ កិច្ចខិតខំប្រឹងប្រែងរកហេតុផលខ្ពស់ ជាទូទៅចំណាយតិចជាង ដោយសារតែ Astra បានដោះស្រាយហ្គេមក្នុងសកម្មភាពតិចជាង ដោយកាត់បន្ថយចំនួនសរុបនៃការហៅទូរសព្ទ និងសញ្ញាសម្ងាត់ដែលបានដុតក្នុងមួយដំណើរការ។
គំរូដែលបង្កើតភាសាផ្ទាល់ខ្លួន
លើសពីពិន្ទុ រង្វាន់ ARC បានគូសបញ្ជាក់ពីអាកប្បកិរិយាប្រកបដោយគុណភាពដែលក្រុមបានសង្កេតឃើញ។ Astra បានប្រែក្លាយបរិស្ថានដែលមិនធ្លាប់ស្គាល់ជាបន្តបន្ទាប់ទៅជាគំរូពិភពលោកដែលមានលក្ខណៈជានិមិត្តរូបដ៏តូច—តំណាងឱ្យមេកានិចហ្គេមជាក្បួនឡូជីខល និងបង្កើតពាក្យខ្លីៗសម្រាប់ដែនជាក់លាក់របស់ខ្លួនដើម្បីតាមដានសកម្មភាពរដ្ឋ និងផែនការ។
នោះច្បាស់ណាស់ជំនាញ ARC-AGI-3 ត្រូវបានរចនាឡើងដើម្បីស៊ើបអង្កេត។ ដែលជាកន្លែងដែលជំនាន់មុននៃគោលបានសាកល្បងហេតុផលរាវលើគំរូប្រលោមលោក ជំនាន់ទីបីសាកល្បងថាតើភ្នាក់ងារអាចរុករក ធ្វើគំរូ កំណត់គោលដៅ និងអនុវត្តផែនការនៅក្នុងបរិស្ថានដែលវាមិនធ្លាប់ឃើញ — ធាតុផ្សំនៃបញ្ជីរង្វាន់ ARC ជាការរុករក ការធ្វើគំរូ ការកំណត់គោលដៅ និងការធ្វើផែនការ និងការប្រតិបត្តិ។
ផ្ទាំងខាងក្រោយ AGI-Era
លទ្ធផលគោលបានមកដល់ចំពេលមានវោហាសាស្ត្រអតិបរមាពី OpenAI ខ្លួនឯង។ នៅក្នុងសន្និសីទសារព័ត៌មានមួយមុនពេលចាប់ផ្តើមនៅថ្ងៃព្រហស្បតិ៍ ប្រធានក្រុមហ៊ុនលោក Greg Brockman បាននិយាយថា វាមិនសមហេតុផលទេក្នុងការមានអារម្មណ៍ថាឥឡូវនេះយើងស្ថិតនៅក្នុងយុគសម័យ AGI ខណៈពេលដែលបញ្ឈប់ការប្រកាសជាផ្លូវការ នេះបើយោងតាមការចុះផ្សាយរបស់ The New Stack នៃការចាប់ផ្តើមនេះ។ គាត់បានពិពណ៌នា AGI ថាជា "គំនិតបេសកកម្ម ឬគំនិតខាងវិញ្ញាណ" ជាជាងការកេះតាមកិច្ចសន្យា។
អ្នកស្រាវជ្រាវ OpenAI Aidan Clark បាននិយាយថា Astra គឺជាដំណើរការបណ្តុះបណ្តាលដ៏ធំបំផុតរបស់ក្រុមហ៊ុនរហូតមកដល់បច្ចុប្បន្ន ដែលជាការបណ្តុះបណ្តាលមុនគេបង្អស់លើ GPUs ច្រើនជាង 100,000 នៅគេហទំព័រ Stargate ក្នុងរដ្ឋ Texas ហើយការចេញផ្សាយ OpenAI ដំបូងបង្អស់ដែលម៉ូដែលមុនៗបានដើរតួយ៉ាងសំខាន់ក្នុងការត្រួតពិនិត្យដំណើរការបណ្តុះបណ្តាល។ ការចូលដំណើរការនៅតែជាដំណាក់កាល៖ ការចេញផ្សាយចាប់ផ្តើមជាមួយអតិថិជនសហគ្រាសនៅក្នុងកម្មវិធី Daybreak ជាមួយនឹងភាពអាចរកបានរបស់ Plus, Pro, Business និង Enterprise បូកនឹងការចូលប្រើ API និង AWS ដែលបានសន្យានៅក្នុងប៉ុន្មានថ្ងៃខាងមុខនេះ។
សញ្ញាផ្កាយនៅលើពិន្ទុ
ការប្រុងប្រយ័ត្នត្រូវបានធានានៅផ្នែកខាងមុខជាច្រើន។ ការអនុវត្ត ARC-AGI-3 របស់ Astra ពឹងផ្អែកយ៉ាងខ្លាំងទៅលើការកំណត់រចនាសម្ព័ន្ធខ្សែ ដូចដែលលេខចំណងជើងពីរបង្ហាញ ហើយខ្សែផ្ទាល់ខ្លួនដែលរក្សាស្ថានភាពគំរូគឺជាចំណុចដែលកើតឡើងដដែលៗនៅក្នុងជម្លោះគោល។ ការវិភាគរបស់ The New Stack នៃការបើកដំណើរការបានកត់សម្គាល់ថា Astra "ទទួលបានផលចំណេញច្រើនលើការងារឯកទេស ប៉ុន្តែវាមកដោយតម្លៃខ្ពស់ និងមិនច្បាស់លាស់ក្នុងការដឹកនាំកញ្ចប់កូដ" ដែលជាការរំលឹកថា គំរូល្បែងផ្គុំរូបភ្នាក់ងារ និងបន្ទុកការងារពាណិជ្ជកម្មប្រចាំថ្ងៃវាស់វែងខុសគ្នា។
រង្វាន់ ARC ខ្លួនវាកំណត់នូវលំហាត់នេះថាជាការវាស់ស្ទង់ "គម្លាតសំណល់" រវាង AI និង AGI បច្ចុប្បន្ន ដោយកំណត់ AGI ជាសមត្ថភាពក្នុងការទទួលបានជំនាញណាមួយដែលមនុស្សអាចធ្វើបាន ប្រកបដោយប្រសិទ្ធភាពដូចមនុស្សអាចធ្វើបាន។ ពិន្ទុជិតល្អឥតខ្ចោះក្រោមលក្ខខណ្ឌអំណោយផលមិនបិទគម្លាតនោះដោយខ្លួនវាទេ។ ហើយនៅ $17,000 ទៅ $50,000 ក្នុងមួយដំណើរការវាយតម្លៃ មានតែមន្ទីរពិសោធន៍ដែលមានធនធានល្អប៉ុណ្ណោះដែលអាចមានលទ្ធភាពក្នុងការដំណើរការតារាងពិន្ទុក្នុងមាត្រដ្ឋាននេះ ទោះបីជាទិន្នន័យតម្លៃរបស់ ARC Prize បង្ហាញពីហេតុផលដ៏ឆ្លាតវៃអាចកាត់បន្ថយវិក្កយបត្របានក៏ដោយ។
ហេតុអ្វីវាសំខាន់
ប្រសិទ្ធភាពនៃសកម្មភាពគឺជាអ័ក្សថ្មីនៃការប្រៀបធៀប។ គំរូដែលដោះស្រាយគ្រប់កម្រិត ប៉ុន្តែខ្ជះខ្ជាយការហៅទូរសព្ទរាប់ពាន់ដែលធ្វើវាមិនសូវមានប្រយោជន៍ - និងថ្លៃជាង - ជាងមួយដែលធ្វើសកម្មភាពដូច Astra បានធ្វើនៅទីនេះ៖ ស្វែងយល់ដោយចេតនា បង្រួមអ្វីដែលវារៀន និងធ្វើសកម្មភាពលើវា។ អ្វីដែលគេសន្និដ្ឋានអំពីការជជែកដេញដោល AGI ទិន្នន័យពានរង្វាន់ ARC បង្ហាញថាភ្នាក់ងារព្រំដែនឥឡូវនេះកំពុងផ្គូផ្គងមនុស្សមិនត្រឹមតែលើថាតើពួកគេអាចដោះស្រាយបញ្ហាប្រលោមលោកបានទេ ប៉ុន្តែនៅលើរបៀបដែលពួកគេដោះស្រាយដោយសេដ្ឋកិច្ច។
នាំមុខ AI
រាល់លទ្ធផលគោល ការបើកបង្ហាញគំរូ និងការពិភាក្សាអំពីសុវត្ថិភាព តាមដាននៅពេលវាកើតឡើង — អានព័ត៌មាន AI បន្ថែម →
