Google DeepMind បានប្រកាសកាលពីថ្ងៃទី 27 ខែសីហា នូវអ្វីដែលខ្លួនហៅថាការវាយតម្លៃទ្វេរដងដំបូងបង្អស់របស់ពិភពលោកនៃគំរូ AI កម្រិតព្រំដែនដែលមានកម្មសិទ្ធិ ដែលជាការរៀបចំគ្រីបដែលត្រូវបានរចនាឡើងដើម្បីឱ្យអ្នកជំនាញខាងក្រៅស្ត្រេសសាកល្បងគំរូរបស់ Google ដោយមិនដែលភាគីណាមួយបានឃើញអាថ៌កំបាំងរបស់ភាគីម្ខាងទៀត។
អ្នកបើកយន្តហោះដែលត្រូវបានពិពណ៌នានៅក្នុងការបង្ហោះប្លុក DeepMind ដោយ William Isaac, Sol Messing និង Kristian Lum ដំណើរការម៉ូដែល Gemini Flash Lite តាមរយៈស្តង់ដារសម្ងាត់នៅក្នុងបរិយាកាសសុវត្ថិភាពសម្ងាត់។ Google DeepMind កំពុងចាប់ដៃគូជាមួយវិទ្យាស្ថានសុវត្ថិភាព AI របស់សិង្ហបុរី OpenMined, AVRI និង MLCommons លើកិច្ចខិតខំប្រឹងប្រែងនេះហើយបានបោះពុម្ពរបាយការណ៍បច្ចេកទេសដែលពិពណ៌នាអំពីវិធីសាស្រ្តនេះ។
សេចក្តីប្រកាសនេះនិយាយអំពីភាពទន់ខ្សោយដែលជាប់លាប់បំផុតមួយនៅក្នុងការវាយតម្លៃ AI៖ ការចម្លងតាមស្តង់ដារ។ សម្រាប់អ្នកអានដែលតាមដាន ព័ត៌មានស្រាវជ្រាវ AI វាតំណាងឱ្យការប៉ុនប៉ងជាក់ស្តែងមួយបន្ថែមទៀតដើម្បីធ្វើឱ្យការធ្វើតេស្តគំរូភាគីទីបីមានភាពស្អាតស្អំ។
បញ្ហាការចម្លងរោគ ត្រូវបានពន្យល់
DeepMind បើកការប្រកាសរបស់ខ្លួនជាមួយនឹងការប្រៀបធៀបថ្នាក់រៀន។ ប្រសិនបើសិស្សឃើញសំណួរប្រឡងជាមុនដោយចៃដន្យ ពិន្ទុល្អឥតខ្ចោះមានន័យថាគ្មានអ្វីសោះ។ តក្កវិជ្ជាដូចគ្នាអនុវត្តចំពោះគំរូព្រំដែន៖ ប្រសិនបើគំរូមួយត្រូវបានលាតត្រដាងរួចហើយចំពោះសំណួរនៅក្នុងគោលមួយ — តាមរយៈទិន្នន័យបណ្តុះបណ្តាល សំណុំការវាយតម្លៃដែលលេចធ្លាយ ឬការបង្កើនប្រសិទ្ធភាពពីមុន — ពិន្ទុលទ្ធផលអាចហួសកម្រិតសមត្ថភាពពិតប្រាកដ។
នេះមិនមែនជាការព្រួយបារម្ភសម្មតិកម្មទេ។ ការចម្លងរោគ Benchmark បានបង្អាក់វិស័យនេះអស់រយៈពេលជាច្រើនឆ្នាំ ដោយអ្នកស្រាវជ្រាវបង្ហាញម្តងហើយម្តងទៀតថា ការធ្វើតេស្តដ៏ពេញនិយមបានលេចធ្លាយចូលទៅក្នុងស្ថាប័នបណ្តុះបណ្តាលតាមមាត្រដ្ឋានគេហទំព័រ ហើយម៉ូដែលនោះអាចត្រូវបានកែសម្រួលដោយស្ងាត់ស្ងៀម ដើម្បីអនុវត្តបានល្អលើការវាយតម្លៃដែលគេស្គាល់។ នៅពេលដែលរដ្ឋាភិបាល និងសហគ្រាសប្រើប្រាស់ពិន្ទុគោលដើម្បីធ្វើការសម្រេចចិត្តលើលទ្ធកម្ម និងគោលនយោបាយ តួលេខអតិផរណានាំមកនូវផលវិបាកពិតប្រាកដ។
នៅពេលដែលម៉ូដែលកាន់តែមានសមត្ថភាពកាន់តែរីកចម្រើន DeepMind អះអាងថា ភាគហ៊ុនគឺខ្ពស់បំផុតសម្រាប់ប្រភេទវាយតម្លៃរសើប - ការធ្វើតេស្តសុវត្ថិភាពតាមអ៊ីនធឺណិត និងប្រធានការវាយតម្លៃរបស់រដ្ឋាភិបាលក្នុងចំណោមពួកគេ - ដែលពិន្ទុកខ្វក់មិនគ្រាន់តែជាការយល់ច្រឡំប៉ុណ្ណោះទេ ប៉ុន្តែអាចមានគ្រោះថ្នាក់។
ការដោះដូរចាស់៖ ការជម្រុញរបស់អ្នក ឬទម្ងន់របស់យើង។
ជាប្រវត្តិសាស្ត្រ ការវាយតម្លៃខាងក្រៅដែលមានភាគហ៊ុនខ្ពស់បានបង្ខំឱ្យមានជម្រើសដែលមិនស្រួល។ ទាំងអ្នកវាយតម្លៃបានប្រគល់ការជំរុញការធ្វើតេស្តរបស់ខ្លួនទៅឱ្យអ្នកផ្តល់គំរូ — ប្រថុយដែលអ្នកផ្តល់សេវានឹងឃើញសំណួរសាកល្បងជាមុន — ឬអ្នកផ្តល់សេវាប្រគល់ទម្ងន់គំរូទៅឱ្យអ្នកវាយតម្លៃ — ប្រថុយនឹងការបាត់បង់កម្មសិទ្ធិបញ្ញាដ៏មានតម្លៃបំផុតរបស់វា។
DeepMind សរសេរថា ពិធីការសូន្យ និងការការពារកិច្ចសន្យាយ៉ាងម៉ត់ចត់បានរក្សាការសាកល្បងខាងក្រៅជាយូរមកហើយ ធ្វើឱ្យមានការសម្ងាត់។ DeepMind សរសេរ ប៉ុន្តែទាំងនោះគឺជាការសន្យាដែលអនុវត្តដោយគោលការណ៍ជាជាងដោយគណិតវិទ្យា។ ការវាយតម្លៃពិការភ្នែកពីរដងជំនួសការជឿទុកចិត្តនោះដោយភស្តុតាងគ្រីបគ្រីប។
របៀបដែលប្រអប់គ្រីបតូដំណើរការ
អ្នកបើកយន្តហោះប្រើ Confidential Space ដែលជាផ្នែកមួយនៃផលប័ត្រនៃការគណនាសម្ងាត់របស់ Google Cloud ដើម្បីបង្កើតនូវអ្វីដែល DeepMind ពិពណ៌នាថាជា "ប្រអប់គ្រីប"។ នៅខាងក្នុងវា ទាំងពាក់កណ្តាលនៃការវាយតម្លៃ — គោលការសម្ងាត់ និងគំរូកម្មសិទ្ធិ — នៅតែជាឯកជនសម្រាប់ម្ចាស់របស់ពួកគេរៀងៗខ្លួន ហើយបរិស្ថាននឹងផ្ទៀងផ្ទាត់ការពិតនោះ។
លទ្ធផលគឺពិតជាពិការភ្នែកទ្វេរដង៖ អ្នកវាយតម្លៃខាងក្រៅមិនអាចមើលទម្ងន់គំរូ Gemini បានទេ ហើយ Google មិនអាចមើលឃើញការសាកល្បងរបស់អ្នកវាយតម្លៃនោះទេ។ ភាគីទាំងសងខាងមិនត្រូវជឿជាក់លើការសន្យារបស់ភាគីម្ខាងទៀតទេ ព្រោះស្ថាបត្យកម្មខ្លួនឯងធ្វើឱ្យលេចធ្លាយជាគោលការណ៍មិនអាចទៅរួចនោះទេ។ ជាការរិះគន់ ការដំឡើងនេះក៏រារាំងទិន្នន័យវាយតម្លៃពីការប្រើប្រាស់នៅពេលក្រោយ ដើម្បីបង្កើនប្រសិទ្ធភាពប្រតិបត្តិការរបស់ម៉ូដែល មុនពេលការធ្វើតេស្តនាពេលអនាគត — បិទរង្វិលជុំដែលជាធម្មតាការចម្លងរោគនឹងចូលមកវិញ។
ហេតុអ្វីបានជាវាសំខាន់សម្រាប់ការត្រួតពិនិត្យ AI
សារៈសំខាន់ទូលំទូលាយលើសពីគំរូ Gemini មួយ។ អង្គការឯករាជ្យ - វិទ្យាស្ថានសុវត្ថិភាព AI មន្ទីរពិសោធន៍សិក្សា និយតករ - បានតស៊ូអស់ជាច្រើនឆ្នាំដើម្បីវាយតម្លៃយ៉ាងម៉ឺងម៉ាត់នូវគំរូព្រំដែនបិទជិត យ៉ាងជាក់លាក់ ពីព្រោះអ្នកផ្តល់សេវាមិនអាចប្រគល់ទម្ងន់បានទេ ហើយអ្នកវាយតម្លៃនឹងមិនប្រគល់ស្តង់ដារ។ រាល់វិទ្យាស្ថានសុវត្ថិភាព AI សំខាន់ៗបានដោះស្រាយជាមួយនឹងកំណែនៃបញ្ហានេះ នៅពេលចុះហត្ថលេខាលើកិច្ចព្រមព្រៀងវាយតម្លៃជាមួយមន្ទីរពិសោធន៍ព្រំដែន។
ប្រសិនបើអ្នកបើកយន្តហោះកាន់ឡើង វាផ្តល់នូវគំរូមួយដែលអធិបតេយ្យភាពទិន្នន័យ និងកម្មសិទ្ធិបញ្ញាអាចរស់រានមានជីវិត ទាក់ទងជាមួយការត្រួតពិនិត្យឯករាជ្យ។ DeepMind និយាយថា ខ្លួនសង្ឃឹមថាអ្នកបើកយន្តហោះ "បង្កើតព្រំដែនថ្មីសម្រាប់ការត្រួតពិនិត្យគំរូ ដោយជួយឱ្យឧស្សាហកម្មកាន់តែទូលំទូលាយបង្កើតប្រព័ន្ធ AI កាន់តែមានសុវត្ថិភាព ភាពជឿជាក់ និងជឿទុកចិត្តបានយ៉ាងទូលំទូលាយ"។
បញ្ជីដៃគូគឺគួរឱ្យកត់សម្គាល់នៅក្នុងខ្លួនវាផ្ទាល់។ វិទ្យាស្ថានសុវត្ថិភាព AI របស់សិង្ហបុរី គឺជាស្ថាប័នវាយតម្លៃជាតិសកម្មបំផុតមួយ។ OpenMined បង្កើតឧបករណ៍គណនាដែលរក្សាភាពឯកជន។ MLCommons ធ្វើឱ្យស្តង់ដារការធ្វើជាគំរូឧស្សាហកម្ម។ AVERI បង្រួបបង្រួមសមាគមដែលលាតសន្ធឹងលើរដ្ឋាភិបាល ស្ថាប័នអប់រំ និងស្តង់ដារឧស្សាហកម្ម ដែលជាមណ្ឌលបោះឆ្នោតដែលត្រូវអនុម័តការវាយតម្លៃពិការភ្នែកពីរដងដើម្បីឱ្យវាក្លាយជាបទដ្ឋានជាជាងការធ្វើបាតុកម្ម។
ការប្រណាំងអាវុធលើសុចរិតភាពនៃការវាយតម្លៃ
ការប្រកាសនេះកើតឡើងចំពេលមានការពិនិត្យមើលឡើងវិញអំពីរបៀបដែលក្រុមហ៊ុន AI ចាត់ថ្នាក់ខ្លួនឯង។ មន្ទីរពិសោធន៍ប្រឈមមុខនឹងការចោទប្រកាន់កាន់តែច្រើនឡើងលើការរើសយកគំរូល្អ ហើយតារាងពិន្ទុឯករាជ្យបានក្លាយទៅជាមានឥទ្ធិពលយ៉ាងជាក់លាក់ ដោយសារតែពួកគេអង្គុយនៅខាងក្រៅការគ្រប់គ្រងរបស់អ្នកលក់។ ការវាយតម្លៃពិការភ្នែកពីរដងពង្រីកចលនាឯករាជ្យនោះនៅក្នុងហេដ្ឋារចនាសម្ព័ន្ធផ្ទាល់របស់អ្នកលក់ ដែលជាការផ្លាស់ប្តូរគួរឱ្យកត់សម្គាល់សម្រាប់ក្រុមហ៊ុនដែលបានទទូចជាប្រវត្តិសាស្ត្រលើការគ្រប់គ្រងរាល់ព័ត៌មានលម្អិតនៃរបៀបដែលគំរូរបស់ពួកគេត្រូវបានសាកល្បង។
សម្រាប់ពេលនេះ អ្នកបើកយន្តហោះគ្របដណ្តប់លើគំរូមួយ និងសំណុំនៃស្តង់ដារសម្ងាត់មួយ។ ប៉ុន្តែប្រសិនបើការផ្ទៀងផ្ទាត់ជាសម្ងាត់ ការវាយតម្លៃគ្មានការចម្លងរោគក្លាយជាទម្លាប់តាមបច្ចេកទេស វាអាចផ្លាស់ប្តូរអ្វីដែលសហគ្រាស និងនិយតកររំពឹងពីមន្ទីរពិសោធន៍ព្រំដែននីមួយៗ ហើយធ្វើឱ្យ "ការជឿជាក់លើពិន្ទុរបស់យើង" កាន់តែពិបាកលក់នៅក្នុងទីផ្សារកាន់តែខ្លាំងឡើងលើការអះអាងដែលអាចផ្ទៀងផ្ទាត់បាន។
---
ស្នាក់នៅមុន AIទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។
អានព័ត៌មាន AI បន្ថែម →