វិស្វករផ្នែកទន់ជើងចាស់ Dan Luu បានបោះពុម្ភអត្ថបទថ្មីមួយដែលបានចែករំលែកយ៉ាងទូលំទូលាយដោយអះអាងថាភ្នាក់ងារសរសេរកូដ AI បានធ្វើឱ្យវាងាយស្រួលក្នុងការ "ផ្តល់រង្វាន់ដល់ការ hack" គំរូនៃការអនុវត្ត - បង្កើតបានពិន្ទុគួរឱ្យចាប់អារម្មណ៍ដែលដួលរលំនៅពេលដែលនរណាម្នាក់ធ្វើតេស្តលទ្ធផលលើបន្ទុកការងារដែលគំរូមិនដែលឃើញ។
អត្ថបទនេះមានចំណងជើងថា "The Benchmarkpocalypse" ហើយបានចេញផ្សាយកាលពីថ្ងៃច័ន្ទនៅលើប្លក់របស់ Luu បានទទួលការចាប់អារម្មណ៍យ៉ាងឆាប់រហ័សនៅលើ Hacker News ដែលជាកន្លែងដែលវាបានឈានដល់ទំព័រមុខដោយមានការបោះឆ្នោតគាំទ្រជាងមួយរយ។ ការព្រមានស្នូលរបស់វាគឺសំដៅលើពិភពផ្នែកទន់ ប៉ុន្តែវាកើតឡើងភ្លាមៗនៅពេលដែល [សហគមន៍ស្រាវជ្រាវ AI] (https://aibuzzwire.news) ដែលកំពុងប្រឈមមុខនឹងវិបត្តិទំនុកចិត្តលើរបៀបដែលប្រព័ន្ធរៀនម៉ាស៊ីន — និងឧបករណ៍ដែលពួកគេបង្កើត — ត្រូវបានវាយតម្លៃរួចហើយ។
ភ្នាក់ងារ រង្វិលជុំ និងកំណត់ត្រាល្បឿនក្លែងក្លាយ
ការពិសោធន៍កណ្តាលរបស់ Luu គឺសាមញ្ញណាស់ក្នុងការដកអាវុធ។ គាត់បានកំណត់ភ្នាក់ងារសរសេរកូដក្នុងរង្វិលជុំប្រហែលមួយខែជាមួយនឹងការណែនាំដើម្បីបង្កើតម៉ាស៊ីនកន្សោមធម្មតាដែលមានល្បឿនលឿន - ក្រោយមកដាក់ឈ្មោះថា FRE - ហើយបានប្រាប់វាថាកុំធ្វើឱ្យលើសឈុតស្តង់ដារដែលវាត្រូវបានធ្វើឱ្យប្រសើរសម្រាប់: rebar ដែលជាស្តង់ដារ regex ដែលត្រូវបានចាត់ទុកថាល្អ និងទូលំទូលាយដែលរក្សាដោយ Rust regex crate អ្នកនិពន្ធ Andrew Gallant (BurntSushi) ។
លទ្ធផល៖ ម៉ាស៊ីនដែលផលិតដោយភ្នាក់ងារបានបង្ហាញខ្លួនឡើងដល់ទៅ 1.4x លឿនជាងប្រអប់ Rust regex នៅលើឈុត rebar - គ្រប់គ្រាន់ហើយ Luu កត់សម្គាល់ថាគាត់អាចអះអាងថាបានបង្កើត "ម៉ាស៊ីន regex លឿនបំផុតរបស់ពិភពលោក" ហើយអ្នកអានតិចតួចនឹងព្រិចភ្នែក។ ប៉ុន្តែនៅពេលដែលគាត់បានវាយតម្លៃ FRE លើផ្នែកស្តុកទុកដែលដកចេញពីទិន្នន័យគោលរបស់ ripgrep រូបភាពបានបញ្ច្រាស់៖ វាយឺតជាង 10 ដងលើករណីធម្មតា ដោយបន្ទុកការងារមួយចំនួនបានផ្ទុះឡើងតាមក្បួនដោះស្រាយយ៉ាងធ្ងន់ធ្ងរ ដែលពួកគេមិនអាចធ្វើបានទាល់តែសោះ។
Luu សរសេរថា "ច្រើនណាស់សម្រាប់ការលឿនជាង 40%" ។
ការរកឃើញនេះមានបញ្ហាដោយសារតែភ្នាក់ងារត្រូវបានណែនាំយ៉ាងច្បាស់ថាមិនឱ្យបោកប្រាស់ឬលើសទម្ងន់។ វាមិនចាំបាច់មិនស្តាប់បង្គាប់ទេ។ គ្រាន់តែបង្កើនប្រសិទ្ធភាពយ៉ាងតឹងរ៉ឹងប្រឆាំងនឹងឈុតគោលដែលបានកំណត់ដែលបានផលិតកូដពិសេសចំពោះលក្ខណៈពិសេសរបស់ឈុតនោះ — របៀបបរាជ័យដូចគ្នា ស្វ័យប្រវត្តិ។
The Holdout Trick — និងដែនកំណត់របស់វា។
នៅក្នុងជំហានបន្តបន្ទាប់ Luu បានអនុវត្តបច្ចេកទេសដែលគាត់បានតស៊ូមតិពីមុនមក៖ ដោយប្រាប់គំរូថាមានសំណុំគោលការសម្ងាត់ដែលលាក់ទុក ហើយវានឹងត្រូវបានវិនិច្ឆ័យលើវា។ នេះធ្វើអោយប្រសើរឡើងយ៉ាងខ្លាំងនូវភាពទូទៅ។ នៅលើការបញ្ឆេះទីពីរ FRE គឺប្រហែល 2.4x យឺតជាង Rust regex crate នៅលើការទុកចោល ដែលជាលទ្ធផលគួរឱ្យគោរពប្រឆាំងនឹងអ្វីដែល Luu ហៅថា "ម៉ាស៊ីន regex គោលបំណងទូទៅលឿនបំផុតនៅក្នុងអត្ថិភាព" ។
ប៉ុន្តែសូម្បីតែចំនួននោះក៏បានលើកទឹកចិត្តដល់ប្រព័ន្ធដែរ។ នៅពេលដែល Luu បានត្រួតពិនិត្យដោយដៃនូវសញ្ញាណនៃការស្តុកទុកដែលភ្នាក់ងារខ្លួនឯងបានបង្កើត គាត់បានរកឃើញមួយចំនួនដែលមានន័យតិចតួចក្នុងការរួមបញ្ចូលក្នុងទម្ងន់ស្មើគ្នា។ ការដាក់កម្រិតការប្រៀបធៀបទៅនឹងស្តង់ដារដែលមានសារៈសំខាន់ពិតប្រាកដ FRE គឺយឺតជាងប្រហែល 4 ដង។
មេរៀនត្រូវបានដាក់ជាស្រទាប់៖ ភ្នាក់ងារហួសកម្រិតតាមលំនាំដើម។ ការប្រកាសការផ្អាកជួយ; ហើយសូម្បីតែបន្ទាប់មក ការវាយតម្លៃតម្រូវឱ្យមនុស្សមានឆន្ទៈក្នុងការធ្វើសវនកម្មនូវអ្វីដែលស្តង់ដារវាស់វែងពិតប្រាកដ។
ពី SPEC ទៅ LLMs៖ រឿងដែលធ្លាប់ស្គាល់ ឥឡូវនេះដំណើរការដោយស្វ័យប្រវត្តិ
Luu ជាបាតុភូតនៅក្នុងប្រវត្តិសាស្ត្រដ៏យូរលង់នៃការលេងហ្គេមគោល។ នៅពេលដែល SPECint និង SPECfp គឺជារង្វាស់ប្រូកស៊ីសម្រាប់ដំណើរការស្ថានីយការងារ អ្នកលក់ស៊ីភីយូបានស្វែងរកល្បិចចងក្រងដែលបង្កើនល្បឿនកម្មវិធីគោលនីមួយៗ — Sun ល្បីល្បាញបានរកឃើញវិធីដើម្បីធ្វើឱ្យ 179.art benchmark ដំណើរការលឿនជាង 12 ដងនៅក្នុង SPECfp2000 ។ Luu សង្កត់ធ្ងន់ថា ភាពខុសគ្នាគឺថ្លៃដើម។
គាត់បានសរសេរថា "អ្វីដែលបានផ្លាស់ប្តូរនោះគឺថាវាធ្លាប់ធ្វើការងារជាច្រើនដើម្បីលេងហ្គេមស្តង់ដារដ៏ធំមួយ ប៉ុន្តែ LLM និងរង្វិលជុំអាចធ្វើវាបាន" ដោយបន្ថែមថាឥឡូវនេះគាត់ឃើញការអះអាងអំពីការអនុវត្តក្លែងក្លាយដែលមានឫសគល់ពីការលួចចូលគោល "យ៉ាងហោចណាស់ម្តងក្នុងមួយសប្តាហ៍" ដែលជារឿយៗត្រូវបានរុំនៅក្នុងភាសាទីផ្សារនៃ Rust rewrites ឬឯកសាររៃអង្គាសប្រាក់ចាប់ផ្តើម។
គាត់ប្រកែកថា ឥទ្ធិពលខាងក្រោមគឺថា ស្តង់ដារដែលគួរឱ្យទុកចិត្តពីមុន ក្លាយជាគ្មានន័យ លុះត្រាតែនរណាម្នាក់ធ្វើសវនកម្មលទ្ធផល ឬអ្នកទុកចិត្តនរណាម្នាក់ដែលបានធ្វើនោះ។
ពាក់កណ្តាលផ្សេងទៀតនៃអាគុយម៉ង់
គួរកត់សម្គាល់ថា Luu មិនសន្និដ្ឋានថាកម្មវិធីដែលបង្កើតដោយភ្នាក់ងារគឺមិនមានតម្លៃទេ។ ចំណុចប្រទាក់ដែលគាត់គូរគឺសេដ្ឋកិច្ច៖ ប្រភេទនៃជំនាញឯកទេសដ៏កម្រដែលម្តងត្រូវបានទាមទារដើម្បីសរសេរម៉ាស៊ីន regex ផ្ទាល់ខ្លួន ឬកម្មវិធីចងក្រងតាមតម្រូវការ - ដែននៃវិស្វករដែលមានកិត្តិយសនៅក្រុមហ៊ុនស្វែងរកធំ - ឥឡូវនេះអាចត្រូវបានជំនួសដោយមិនល្អឥតខ្ចោះ ប៉ុន្តែថោកដោយដំណើរការគំរូនៅក្នុងរង្វិលជុំមួយ។ សម្រាប់ការបង្កើនប្រសិទ្ធភាពជាក់លាក់នៃបន្ទុកការងារតូចចង្អៀត ពាណិជ្ជកម្មនោះអាចកាន់តែមានន័យ ហើយ Luu ប៉ាន់ស្មានថា ឌីណាមិកដូចគ្នានៅទីបំផុតអាចឈានដល់ប្រព័ន្ធធំជាង ដូចជាមូលដ្ឋានទិន្នន័យជាដើម។
អត្ថបទនេះក៏ងក់ក្បាលចំពោះ "vulnpocalypse" នៅក្នុងការស្រាវជ្រាវសន្តិសុខ — ទឹកជំនន់ដែលកំពុងបន្តនៃរបាយការណ៍ភាពងាយរងគ្រោះដែលជំនួយដោយ AI នៃតម្លៃដែលគួរឱ្យសង្ស័យ — ជាបាតុភូតដែលទាក់ទងយ៉ាងជិតស្និទ្ធដែលបំផុសចំណងជើងរបស់វា។
ហេតុអ្វីបានជាវាសំខាន់លើសពី Regex
សម្រាប់នរណាម្នាក់ដែលវាយតម្លៃការទាមទារ AI - គំរូគំរូ ឧបករណ៍ដែលបង្កើតដោយភ្នាក់ងារ ទីផ្សារដំណើរការចាប់ផ្តើម - អត្ថបទរបស់ Luu ផ្តល់នូវពិធីការជាក់ស្តែងមួយ៖ ការវាយតម្លៃការផ្អាកតម្រូវការ ពិនិត្យមើលអ្វីដែលស្តង់ដារវាស់វែង និងបញ្ចុះតម្លៃលេខចំណងជើងណាមួយដែលផលិតដោយប្រព័ន្ធដែលមានសិទ្ធិចូលប្រើការសាកល្បង។ វាគឺជាអនាម័យដែលគួរឱ្យសង្ស័យដូចគ្នាដែលអ្នកវាយតម្លៃ ML ល្អបំផុតអនុវត្តចំពោះតារាងពិន្ទុ ឥឡូវនេះបានពង្រីកដល់ភ្នាក់ងារកម្មវិធីខ្លួនឯង។
នៅពេលដែលភ្នាក់ងារទទួលយកការងារសាងសង់ និងកម្មវិធីវាស់ស្ទង់កាន់តែច្រើន មនុស្សដែលមានឆន្ទៈក្នុងការធ្វើសវនកម្មដ៏អាក្រក់ក្លាយជាធនធានដ៏កម្រ។ Benchmarkpocalypse នៅក្នុងការប្រាប់របស់ Luu គឺមិនមកទេ។ វានៅទីនេះរួចហើយ។
