នៅពេលដែល OpenAI បានដាក់បង្ហាញ GPT-6 Astra នៅសប្តាហ៍នេះ ការបង្ហាញមួយបានទាក់ទាញការចាប់អារម្មណ៍ជាពិសេសពីទស្សនិកជនដែលកម្រទទួលបានការស្រែកយំនៅឯការបើកដំណើរការម៉ូដែល Frontier: វិស្វករអគ្គិសនី។ ការបង្ហោះបង្ហោះបង្ហាញពីគំរូរចនាបន្ទះសៀគ្វីនៅក្នុង KiCad ដែលជាឧបករណ៍រចនាអេឡិចត្រូនិកប្រភពបើកចំហ។ ប៉ុន្តែក្រុមវិស្វករតូចមួយបាននឹងកំពុងសួរសំណួរដែលពិបាកជាងនេះ មិនមែនថាតើម៉ូដែល AI អាចដំណើរការកម្មវិធីអេឡិចត្រូនិចបានទេ ប៉ុន្តែថាតើសៀគ្វីដែលពួកគេផលិតពិតជាដំណើរការដែរឬទេ។

ចម្លើយរបស់ពួកគេបានមកដល់នៅថ្ងៃទី 4 ខែកញ្ញា ក្នុងទម្រង់ជា EEBench ដែលជាស្តង់ដារសាធារណៈថ្មីមួយដែលផ្តល់ចំណាត់ថ្នាក់សៀគ្វីដែលរចនាដោយ AI ដោយប្រើការក្លែងធ្វើ SPICE កំណត់ជាជាងការវិនិច្ឆ័យរបស់មនុស្ស។ លទ្ធផលដំបូងបង្ហាញថា ម៉ូដែលបច្ចុប្បន្នដឹងច្រើនអំពីគ្រឿងអេឡិចត្រូនិក ជាងលទ្ធផលដែលបង្ហាញជាធម្មតា ប៉ុន្តែនៅតែបរាជ័យចំពោះប្រភេទនៃអាកប្បកិរិយាផ្នែកពិភពពិត ដែលធ្វើអោយវិស្វករមនុស្សកើនឡើងផងដែរ។ For more context on this story, see our ongoing AI trends.

ហេតុអ្វីបានជាការរចនាសៀគ្វីត្រូវការស្តង់ដារផ្ទាល់ខ្លួនរបស់វា។

ក្រុមការងារ EEBench ដែលបោះពុម្ពផ្សាយគោលនៅ ebench.org និយាយថា បទពិសោធន៍របស់វាបង្ហាញថា ម៉ូដែលបច្ចុប្បន្នបានស្រូបយកសៀវភៅសិក្សា សន្លឹកទិន្នន័យ កំណត់ចំណាំកម្មវិធី និងលេខកូដយ៉ាងច្រើន។ ចំណុចប្រទាក់គឺជាចំណុចប្រទាក់។ នៅពេលដែលភ្នាក់ងារដំណើរការឧបករណ៍ CAD ក្រាហ្វិកដូចជា KiCad វាចំណាយកិច្ចខិតខំប្រឹងប្រែងជាច្រើនរបស់ខ្លួនក្នុងការចុចតាមរយៈម៉ឺនុយ និងតាមដានអ្វីដែលមាននៅលើអេក្រង់ ដោយប្រើប្រាស់បង្អួចបរិបទរបស់វាជាមួយនឹងកូអរដោណេ និងស្ថានភាពកម្មវិធី ជាជាងហេតុផលអគ្គិសនី។

EEBench ប្រើវិធីសាស្រ្តផ្សេង។ សៀគ្វីនៅក្នុងគោលត្រូវបានសរសេរជាភាសា atopile ដែលជាភាសាដែលពណ៌នាអំពីអេឡិចត្រូនិចជាកូដប្រកាស ដូច្នេះភ្នាក់ងារធ្វើការដោយផ្ទាល់លើសមាសធាតុ ការតភ្ជាប់ និងឧបសគ្គ។ គំរូអាចកែប្រែការរចនា បង្កើតវា ដំណើរការការក្លែងធ្វើ និងពិនិត្យមើលការបរាជ័យដោយមិនចាំបាច់ចាកចេញពីគម្រោង។ យោងតាមក្រុមនេះ វាដំណើរការបានល្អជាងការស្នើសុំគំរូដើម្បីគូរបន្ទាត់នៅក្នុង GUI ហើយវាអនុញ្ញាតឱ្យស្តង់ដារសាកល្បងចំណេះដឹងអេឡិចត្រូនិចជាជាងជំនាញប្រើប្រាស់កុំព្យូទ័រ។

ផ្នែកពិត ការបរាជ័យពិត

កិច្ចការសាធារណៈមួយត្រូវបានដកចេញពីម៉ែត្រថាមពលលំនៅដ្ឋាន។ នៅពេលដែលការផ្គត់ផ្គង់ 5 វ៉ុលរបស់វារលាយបាត់ សៀគ្វីត្រូវតែរក្សា processor ឱ្យនៅមានជីវិតរយៈពេល 20 មិល្លីវិនាទីទៀត ដូច្នេះវាអាចរក្សាទុកការអានបង្គរ ដោយផ្លូវដែកដែលត្រូវបានការពារនៅខាងលើកម្រិត 3.0 វ៉ុលរបស់ processor ពេញមួយពេល។

ម៉ូដែលភាគច្រើន ក្រុមការងាររាយការណ៍ភ្លាមឈានដល់ការសន្និដ្ឋានមូលដ្ឋានត្រឹមត្រូវ៖ បន្ថែម capacitor ។ គោលធ្វើឱ្យពិបាកជាងសំឡេង។ capacitor សេរ៉ាមិចពិតប្រាកដអាចផ្តល់តិចជាង capacitance ដែលបានផ្សព្វផ្សាយរបស់វា នៅពេលដែលតង់ស្យុងត្រូវបានអនុវត្តនៅទូទាំងវា គ្រឿងបន្លាស់មានភាពធន់ទ្រាំ ហើយ capacitance បន្ថែមនឹងបន្ថែមថ្លៃដើម យកកន្លែងទំនេរ និងបន្ថយការបញ្ចូលថ្មរបស់ផ្លូវដែកនៅពេលដែលថាមពលត្រលប់មកវិញ។

សិស្សថ្នាក់រៀនបានចាប់យកការបញ្ជូនមួយដែលបង្ហាញពីគម្លាតរវាងចម្លើយក្នុងសៀវភៅសិក្សា និងផ្នែករឹងធ្វើការ។ ការរចនាដែលបានបញ្ជាក់ 22 microfarads ជាឈ្មោះ - តម្លៃដែលមើលទៅគ្រប់គ្រាន់នៅលើក្រដាស។ ប៉ុន្តែនៅ 4.7 វ៉ុលនៃភាពលំអៀង ថ្នាក់វាស់បានត្រឹមតែ 11.4 microfarads នៃ capacitance មានប្រសិទ្ធភាព ដែលទាបជាងតម្រូវការ 545-microfarad របស់កិច្ចការ។ កូដប្រភពត្រូវបានសាងសង់ដោយជោគជ័យ។ សៀគ្វីនៅតែបរាជ័យ៖ ការក្លែងធ្វើបានបង្ហាញពីផ្លូវដែកដែលបានការពារធ្លាក់ចុះក្រោមតម្រូវការ 3 វ៉ុល បន្ទាប់ពីត្រឹមតែ 0.85 មីលីវិនាទី ដោយមិននៅជិត 20 ដែលត្រូវការនោះទេ។

កិច្ចការកាន់តែពិបាកជំរុញទៅមុខ។ ការចាត់តាំងអាណាឡូកមួយតម្រូវឱ្យសំយោគតម្រងពហុមតិត្រឡប់ទាបជុំវិញ op-amp ដោះស្រាយសមាមាត្រ resistor និង capacitor សម្រាប់បង្គោលដែលត្រូវការ ហើយរក្សាការកើនឡើង ប្រេកង់កាត់ និង Q ក្នុងដែនកំណត់ សូម្បីតែនៅពេលដែលសមាសធាតុទាំងអស់ត្រូវបានរុញទៅជ្រុងនៃការអត់ឱនដ៏អាក្រក់បំផុតក៏ដោយ។

របៀបដែលចំណាត់ថ្នាក់ដំណើរការ

ការត្រួតពិនិត្យ EEBench ត្រូវបានកំណត់យ៉ាងពេញលេញ។ ខ្សែនេះបង្កើតការរចនាដែលបានដាក់ស្នើ បង្កើតក្រាហ្វសៀគ្វី និងវិក័យប័ត្រសម្ភារៈ ហើយដំណើរការសំណុំនៃការក្លែងធ្វើ និងការត្រួតពិនិត្យការរចនា ដោយតម្រូវការនីមួយៗបង្កើតការវាស់វែងធៀបនឹងដែនកំណត់ជាលេខ។ ភារកិច្ចវាស់ស្ទង់ការកើនឡើង កម្រិតចាប់ផ្ដើម រលក ការឆ្លើយតបបណ្តោះអាសន្ន និងអាកប្បកិរិយានៅជ្រុងនៃការអត់ឱនផ្នែក។ ពិន្ទុបច្ចេកទេសត្រូវបានរួមបញ្ចូលជាមួយវិធានការប្រសិទ្ធភាពចំណាយធៀបនឹងវិក្កយបត្រយោងនៃសម្ភារៈ - ទោះបីជាតម្លៃជួយបានតែនៅពេលដែលសៀគ្វីដំណើរការក៏ដោយ។

ក្រុមធ្វើការប្រៀបធៀបការដំឡើងទៅនឹងការផ្តល់ឱ្យភ្នាក់ងារសរសេរកូដនូវកម្មវិធីចងក្រង និងឈុតសាកល្បង លើកលែងតែការធ្វើតេស្តវាស់វ៉ុល និងឥរិយាបថសមាសធាតុ។ រាល់កិច្ចការទាំងអស់នៅក្នុងកំណែទី 1 ប្រើប្រាស់ផ្នែកផលិតពិតប្រាកដ ជាមួយនឹងលក្ខណៈជាក់លាក់ដែលបានស្រង់ចេញពីសន្លឹកទិន្នន័យ ហើយយកទៅក្នុងគំរូក្លែងធ្វើ ដោយបង្ខំឱ្យភ្នាក់ងារស្វែងរកបន្សំដែលមានស្រាប់ អាចត្រូវបានបញ្ជាទិញ និងមានតម្លៃសមហេតុផល។

តារាងអ្នកដឹកនាំដំបូង

លទ្ធផលចាប់ពីថ្ងៃទី 1 ខែកញ្ញា បានដាក់ Claude Opus 5 នៅកំពូលនៃ EEBench V1 ជាមួយនឹង 61.6% ឆ្លងកាត់កិច្ចការ 13 ។ Grok 4.6 ជាប់ចំណាត់ថ្នាក់លេខ 2 នៅ 57.1% គ្រាន់តែនាំមុខ Claude Fable 5.1 នៅ 56.4% ។ Claude Fable 5 ទទួលបានពិន្ទុ 54.3% និង Claude Opus 4.8 Max 51.4% ។ ក្រុម​នេះ​កត់​សម្គាល់​ថា ប៉ុន្មាន​ខែ​មុន​នេះ វា​នឹង​មិន​មាន​ម៉ូដែល​រំពឹង​ថា​នឹង​ធ្វើ​បាន​ល្អ​នេះ​ទេ។

លទ្ធផលមួយបានធ្វើឱ្យក្រុមពេញចិត្តជាពិសេស៖ xAI រួមបញ្ចូល EEBench នៅក្នុងកាតគំរូ Grok 4.6 នៅក្នុងផ្នែកមួយស្តីពីការបង្កើនល្បឿនវិស្វកម្ម រួមជាមួយនឹងគំរូ 3D និងការវាយតម្លៃ CAD parametric ។ ការរត់ការបោះពុម្ពផ្សាយផ្ទាល់ខ្លួនរបស់ xAI ទទួលបានពិន្ទុ Grok 4.6 នៅ 60.0% ជាមួយនឹងការខិតខំប្រឹងប្រែងរកហេតុផលខ្ពស់។ យោងតាមសម្ភារៈចាប់ផ្តើមរបស់ xAI ម៉ូដែលនេះបានទទួលទិន្នន័យវិស្វកម្មដែលមានគុណភាពខ្ពស់ និងការបណ្តុះបណ្តាលការរៀនពង្រឹងនៅក្នុងបរិយាកាសជាក់លាក់នៃដែន រួមទាំងការរចនាដែលប្រើដោយកុំព្យូទ័រ។

ម៉ូដែលរបស់ OpenAI ដែលបានសាកល្បងរហូតមកដល់ពេលនេះ អង្គុយលើតុបន្ថែមទៀត៖ GPT-5.5 ទទួលបានពិន្ទុ 42.3% និង GPT-5.6 Sol 39.4% ។ មិនមានលទ្ធផល GPT-6 Astra នៅឡើយទេ - គម្លាតគួរឱ្យកត់សម្គាល់ដែលបានផ្តល់ឱ្យថាការបង្ហាញ KiCad របស់ម៉ូដែលបានធ្វើឱ្យមានការចាប់អារម្មណ៍ជាថ្មី។ តារាងពិន្ទុ វិធីសាស្រ្ត និងអ្នករុករកលទ្ធផលគំរូរបស់តារាងពិន្ទុគឺជាសាធារណៈទាំងអស់ ហើយមន្ទីរពិសោធន៍អាចដំណើរការគំរូរបស់ពួកគេផ្ទាល់។

អ្វីដែលវាមិនវាស់វែង - នៅឡើយ

EEBench V1 គ្របដណ្តប់ការរចនាអាណាឡូក និងឌីជីថលតាមរយៈការក្លែងធ្វើតែប៉ុណ្ណោះ។ វាមិនទាន់សាកល្បងថាតើគំរូមួយអាចដាក់បន្ទះរាងកាយ ផលិតវា ឬនាំយកផលិតផលដែលបានបញ្ចប់ — ដំណាក់កាលដែលរបៀបបរាជ័យថ្មីទាំងស្រុងលេចឡើង។ ក្រុមការងារនិយាយថា ខ្លួនចង់បន្ថែមដំណាក់កាលទាំងនោះនៅពេលក្រោយ ប៉ុន្តែបានផ្តោតលើកំណែ 1 លើតម្រូវការ-ការរចនា-ផ្ទៀងផ្ទាត់រង្វិលជុំ ពីព្រោះនោះជាកន្លែងដែលការងារវិស្វកម្មមានប្រយោជន៍អាចត្រូវបានចាត់ថ្នាក់តាមគោលដៅរួចហើយ។

ទោះយ៉ាងណាក៏ដោយ គោលការណ៏បានមកដល់ក្នុងពេលដ៏ខ្លីមួយ។ ឥឡូវនេះមន្ទីរពិសោធន៍ព្រំដែនមួយបានដកស្រង់វានៅក្នុងកាតគំរូ ការបង្ហាញការបង្ហាញដាក់គ្រឿងអេឡិចត្រូនិចនៅលើទំព័រមុខ ហើយពិន្ទុកំពូល - 61.6% - បង្ហាញថាម៉ូដែលទទួលបានសមត្ថភាពប្រកបដោយអត្ថន័យខណៈពេលដែលនៅឆ្ងាយពីភាពគួរឱ្យទុកចិត្ត។ សម្រាប់វិស្វករអគ្គិសនីដែលកំពុងមើល សារពីលទ្ធផល EEBench ដំបូងត្រូវបានវាស់វែង៖ AI អាចបង្កើនការរចនាសៀគ្វីនៅលើក្រដាស។ ថាតើពួកវារស់រានមានជីវិតទំនាក់ទំនងជាមួយផ្នែកពិតឬអត់ គឺច្បាស់ណាស់នូវអ្វីដែលជាគោលនេះដើម្បីស្វែងយល់។

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →