Z.ai ដែលជាក្រុមហ៊ុនបញ្ញាសិប្បនិមិត្តដែលមានមូលដ្ឋាននៅទីក្រុងប៉េកាំងដែលត្រូវបានគេស្គាល់ថាជា Zhipu បានចេញផ្សាយ GLM-5.3 ដែលជាការកែប្រែថ្មីនៃគំរូស្មាតហ្វូនរបស់ខ្លួនដែលក្រុមហ៊ុននិយាយថាជាប្រព័ន្ធទម្ងន់បើកចំហដែលមានសមត្ថភាពបំផុតសម្រាប់វិស្វកម្មសូហ្វវែរ - និងមួយដែលបានអភិវឌ្ឍជំនាញសន្តិសុខតាមអ៊ីនធឺណិតដែលមិននឹកស្មានដល់។ បានប្រកាសនៅថ្ងៃទី 14 ខែសីហា និងលម្អិតនៅក្នុងការប្រកាសកំណត់ហេតុបណ្ដាញរបស់ក្រុមហ៊ុន GLM-5.3 ត្រូវបានបង្កើតឡើងនៅលើគំរូមូលដ្ឋានប៉ារ៉ាម៉ែត្រប្រហែល 700 ពាន់លានដូចគ្នានឹង GLM-5.2 ជំនាន់មុនរបស់ខ្លួនដែលបានចេញផ្សាយនៅក្នុងខែមិថុនា។ រាល់ការកែលម្អ ក្រុមហ៊ុនបាននិយាយថា កើតចេញពីការបណ្តុះបណ្តាលក្រោយការបណ្តុះបណ្តាល ជាជាងមូលដ្ឋានគ្រឹះធំជាង។ ការចេញផ្សាយនេះគឺចុងក្រោយបំផុតនៅក្នុងរលកនៃគំរូទម្ងន់បើកចំហរបស់ចិនដែលមានគោលបំណងដើម្បីប្រកួតប្រជែងប្រព័ន្ធបិទពី Anthropic និង OpenAI ។ សម្រាប់កម្មវិធីតាមដានគំរូ AI Buzz Wire GLM-5.3 គឺជាសញ្ញាយ៉ាងច្បាស់ថាព្រំដែនបើកចំហរកំពុងបិទគម្លាតសរសេរកូដលឿនជាងការរំពឹងទុក។

ចំណេញបានបង្កើតឡើងទាំងស្រុងលើការបណ្តុះបណ្តាលក្រោយការបណ្តុះបណ្តាល

Z.ai និយាយមិនច្បាស់អំពីវិធីសាស្រ្តរបស់ខ្លួនជាមួយ GLM-5.3: "ការធ្វើមាត្រដ្ឋានក្រោយការបណ្តុះបណ្តាលគឺជាអ្វីដែលយើងបានធ្វើ" ។ ក្រុមហ៊ុនបានអនុវត្តលើការពង្រឹងការរៀនសូត្រដែលវាបានណែនាំជាមួយ GLM-5.2 — រួមទាំង IndexShare សម្រាប់ដំណើរការបរិបទវែងប្រកបដោយប្រសិទ្ធភាព SAO សម្រាប់ការពង្រឹងការរៀនសូត្រលើកិច្ចការផ្តេកវែង និងក្របខ័ណ្ឌប្រភពបើកចំហដែលហៅថា slime សម្រាប់ការបណ្តុះបណ្តាលអសមកាលខ្នាតធំ។ ក្នុងរយៈពេលមួយខែកន្លងមកនេះ វាគ្រាន់តែបញ្ចូលបរិយាកាសកាន់តែច្រើន កិច្ចការចម្រុះកាន់តែច្រើន និងការគណនាកាន់តែច្រើនទៅក្នុងជង់នោះ។

ការទូទាត់បង្ហាញឡើងនៅទូទាំងស្តង់ដារសរសេរកូដ។ នៅលើ Terminal Bench 3.0 GLM-5.3 លោតពីពិន្ទុរបស់ GLM-5.2 ពី 4.6 ទៅ 28.3 ដែលជាការកែលម្អច្រើនជាងប្រាំមួយដង។ វាប្រកាសលទ្ធផលនៃប្រភពបើកចំហនៅលើ Terminal Bench 3.0 និងនៅលើការប្រឡងចុងក្រោយរបស់ភ្នាក់ងារ ហើយធ្វើឱ្យប្រសើរឡើងពី 23.8 ដល់ 28.5 នៅលើរង្វាស់ ALE-CLI នៃសមត្ថភាពភ្នាក់ងារ។ Z.ai រាយការណ៍ពីការកែលម្អ 50% លើ GLM-5.2 នៅលើ Z.ai Code Bench ក្នុងផ្ទះរបស់ខ្លួន ដែលជាស្តង់ដារឯកជនដែលត្រូវបានរចនាឡើងដើម្បីវាយតម្លៃភ្នាក់ងារសរសេរកូដនៅក្នុងបរិយាកាសអភិវឌ្ឍន៍ជាក់ស្តែង និងកាត់បន្ថយហានិភ័យនៃការចម្លងរោគពីសំណុំតេស្តសាធារណៈ។

សំខាន់ ការទទួលបានមកជាមួយប្រសិទ្ធភាពសញ្ញាសម្ងាត់ប្រសើរជាងមុន មិនមែនត្រឹមតែលទ្ធផលប្រសើរជាងមុននោះទេ។ នៅឯការខិតខំប្រឹងប្រែងខ្ពស់ GLM-5.3 ឈានដល់ការបញ្ចប់ 31.4% លើស្តង់ដារក្នុងផ្ទះនៅប្រហែល 50,000 និមិត្តសញ្ញាទិន្នផលក្នុងមួយកិច្ចការ ដែល Z.ai និយាយថាលើសពី Claude Opus 4.8 របស់ Anthropic នៅ 29.5% ជាមួយនឹង 120,000 tokens ។ GLM-5.3 នៅតែតាមពីក្រោយ Claude Fable 5 កម្រិតខ្ពស់ជាងរបស់ Anthropic ដែលឈានដល់ 39.5% ដោយការខិតខំប្រឹងប្រែងអតិបរមា។

ការលោតផ្លោះដែលមិននឹកស្មានដល់ក្នុងសមត្ថភាពអ៊ីនធឺណិត

លទ្ធផលដ៏គួរឱ្យចាប់អារម្មណ៍បំផុតពី GLM-5.3 មិនមែននៅក្នុងការសរសេរកូដទេ ប៉ុន្តែនៅក្នុងសុវត្ថិភាព។ នៅពេលដែល Z.ai ធ្វើមាត្រដ្ឋានក្រោយការបណ្តុះបណ្តាល និងណែនាំទិន្នន័យ និងបរិស្ថាននៃការស្វែងរកភាពងាយរងគ្រោះ ទៅក្នុងល្បាយបណ្តុះបណ្តាល វារំពឹងថាគំរូនឹងប្រសើរឡើងក្នុងការស្វែងរក និងវែកញែកអំពីគុណវិបត្តិ។ អ្វី​ដែល​ធ្វើ​ឱ្យ​ក្រុម​មាន​ការ​ភ្ញាក់​ផ្អើល​នោះ​គឺ​ថា​តើ​សមត្ថភាព​នោះ​បាន​អភិវឌ្ឍ​យ៉ាង​លឿន​ប៉ុណ្ណា។

GLM-5.3 មិនគ្រាន់តែមានភាពប្រសើរជាងមុនក្នុងការរកឃើញកំហុសដាច់ដោយឡែកនោះទេ។ វាបានចាប់ផ្តើមធ្វើការវែកញែកក្នុងដំណាក់កាលជាច្រើននៃការកេងប្រវ័ញ្ច បង្កើតផែនការរួមគ្នាសម្រាប់ខ្សែសង្វាក់វាយប្រហារពេញលេញ។ នៅលើ CyberGym ដែលជាស្តង់ដារដែលសាកល្បងថាតើគំរូអាចកំណត់អត្តសញ្ញាណ និងសុពលភាពភាពងាយរងគ្រោះពីកូដប្រភពប្រអប់ស GLM-5.3 ទទួលបានពិន្ទុ 84.5% កើនឡើងពី GLM-5.2 77.2% ។ នោះគឺជាលទ្ធផលល្អបំផុតនៅលើតារាងពិន្ទុនាំមុខ Mythos 5 នៅ 83.8% និង GPT-5.6 Sol នៅ 83.6% ។ នៅលើ ExploitBench ដែលទាមទារឱ្យមានការវែកញែកកាន់តែស៊ីជម្រៅអំពីភាពងាយរងគ្រោះពិតប្រាកដ និងការកេងប្រវ័ញ្ចរបស់ពួកគេ GLM-5.3 ច្រើនជាងទ្វេដងពិន្ទុរបស់ GLM-5.2 ឈានដល់ 54.4% ទោះបីជាវានៅតែនៅពីក្រោយ Mythos 5 នៅ 78.0% និង GPT-5.6 Sol នៅ 76.5% ក៏ដោយ។

Z.ai សង្កេតមើលលំនាំជាប់លាប់៖ ខ្សែសង្វាក់ការកេងប្រវ័ញ្ចកាន់តែខ្ពស់ដែលគោលមួយស្ថិតនៅ ការកើនឡើងកាន់តែធំជាង GLM-5.2 - ហើយគម្លាតដែលនៅសល់កាន់តែធំទូលាយទៅព្រំដែនបិទជិត។ ក្រុមហ៊ុន​បាន​កត់​សម្គាល់​ថា៖ «សមត្ថភាព​កំពុង​កើន​ឡើង​លឿន​បំផុត​នៅ​កន្លែង​ដែល​យើង​នៅ​ឆ្ងាយ​ជាង​គេ»។

ការរកឃើញភាពងាយរងគ្រោះពិភពលោកពិតប្រាកដ

ជំនាញអ៊ិនធឺណិតមិនត្រូវបានកំណត់ចំពោះស្តង់ដារទេ។ Z.ai រាយការណ៍ថា ចាប់តាំងពី GLM-5.2 មក វាបានធ្វើការជាមួយក្រុមសន្តិសុខជាច្រើននៅក្នុងប្រទេសចិន ដើម្បីសាកល្បងម៉ូដែលរបស់ខ្លួនប្រឆាំងនឹងមូលដ្ឋានកូដពិភពលោកពិត។ បន្ទាប់ពីការពិនិត្យមើលដោយអ្នកជំនាញ ការត្រួតពិនិត្យ និងការដកស្ទួន គំរូនេះបានកំណត់អត្តសញ្ញាណភាពងាយរងគ្រោះចំនួន 2,436 នៅទូទាំងគម្រោងចំនួន 269 ដែលក្នុងនោះមាន 1,097 បញ្ហានៃភាពធ្ងន់ធ្ងរពីមធ្យមទៅកម្រិតខ្ពស់។ ការរកឃើញមានវិសាលភាពខឺណែលប្រព័ន្ធ ប្រព័ន្ធប្រតិបត្តិការ ម៉ាស៊ីនកម្មវិធីរុករក ហេដ្ឋារចនាសម្ព័ន្ធប្រភពបើកចំហ កម្មវិធីបណ្តាញ និងពិធីការបណ្តាញ - ភាគច្រើនមិនបានកត់សម្គាល់អស់រយៈពេលជាច្រើនឆ្នាំ ឬរាប់ទសវត្សរ៍មកហើយ ជាមួយនឹងអាយុកាលចាស់បំផុតប្រហែល 40 ឆ្នាំ។

លទ្ធផលទាំងនោះបានឆ្លុះបញ្ចាំងពីការងារ Anthropic បានពិពណ៌នានៅក្នុងការស្រាវជ្រាវសុវត្ថិភាពពហុភ្នាក់ងាររបស់ខ្លួន ដែលភ្នាក់ងារសម្របសម្រួលត្រូវបានប្រើប្រាស់ដើម្បីស្វែងរកភាពងាយរងគ្រោះនៅក្នុងកម្មវិធីប្រភពបើកចំហតាមមាត្រដ្ឋាន។

បើកទម្ងន់ - ជាមួយនឹងការពន្យារពេល

Z.ai និយាយថា វានឹងបញ្ចេញទម្ងន់ GLM-5.3 ក្នុងរយៈពេលពីរសប្តាហ៍ នៅពេលដែលការវាយតម្លៃសុវត្ថិភាព និងការឡើងរឹងត្រូវបានបញ្ចប់។ ការពន្យារពេលដោយចេតនានោះឆ្លុះបញ្ចាំងពីភាពតានតឹងដែលកំពុងដំណើរការតាមរយៈការប្រកាសនេះ៖ គំរូដែលអភិវឌ្ឍសមត្ថភាពអ៊ីនធឺណេតវាយលុកដ៏ខ្លាំងក្លាលឿនជាងអ្នកបង្កើតរបស់ខ្លួនបានរំពឹងទុកគឺពិតជាប្រភេទនៃប្រព័ន្ធដែលចោទជាសំណួរអំពីការចេញផ្សាយប្រកបដោយការទទួលខុសត្រូវ។ ក្រុមហ៊ុនសង្កត់ធ្ងន់ថាភាពស៊ីសង្វាក់នៃការបណ្តុះបណ្តាល-ការចេញដំណើរការរបស់ខ្លួនត្រូវបានធ្វើឱ្យប្រសើរឡើងដល់កម្រិតខ្ពស់នៃភាពជាក់លាក់ជាលេខ ហើយការលំបាកជាច្រើនក្នុងការធ្វើមាត្រដ្ឋានបានផ្លាស់ប្តូរពីគំរូខ្លួនវាទៅជាការរចនានៃបរិយាកាសការងារជាក់ស្តែងដែលអាចផ្ទៀងផ្ទាត់បាន។

រូបភាពប្រកួតប្រជែងគឺច្បាស់។ GLM-5.3 បង្រួមចម្ងាយទៅកាន់ព្រំដែនបិទជិត លើកិច្ចការសរសេរកូដ និងភ្នាក់ងារ ខណៈពេលដែលទាមទារការនាំមុខទាំងស្រុងលើចំណុចខ្សោយសំខាន់-ការរកឃើញចំណុចខ្សោយ។ វាធ្វើដូច្នេះជាគំរូទម្ងន់បើកចំហ - មានន័យថានៅពេលដែលបានចេញផ្សាយ ទម្ងន់នឹងអាចរកបានដោយសេរីសម្រាប់នរណាម្នាក់ដើម្បីទាញយក សិក្សា និងបង្កើត។ ថាតើការបើកចំហរនោះបង្កើនល្បឿនវឌ្ឍនភាព ឬបង្កើនក្តីបារម្ភអំពីសុវត្ថិភាពថ្មី គឺជាការជជែកវែកញែក GLM-5.3 ទាំងអស់ ប៉ុន្តែត្រូវបានធានាថានឹងបន្តឡើងវិញ។

នាំមុខ AI

សម្រាប់ការចេញផ្សាយគំរូ AI ចុងក្រោយគេ ការប្រយុទ្ធគ្នាជាគោល និងការវិភាគឧស្សាហកម្ម សូមចំណាំ AI Buzz Wire

អានព័ត៌មាន AI បន្ថែម →