Cerebras បានបន្ថែម Qwen 3.8 27B ទៅកាន់ចំណុចចុងក្រោយសាធារណៈនៃវេទិកា Cerebras Inference របស់ខ្លួន ដែលគំរូទម្ងន់បើកចំហដំណើរការប្រហែល 1,500 ថូខឹនក្នុងមួយវិនាទី នេះបើយោងតាមឯកសារកាតាឡុកគំរូរបស់ក្រុមហ៊ុន។ ការចុះបញ្ជីនេះធ្វើឱ្យគ្រួសារគំរូបើកចំហមួយដែលត្រូវបានប្រើប្រាស់យ៉ាងទូលំទូលាយបំផុតរបស់ Alibaba អាចរកបានក្នុងល្បឿនដែលទាបជាងការបម្រើ GPU-hosted ធម្មតា។

សេចក្តីប្រកាសនេះបានទាក់ទាញការចាប់អារម្មណ៍ភ្លាមៗពីអ្នកអភិវឌ្ឍន៍៖ រឿងនេះប្រមូលបានច្រើនជាង 600 ពិន្ទុនៅលើ Hacker News ក្នុងរយៈពេលមួយថ្ងៃ ដែលជាកម្រិតនៃការទាក់ទាញដែលឆ្លុះបញ្ចាំងពីតម្រូវការដ៏ក្តៅគគុកសម្រាប់ការសន្និដ្ឋានលឿន និងថោក។ សម្រាប់ទិដ្ឋភាពទូលំទូលាយនៃទីផ្សារការសន្និដ្ឋាន តុ [ព័ត៌មាន AI] (https://aibuzzwire.news) តាមដានរាល់ការធ្វើបច្ចុប្បន្នភាពវេទិកាសំខាន់ៗនៅពេលវាមកដល់។

លក្ខណៈពិសេសនៅលើកាតាឡុក

ឯកសាររបស់ Cerebras, Qwen 3.8 27B ផ្ទុក 27 ពាន់លានប៉ារ៉ាម៉ែត្រ និងគាំទ្រ 64K tokens នៃបរិបទនៅលើកម្រិតឥតគិតថ្លៃ និង 128K នៅលើកម្រិតបង់ប្រាក់ដែលដំណើរការនៅប្រហែល 1,500 tokens ក្នុងមួយវិនាទី។ វាស្ថិតនៅក្បែរម៉ូដែល GPT-OSS 120B ទម្ងន់បើកចំហរបស់ OpenAI ដែលកាតាឡុកដូចគ្នារាយប៉ាយប្រហែល 3,000 ថូខឹនក្នុងមួយវិនាទីជាមួយនឹងបរិបទ 65K នៅលើកម្រិតឥតគិតថ្លៃ និង 131K នៅលើកម្រិតបង់ប្រាក់។

ម៉ូដែលទាំងពីរមាននៅលើការសាកល្បងឥតគិតថ្លៃរបស់ Cerebras និងកម្រិតបង់ប្រាក់តាមដែលអ្នកទៅ ដោយអាស្រ័យលើកម្រិតអត្រាការប្រាក់។ អតិថិជនដែលត្រូវការសមត្ថភាពបម្រុង ទិន្នផលខ្ពស់ ឬ SLAs ផលិតកម្មត្រូវបានតម្រង់ទៅរកការផ្តល់ជូន Dedicated Endpoints របស់ក្រុមហ៊ុន ដែលឯកសារនេះក៏រាយបញ្ជីជាផ្លូវទៅកាន់គ្រួសារគំរូបន្ថែមលើសពីពីរនៅលើចំណុចបញ្ចប់សាធារណៈ។

បង្អួចបរិបទសមនឹងទទួលបានការយកចិត្តទុកដាក់រួមជាមួយនឹងតួលេខល្បឿន។ ប្រាំមួយម៉ឺនបួនពាន់ថូខឹននៅលើកម្រិតឥតគិតថ្លៃ - និង 128,000 លើការបង់ប្រាក់ - គឺគ្រប់គ្រាន់ដើម្បីផ្ទុកមូលដ្ឋានកូដដែលមានទំហំ ឯកសារវែង ឬប្រតិចារឹកភ្នាក់ងារបន្ថែមនៅក្នុងអង្គចងចាំក្នុងពេលតែមួយ ដែលសំខាន់សម្រាប់បន្ទុកការងារពិតប្រាកដដែលការឌិកូដរហ័សត្រូវបង់។ ឯកសាររបស់ Cerebras ក៏រួមបញ្ចូលផងដែរនូវមគ្គុទ្ទេសក៍ភាពឆបគ្នារបស់ OpenAI ដោយកាត់បន្ថយការចំណាយលើការប្តូរសម្រាប់ក្រុមដែលលេខកូដដែលមានស្រាប់កំណត់គោលដៅ OpenAI SDK រួចហើយ៖ ជាគោលការណ៍ ការចង្អុលអតិថិជនដែលមានស្រាប់នៅចំណុចបញ្ចប់ Cerebras គឺជាការផ្លាស់ប្តូរការកំណត់ជាជាងការសរសេរឡើងវិញ។

ម៉ូដែលដែលមិនបានកាត់ចេញ ការបង្ហាប់ថ្លា

ព័ត៌មានលម្អិតមួយដែលគួរកត់សម្គាល់នៅក្នុងឯកសារគឺការបង្ហាញរបស់ Cerebras អំពីរបៀបដែលវាគ្រប់គ្រងការបង្ហាប់គំរូ។ ក្រុមហ៊ុនបញ្ជាក់ថា គ្រប់ម៉ូដែលទាំងអស់នៅលើចំណុចបញ្ចប់សាធារណៈរបស់វា គឺជាកំណែដើម ដែលមិនមានការកាត់ចេញ ហើយថាវាប្រើប្រាស់បរិមាណជ្រើសរើសសម្រាប់តែទម្ងន់ប៉ុណ្ណោះក្នុងអំឡុងពេលផ្ទុក ដើម្បីរក្សាគុណភាព។ ស្រទាប់រសើបនៅតែមានភាពជាក់លាក់ពេញលេញ ការធ្វើឱ្យសកម្ម ការយកចិត្តទុកដាក់ ហើយឃ្លាំងសម្ងាត់ KV នៅតែមិនមានបរិមាណ ហើយ dequantization កើតឡើងភ្លាមៗ។

Cerebras ក៏បង្ហាញពីការស្រាវជ្រាវរបស់ខ្លួនទៅលើបច្ចេកទេសកាត់ចេញដូចជា REAP (Router-weighted Expert Activation Pruning): បំរែបំរួលកាត់ចេញត្រូវបានចែករំលែកជាមួយសហគមន៍ស្រាវជ្រាវនៅលើ Hugging Face ប៉ុន្តែមិនត្រូវបានបម្រើតាមរយៈ API សាធារណៈទេ។ សម្រាប់អ្នកអភិវឌ្ឍន៍ជ្រើសរើសកន្លែងដែលត្រូវដំណើរការគំរូបើកចំហ តម្លាភាពនោះអំពីអ្វីដែលពិតប្រាកដកំពុងត្រូវបានបម្រើគឺមានភាពច្បាស់លាស់ខុសពីធម្មតា។

ហេតុអ្វីបានជា Token Speed មានសារៈសំខាន់

លេខឆ្លងកាត់ដូចជាបញ្ហាទាំងនេះភាគច្រើនសម្រាប់បន្ទុកការងារភ្នាក់ងារ និងសរសេរកូដ។ កម្មវិធីដែលភ្ជាប់ការហៅទូរសព្ទគំរូរាប់រយ — ភ្នាក់ងារសរសេរកូដ លំហូរការងារស្វយ័ត ជំនួយការតាមពេលវេលាជាក់ស្តែង គុណនឹងភាពយឺតយ៉ាវក្នុងមួយសញ្ញាសម្ងាត់នៅគ្រប់ជំហាន ដូច្នេះភាពខុសគ្នារវាង 50 និង 1,500 សញ្ញាសម្ងាត់ក្នុងមួយវិនាទីទៅជាបទពិសោធន៍ខុសគ្នាប្រកបដោយគុណភាព។ កម្មវិធីអន្តរកម្មដែលស្ទ្រីមការបញ្ចប់ដ៏វែងទទួលបានអត្ថប្រយោជន៍យ៉ាងជាក់ស្តែងបំផុត។

ការដោះដូរគឺជាវិសាលភាព។ គំរូប៉ារ៉ាម៉ែត្រចំនួន 27 ពាន់លាននឹងមិនផ្គូផ្គងប្រព័ន្ធព្រំដែនលើកិច្ចការហេតុផលដ៏លំបាកបំផុតនោះទេ ហើយឯកសារផ្ទាល់ខ្លួនរបស់ Cerebras ដឹកនាំបន្ទុកផលិតកម្មធ្ងន់ឆ្ពោះទៅរកសមត្ថភាពជាក់លាក់។ ប៉ុន្តែសម្រាប់កិច្ចការកណ្តាលដ៏ធំ ដែលម៉ូដែលបើកចំហទំហំមធ្យមគឺល្អគ្រប់គ្រាន់រួចទៅហើយ — ការសង្ខេប ការចាត់ថ្នាក់ ការប្រើប្រាស់ឧបករណ៍ ការកែសម្រួលកូដ — ល្បឿនក្លាយជាភាពខុសគ្នា។

វាក៏មានវិមាត្រតម្លៃអ្នកអភិវឌ្ឍន៍នឹងថ្លឹងថ្លែងផងដែរ។ គំរូចំណុចបញ្ចប់សាធារណៈគឺអាចប្រើប្រាស់បាននៅលើការសាកល្បងឥតគិតថ្លៃ មុនពេលការប្តេជ្ញាចិត្តណាមួយ ដែលបង្កើតការប្រៀបធៀបទៅនឹងបន្ទុកការងារផ្ទាល់ខ្លួនរបស់ក្រុមមួយ ដោយមិនមានការកកិត ដែលជាចេតនានៅលើផ្លូវឡើងដែលផ្ទុយនឹងកិច្ចសន្យាសហគ្រាសដែលតម្រូវឱ្យមានការសន្ទនាផ្នែកលក់ មុនពេលនិមិត្តសញ្ញាទីមួយត្រូវបានបម្រើ។ ដែនកំណត់អត្រាដែលបានចងក្រងជាឯកសារគឺជាឧបសគ្គក្នុងការមើល៖ ការចូលប្រើកម្រិតឥតគិតថ្លៃមានដើម្បីបញ្ជាក់ល្បឿន មិនមែនដើម្បីដំណើរការចរាចរណ៍ផលិតកម្មទេ។

ការលាតសន្ធឹងដ៏មមាញឹកសម្រាប់ម៉ូដែលបើកចំហ

ការបន្ថែមនេះចុះចតក្នុងអំឡុងពេលមានហ្វូងមនុស្សសម្រាប់ AI ទម្ងន់បើកចំហ។ មន្ទីរពិសោធន៍ IFM ដែលមានមូលដ្ឋាននៅ UAE ទើបតែបានណែនាំ K2 Horizon ដែលជាកងនាវាតភ្ជាប់នៃម៉ូដែលបើកចំហពេញលេញចំនួនប្រាំមួយ ហើយ Meta បន្តរំលឹកគ្រួសារ Muse របស់ខ្លួនសម្រាប់ការសរសេរកូដ និងការប្រើប្រាស់ភ្នាក់ងារ។ ទន្ទឹមនឹងនេះ ប្រព័ន្ធអេកូគំរូបើកចំហនៅក្នុងប្រទេសចិនរក្សាការដឹកជញ្ជូនក្នុងល្បឿនមួយដែលបានបង្ហាប់វដ្តនៃការចេញផ្សាយនៅទូទាំងឧស្សាហកម្មនេះ។

សម្រាប់អ្នកអភិវឌ្ឍន៍ ការអនុវត្តជាក់ស្តែងគឺថាជង់គំរូបើកចំហកំពុងមានភាពចាស់ទុំនៅលើផ្នែកខាងមុខពីរក្នុងពេលតែមួយ៖ សមត្ថភាព ដោយសារម៉ូដែលខ្នាតកណ្តាលបិទគម្លាតជាមួយនឹងស្មាតហ្វូនលើកិច្ចការប្រចាំថ្ងៃ និងការបម្រើសេដ្ឋកិច្ច ជាអ្នកផ្តល់ការសន្និដ្ឋានពិសេសប្រកួតប្រជែងលើល្បឿនឆៅ។ Qwen 3.8 27B នៅលើ Cerebras គឺជាចំណុចទិន្នន័យសម្រាប់និន្នាការទាំងពីរ — ម៉ូដែលបើកចំហជំនាន់បច្ចុប្បន្នបម្រើក្នុងល្បឿនដែលកម្រនិងអសកម្មកាលពីឆ្នាំមុន លើគោលបំណងផ្នែករឹងដែលបង្កើតឡើងសម្រាប់ការងារ។

អ្នកអភិវឌ្ឍន៍ដែលវាយតម្លៃវេទិកានេះគួរតែកំណត់តម្លៃការងារផ្ទាល់ខ្លួនរបស់ពួកគេ៖ ល្បឿនដែលបានបោះពុម្ពគឺជាតួលេខកាតាឡុក លំហូរនៃពិភពពិតអាស្រ័យលើប្រវែងភ្លាមៗ ភាពស្របគ្នា និងការកំណត់រចនាសម្ព័ន្ធ ហើយកម្រិតអត្រានៃថ្នាក់ឥតគិតថ្លៃនឹងចងមុនពេលល្បឿនរបស់វាកើតឡើង។

នាំមុខ AI

រាល់ការចេញផ្សាយគំរូ ការអាប់ដេតវេទិកាសន្និដ្ឋាន និងការបើកដំណើរការឧបករណ៍អ្នកអភិវឌ្ឍន៍ តាមដាននៅពេលវាកើតឡើង — អានព័ត៌មាន AI បន្ថែម →