Cerebras បានដកខ្លួនចេញពី CS-4 ដែលជាប្រព័ន្ធ AI inference rack-scale ដែលបង្កើតឡើងជុំវិញប្រព័ន្ធដំណើរការ WSE-3 Turbo wafer-scale ថ្មីរបស់ខ្លួន ដោយអះអាងថាម៉ាស៊ីនផ្តល់នូវការសន្និដ្ឋានលឿនជាងប្រព័ន្ធផ្អែកលើ GPU ដល់ទៅ 30 ដង ខណៈដែលក្រុមហ៊ុនដាក់ខ្លួនឯងថាជាជម្រើសល្បឿនជំនួសអាណាចក្រមជ្ឈមណ្ឌលទិន្នន័យរបស់ Nvidia ។
ការបើកដំណើរការដែលបានប្រកាសកាលពីថ្ងៃអង្គារ និងរៀបរាប់លម្អិតនៅទូទាំងទំព័រផលិតផលរបស់ក្រុមហ៊ុន និងរលកនៃការគ្របដណ្តប់ពី Reuters, Bloomberg និង The Register បង្ហាញពីការធ្វើឱ្យឡើងវិញផ្នែករឹងដ៏សំខាន់បំផុតរបស់ Cerebras ចាប់តាំងពីការចេញជាសាធារណៈ — និងជាពេលវេលាដ៏សំខាន់សម្រាប់ក្រុមហ៊ុនដែលភាគហ៊ុនរបស់ពួកគេបានតស៊ូចាប់តាំងពី IPO របស់ខ្លួន។ វិនិយោគិនហាក់ដូចជាកំពុងយកចិត្តទុកដាក់៖ ភាគហ៊ុនរបស់ Cerebras (CBRS) បានកើនឡើងនៅលើព័ត៌មាននេះ ហើយ Investor's Business Daily បានដកស្រង់ការអត្ថាធិប្បាយរបស់នាយកប្រតិបត្តិដែលថាទីផ្សារការសន្និដ្ឋានរបស់ AI គឺ "រីកលូតលាស់លឿនណាស់" ។
សម្រាប់អ្នកអានដែលតាមដានការប្រណាំងបង្កើនល្បឿនដើម្បីធ្វើឱ្យម៉ូដែល AI ឆ្លើយតបកាន់តែលឿន ការបើកដំណើរការ CS-4 គឺជារឿងរ៉ាវផ្នែករឹងដ៏ផលវិបាកបំផុតមួយនៃត្រីមាសនេះ ហើយវាកើតឡើងចំពេលមានការផ្លាស់ប្តូរកាន់តែទូលំទូលាយនៅក្នុងវិស័យឧស្សាហកម្ម AI ដែលបន្តផ្លាស់ប្តូររូបរាងកុំព្យូទ័រ។
តើមានអ្វីនៅខាងក្នុង CS-4
សមាសធាតុចំណងជើងគឺ WSE-3 Turbo ដែលជាកំណែអាប់ដេតនៃម៉ាស៊ីន Wafer Scale Engine ដែលមានទំហំប៉ុនចានអាហារពេលល្ងាចរបស់ Cerebras ។ យោងតាមការជ្រមុជទឹកជ្រៅបច្ចេកទេសរបស់ The Register WSE-3T មិនមែនជាស៊ីលីកុនថ្មីនោះទេ វារក្សាដំណើរការ TSMC 5nm ដដែល ផ្ទៃដីទំហំ 46,225 មិល្លីម៉ែត្រការ៉េ ត្រង់ស៊ីស្ទ័រ 4 ពាន់ពាន់លាន ស្នូល 900,000 និង 44 GB នៃ SRAM នៅលើ wafer ដូច WSE-3 ដែលមានអាយុពីរឆ្នាំ។
ផ្ទុយទៅវិញ Cerebras សម្រេចបាននូវការអនុវត្តទ្វេដងរបស់ខ្លួនដោយរុញបន្ទះឈីបដែលមានស្រាប់កាន់តែពិបាក។ WSE-3T បង្កើនទ្វេដងនូវ FP16 sparse compute ទៅ 250 petaFLOPS បង្កើនទ្វេដងនូវដំណើរការ FP16 ក្រាស់ដល់ការប៉ាន់ស្មាន 25 petaFLOPS បង្កើនកម្រិតបញ្ជូនអង្គចងចាំទ្វេដងដល់ 43.2 petabytes ក្នុងមួយវិនាទី និងបង្កើនកម្រិតបញ្ជូន I/O ទ្វេដងដល់ 2.4 terabits ក្នុងមួយវិនាទី។ ការចុះឈ្មោះបានប៉ាន់ប្រមាណថាក្រុមហ៊ុនឥឡូវនេះកំពុងកំណត់ស៊ីលីកុននៅប្រហែល 2.8 GHz កើនឡើងពីប្រហែល 1.4 GHz នៅក្នុងជំនាន់មុន។
ល្បិចនេះបើយោងតាម Cerebras គឺជាប្រព័ន្ធចែកចាយថាមពលដែលបានរចនាឡើងវិញដែលមានចម្ងាយត្រឹមតែ 0.5 មីលីម៉ែត្រពីខួរក្បាល — ប្រហែល 100 ដងជិតជាង ~ 50 មីលីម៉ែត្រធម្មតានៃបន្ទះ GPU ធម្មតា។ ភាពជិតនោះស្ទើរតែលុបបំបាត់ការបាត់បង់ថាមពលនៅកម្រិតក្តារ និងអនុញ្ញាតឱ្យថាមពលពីរដងច្រើនជាងដើម្បីទៅដល់ wafer ដែលអនុញ្ញាតឱ្យមានប្រេកង់ប្រតិបត្តិការខ្ពស់ជាងនៅពីក្រោយការបង្កើតសញ្ញាសម្ងាត់លឿនជាងមុន។
ស្ថាបត្យកម្ម Nexus Rack
លើសពីបន្ទះឈីបខ្លួនវា CS-4 ណែនាំនូវអ្វីដែល Cerebras ហៅថា ស្ថាបត្យកម្ម Nexus Platform Architecture ដែលជាការរចនាខ្នាត rack-scale ពិតដំបូងរបស់វា និងចម្លើយផ្ទាល់ចំពោះ Nvidia's NVL72 និង AMD's Helios rack systems។ CS-4 នីមួយៗអាចផ្ទុកនូវប្រព័ន្ធដំណើរការ WSE-3T រហូតដល់ទៅបីដែលដាក់នៅក្នុង "កាបូបស្ពាយ Wafer-Scale" ដែលមានផ្ទុកដោយខ្លួនឯង — កញ្ចប់ 3D ដែលបត់ wafer, ការបំប្លែងថាមពល, ការត្រជាក់រាវដោយផ្ទាល់, I/O ល្បឿនលឿន និងគ្រប់គ្រងអេឡិចត្រូនិចចូលទៅក្នុងការជួបប្រជុំគ្នាតែមួយជាមួយនឹងសមាសធាតុតិចជាង 50% ។
ការរចនាម៉ូឌុលបំបែកថាមពលស្ថេរភាព ភាពត្រជាក់ និងស្រទាប់បណ្តាញចេញពីកុំព្យូទ័រ។ យោងតាមក្រុមហ៊ុនបានឱ្យដឹងថា Cerebras PowerRack អាចត្រូវបានដំឡើង និងមានលក្ខណៈគ្រប់គ្រាន់មុនពេលកុំព្យូទ័រមកដល់ ហើយកាបូបស្ពាយបន្ទាប់មករុញចូលកន្លែង ដោយកាត់បន្ថយពេលវេលាដាក់ពង្រាយពីមួយថ្ងៃទៅមួយថ្ងៃ។
ការប្រើប្រាស់ថាមពលគឺសំខាន់។ ការចុះឈ្មោះប៉ាន់ស្មានប្រហែល 46 kW ក្នុងមួយកាបូបស្ពាយហើយការទាញប្រព័ន្ធសរុបពី 120 ទៅ 140 kW ដែលជាលេខគួរឱ្យចាប់អារម្មណ៍ដែលទោះជាយ៉ាងណាក៏ដោយមើលទៅមានលក្ខណៈអភិរក្សនៅជាប់នឹងប្រព័ន្ធ rack ពី 240 ទៅ 250 kW AMD និង Nvidia ត្រូវបានគេរំពឹងថានឹងដឹកជញ្ជូននៅចុងឆ្នាំនេះ។
សម្លាប់កុងតាក់
ប្រហែលជាជម្រើសដែលគួរឱ្យចាប់អារម្មណ៍បំផុតតាមបច្ចេកទេសគឺការភ្ជាប់គ្នាទៅវិញទៅមក។ ជាជាងការបញ្ជូនចរាចរ wafer-to-wafer តាមរយៈកុងតាក់ — វិធីសាស្រ្តដែល AWS បានអនុម័តសម្រាប់ឧបករណ៍បង្កើនល្បឿន Trainium3 របស់ខ្លួន — Cerebras បញ្ជូនបន្ទះសៀគ្វីរបស់វាទៅជា 2D torus topology ដែលជាកន្លែងដែល wafers ជិតខាងនិយាយដោយផ្ទាល់ទៅគ្នាទៅវិញទៅមក។ ការរចនាកាត់បន្ថយភាពយឺតយ៉ាវរបស់ wafer-to-wafer ពី 5 microseconds មកត្រឹមតែ 2 ហើយ Cerebras និយាយថា Mesh អាចទ្រទ្រង់ម៉ូដែលរហូតដល់ទៅ 50 trillion parameters ដែលមានភាពងាយស្រួលលើសពីអ្វីដែលមាននាពេលបច្ចុប្បន្ន។
លទ្ធផលនៃល្បឿនគឺគួរឱ្យចាប់អារម្មណ៍។ នៅលើប្រព័ន្ធ CS-4 តែមួយ ក្រុមហ៊ុនវាយតម្លៃការវិភាគសិប្បនិម្មិតបានវាស់វែងរហូតដល់ 4,400 ថូខឹនក្នុងមួយវិនាទីសម្រាប់អ្នកប្រើប្រាស់នៅលើ gpt-oss-120b — ប្រហែល 12 ដងនៃ ~350 tokens ក្នុងមួយវិនាទីនៃសេវាកម្មសន្និដ្ឋានផ្អែកលើ GPU លឿនបំផុតដែលមានថ្ងៃនេះ។ Cerebras ក៏អះអាងដែរថាប្រព័ន្ធនេះទ្រទ្រង់នូវសញ្ញាសម្ងាត់ច្រើនជាង 1,000 ក្នុងមួយវិនាទីលើម៉ូដែលលើសពី 10 លានលានប៉ារ៉ាម៉ែត្រ។
យុទ្ធសាស្ត្រភាពជាដៃគូដែលមិនរួមបញ្ចូលគ្នា
គួរកត់សម្គាល់ថា Cerebras លែងព្យាយាមដំណើរការបំពង់បង្ហូរប្រេងទាំងស្រុងលើស៊ីលីកូនរបស់វាទៀតហើយ។ ក្រុមហ៊ុនបានចាប់ដៃគូជាមួយ AWS និង AMD ដើម្បីបិទដំណើរការដំណាក់កាលដំណើរការរហ័សដែលពឹងផ្អែកទៅលើការគណនាទៅលើ Trainium XPUs និង Instinct GPUs រៀងៗខ្លួន ដោយបន្សល់ទុកម៉ាស៊ីនទំហំ wafer របស់ខ្លួនដើម្បីគ្រប់គ្រងដំណាក់កាលនៃការឌិកូដដែលងាយនឹងយឺតយ៉ាវ ដែលទុនបម្រុង SRAM ដ៏ធំរបស់ពួកគេភ្លឺ។
ការបើកដំណើរការ CS-4 ក៏ពង្រីកកិច្ចសហការរបស់ Cerebras ជាមួយ OpenAI ផងដែរ។ ក្រុមហ៊ុន Yahoo Finance បានរាយការណ៍ពីការដាក់បង្ហាញជាមួយនឹងភាពជាដៃគូថ្មីរបស់ OpenAI និង AMD ក្នុងគោលបំណងពន្លឿនការសន្និដ្ឋានរបស់ AI — ការបង្កើតនូវរបៀប Ultrafast ដែលក្រុមហ៊ុនបានណែនាំកាលពីដើមខែសីហា ដែលបាននាំយក GPT-5.6 Sol ដល់អ្នកប្រើប្រាស់រហូតដល់ 750 tokens ក្នុងមួយវិនាទី។
ការព្រមាននៅពីក្រោយលេខចំណងជើង
អ្នកវិភាគឧស្សាហកម្មជំរុញឱ្យមានការប្រុងប្រយ័ត្នមួយចំនួនលើតួលេខទីផ្សារ។ ការចុះឈ្មោះបានកត់សម្គាល់ថាចំណងជើង 250 petaFLOPS របស់ Cerebras ពឹងផ្អែកលើភាពខ្វែងគំនិត ដែលជាទូទៅមិនផ្តល់អត្ថប្រយោជន៍ដល់ការសន្និដ្ឋានគំរូភាសាធំនោះទេ ហើយតួលេខនៃកម្រិតបញ្ជូននៃការចងចាំកំពូលគឺភាគច្រើនជាទ្រឹស្តីចាប់តាំងពី WSE-3 ខ្វះកុំព្យូទ័រដើម្បីបំពេញ SRAM របស់វា។ ការបោះពុម្ភផ្សាយក៏បានចោទសួរថាហេតុអ្វីបានជា Cerebras បង្កើនការអនុវត្តទ្វេដងជាជាងការបង្កើនសមត្ថភាព SRAM ដែលមិនមានអត្ថន័យរីកចម្រើនចាប់តាំងពី WSE-2 បានចាប់ផ្តើមកាលពី 5 ឆ្នាំមុន ដែលជាជម្រើសដែលចង់ដឹងចង់ឃើញនៅក្នុងយុគសម័យនៃការសន្និដ្ឋានដាច់ដោយឡែកដែលឧបករណ៍បង្កើនល្បឿនឌិកូដទទួលបានអត្ថប្រយោជន៍ច្រើនបំផុតពីការចងចាំ។
ទោះយ៉ាងណាក៏ដោយ ឱកាសទីផ្សារគឺពិតប្រាកដ។ នៅពេលដែល AI chatbots និងភ្នាក់ងារទាមទារពេលវេលាឆ្លើយតបលឿនជាងមុន ល្បឿននៃការសន្និដ្ឋានបានក្លាយទៅជាភាពខុសគ្នានៃការប្រកួតប្រជែងពិតប្រាកដ ហើយឥឡូវនេះ Cerebras បានបង្ហាញឱ្យឃើញថាវាអាចរំលឹកឡើងវិញនូវបច្ចេកវិទ្យាទំហំ wafer-scale មិនធម្មតារបស់វានៅលើនិន្នាការពាណិជ្ជកម្ម។
ការនាំចេញ CS-4 លើកដំបូងចាប់ផ្តើមនៅត្រីមាសនេះ ដោយប្រព័ន្ធដំបូងគេរំពឹងលើអ៊ីនធឺណិតមុនដំណាច់ខែកញ្ញា។ ថាតើវាគ្រប់គ្រាន់ដើម្បីបំបែកភាពលេចធ្លោរបស់ Nvidia នៅតែត្រូវបានគេមើលឃើញដែរឬទេ — ប៉ុន្តែជាលើកដំបូងក្នុងរយៈពេលមួយរយៈនេះ ការសន្និដ្ឋាន AI លឿនបំផុតនៅក្នុងឧស្សាហកម្មនេះមានអាសយដ្ឋានថ្មី។
នាំមុខ AI
Hardware ចាប់ផ្តើមដូចជា CS-4 ផ្លាស់ទីទីផ្សារ និងកំណត់ឡើងវិញនូវអ្វីដែលប្រព័ន្ធ AI អាចធ្វើបាន។ អានព័ត៌មាន AI បន្ថែម ដើម្បីតាមដានរាល់ការអភិវឌ្ឍន៍។
ស្វែងយល់ពីការគ្របដណ្តប់ AI ចុងក្រោយបំផុត →