គម្រោងតូចមួយប៉ុន្តែគួរឱ្យចាប់អារម្មណ៍កំពុងផ្សព្វផ្សាយនៅលើ Hacker News នៅសប្តាហ៍នេះ: openTPU ដែលជាប្រភពបើកចំហរ AI បង្កើនល្បឿនដែលការរចនាផ្នែករឹងត្រូវបានផលិតដោយភ្នាក់ងារ AI ។ ឃ្លាំងដែលត្រូវបានបោះពុម្ពផ្សាយក្រោមអាជ្ញាប័ណ្ណ Apache 2.0 នៅលើ GitHub ពិពណ៌នាអំពីអ្វីដែលអ្នកនិពន្ធរបស់វាហៅថា "ឧបករណ៍បង្កើនល្បឿន AI បើកចំហរដែលបង្កើតឡើងដោយ AI" ហើយមិនដូចការបង្ហាញភាគច្រើននៅក្នុងប្រភេទនេះទេ វាដំណើរការគំរូផលិតកម្មពិតប្រាកដជាមួយនឹងទម្ងន់ពិតរបស់ពួកគេនៅលើកាតរូបវ័ន្តដែលអ្នកចូលចិត្តអាចសិក្សាដល់ទីបញ្ចប់។

គម្រោងនេះសួរសំណួរចំនួនពីរ តាមពាក្យរបស់ README ផ្ទាល់របស់វា៖ តើភ្នាក់ងារ AI អាចឈានទៅដល់ការរចនាផ្នែករឹងបានដល់កម្រិតណា ហើយតើពួកគេអាចបង្កើតបន្ទះឈីបដែលដំណើរការការសន្និដ្ឋានដោយខ្លួនឯងបានទេ? សំណួរទីពីរគឺការបង្កហេតុ។ ប្រព័ន្ធ AI ដែលរចនាស៊ីលីកុន — ឬក្នុងករណីនេះ FPGA bitstream — ដែលបង្កើតនិមិត្តសញ្ញាផ្ទាល់ខ្លួនរបស់វា គឺជារង្វិលជុំដែលចាប់យកកន្លែងដែលការស្រមើលស្រមៃរបស់ឧស្សាហកម្មកំពុងធ្វើដំណើរ។ For more context on this story, see our ongoing artificial intelligence updates.

អ្វីដែលដំណើរការពិតប្រាកដនៅលើកាត

គោលដៅផ្នែករឹងគឺមិនមានភាពស្រពិចស្រពិលដោយស្តង់ដារមជ្ឈមណ្ឌលទិន្នន័យ៖ កាត Inspur YPCB-00338 ដែលបង្កើតឡើងជុំវិញ Xilinx Kintex-7 xc7k480t FPGA ដែលមានបណ្តាញ DDR3 ពីរ និងកម្រិតបញ្ជូនអង្គចងចាំខ្ពស់បំផុត 17.1 GB/s ។ នោះ​គឺ​ជា​ការ​ឃ្លាត​ឆ្ងាយ​ពី​ឧបករណ៍​បង្កើនល្បឿន​ដែល​មាន​ជង់ HBM ដែល​ធ្វើ​ឱ្យ​លទ្ធផល​គួរ​ឱ្យ​ចាប់​អារម្មណ៍​មិន​តិច​ទេ។

យោងតាមការវាស់វែងដែលបានបោះពុម្ពផ្សាយរបស់គម្រោង ការរចនានេះដំណើរការនូវម៉ូដែលបើកចំហទំនើបចំនួន 10 ជាមួយនឹងទម្ងន់ពិតរបស់ពួកគេ។ LFM2.5-230M ឌិកូដនៅ 59 tokens ក្នុងមួយវិនាទីក្នុង int8 និង 85.8 tokens ក្នុងមួយវិនាទីក្នុង 4-bit។ Qwen3-0.6B គ្រប់គ្រង 21.6 ថូខឹនក្នុងមួយវិនាទី ខណៈពេលដែលម៉ូដែលធំ ៗ ធ្លាក់ចុះដូចការរំពឹងទុក៖ SmolLM3-3B នៅ 5 tokens ក្នុងមួយវិនាទី int8, Phi-4-mini (3.8B) នៅ 4 និង Qwen3.5-4B នៅ 5.9 tokens ក្នុងមួយវិនាទីក្នុង 4-bit។ Gemma 4 E2B និង E4B ក៏ដំណើរការផងដែរ ដោយរក្សាតារាងបង្កប់ក្នុងមួយស្រទាប់របស់ពួកគេនៅលើកាត។

ក្រុមនេះបានទៅបន្ថែមទៀតជាមួយនឹងម៉ូដែលចម្រុះនៃអ្នកជំនាញដែលលើសពី 4 GiB នៃ DRAM របស់កាត។ LFM2.5-8B-A1B — 8.5 billion parameters with 1.7 billion active — decodes at 10.6 tokens per second by streaming experts from host storage, with 98.5% of expert use hitting on-card slots and only 5.2 MB transfer per token. Qwen3.5-35B-A3B ដំណើរការនៅ 3.95 tokens ក្នុងមួយវិនាទី ខណៈកំពុងផ្សាយ 153 MB ក្នុងមួយ token លើ PCIe។ រាល់ការកំណត់រចនាសម្ព័ន្ធ README បាននិយាយថាត្រូវគ្នានឹងសញ្ញាក្លែងធ្វើរបស់គម្រោងសម្រាប់សញ្ញាសម្ងាត់ - ភាពជាក់លាក់បន្តិចដែលអះអាងថាពួក Hacker ផ្នែករឹងនឹងទទួលស្គាល់ថាជាផ្នែករឹងនៃការងារ។

សាងសង់ដូចគម្រោង Silicon ពិតប្រាកដ

អ្វីដែលបំបែក openTPU ពីការបង្ហាញ FPGA ចំណង់ចំណូលចិត្តធម្មតាគឺភាពពេញលេញនៃជង់។ monorepo មានការរចនាផ្នែករឹង SystemVerilog សំណុំការណែនាំផ្ទាល់ខ្លួន ឧបករណ៍ក្លែងធ្វើប៊ីតជាក់លាក់ ភាសាខឺណែលជាមួយនឹងកម្មវិធីចងក្រងផ្ទាល់ខ្លួន និងកម្មវិធីម៉ាស៊ីនដែលជំរុញកាត PCIe រួមទាំងឧបករណ៍ប្រើប្រាស់ត្រួតពិនិត្យ otpu-smi ក្នុងស្មារតីនៃ nvidia-smi និងការបង្ហាញ otpu-chat ។

រូបភាពផលិតកម្មដំណើរការឯកតាម៉ាទ្រីសស៊ីស្តូលិកជួរឈរបួន និងម៉ាស៊ីនស្ទ្រីមនៅ 133.33 MHz ជាមួយនឹងឧបករណ៍បញ្ជាអង្គចងចាំ LiteDRAM ដែលបានក្រិតតាមខ្នាតដោយស៊ីភីយូតូចមួយនៅខាងក្នុងអង្គចងចាំ - កាតធ្វើក្រិតតាមខ្នាត DDR3 ទាំងពីរឆានែលក្នុងរយៈពេល 12 វិនាទីដោយមិនមានការចូលរួមពីម៉ាស៊ីន។ ការ​បង្កើត​បច្ចុប្បន្ន​ដែល​បាន​ដាក់​ពង្រាយ​តាំង​ពី​ថ្ងៃ​ទី 1 ខែ​តុលា ឌិកូដ​ម៉ូដែល​ជា​ច្រើន​ពី 8 ទៅ 10 ភាគរយ​លឿន​ជាង​រូបភាព​មុន​ខណៈ​ពេល​ដែល​ជំរុញ​ការ​ប្រើ DRAM ដល់ 91-94 ភាគរយ​នៃ​កម្រិត​កំពូល។

គម្រោងនេះក៏ចងក្រងឯកសារទម្រង់ទម្ងន់ 4 ប៊ីតដែលបង្កើតឡើងនៅលើតម្លៃ FP4 ជាមួយនឹងមាត្រដ្ឋានប្លុកពីរកម្រិតនៅ 4.25 ប៊ីតក្នុងមួយទម្ងន់ ដោយរក្សាក្បាលគំរូភាសានៅក្នុង int8 សម្រាប់ភាពត្រឹមត្រូវ។ ទ្រង់ទ្រាយកាត់បន្ថយបៃក្នុងមួយសញ្ញាសម្ងាត់ប្រហែលមួយភាគបី ហើយបង្កើនល្បឿននៃការឌិកូដពី 40 ទៅ 45 ភាគរយលើម៉ូដែលមួយចំនួន។

README ផ្តល់កិត្តិយសដល់វិធីសាស្រ្តរបស់គម្រោងចំពោះមេរៀនពីឃ្លាំងមុនមួយ ការប្រកួតស្វ័យប្រវត្តដែលស្វែងរកការស្វែងរកស្ថាបត្យកម្មផ្នែករឹងដែលជំរុញដោយ AI ។ openTPU គឺជាកម្មវិធីនៃវិធីសាស្ត្រនោះចំពោះឧបករណ៍បង្កើនល្បឿនពេញលេញ ដោយការរចនារបស់ភ្នាក់ងារមានសុពលភាពប្រឆាំងនឹងម៉ាស៊ីនក្លែងធ្វើមុនពេលប៉ះផ្នែករឹង។

ហេតុអ្វីវាសំខាន់

ការសម្តែងនៅទីនេះនឹងមិនមានបញ្ហា Nvidia ទេ។ Kintex-7 ជាមួយ DDR3 គឺជាប្រភេទ Hardware ដែលមានអាយុមួយទសវត្សរ៍ ហើយម៉ូដែលដែលវាដំណើរការគឺតូច។ ប៉ុន្តែនោះគឺជាចំណុចដែលគម្រោងបង្កើតដោយប្រយោល៖ ឧបករណ៍បង្កើនល្បឿនទាំងមូល - RTL សំណុំការណែនាំ ក្លែងធ្វើកម្មវិធីចងក្រង និងជង់ម៉ាស៊ីន - អាចអានបានសម្រាប់មនុស្សម្នាក់ក្នុងឃ្លាំងមួយ ហើយវាត្រូវបានរចនាយ៉ាងហោចណាស់ដោយផ្នែកដោយភ្នាក់ងារ AI ជាជាងក្រុមផ្នែករឹង។

ចរន្តបីបញ្ចូលគ្នានៅក្នុងគំនិតនោះ។ ទីមួយ ផ្នែករឹង AI ប្រភពបើកចំហត្រូវបានរារាំងជាយូរមកហើយដោយវិសាលភាពនៃជំនាញដែលត្រូវការ។ លំហូរការរចនាដែលជំរុញដោយភ្នាក់ងារកាត់បន្ថយរបាំងនោះ។ ទីពីរ តម្រូវការការសន្និដ្ឋានកំពុងជំរុញអ្នកស្រាវជ្រាវឆ្ពោះទៅរកផ្នែករឹងដែលមានគោលបំណងពិសេសកម្រនិងអសកម្ម ហើយការស្វែងរកការរចនាដោយស្វ័យប្រវត្តិគឺជាលក្ខណៈធម្មជាតិសម្រាប់ការរុករកកន្លែងនោះ។ ទីបី មុំបង្ហោះដោយខ្លួនឯង - AI បង្កើតម៉ាស៊ីនដែលវាដំណើរការ - បានក្លាយជាសញ្ញាមួយដែលសហគមន៍ឃ្លាំមើលយ៉ាងជិតស្និទ្ធ ដោយវិនិច្ឆ័យដោយការកើនឡើងយ៉ាងឆាប់រហ័សនៃគម្រោងនៅលើ Hacker News ដែលជាកន្លែងដែលវាប្រមូលបានច្រើនជាង 150 ពិន្ទុក្នុងរយៈពេលប៉ុន្មានម៉ោង។

ឃ្លាំងនេះត្រូវបានបង្កើតឡើងនៅថ្ងៃទី 24 ខែកញ្ញា ហើយបានទទួលការជំរុញចុងក្រោយរបស់ខ្លួននៅថ្ងៃទី 2 ខែតុលា ជាមួយនឹងលទ្ធផលវាស់វែងដែលចុះកាលបរិច្ឆេទថ្មីៗនេះនៅថ្ងៃទី 1 ខែតុលា ដែលជាល្បឿននៃការអភិវឌ្ឍន៍ដែលមានតម្លៃមើលដោយខ្លួនឯង។ សម្រាប់អ្នកដែលចង់យល់ពីរបៀបដែលឧបករណ៍បង្កើនល្បឿន AI ដំណើរការពីម៉ាទ្រីសគុណនៅក្នុង Python ចុះទៅខ្សែភ្លើង ស៊ុមផ្ទាល់របស់គម្រោងគឺត្រឹមត្រូវ៖ រឿងទាំងមូលរស់នៅក្នុង monorepo តូចមួយដែលអ្នកអាចអានដល់ចប់។

ថាតើផ្នែករឹងដែលរចនាដោយភ្នាក់ងារក្លាយជាទីផ្សារពិសេស ឬនៅតែជាការចង់ដឹងចង់ឃើញនៃការស្រាវជ្រាវនោះ OpenTPU បានបង្ហាញនូវអ្វីដែលជាក់ស្តែង៖ ឧបករណ៍ដែលអនុញ្ញាតឱ្យម៉ូដែល AI សរសេរកម្មវិធីឥឡូវនេះបានបង្កើតប្រព័ន្ធផ្នែករឹងដែលធ្វើការ និងផ្ទៀងផ្ទាត់ដែលដំណើរការម៉ូដែលដូចគ្នាទាំងនោះ។ រង្វិលជុំត្រូវបានបិទយ៉ាងហោចណាស់នៅមាត្រដ្ឋាន FPGA ។

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →