គម្រោងប្រភពបើកចំហដែលគេស្គាល់តិចតួចហៅថា Strata កំពុងមានពេលមួយហើយ។ ម៉ាស៊ីនដែលមានអាជ្ញាប័ណ្ណពី MIT ដែលដំណើរការ Qwen3.8-Flash-Next របស់ក្រុមហ៊ុន Alibaba ដែលជាគំរូចម្រុះនៃអ្នកជំនាញចំនួន 125 ពាន់លានរូប នៅលើកុំព្យូទ័រលេងហ្គេមធម្មតា បានបាញ់ទៅលើទំព័រមុខរបស់ Hacker News នៅថ្ងៃទី 4 ខែតុលា ជាមួយនឹងច្រើនជាង 640 ពិន្ទុ ហើយឃ្លាំង GitHub របស់វាត្រូវបានបង្កើតឡើងចាប់តាំងពីខែកញ្ញា 4,000 ។
ទីលានគឺសាមញ្ញ៖ គំរូប៉ារ៉ាម៉ែត្រ 125 ពាន់លានដែលជាធម្មតារស់នៅលើម៉ាស៊ីនមេអាចជជែក សរសេរកូដ អានរូបភាព និងជំរុញភ្នាក់ងារសរសេរកូដទាំងស្រុងលើកាតក្រាហ្វិកអ្នកប្រើប្រាស់ ដោយគ្មានអ្វីចេញពីម៉ាស៊ីននោះទេ។
អ្វីដែល Strata ពិតជាធ្វើ
Strata គឺជាម៉ាស៊ីនសន្និដ្ឋាន និងកម្មវិធីដំឡើងដោយចុចមួយដងសម្រាប់ Windows និង Linux ។ យោងតាមឯកសាររបស់វា តម្រូវការមានកម្រិតតិចតួចតាមស្តង់ដារនៃម៉ូដែល Frontier៖ GPU ដែលមាន VRAM យ៉ាងតិច 12GB ពី NVIDIA's RTX 20, 30, 40 ឬ 50 series ឬ AMD's Radeon RX 6000, 7000 ឬ 9000 series, យ៉ាងហោចណាស់ 32GB នៃ RAM ប្រព័ន្ធ SD8 និងទំហំទំនេរប្រហែល 32GB ។
ម៉ាស៊ីនបញ្ជូនកំណែបរិមាណនៃ Qwen3.8-Flash-Next នៅកម្រិតបង្ហាប់ជាច្រើនចាប់ពី Q2_0 ដល់ IQ3_S បូករួមទាំងវ៉ារ្យ៉ង់កូដពិសេស។ វាលាតត្រដាង OpenAI និង Anthropic-compatible APIs នៅលើ localhost ដែលមានន័យថាឧបករណ៍ដែលបានបង្កើតឡើងសម្រាប់ ChatGPT ឬ Claude — រួមទាំងភ្នាក់ងារសរសេរកូដដូចជា Claude Code, Cursor និង Codex — អាចត្រូវបានចង្អុលទៅម៉ាស៊ីនមេក្នុងស្រុកជាមួយនឹងការផ្លាស់ប្តូរតិចតួចបំផុត។ ការបញ្ចូលរូបភាពជាជម្រើស និងការគាំទ្រពហុ GPU ត្រូវបានរួមបញ្ចូល ហើយកម្មវិធីដំឡើងថែមទាំងផ្តល់នូវរបៀបតំឡើងដែលជំនួយដោយ AI ដែលអនុញ្ញាតឱ្យអ្នកជំនួយការសរសេរកូដកំណត់រចនាសម្ព័ន្ធម៉ាស៊ីនពីប្រអប់បញ្ចូលតែមួយ។
លេខល្បឿន
ស្តង់ដារដែលបានបោះពុម្ពផ្សាយរបស់គម្រោងដែលបានវាស់វែងលើផ្ទៃតុអ្នកប្រើប្រាស់ពីរគឺជាហេតុផលដែលការចេញផ្សាយរីករាលដាល។ នៅលើ NVIDIA RTX 5070 ជាមួយនឹង 12GB នៃ VRAM ភ្ជាប់ជាមួយ Ryzen 5 7600 និង RAM 64GB, Strata រាយការណ៍ថា:
- Q2_0 quantization: 94 tokens per second for generation and 2,650 tokens per second for prompt process on a 32K-token document
- IQ3_S: 53 tokens per second generation, 1,620 tokens per second prompt processing
- បំរែបំរួលអ្នកសរសេរកូដ៖ 55 tokens ក្នុងមួយជំនាន់ទីពីរ
នៅផ្នែកខាង AMD RX 9070 XT ដែលមាន 16GB នៃ VRAM គ្រប់គ្រង 60 tokens ក្នុងមួយវិនាទីនៅ Q2_0 ។ ឯកសារប៉ាន់ស្មានថា RTX 3090 ដែលមាន 24GB នៃ VRAM គួរតែឈានដល់ 100 ទៅ 140 tokens ក្នុងមួយវិនាទី — លឿនជាងមនុស្សភាគច្រើនអាចអានបាន។
សម្រាប់ការប្រៀបធៀបកាលពីប្រាំមួយខែមុន ការដំណើរការសូម្បីតែគំរូក្រាស់ 70 ពាន់លានក្នុងមូលដ្ឋានក្នុងល្បឿនដែលអាចប្រើប្រាស់បានទាមទារស្ថានីយការងារដែលមានអង្គចងចាំរួបរួមរាប់រយជីហ្គាបៃ ឬល្បិចក្នុងការឌិកូដស្មានដែលឈ្លានពាន។
ហេតុអ្វីបានជាម៉ូដែល 125B សមនៅលើកាតហ្គេម
បច្ចេកវិជ្ជាពីរផ្នែកធ្វើឱ្យវាអាចទៅរួច។ ទីមួយគឺគំរូខ្លួនឯង។ ដូចដែល AI Buzz Wire គ្របដណ្តប់នៅការចេញផ្សាយរបស់វា Qwen3.8-Flash-Next គឺជាស្ថាបត្យកម្មចម្រុះនៃអ្នកជំនាញដែលមានប៉ារ៉ាម៉ែត្រសរុបប្រហែល 125 ពាន់លានប៉ុន្តែមានតែប្រហែល 6 ពាន់លានសកម្មក្នុងមួយសញ្ញា - ដូច្នេះពាក្យដែលបានបង្កើតនីមួយៗប៉ះនឹងផ្នែកតូចមួយនៃបណ្តាញ ដោយកាត់បន្ថយការគណនាក្នុងមួយនិមិត្តសញ្ញា។
ទីពីរគឺបរិមាណ។ ការកំណត់ជាមុនលឿនបំផុតរបស់ Strata បង្រួមទម្ងន់របស់ម៉ូដែលទៅ 2 ឬ 3 ប៊ីតក្នុងមួយប៉ារ៉ាម៉ែត្រ ដោយធ្វើការជួញដូរនូវភាពត្រឹមត្រូវមួយចំនួនសម្រាប់ជើងដែលសមនឹង GPU 12GB និង RAM ប្រព័ន្ធ។ ការដោះដូរនោះគឺជាការព្រមានចម្បង៖ បរិមាណ Q2-class និង IQ2-class វាស់ស្ទង់គុណភាពអន់ថយលើការងារដែលមានហេតុផល ហើយអ្នកទិញគួរតែចាត់ទុកលេខល្បឿនចំណងជើងជាចំណុចចាប់ផ្តើមជាជាងការធានាសម្រាប់រាល់បន្ទុកការងារ។ ទំព័រគំរូសហគមន៍នៅក្នុងឃ្លាំងតាមដានលទ្ធផលគុណភាពតាមទំហំ។
ផ្នែកនៃរលក AI ក្នុងស្រុកធំជាង
Strata មកដល់ចំពេលមានសន្ទុះបង្កើនល្បឿនសម្រាប់ការសន្និដ្ឋានក្នុងតំបន់។ គ្រួសារ Qwen របស់ Alibaba បានក្លាយជាបណ្តាញគំរូទម្ងន់បើកចំហដែលត្រូវបានទាញយកច្រើនបំផុត Meta និង Google មានគំរូប្រកួតប្រជែងដែលមានប្រភពបើកចំហរបស់ពួកគេផ្ទាល់ ហើយរលកនៃឧបករណ៍ឥឡូវនេះអនុញ្ញាតឱ្យអ្នកប្រើប្រាស់ដំណើរការជំនួយការដែលមានសមត្ថភាពដោយមិនចាំបាច់ជាវ ឬទិន្នន័យចាកចេញពីឧបករណ៍របស់ពួកគេ។
គម្រោងនេះក៏ឆ្លុះបញ្ចាំងពីរបៀបដែលនិយមន័យនៃ "ផ្នែករឹងអ្នកប្រើប្រាស់" កំពុងផ្លាស់ប្តូរ។ កាតក្រាហ្វិកកម្រិតមធ្យមឆ្នាំ 2026 ដែលមានអង្គចងចាំ 12GB នៃ VRAM ដែលដឹកជញ្ជូនជាចម្បងសម្រាប់ការលេងហ្គេម ឥឡូវនេះគឺជាឧបករណ៍បង្កើនល្បឿនការសន្និដ្ឋានដែលអាចសម្រេចបានសម្រាប់ម៉ូដែលនៅក្នុងថ្នាក់ទំហំដែលកំណត់ប្រព័ន្ធព្រំដែនកាលពីពីរឆ្នាំមុន។
Strata នៅតែជាកម្មវិធីដំបូង ដែលជាកម្មវិធីតាមដានបញ្ហារបស់ឃ្លាំងចងក្រងឯកសារគែមរដុបលើ GPUs ចាស់ៗ និងប្រព័ន្ធដំណើរការមិនមែន AVX2 ប៉ុន្តែគម្រោងនេះត្រូវបានផ្តល់អាជ្ញាប័ណ្ណពី MIT ឥតគិតថ្លៃ និងត្រូវបានបង្កើតឡើងក្នុងលក្ខណៈបើកចំហ ដោយមានការគាំទ្រការពិសោធន៍សម្រាប់ Intel Arc កាត Tesla និង Radeon ចាស់ៗ និងឧបករណ៍ផ្ទុក GPU ច្រើនដែលចងក្រងដោយសមាជិកសហគមន៍។
សម្រាប់អ្នកអភិវឌ្ឍន៍ ការអនុវត្តជាក់ស្តែងបំផុតអាចជាភាពឆបគ្នានៃ API របស់ម៉ាស៊ីនមូលដ្ឋាន៖ ស្គ្រីប ឬភ្នាក់ងារណាមួយដែលសរសេរប្រឆាំងនឹង OpenAI ឬ Anthropic SDK អាចត្រូវបានបញ្ជូនបន្តទៅកាន់ការដាក់ពង្រាយ Qwen ក្នុងតំបន់ដោយការផ្លាស់ប្តូរ URL មូលដ្ឋាន ធ្វើឱ្យ Strata ជាជម្រើសកកិតទាបសម្រាប់ការធ្វើគំរូតាមឯកជនភាព ការប្រើប្រាស់ក្រៅបណ្តាញ ឬគ្រាន់តែកំណត់ការចំណាយ API ។
##របៀបសាកល្បង
ការចាប់ផ្តើមមិនតម្រូវឱ្យមានវគ្គស្ថានីយជាមួយនឹងសៀវភៅដៃទេ។ កម្មវិធីដំឡើងផ្តល់កម្មវិធីបញ្ជា ទម្ងន់គំរូ និងម៉ាស៊ីនមេក្នុងតំបន់ក្នុងមួយច្រក ហើយឃ្លាំងរួមបញ្ចូលឯកសារដំឡើងដែលត្រូវបានរចនាឡើងដើម្បីបិទភ្ជាប់ដោយផ្ទាល់ទៅក្នុងជំនួយការសរសេរកូដ AI ដែលបន្ទាប់មកកំណត់រចនាសម្ព័ន្ធម៉ាស៊ីនដោយស្វ័យប្រវត្តិ។ ការចាប់ផ្តើមដំបូងគឺយឺតជាងខណៈពេលដែលទម្ងន់ផ្ទុកពីថាស។ ឯកសារណែនាំ SSD ហើយព្រមានថាការសន្ទនាដ៏វែងផ្លាស់ប្តូរការងារបន្ថែមទៀតទៅលើ RAM ប្រព័ន្ធ។
នាំមុខ AIអនុវត្តតាម AI Buzz Wire សម្រាប់ព័ត៌មានចុងក្រោយបំផុតអំពីម៉ូដែលប្រភពបើកចំហ ឧបករណ៍ AI ក្នុងស្រុក និងផ្នែករឹងសន្និដ្ឋាន។
អានព័ត៌មាន AI បន្ថែម →