Fireworks Research ដែលជាក្រុមគំរូនៅក្នុងការចាប់ផ្តើមដំណើរការ Fireworks AI បានណែនាំ Ember-1 ដែលជាគំរូឯកទេសដែលក្រុមហ៊ុននិយាយថាផលិតចម្លើយដូចគ្នានឹង Kimi K3 របស់ Moonshot AI ខណៈពេលដែលបញ្ចេញសញ្ញាសម្ងាត់តិចជាង 40% ។ គំរូនេះបានផ្សាយបន្តផ្ទាល់នៅលើវេទិការបស់ Fireworks កាលពីថ្ងៃទី 23 ខែកញ្ញា ហើយក្នុងរយៈពេលប៉ុន្មានថ្ងៃកន្លងមកនេះ វាបានក្លាយទៅជាការចេញផ្សាយមួយក្នុងចំណោមការចេញផ្សាយដែលពិភាក្សាច្រើនបំផុតនៅក្នុងសហគមន៍អ្នកអភិវឌ្ឍន៍ ដោយទទួលបានការបោះឆ្នោតគាំទ្ររាប់រយនៅលើ Hacker News ខណៈដែលអ្នកសរសេរកូដបានពិភាក្សាថាតើនិមិត្តសញ្ញាហេតុផលគឺជាព្រំដែននៃការចំណាយបន្ទាប់។
ទីលាននេះកើតឡើងនៅពេលវិក័យប័ត្រសន្និដ្ឋាន មិនមែនសមត្ថភាពគំរូទេ កាន់តែសម្រេចចិត្តថាតើក្រុមណាអាចមានលទ្ធភាពដឹកជញ្ជូន។ សម្រាប់ក្រុមដែលមើលបន្ទុកការងាររបស់ភ្នាក់ងារប្រើប្រាស់ថវិកា [ការវិវឌ្ឍន៍ AI ចុងក្រោយបង្អស់] (https://aibuzzwire.news) បានបញ្ជាក់រឿងមួយយ៉ាងច្បាស់៖ ទម្លាប់ថ្លៃបំផុតរបស់ឧស្សាហកម្មនាពេលនេះ គឺមិនមែនជាការបណ្ដុះបណ្ដាលគំរូព្រំដែននោះទេ គឺកំពុងដំណើរការពួកគេ។ Ember-1 គឺជាការប៉ុនប៉ងរបស់ Fireworks ដើម្បីវាយប្រហារបញ្ហានោះដោយផ្ទាល់ ហើយក្រុមហ៊ុនបានគាំទ្រវាជាមួយនឹងការកំណត់លម្អិតខុសពីធម្មតានៃស្តង់ដារ និងលេខផលិតកម្ម។
គំរូគិតច្រើន គិតច្រើនពេក
ការសង្កេតស្នូលនៅពីក្រោយ Ember-1 គឺថាគំរូហេតុផលដូចជា Kimi K3 ចំណាយភាគច្រើននៃនិមិត្តសញ្ញាដែលបានបង្កើតរបស់ពួកគេ - ជួនកាលច្រើនជាង 90% យោងតាម Fireworks - លើហេតុផលផ្ទៃក្នុងជាជាងលើចម្លើយខ្លួនឯង។ តាមសំណើតែមួយ វាថ្លៃណាស់។ នៅក្នុងបន្ទុកការងាររបស់ភ្នាក់ងារ វាផ្សំឡើង៖ រាល់វេននៃការសន្ទនាភ្នាក់ងារមួយនឹងចាក់ឡើងវិញនូវហេតុផលពីមុនទាំងអស់ត្រឡប់ទៅគំរូ ដូច្នេះបរិបទកើនឡើងប្រហែលបួនជ្រុងជាមួយនឹងចំនួនវេន ហើយដានហេតុផលវែងៗពីវេនដំបូងត្រូវបានអានឡើងវិញ និងចេញវិក្កយបត្រឡើងវិញនៅរាល់ការហៅទូរសព្ទជាបន្តបន្ទាប់។
Fireworks និយាយថា អតិថិជនបានប្រាប់ពួកគេថា ពួកគេចង់បានសមត្ថភាពសរសេរកូដរបស់ Kimi K3 ក្នុងតម្លៃទាប ប៉ុន្តែការបិទការព្យាយាមវែកញែករបស់ម៉ូដែលនេះមិនដំណើរការទេ ពោលគឺការកំណត់ការខិតខំប្រឹងប្រែងទាបបានបាត់បង់គុណភាពច្រើនពេក។ ជម្រើសគឺដើម្បីបណ្តុះបណ្តាលគំរូដែលហេតុផលកាន់តែមានប្រសិទ្ធភាព ខណៈពេលដែលរក្សាហេតុផលដែលសំខាន់។
បណ្ដុះបណ្ដាលកាកសំណល់
Building Ember-1 បានធ្វើការពិសោធន៍បណ្តុះបណ្តាលច្រើនជាង 50 និងការវាយតម្លៃជាង 200 ដែលដំណើរការទាំងស្រុងលើវេទិកា Serverless Training ផ្ទាល់ខ្លួនរបស់ Fireworks នេះបើយោងតាមការបង្ហោះប្លុករបស់ក្រុមហ៊ុន។ ក្រុមនេះនិយាយថា ខ្លួនបានបង្កើតក្បួនដោះស្រាយការបណ្តុះបណ្តាលថ្មីតាមវិធីដើម្បីកាត់បន្ថយហេតុផលដោយមិនបាត់បង់ភាពត្រឹមត្រូវ។
គួរកត់សម្គាល់ថាក្រុមហ៊ុនមិនបានព្យាយាមលុបបំបាត់ការលក់ដុំដោយហេតុផលនោះទេ។ ពាក្យសំដីជាក់ស្តែងមួយចំនួនរបស់ Kimi K3 គឺជាការឆ្លុះបញ្ចាំងដោយខ្លួនឯងប្រកបដោយផលិតភាព — ការពិនិត្យមើលការសន្មត់ ការឆ្លើយតបទៅនឹងមតិកែលម្អ ឬការតាមដានលទ្ធផលត្រឡប់ទៅការសម្រេចចិត្តមុននេះ ជួយឱ្យគំរូងើបឡើងវិញពីកំហុស។ របបបណ្តុះបណ្តាលត្រូវបានរៀបចំឡើងដើម្បីរក្សាសមត្ថភាពនោះ ខណៈពេលដែលកាត់បន្ថយរង្វិលជុំដែលមិនបង្កើតផល។
ទិន្នន័យបណ្ដុះបណ្ដាលមានវិសាលភាពគណិតវិទ្យា ការសរសេរកូដ ការណែនាំតាមក្រោយ ការសន្ទនា ការស្វែងរក ការប្រើប្រាស់ឧបករណ៍ និងវិស្វកម្មផ្នែកទន់ ដែលគ្របដណ្តប់ទាំងបញ្ហាដាច់ដោយឡែក និងអន្តរកម្មពហុវេន។ កាំជ្រួចនិយាយថាវាប្រើតែទិន្នន័យផ្ទាល់ខ្លួនរបស់វា ហើយគ្មានទិន្នន័យអតិថិជនទេ។
សញ្ញាសម្គាល់៖ នៅលើ ឬនៅជិតព្រំដែន Pareto
ដើម្បីបង្កើតករណីតម្លៃ កាំជ្រួចបានគណនាតម្លៃតាមស្តង់ដារនីមួយៗដោយប្រើតម្លៃ API សាធារណៈរបស់ Kimi K3 — $3 ក្នុងមួយលានសញ្ញាបញ្ចូលដែលមិនបានលាក់ 0.30 ដុល្លារក្នុងមួយលានសញ្ញាសម្ងាត់បញ្ចូលក្នុងឃ្លាំងសម្ងាត់ និង $15 ក្នុងមួយលាននិមិត្តសញ្ញាទិន្នផល ហើយប្រៀបធៀប Ember-1 ទល់នឹង K3 នៅកម្រិតទាប ខ្ពស់ និងអតិបរមា។ នៅទូទាំងរាល់ស្តង់ដារដែលមានគំរូសាកល្បងច្រើនជាង 50 ក្រុមហ៊ុនរាយការណ៍ថា Ember-1 អង្គុយនៅលើឬនៅជិតព្រំប្រទល់ Pareto ដែលត្រូវគ្នានឹង K3 ក្នុងកិច្ចខិតខំប្រឹងប្រែងអតិបរមាសម្រាប់ប្រភាគនៃការចំណាយ និងគ្រប់គ្រងយ៉ាងតឹងរ៉ឹង K3 នៅការខិតខំប្រឹងប្រែងទាប។
ការប្រៀបធៀបចំណងជើងធៀបនឹង K3 នៅការខិតខំប្រឹងប្រែងអតិបរមា ដូចដែលបានរាយការណ៍ដោយ Fireworks៖
| Benchmark | គំរូ | K3 (ការខិតខំប្រឹងប្រែងអតិបរមា) | Ember-1 |
|--|---|---|---|
| Terminal Bench 2.1 | ៨៩ | 80.9% | 82.0% |
| SWE-bench Verified | ៥០០ | 93.2% | 92.2% |
| SWE-អន្តរកម្ម | ៧៥ | ២១.៣% | 20.0% |
| DeepSWE 1.1 | ១១៣ | 66.4% | 75.2% |
| τ²-Bench Airline | ៥០ | ៦៤% | ៦៦% |
លើការចំណាយក្នុងមួយកិច្ចការ កាំជ្រួចរាយការណ៍ Ember-1 កាត់បន្ថយការចំណាយ 51.9% នៅលើ Terminal Bench 2.1, 32.5% នៅលើ SWE-Interact, 23.7% នៅលើ DeepSWE 1.1 និង 15.5% នៅលើ SWE-bench Verified ទាក់ទងទៅនឹង K3 នៅការខិតខំប្រឹងប្រែងអតិបរមា - ក្នុងករណីក្រុមហ៊ុន DeepSWE គណនាភាពខុសគ្នានៃការងារ 12 ដុល្លារក្នុងមួយឯកតា។ អត្រា។
ក្រុមហ៊ុនក៏បានវាយតម្លៃ Ember-1 នៅលើ Doximity's Bedside Bench ដែលជាស្តង់ដារដែលមានសុពលភាពដោយគ្រូពេទ្យនៃករណីព្យាបាលចំនួន 500 នៅទូទាំងឯកទេស 10 ដែល Fireworks ដំណើរការតាមរយៈ Specialized Intelligence Index ដែលទើបនឹងបើកដំណើរការថ្មី។ នៅទីនោះ Fireworks និយាយថា Ember-1 កំណត់ព្រំដែន Pareto ថ្មីលើតម្លៃក្នុងមួយកិច្ចការទាំងម៉ូដែលបើកចំហ និងបិទ រួមទាំង GPT-5.6 Sol, GPT-6 Astra និង Claude Opus 5។ ការអះអាងនោះបានមកពីសន្ទស្សន៍ផ្ទាល់ខ្លួនរបស់ Fireworks ហើយមិនត្រូវបានផ្ទៀងផ្ទាត់ដោយឯករាជ្យទេ។
ចរាចរណ៍បន្តផ្ទាល់៖ ថូខឹនតិចជាងមុន ពិន្ទុដូចគ្នា។
គោលគឺជារឿងមួយ; ផលិតកម្មគឺមួយទៀត។ កាំជ្រួចបានដំណើរការការធ្វើតេស្ត A/B ផ្ទាល់ជាមួយអតិថិជនពីរនាក់លើបន្ទុកការងារសរសេរកូដផលិតកម្មរបស់ពួកគេ ហើយរាយការណ៍ថា Ember-1 បានប្រើថូខឹនតិចជាង 35% ក្នុងមួយកិច្ចការក្នុងគុណភាពប្រៀបធៀប។ នៅក្នុងការប្រៀបធៀបដែលបានវាស់វែងមួយ Kimi K3 ទទួលបានពិន្ទុ 0.751 ខណៈពេលដែលបង្កើតនិមិត្តសញ្ញាលទ្ធផល 49,300 ក្នុងមួយកិច្ចការ ទល់នឹង 0.753 សម្រាប់ Ember-1 លើ 29,900 tokens ដែលជាការថយចុះ 71.3% នៅក្នុងនិមិត្តសញ្ញាហេតុផល និង 39% ថូខឹនសរុបតិចជាង។ បន្ទាប់ពីការធ្វើតេស្ត អតិថិជនម្នាក់បានផ្លាស់ប្តូរ Ember-1 ទៅជាផលិតកម្មផ្ទាល់ ដោយមានគម្រោងពង្រីកវាឡើង ដើម្បីជំនួសគំរូមូលដ្ឋានទាំងស្រុង។
នៅខាងក្នុង Fireworks ខ្លួនវា ម៉ូដែលនេះត្រូវបានផ្លាស់ប្តូរដោយស្ងៀមស្ងាត់ទៅក្នុងដំណើរការនៃការសរសេរកូដផ្ទាល់ខ្លួនរបស់ក្រុមហ៊ុនមុនពេលចាប់ផ្តើម។ លទ្ធផលដែលក្រុមនេះនិយាយថាវាជាមោទនភាពបំផុត៖ គ្មានអ្នកណាកត់សម្គាល់ឡើយ។ អ្នកអភិវឌ្ឍន៍បានអនុវត្តការងាររបស់ពួកគេដោយមិនរកឃើញកុងតាក់ ខណៈពេលដែលប្រើប្រាស់ថូខឹនតិចជាងច្រើន។
ភាពវៃឆ្លាតពិសេសជាយុទ្ធសាស្ត្រ
Ember-1 គឺជាគំរូដំបូងនៅក្នុងស៊េរីដែលបានគ្រោងទុកពី Fireworks Research ហើយវាមកដល់ជាមួយនឹងសន្ទស្សន៍ភាពវៃឆ្លាតពិសេសរបស់ក្រុមហ៊ុន ដែលជាកិច្ចខិតខំប្រឹងប្រែងស្តង់ដារដែលបានណែនាំកាលពីដើមខែនេះដើម្បីប្រៀបធៀបម៉ូដែលបើកចំហ បិទ និងឯកទេសលើកិច្ចការពិភពលោកពិតដែលបង្កើតឡើងដោយអ្នកជំនាញ។
ល្បែងយុទ្ធសាស្ត្រគឺងាយស្រួលអាន។ ជាជាងបង្វឹកគំរូព្រំដែនពីដំបូង កាំជ្រួចបានយកគំរូទម្ងន់បើកចំហដ៏រឹងមាំ ប្រសិទ្ធភាពសញ្ញាសម្ងាត់ដែលបានបណ្តុះបណ្តាលទៅក្នុងវា ហើយឥឡូវនេះកំពុងលក់សមត្ថភាពដូចគ្នាក្នុងតម្លៃទាបបំផុតក្នុងមួយកិច្ចការ។ នៅពេលដែលការចេញផ្សាយទម្ងន់បើកចំហពីមន្ទីរពិសោធន៍ដូចជា Moonshot បន្តបិទគម្លាតសមត្ថភាព អ្នកផ្តល់ការសន្និដ្ឋានកំពុងរកឃើញថាភាពខុសគ្នាជាប់លាប់អាចស្ថិតនៅក្នុងការចំណាយក្នុងមួយកិច្ចការដែលបានបញ្ចប់ជាជាងតំណែងតារាងពិន្ទុ ដែលជាការផ្លាស់ប្តូរដែលអនុគ្រោះដល់ក្រុមហ៊ុនជាមួយនឹងការបណ្តុះបណ្តាលរឹងមាំ និងសេវាកម្មហេដ្ឋារចនាសម្ព័ន្ធ។
ការព្រមានគួរបញ្ជាក់ឱ្យច្បាស់៖ លេខខាងលើបានមកពីប្លុកផ្ទាល់ខ្លួនរបស់ Fireworks ការវាយតម្លៃផ្ទាល់ខ្លួន និងអតិថិជនដែលបង់ប្រាក់ផ្ទាល់ខ្លួន។ ការចម្លងឯករាជ្យនៃការសន្សំសញ្ញាសម្ងាត់លើបន្ទុកការងារខាងក្រៅនឹងក្លាយជាការសាកល្បងពិតប្រាកដ។ ប៉ុន្តែប្រសិនបើលទ្ធផលនៅតែរក្សា នោះវិធីដែលមានប្រសិទ្ធភាពបំផុតក្នុងការដំណើរការគំរូបើកចំហកម្រិតព្រំដែន ប្រហែលជាលែងធ្វើឱ្យវាគិតតិចទៀតហើយ — វាអាចជាដំណើរការគំរូដែលរៀនគិតប្រកបដោយប្រសិទ្ធភាព។
---
ទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។
អានព័ត៌មាន AI បន្ថែម →