ក្រុម Ornith បានចេញផ្សាយ Ornith-1.5 ដែលជាក្រុមគ្រួសារនៃគំរូភាសាបើកចំហដែលបង្កើតឡើងជុំវិញគំនិតមិនធម្មតាមួយ៖ គំរូបង្កើតការងារបណ្តុះបណ្តាលផ្ទាល់ខ្លួន រចនារន្ទាផ្ទាល់ខ្លួន និងរៀនពីការព្យាយាមដំណោះស្រាយផ្ទាល់ខ្លួននៅក្នុងរង្វិលជុំដែលកំពុងដំណើរការជាបន្តបន្ទាប់។ យោងតាមការវាយតម្លៃផ្ទាល់ខ្លួនរបស់ក្រុម ស្មាតហ្វូន Ornith-1.5-397B ទទួលបានពិន្ទុ 86.1 នៅលើ Terminal-Bench 2.1 (Terminus-2) ដោយដាក់វាឱ្យស្មើគ្នាជាមួយនឹង Anthropic's Claude Opus 4.8 នៅ 85.0 និងនាំមុខគ្រប់ម៉ូដែលប្រភពបើកចំហផ្សេងទៀតដែលមានទំហំប្រៀបធៀប។

ការចេញផ្សាយដែលបានបោះពុម្ពផ្សាយនៅសប្តាហ៍នេះនៅលើប្លក់ Ornith និងនៅលើ Hugging Face ក្រោមអាជ្ញាប័ណ្ណ MIT គឺជា salvo ចុងក្រោយបំផុតនៅក្នុងការប្រណាំង AI ប្រភពបើកចំហដែលបានបង្កើតលទ្ធផលជាទៀងទាត់ម្តងដែលគិតថាមិនអាចទៅរួចដោយគ្មានថវិការបស់មន្ទីរពិសោធន៍ព្រំដែន។ សម្រាប់អ្នកអភិវឌ្ឍន៍ និងសហគ្រាសដែលតាមដាន [ព័ត៌មានគំរូ AI ចុងក្រោយបំផុត] (https://aibuzzwire.news) សារៈសំខាន់គឺពីរដង៖ ភាពស្មើគ្នានៃស្តង់ដារជាមួយនឹងគំរូបិទជិតឈានមុខគេ និងរូបមន្តបណ្តុះបណ្តាលដែលចង្អុលទៅកន្លែងដែលការអភិវឌ្ឍន៍គំរូបើកចំហកំពុងឈានទៅមុខបន្ទាប់។

បីទំហំ រូបមន្តតែមួយ

Ornith-1.5 ដឹកជញ្ជូនក្នុងការកំណត់រចនាសម្ព័ន្ធចំនួនបី៖ ស្មាតហ្វូនចម្រុះ 397B-parameter-of-experts flagship, 35B MoE ដែលដំណើរការតែប៉ារ៉ាម៉ែត្រ 3B ក្នុងមួយសញ្ញាសម្ងាត់ និងម៉ូដែលក្រាស់ 9B ជាមួយនឹងវ៉ារ្យ៉ង់ "Mobile" បរិមាណដែលត្រូវបានរចនាឡើងដើម្បីដំណើរការដោយផ្ទាល់នៅលើឧបករណ៍ iPhone និង Android ។ ទាំងបីមាននៅលើ Hugging Face រួមជាមួយនឹង GGUF, MLX, និង NVFP4 builds ហើយកាតគំរូបង្ហាញថាគ្រួសារនេះត្រូវបានបង្កើតឡើងនៅលើស្ថាបត្យកម្ម Qwen3.5 MoE ។

ពូជពង្សគឺសំខាន់នៅទីនេះ។ Ornith-1.0 ដែលត្រូវបានចេញផ្សាយកាលពីដើមឆ្នាំនេះ បានធ្វើឱ្យពេញនិយមនូវវិធីសាស្រ្ត "រន្ទាដោយខ្លួនឯង" ចំពោះការសរសេរកូដភ្នាក់ងារ ហើយបានក្លាយជាការពេញនិយមដ៏ស្ងប់ស្ងាត់ - ការបង្កើត 9B GGUF របស់វាបានកត់ត្រាការទាញយកច្រើនជាងប្រាំលានដងនៅលើ Hugging Face ។ Ornith-1.5 ពង្រីកក្របខ័ណ្ឌនោះពីការបង្កើនប្រសិទ្ធភាពនៃរន្ទា និងការដាក់ចេញចូលទៅក្នុងបំពង់កែលម្អខ្លួនឯងពេញលេញ។

រង្វិលជុំកែលម្អខ្លួនឯង ពន្យល់

នៅក្នុងបំពង់បញ្ជូនក្រោយការបណ្តុះបណ្តាលធម្មតា ការរៀនពង្រឹងដំណើរការប្រឆាំងនឹងសំណុំថេរនៃកិច្ចការដែលរៀបចំដោយមនុស្ស។ ជំនួសមកវិញ Ornith-1.5 មានគំរូដោយខ្លួនវាផ្ទាល់បានស្នើរភារកិច្ចថ្មី បង្កើតរន្ទាជាក់លាក់នៃភារកិច្ច — ការណែនាំ ឧបករណ៍ និងយុទ្ធសាស្ត្របំបែកដែលប្រើដើម្បីវាយប្រហារបញ្ហា — ហើយបន្ទាប់មកបង្កើតដំណោះស្រាយដែលត្រូវបានដាក់ពិន្ទុដោយរន្ទាដែលវាទើបតែសាងសង់។ រង្វាន់ត្រូវបានផ្សព្វផ្សាយឡើងវិញតាមរយៈដំណាក់កាលទាំងបីដោយប្រើ GRPO ដូច្នេះប្រព័ន្ធនឹងរៀនសរសេរកិច្ចការប្រសើរជាងមុន រន្ទាប្រសើរជាងមុន និងដំណោះស្រាយប្រសើរជាងមុន។

រង្វាន់នៃការបង្កើតភារកិច្ចគឺជាបេះដូងនៃការរចនា។ កិច្ចការដែលបានស្នើនីមួយៗត្រូវបានដាក់ពិន្ទុលើសញ្ញាពហុគុណចំនួនបី៖ សុពលភាព (តើរន្ទាដំណើរការ និងវាយតម្លៃត្រឹមត្រូវទេ?) ការលំបាកផ្នែកខាងមុខ (តើអត្រាជោគជ័យជាក់ស្តែងរបស់គំរូគឺនៅជិតគោលដៅប្រហែល 20 ភាគរយ រក្សាកិច្ចការដែលពិបាក ប៉ុន្តែអាចរៀនបាន?) និងភាពថ្មីថ្មោង (តើវាគ្រប់គ្រាន់ហើយឬនៅ? ដោយសារតែភាពលំបាកត្រូវបានវាស់វែងធៀបនឹងអត្រាជោគជ័យបច្ចុប្បន្នរបស់គំរូ នោះកម្មវិធីសិក្សានឹងកើនឡើងដោយស្វ័យប្រវត្តិនៅពេលដែលគំរូមានភាពប្រសើរឡើង។

ក្រុមនេះក៏រាយការណ៍អំពីវិធានការប្រឆាំងនឹងការលួចចូលយ៉ាងច្បាស់លាស់ក្នុងអំឡុងពេលវាយតម្លៃ៖ ប្រវត្តិ git ត្រូវបានដកចេញពីរូបភាពឃ្លាំង ដូច្នេះម៉ូដែលមិនអាចយកមកវិញនូវដំណោះស្រាយពីមុន ហើយការចូលប្រើបណ្តាញត្រូវបានបិទដើម្បីការពារម៉ូដែលពីការទាញយកចម្លើយពីខាងក្រៅ។ លទ្ធផលទាំងអស់គឺជាមធ្យមលើការរត់ឯករាជ្យចំនួនប្រាំ។

លេខ

នៅលើការសរសេរកូដភ្នាក់ងារ ចង្កោមលទ្ធផលដែលរាយការណ៍ដោយខ្លួនឯងរបស់ស្មាតហ្វូននៅផ្នែកខាងលើនៃវាលប្រភពបើកចំហ។ នៅលើ Terminal-Bench 2.1 ដំណើរការតាមរយៈ Terminus-2 harness, Ornith-1.5-397B's 86.1 edges out Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7) និង GLM-5.2 (81) ។ នៅលើស្តង់ដារដូចគ្នាដែលដំណើរការតាមរយៈខ្សែ Claude Code Ornith-1.5 ប្រកាស 85.2 ប្រឆាំងនឹង Opus 4.8's 78.9 ។ នៅលើ SWE-bench Verified ទាំងពីរត្រូវបានចងយ៉ាងមានប្រសិទ្ធភាពនៅ 86.0 និង 85.8 ដោយ Kimi K3 នាំមុខបន្តិចនៅ 86.2 ។

ចន្លោះប្រហោងកាន់តែទូលំទូលាយនៅលើឈុតភ្នាក់ងារដែលពិបាកជាង។ នៅលើ DeepSWE, Ornith-1.5-397B ទទួលបានពិន្ទុ 56.0 — នាំមុខ GLM-5.2's 46.2 ទោះបីជានៅពីក្រោយ Opus 4.8 (59.0) និង Kimi K3 (67.5) ក៏ដោយ។ ការលោតដ៏គួរឱ្យចាប់អារម្មណ៍បំផុតគឺជំនាន់: Ornith-1.0 ទទួលបានពិន្ទុត្រឹមតែ 8.0 នៅលើ DeepSWE មានន័យថាការបន្តថ្មីផ្តល់នូវការកែលម្អប្រាំពីរដងលើគ្រួសារគោលដូចគ្នា។

ម៉ូដែលតូចៗប្រាប់រឿងផ្ទាល់ខ្លួនរបស់ពួកគេ។ Ornith-1.5-35B-A3B ដែលធ្វើសកម្មភាពតែប៉ារ៉ាម៉ែត្រ 3B ក្នុងមួយនិមិត្តសញ្ញា ទទួលបានពិន្ទុ 68.5 នៅលើ Terminal-Bench 2.1 (Claude Code) ធៀបនឹង 43.4 សម្រាប់ Gemma 4-31B របស់ Google និង 51.7 សម្រាប់ Meta's Muse Glimmer-30B, post-30B, and S. ម៉ូដែល 9B ឈានដល់ 47.0 នៅលើ Terminal-Bench 2.1, 70.6 នៅលើ SWE-bench Verified និង 86.4 នៅលើ GPQA Diamond ដែលជាលេខដែលដាក់ម៉ូដែលថ្នាក់ទូរស័ព្ទក្នុងចម្ងាយដ៏គួរឱ្យចាប់អារម្មណ៍ពីគូប្រជែងថ្នាក់កុំព្យូទ័រ។

ការព្រមាន និងបរិបទ

ទាំងនេះគឺជាស្តង់ដារដែលដំណើរការដោយអ្នកអភិវឌ្ឍន៍ មិនមែនជាលទ្ធផលដែលបានធ្វើសវនកម្មដោយឯករាជ្យទេ ហើយគំរូប្រៀបធៀបត្រូវបានវាយតម្លៃដោយក្រុម Ornith ក្រោមការកំណត់ខ្សែផ្ទាល់ខ្លួនរបស់វា។ មន្ទីរពិសោធន៍គូប្រជែងក៏លៃតម្រូវសម្រាប់ការដោះដូរផ្សេងៗគ្នា។ ការនាំមុខរបស់ Kimi K3 នៅលើ DeepSWE បង្ហាញថាព្រំដែននៃការងារកម្មវិធីភ្នាក់ងារនៅតែប្រកួតប្រជែង។ ប៉ុន្តែតម្លាភាពពេញតារាងនៃការចេញផ្សាយ — មធ្យមភាគប្រាំ ការកំណត់រចនាសម្ព័ន្ធខ្សែដែលបានបោះពុម្ព ការការពារដែលបានបង្ហាញ — ធ្វើឱ្យការផលិតឡើងវិញដោយឯករាជ្យខុសពីធម្មតា។

ការឆ្លើយតបរបស់សហគមន៍មានច្រើនណាស់។ សេចក្តីប្រកាសនៃការចេញផ្សាយនេះបានទាក់ទាញបានជាងមួយរយចំណុចនៅលើ Hacker News ក្នុងរយៈពេលប៉ុន្មានម៉ោងជាមួយនឹងការពិភាក្សាផ្តោតតិចជាងលើការអះអាងគោលជាជាងលើវិធីសាស្រ្តកែលម្អខ្លួនឯង ដែលអ្នកអត្ថាធិប្បាយជាច្រើនបានពណ៌នាថាជាការអនុវត្តបើកចំហដ៏គួរឱ្យទុកចិត្តបំផុតនៃការបង្កើតកិច្ចការដែលមានរចនាប័ទ្មឡើងវិញ។

សម្រាប់ប្រព័ន្ធអេកូប្រភពបើកចំហ Ornith-1.5 ចុះចតនៅពេលគំរូបើកចំហពីមន្ទីរពិសោធន៍របស់ប្រទេសចិន និងក្រុមឯករាជ្យលោកខាងលិចបាននឹងកំពុងបិទគម្លាតជាមួយនឹងព្រំដែនបិទជិតលើការងារសរសេរកូដ និងភ្នាក់ងារ។ គ្រួសារដែលមានអាជ្ញាប័ណ្ណ MIT ដែលផ្គូផ្គងនឹងម៉ូដែលបិទជិតឈានមុខគេនៅលើ Terminal-Bench — និងដឹកជញ្ជូនវ៉ារ្យ៉ង់ 9B ដែលត្រៀមរួចជាស្រេចតាមទូរស័ព្ទ — បង្រួមគម្លាតនោះបន្ថែមទៀត ហើយធ្វើវាដោយប្រើវិធីសាស្ត្របណ្តុះបណ្តាលដែលអ្នកណាម្នាក់អាចត្រួតពិនិត្យ ផលិតឡើងវិញ និងពង្រីកបាន។

---

ស្នាក់នៅមុន AI

ទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។

អានព័ត៌មាន AI បន្ថែម →