ក្រុមហ៊ុន Cognition ដែលជាក្រុមហ៊ុននៅពីក្រោយវិស្វករកម្មវិធី Devin AI បានចាប់ផ្តើម SWE-2 កាលពីថ្ងៃព្រហស្បតិ៍ ដោយពណ៌នាថាវាជាគំរូសរសេរកូដកម្រិតខ្ពស់បំផុតរបស់វានៅឡើយ។ នៅក្នុងការបង្ហោះប្លក់មួយដែលបានចេញផ្សាយនៅថ្ងៃទី 10 ខែកញ្ញា ក្រុមហ៊ុនបាននិយាយថា ម៉ូដែលថ្មីនេះជំរុញនូវអ្វីដែលវាហៅថា ព្រំដែន Pareto នៃសមត្ថភាព និងតម្លៃ ដោយទទួលបានពិន្ទុ 50.0% លើ FrontierCode 1.1 Main benchmark ខណៈពេលដែលមានតម្លៃ 64% តិចជាង Fable 5.1 ដែលជាគំរូ Anthropic ដែលឈរនៅពីមុខវាត្រឹមតែ 50.9% ។

ការបើកដំណើរការបានត្រឹមតែមួយថ្ងៃបន្ទាប់ពីក្រុមហ៊ុន Cognition បញ្ជាក់ពីការផ្ដល់មូលនិធិចំនួន 2 ពាន់លានដុល្លារក្នុងតម្លៃ 48 ពាន់លានដុល្លារ ហើយវាបង្ហាញពីរបៀបដែលការចាប់ផ្ដើមសរសេរកូដភ្នាក់ងារសកម្មកំពុងវិនិយោគលើការអភិវឌ្ឍន៍គំរូរបស់ខ្លួនជាជាងការពឹងផ្អែកតែលើម៉ូដែលព្រំដែនភាគីទីបី។ សម្រាប់ការគ្របដណ្តប់ជាបន្តបន្ទាប់នៃការប្រណាំងសរសេរកូដ AI និងអ្វីៗផ្សេងទៀតដែលផ្លាស់ប្តូរឧស្សាហកម្ម សូមចំណាំ [AI Buzz Wire] (https://aibuzzwire.news) ប្រភពប្រចាំថ្ងៃរបស់អ្នកសម្រាប់ការបំបែកព័ត៌មាន AI ។

កន្លែងដែល SWE-2 ចុះចតនៅលើគោល

យោងតាមលទ្ធផលដែលបានបោះពុម្ពផ្សាយរបស់ Cognition SWE-2 ប្រកាស 50.0% លើ FrontierCode 1.1 Main នាំមុខ Grok 4.6 នៅ 48.0% និង GPT-5.6 Sol នៅ 47.5% និងក្នុងចម្ងាយដ៏គួរឱ្យចាប់អារម្មណ៍ GPT-6 Astra ដែលនាំមុខវាលនៅ 53.3% ។ នៅលើសន្ទស្សន៍ DeepSWE 1.1 SWE-2 ឈានដល់ 73.0% ទីពីរបន្ទាប់ពី Astra 74.1% ក្នុងចំណោមម៉ូដែលនៃបញ្ជីការយល់ដឹង។

ការបង្ហាញខ្លាំងបំផុតកើតឡើងនៅលើ Terminal-Bench 2.1 ដែល SWE-2 ទទួលបានពិន្ទុ 92.8% ដែលជាតួលេខខ្ពស់បំផុតនៅក្នុងតារាងប្រៀបធៀបរបស់ Cognition និងនាំមុខ Fable 5.1 នៅ 91.4% និង GPT-6 Astra នៅ 89.9% ។ រូបភាពផ្លាស់ប្តូរនៅលើ Terminal-Bench 4 ដែលពិបាកជាងនេះ ដែល SWE-2 គ្រប់គ្រង 27.3% ទល់នឹង 57.9% សម្រាប់ GPT-6 Astra និង 55.8% សម្រាប់ Fable 5.1 ដែលជាការរំលឹកថាការរចនាប្រសិទ្ធភាពដំបូងរបស់ម៉ូដែលទុកកន្លែងសំខាន់នៅចុងបញ្ចប់នៃការលំបាក។

Cognition បូកសរុបទីតាំងដោយមិនច្បាស់លាស់៖ នៅលើ FrontierCode 1.1 Main និង DeepSWE 1.1 SWE-2 យកឈ្នះម៉ូដែលមុនរបស់ខ្លួន SWE-1.7 និង Grok 4.6 ទាំងពិន្ទុ និងតម្លៃ ផ្គូផ្គង GPT-5.6 Sol និង Fable 5/5.1 ក្នុងប្រភាគនៃតម្លៃរបស់ពួកគេ ហើយមកក្នុងការចំណាយមួយចំនួននៅ GPT ។

ក្រោយការបណ្តុះបណ្តាលពី Kimi K3 នៅពហុកោណមាត្រដ្ឋាន

SWE-2 មិនត្រូវបានបង្កើតឡើងពីដំបូងឡើយ។ ការយល់ដឹងក្រោយការបណ្តុះបណ្តាលគំរូពី Kimi K3 ដែលជាគំរូមូលដ្ឋានប៉ារ៉ាម៉ែត្រ 2.8 ពាន់ពាន់លានពី Moonshot AI ដែលបានទទួលការពង្រឹងយ៉ាងទូលំទូលាយរួចហើយសម្រាប់ការរៀនសរសេរកូដភ្នាក់ងារ។ នៅលើមូលដ្ឋាននោះ Cognition និយាយថាដំណើរការ RL របស់ខ្លួនបានបន្ថែមពី 5 ទៅ 6 ពិន្ទុលើចំណុចគោលជាច្រើន ហើយបានផ្លាស់ប្តូរព្រំដែននៃការអនុវត្តថ្លៃដើមទាំងមូលរបស់ K3 ។

ក្រុមហ៊ុននិយាយថា SWE-2 គឺជាលើកទីមួយហើយដែលខ្លួនបានធ្វើមាត្រដ្ឋានការពង្រឹងការរៀនសូត្រដល់របបពហុកោណប៉ារ៉ាម៉ែត ដោយសាងសង់លើហេដ្ឋារចនាសម្ព័ន្ធបណ្តុះបណ្តាល និងរូបមន្តដែលត្រូវបានបង្កើតឡើងសម្រាប់ SWE-1.7 ។ ការបន្ថែមសំខាន់គឺក្បួនដោះស្រាយ RL ដែលបណ្តុះបណ្តាលកម្រិតនៃហេតុផល-កិច្ចខិតខំប្រឹងប្រែងទាំងអស់នៅក្នុងការរត់តែមួយ ជាជាងព្យាបាលការខិតខំប្រឹងប្រែងទាប មធ្យម និងខ្ពស់ជាគោលដៅបណ្តុះបណ្តាលដាច់ដោយឡែក។

ការផាកពិន័យតម្លៃកំណត់ព្រំដែនទាំងមូល

គំនិតកណ្តាលនៅក្នុងការបណ្តុះបណ្តាលរបស់ SWE-2 គឺជាការពិន័យថ្លៃដើមលីនេអ៊ែរដែលបានអនុវត្តក្នុងមួយកម្រិតនៃកិច្ចខិតខំប្រឹងប្រែងក្នុងការរត់ RL តែមួយ ដោយការដាក់ពិន័យនីមួយៗត្រូវបានកែសម្រួលទៅតាមជម្រាលក្នុងតំបន់នៃព្រំដែន Pareto របស់គំរូមូលដ្ឋាន។ Cognition និយាយថា វិធីសាស្រ្តនេះកើតចេញពីគោលការណ៍ដំបូង ជំរុញការអនុវត្តថ្លៃដើមទាំងមូលរបស់ម៉ូដែល ខណៈពេលដែលរក្សារូបរាងរបស់វា និងឆ្លុះបញ្ចាំងពីការចំណាយរបស់អ្នកប្រើប្រាស់ពិតប្រាកដដោយផ្ទាល់តាមដែលអាចធ្វើទៅបានក្នុងការបណ្តុះបណ្តាល។

ក្រុមហ៊ុនក៏បានរៀបរាប់លម្អិតអំពីកម្រិតមូលដ្ឋាននៃរង្វាន់ដែលវាប្រើតាំងពី SWE-1.6 ដែលវាផ្តល់កិត្តិយសដល់ការបណ្តុះបណ្តាលដែលមានស្ថេរភាពយ៉ាងខ្លាំង រួមជាមួយនឹងការធ្វើឱ្យប្រសើរឡើងដល់ការបម្រើ RL ដែលរួមបញ្ចូលគំរូសេចក្តីព្រាងតាមអ៊ីនធឺណិតដើម្បីបង្កើនប្រសិទ្ធភាពនៃការឌិកូដ។ ជាមួយនឹងខឺណែល NVFP4 និង FP8 និងការបណ្តុះបណ្តាលការយល់ដឹងអំពីបរិមាណ ការយល់ដឹងនិយាយថាវាកាត់បន្ថយការប្រើប្រាស់អង្គចងចាំទាំងមូល បើទោះបីជាគំរូមូលដ្ឋានមានប៉ារ៉ាម៉ែត្រជិតបីដងនៃអ្នកកាន់តំណែងមុនរបស់វាក៏ដោយ។

បំពង់បញ្ជូនទិន្នន័យបណ្តុះបណ្តាលបានពង្រីកផងដែរ៖ ការយល់ដឹងបានបង្កើនចំនួនបីដងនៃបរិស្ថាន RL បន្ថែមការត្រួតលើគ្នាតាមការណែនាំ និងបានសាងសង់ flywheel ដែលដំណើរការដោយចំណុចត្រួតពិនិត្យ SWE-2 ពីមុន ដែលធ្វើអោយឧបករណ៍ផ្ទៀងផ្ទាត់ដែលប្រើដើម្បីដាក់ពិន្ទុគំរូ។

ប្រសិទ្ធភាពដូចបញ្ញា

Cognition frames ការកើនឡើងរបស់ SWE-2 ដែលទាក់ទងយ៉ាងជិតស្និទ្ធទៅនឹងប្រសិទ្ធភាព។ ក្រុមហ៊ុននិយាយថា ការវិនិច្ឆ័យផ្នែកវិស្វកម្មរឹងមាំជាងនេះ ក្រុមហ៊ុនបាននិយាយថា អនុញ្ញាតឱ្យភ្នាក់ងារសរសេរដំណោះស្រាយពេញលេញបន្ថែមទៀតជាមួយនឹងផ្លូវវាងតិចជាងមុន និងការអានដែលលែងត្រូវការតទៅទៀត។ នៅលើ FrontierCode 1.1 Main ការកំណត់រចនាសម្ព័ន្ធការខិតខំប្រឹងប្រែងមធ្យមនៃ SWE-2 ទទួលបានពិន្ទុខ្ពស់ជាង SWE-1.7 ខណៈពេលដែលទទួលយកវេនតិចជាង 58% និងចំណាយតិចជាង 81% ។

ស៊ុមនោះមានសារៈសំខាន់សម្រាប់អាជីវកម្មរបស់ការយល់ដឹង។ Devin ត្រូវ​បាន​លក់​ជា​វិស្វករ​កម្មវិធី​ស្វយ័ត ហើយ​តម្លៃ​សន្និដ្ឋាន​គឺ​ជា​ការ​បញ្ចូល​ផ្ទាល់​ទៅ​នឹង​តម្លៃ​និង​រឹម។ គំរូដែលរក្សាបាននូវគុណភាពជាប់ព្រំដែន ខណៈពេលដែលការកាត់វេន និងសញ្ញាសម្ងាត់នីមួយៗផ្លាស់ប្តូរសេដ្ឋកិច្ចនៃរាល់សម័យ Devin ដែលក្រុមហ៊ុនបម្រើ។

ភាពអាចរកបាន

SWE-2 អាចរកបានចាប់ពីថ្ងៃនេះនៅក្នុង Devin Desktop និង Devin CLI ជាមួយនឹងការដាក់ឱ្យដំណើរការនៅលើ Devin Web និង Fusion កំពុងដំណើរការ នេះបើយោងតាមក្រុមហ៊ុន។ Cognition និយាយថា អ្នកប្រើប្រាស់គួរតែឃើញគំរូនេះបង្ហាញលើផ្ទៃនានាក្នុងរយៈពេលប៉ុន្មានថ្ងៃខាងមុខនេះ។

តើវាមានន័យយ៉ាងណាសម្រាប់ទីផ្សារគំរូសរសេរកូដ

ការចេញផ្សាយនេះរឹតបន្តឹងកញ្ចប់ដែលមានមនុស្សច្រើនរួចទៅហើយនៅពីក្រោយ GPT-6 Astra ។ ឥឡូវនេះក្រុមហ៊ុន Cognition ជាម្ចាស់គំរូដែលធ្វើពាណិជ្ជកម្មដោយមានការផ្តល់ជូនពី Anthropic, OpenAI និង xAI ក្នុងតម្លៃទាបគួរឱ្យកត់សម្គាល់ ហើយវាគ្រប់គ្រងជង់ពេញលេញពីម៉ូដែលទៅផលិតផលភ្នាក់ងារ។ គូប្រជែងនឹងប្រឈមមុខនឹងសម្ពាធក្នុងការឆ្លើយតបលើតម្លៃដូចទៅនឹងសមត្ថភាព ជាពិសេសសម្រាប់កិច្ចការពិបាកកម្រិតមធ្យម ដែលទម្រង់ចំណាយរបស់ SWE-2 គឺខ្លាំងបំផុត។

សម្រាប់អ្នកទិញឧបករណ៍សរសេរកូដ AI ការអនុវត្តជាក់ស្តែងគឺថាជំនួយការសរសេរកូដកម្រិតព្រំដែនលែងត្រូវការការកំណត់តម្លៃកម្រិតព្រំដែនទៀតហើយ។ សម្រាប់ផ្នែកផ្សេងទៀតនៃឧស្សាហកម្មនេះ SWE-2 គឺជាភស្តុតាងដែលថាប្រសិទ្ធភាពក្រោយការបណ្តុះបណ្តាល និងហេដ្ឋារចនាសម្ព័ន្ធ មិនមែនគ្រាន់តែជាខ្នាតគំរូមូលដ្ឋាននោះទេ បានក្លាយជាចំណុចប្រកួតប្រជែងដ៏ខ្លាំងមួយ។

---

ស្នាក់នៅមុន AI

ទទួលបានព័ត៌មាន AI ការវិភាគ និងរបកគំហើញចុងក្រោយបំផុត — ទាំងអស់នៅកន្លែងតែមួយ។

អានព័ត៌មាន AI បន្ថែម →