Kigezo kipya kiitwacho Real-SWE kinatia changamoto jinsi tasnia ya AI inavyopima uwezo wa kuweka usimbaji, na matokeo ya kwanza ni ya unyenyekevu kwa maabara za mipakani. Hadithi ya Anthropic's Fable 5.1, inayoendeshwa ndani ya Uunganisho wa Kanuni ya Claude, inaongoza bodi kwa kiwango cha azimio cha 38.8% kwa kazi zinazotokana na misingi ya biashara ya kibinafsi, ya ulimwengu halisi. Hakuna kielelezo kilichojaribiwa kinafuta asilimia 40.

Alama, iliyotolewa mwezi huu na Maabara Maalum, hutathmini miundo ya mipaka ya AI kwenye misingi ya uzalishaji wa kibinafsi ambayo timu ilitoa leseni kutoka kwa kampuni halisi. Waundaji wake wanasema kuwa kazi zinazozalishwa na wataalamu au za kutengeneza, hata hivyo zimeundwa vyema, si kazi ya neno moja ambayo wahandisi katika makampuni halisi hufanya. For more context on this story, see our ongoing AI news.

Kwa nini Misimbo ya Kibinafsi Inabadilisha Picha

Real-SWE hutofautiana na vigezo vilivyowekwa kama vile SWE-benchi kwenye shoka mbili, kulingana na waandishi wake: vizalia vya usimbaji vya msingi na umaalumu wa maagizo. Kila kazi inatoka kwa mfumo wa umiliki ambao kanuni na suluhu zake hazipatikani kwenye mtandao wa umma, ambayo ina maana kwamba mawakala hawawezi kuegemea majibu ya kukariri kutoka kwa hazina za umma.

Kazi pia hubeba matokeo ya biashara. Majukumu ya mfano wa kielelezo ni pamoja na kupata haki ya bili, kukokotoa kodi, na kuhama wateja - mabadiliko yanayoathiri jinsi biashara inavyoendeshwa, mara nyingi katika huduma nyingi. Kila kampuni ina kanuni zake na njia zake za kuandika msimbo, na mawakala lazima waelewe kanuni hizo na kufanya mabadiliko ambayo yanafanya kazi na yale ambayo tayari yapo.

"Je, wakala wa usimbaji anaweza kufanya kazi ya mhandisi wa programu katika ulimwengu wa kweli?" utangulizi wa benchmark unauliza. Ubao wa wanaoongoza unapendekeza jibu, kwa sasa, ni: karibu theluthi moja tu ya wakati bora zaidi.

Ubao Kamili wa Wanaoongoza

Maabara Mahususi yalitathmini michanganyiko minane ya modeli na viunganishi vya mipaka, kupima kiwango cha utatuzi kama kupita@1 wastani wa zaidi ya mikimbio nane huru kwa kila kazi, kwa asilimia 95 ya vipindi vya kujiamini:

1. Hadithi ya 5.1 (Msimbo wa Claude) — 38.8%
2. GPT-6 Astra (Codex CLI) — 33.8%
3. Gemini 3.8 Flash (Gemini CLI) — 31.2%
4. GLM 5.3 (Msimbo wa Claude) — 28.8%
5. (funga) Grok 4.6 (Grok Build) — 23.8%
5. (funga) Muse Spark 1.3 (Msimbo wa Muse) — 23.8%
7. Kimi K3 (Msimbo wa Kimi) — 18.8%
8. GPT-5.6 Sol (Codex CLI) — 16.2%

Matokeo yalijadiliwa kwa kina kwenye Habari za Hacker mwishoni mwa wiki, ambapo kiwango kilileta kura mia kadhaa na mjadala wa kusisimua kuhusu kama tathmini ya msingi wa kanuni za kibinafsi ndio kigezo sahihi cha maendeleo ya wakala.

Uenezi Finyu Lakini Wenye Maana Juu

Pengo kati ya mifumo minne ya juu ni muhimu kwa kile inachosema kuhusu mazingira ya sasa ya ushindani. Uongozi wa Fable 5.1 wa pointi tano juu ya OpenAI's GPT-6 Astra una maana kwenye kigezo ambapo kila kazi ni tatizo la uzalishaji. Gemini 3.8 Flash ikichukua nafasi ya tatu inashangaza, kwa kuwa kielelezo kimewekwa kama farasi wa haraka na wa gharama ya chini badala ya mfumo bora wa kutoa hoja. GLM 5.3 ya Z.ai, iliyotathminiwa kupitia Msimbo wa Claude, ikitua ndani ya pointi tano za kiongozi inasisitiza jinsi modeli za uzani wazi zimekuwa kwenye kazi ya uhandisi ya vitendo.

Kusema sawa ni kuenea chini. GPT-5.6 Sol, toleo la awali la OpenAI, hutatua chini ya nusu ya kazi nyingi kama Fable 5.1 - ukumbusho wa jinsi mipaka ilivyosogezwa, na jinsi kushuka kunaweza kuwa mfano mmoja wa kizazi nyuma.

Harnesses Muhimu Sana Kama Models

Mojawapo ya chaguo za kimbinu za kielelezo ni kuvutia umakini: badala ya kutathmini miundo kwa kutengwa, Real-SWE hutumia viunga vya asili - Claude Code, Codex CLI, Gemini CLI, Grok Build - kuakisi jinsi wahandisi wa biashara hufanya kazi kwa vitendo. Ubao wa wanaoongoza huorodhesha kwa uwazi michanganyiko ya modeli na kuunganisha, ikikubali kwamba kiunzi, ufikiaji wa zana na misururu ya marudio sasa haiwezi kutenganishwa na uwezo wa kielelezo katika utumiaji halisi.

Muundo huo ni muhimu kwa biashara zinazochagua mifumo. Muundo sawa unaweza kufanya kazi kwa njia tofauti sana kulingana na kifaa cha wakala kilichozungushiwa, na wanunuzi wanaokagua wasaidizi wa usimbaji kwenye nambari za alama za umma wanaweza kupata picha potofu ya jinsi mifumo hiyo itafanya kazi kwenye misingi yao ya kificho.

Nini Maana Kwa Tasnia

Vigezo vimeshutumiwa mara kwa mara kwa kueneza, huku miundo ya mipaka ikichapisha alama karibu kabisa kwenye majaribio ya umma ambayo huvuja kwenye data ya mafunzo. Muundo wa Real-SWE hujaribu kukabiliana na matatizo yote mawili kwa wakati mmoja: nambari ya kuthibitisha ni ya faragha na yenye leseni, majukumu ni bidhaa halisi za kazi za timu za wahandisi wanaofanya kazi, na maagizo yanaonyesha umahususi wa fujo wa tikiti halisi badala ya taarifa za tatizo zilizoboreshwa.

Uchukuzi wa kutisha ni kiwango kamili. Hata mfumo bora zaidi hutatua chini ya kazi nne kati ya kumi za biashara halisi kwenye jaribio la kwanza, wastani wa zaidi ya mara nane. Kwa maendeleo yote ya usimbaji mawakala, kielelezo kinapendekeza kwamba uhandisi wa programu huru kwenye mifumo ya uzalishaji halisi inasalia kuwa shughuli inayosimamiwa - ambayo wahandisi wa kibinadamu hukagua, kuelekeza kwingine na kutengeneza mara nyingi zaidi kuliko onyesho la wachuuzi zinavyodokeza.

Kwa makampuni ya biashara yanayochagua wasaidizi wa usimbaji, kielelezo hutoa orodha ya kutekelezeka ya vitendo: pendelea mifumo iliyotathminiwa kwenye msimbo wa faragha, kusisitiza juu ya vipindi vya kujiamini badala ya nambari za kichwa zinazoendeshwa mara moja, na ubora wa kuunganisha uzito kwa wingi kama uwezo wa kielelezo mbichi. Ubao wa kwanza wa wanaoongoza wa Real-SWE hautakuwa neno la mwisho - lakini ndilo jibu la moja kwa moja bado kwa swali ambalo kila kiongozi wa uhandisi anauliza kuhusu usimbaji wakala.

Kwa zaidi kuhusu mawakala wa usimbaji, matoleo ya miundo na utafiti unaoyaunda, fuata habari za hivi punde za AI kadri duru inayofuata ya matokeo ya kielelezo inavyotua.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →