Timu ya Ornith imetoa Ornith-1.5, familia ya modeli za lugha waziwazi iliyojengwa karibu na wazo lisilo la kawaida: kielelezo huzalisha kazi zake za mafunzo, hutengeneza kiunzi chake, na hujifunza kutokana na majaribio yake ya utatuzi katika kitanzi kinachoendelea. Kulingana na tathmini za timu yenyewe, kinara Ornith-1.5-397B alipata alama 86.1 kwenye Kituo cha Benchi 2.1 (Terminus-2), akiiweka sawa na Claude Opus 4.8 ya Anthropic katika 85.0 na mbele ya kila muundo wa chanzo huria wa ukubwa unaolingana.

Toleo hilo, lililochapishwa wiki hii kwenye blogi ya Ornith na kwenye Hugging Face chini ya leseni ya MIT, ni salvo ya hivi punde katika mbio za chanzo-wazi za AI ambazo zimetoa matokeo mara kwa mara ambayo yalidhaniwa kuwa hayawezekani bila bajeti ya maabara ya mipaka. Kwa wasanidi programu na makampuni ya biashara yanayofuatilia habari za hivi punde za muundo wa AI, umuhimu ni mara mbili: usawa wa kuigwa na muundo unaoongoza wa kufungwa, na kichocheo cha mafunzo kinachoelekeza ni wapi uundaji wa muundo huria unaelekea.

Saizi Tatu, Mapishi Moja

Meli za Ornith-1.5 katika usanidi tatu: kinara cha mchanganyiko wa kigezo cha 397B, 35B MoE ambayo huwasha vigezo vya 3B pekee kwa kila tokeni, na muundo mnene wa 9B wenye kibadala cha "Mkono" uliopimwa iliyoundwa kufanya kazi moja kwa moja kwenye vifaa vya iPhone na Android. Zote tatu zinapatikana kwenye Hugging Face pamoja na miundo ya GGUF, MLX, na NVFP4, na kadi za kielelezo zinaonyesha kuwa familia imejengwa kwenye usanifu wa Qwen3.5 MoE.

Ukoo ni muhimu hapa. Ornith-1.0, iliyotolewa mapema mwaka huu, ilieneza mbinu ya "kujiweka mwenyewe" kwa usimbaji wakala na ikawa maarufu - muundo wake wa 9B GGUF umesajili zaidi ya vipakuliwa milioni tano kwenye Hugging Face. Ornith-1.5 inapanua mfumo huo kutoka kwa uboreshaji wa kiunzi na usambazaji hadi bomba kamili la uboreshaji.

Kitanzi cha Kujiboresha, Kimeelezwa

Katika bomba la kawaida la baada ya mafunzo, mafunzo ya kuimarisha huendeshwa dhidi ya seti isiyobadilika ya kazi zilizoratibiwa na binadamu. Ornith-1.5 badala yake ina muundo wenyewe unaopendekeza kazi mpya, tengeneza kiunzi maalum cha kazi - maagizo, zana, na mkakati wa mtengano unaotumiwa kushambulia tatizo - na kisha kutoa matoleo ya suluhisho ambayo yamewekwa alama na kiunzi ambacho kimeunda hivi punde. Zawadi huenezwa tena kupitia hatua zote tatu kwa kutumia GRPO, kwa hivyo mfumo hujifunza wakati huo huo kuandika kazi bora zaidi, kiunzi bora na suluhu bora.

Zawadi ya kizazi cha kazi ndio moyo wa muundo. Kila kazi iliyopendekezwa ina alama tatu za kuzidisha ishara: uhalali (je, kiunzi hutekeleza na kutathmini ipasavyo?), ugumu wa mipaka (je, kiwango cha mafanikio cha kielelezo kinakaribia lengo la takriban asilimia 20, kuweka majukumu kuwa magumu lakini yanayoweza kujifunza?), na mambo mapya (je, ni tofauti vya kutosha na kila kitu kwenye bafa ya kazi zilizotolewa hapo awali?). Kwa sababu ugumu hupimwa kulingana na kiwango cha mafanikio cha modeli ya sasa, mtaala huongezeka kiotomatiki kadiri muundo unavyoboreka.

Timu pia inaripoti hatua za wazi za kupinga udukuzi wakati wa tathmini: historia ya git huondolewa kwenye picha za hazina ili miundo isiweze kurejesha suluhu za awali, na ufikiaji wa mtandao umezimwa ili kuzuia miundo kupata majibu ya nje. Matokeo yote ni wastani wa mikimbio tano huru.

##Nambari

Kwenye usimbaji wa mawakala, nguzo kuu ya matokeo yaliyoripotiwa yenyewe juu ya uga wa chanzo huria. Kwenye Terminal-Bench 2.1 inapitia kiunganishi cha Terminus-2, Ornith-1.5-397B's 86.1 kingo za Claude Opus 4.8 (85.0), DeepSeek-V4-Flash-0731 (82.7), na GLM-5.2 (81). Katika ulinganifu sawa na uunganisho wa Kanuni ya Claude, machapisho ya Ornith-1.5 85.2 dhidi ya Opus 4.8's 78.9. Kwenye SWE-benchi Imethibitishwa, wawili hao wamefungana kwa 86.0 na 85.8, huku Kimi K3 akiwa mbele kidogo kwa 86.2.

Mapengo hupanuka kwenye vyumba vigumu zaidi vya wakala. Kwenye DeepSWE, Ornith-1.5-397B alipata alama 56.0 — mbele ya GLM-5.2 46.2, ingawa nyuma ya Opus 4.8 (59.0) na Kimi K3 (67.5). Mruko wa kuvutia zaidi ni wa kizazi: Ornith-1.0 alifunga 8.0 pekee kwenye DeepSWE, kumaanisha kwamba marudio mapya yanaleta uboreshaji mara saba kwenye familia sawa.

Mifano ndogo husimulia hadithi zao wenyewe. Ornith-1.5-35B-A3B, inawasha vigezo 3B pekee kwa kila tokeni, inapata alama 68.5 kwenye Kituo cha Benchi 2.1 (Msimbo wa Claude) dhidi ya 43.4 kwa Gemma 4-31B ya Google na 51.7 ya Meta's Muse Glimmer-30B kwenye SWEBEI 30B, na chapisho la 0. Muundo wa 9B hufikia 47.0 kwenye Terminal-Bench 2.1, 70.6 kwenye SWE-bench Imethibitishwa, na 86.4 kwenye GPQA Diamond - nambari zinazoweka muundo wa kiwango cha simu ndani ya umbali wa kuvutia wa wapinzani wa kiwango cha mezani.

Tahadhari na Muktadha

Hizi ni vigezo vinavyoendeshwa na wasanidi programu, si matokeo yaliyokaguliwa kwa kujitegemea, na miundo ya ulinganisho ilitathminiwa na timu ya Ornith chini ya mipangilio yake ya kuunganisha. Maabara pinzani pia huimba kwa biashara tofauti tofauti; Uongozi wa Kimi K3 kwenye DeepSWE unapendekeza mipaka ya kazi ya programu ya mawakala bado inapingwa. Lakini uwazi wa jedwali kamili la toleo - wastani wa uendeshaji tano, usanidi uliochapishwa wa kuunganisha, ulinzi uliofichuliwa - hufanya uenezi wa kujitegemea kuwa wa moja kwa moja usio wa kawaida.

Mwitikio wa jamii umekuwa mkubwa. Tangazo la kutolewa lilivutia zaidi ya pointi mia moja kwenye Habari za Hacker ndani ya saa chache, huku majadiliano yakilenga kidogo juu ya madai ya msingi kuliko mbinu ya uboreshaji binafsi, ambayo watoa maoni kadhaa waliielezea kuwa mojawapo ya utekelezaji wa kuaminika zaidi wa uundaji kazi wa mtindo wa kujirudia.

Kwa mfumo wa ikolojia wa chanzo huria, Ornith-1.5 hutua wakati mifano wazi kutoka kwa maabara za Uchina na timu huru za Magharibi zimekuwa zikifunga pengo kwa mipaka iliyofungwa ya usimbaji na majukumu ya mawakala. Familia iliyo na leseni ya MIT inayolingana na modeli inayoongoza iliyofungwa kwenye Terminal-Bench - na kusafirisha lahaja ya 9B iliyo tayari kwa simu - hupunguza pengo hilo zaidi, na kuifanya kwa njia ya mafunzo ambayo mtu yeyote anaweza kukagua, kuzaliana, na kupanua.

---

Kaa Mbele ya AI

Pata habari za hivi punde za AI, uchanganuzi na mafanikio - yote katika sehemu moja.

Soma habari zaidi za AI →