Muundo Mdogo-Lakini-Mpana-wa-Wataalamu
Kulingana na uchanganuzi wa kina katika MarkTechPost, Instella-MoE-16B-A3B ni muundo wa MoE wa dekoda pekee na jumla ya vigezo bilioni 16 ambavyo huwasha bilioni 2.8 pekee kwa tokeni. Kila moja ya safu zake 27 hutumia wataalam 2 walioshirikiwa pamoja na wataalam 6 waliochaguliwa kutoka kundi la 64, na saizi iliyofichwa ya 2048, vichwa 16 vya umakini, na msamiati wa ishara 128,896. Lengo la Utabiri wa Ishara nyingi** hutumika wakati wa mafunzo ya awali na ya katikati ya mafunzo.
Usanifu huo mdogo - ambapo kipande kidogo cha mtandao "huamka" kwa kila ishara - ni mantiki sawa ya ufanisi nyuma ya mifano ya wazi ya bei nafuu ambayo imeunda upya soko katika mwaka uliopita. AMD ilifunza modeli kwenye tokeni trilioni 7.1 zilizotolewa kutoka shirika la wazi ikiwa ni pamoja na Nemotron-CC-v2, MegaMath, FineMath, RefineCode, na TxT360, kisha ikaendesha hatua ya katikati ya mafunzo kwenye Dolma3 Dolmino 100B katika anuwai tatu za data ambazo ziliunganishwa kwa wastani wa uzito. Hatua ya muktadha mrefu hunyoosha dirisha kutoka 4K hadi tokeni 64K kwa kutumia Uzi.
Ubunifu wa Kiwango cha Mifumo Miwili
Toleo hubeba chaguo mbili za kimuundo ambazo AMD inaangazia kama ushindi wa maana wa uhandisi. La kwanza ni Gated Multi-head Latent Attention (Gated MLA), ambayo huongeza lango jepesi la kutoa mafunzo kwa Uangalifu wa Vichwa Vingi. Makadirio maalum ya mstari hupata lango lenye kiyoyozi linalotumika kwa kuzidisha kabla ya makadirio ya matokeo.
Ya pili, FarSkip-Collective, ni mpango wa muunganisho ambao hupitisha uanzishaji uliopitwa na wakati na sehemu katika MoE na tabaka za umakini, zinazopishana mawasiliano ya kitaalam-sambamba na hesabu. AMD inaripoti 12.7% ya kasi ya mafunzo ya awali na hadi 39.2% punguzo la muda hadi tokeni ya kwanza inapotumika kwa usambamba wa kitaalamu. Kwa kampuni inayoweka maunzi yake kwenye utendakazi wa bei, hizo ndizo nambari ambazo mnunuzi anataka kuona.
Vigezo Vikali vya Muundo Uliofunguliwa Kabisa
Kwenye sehemu ya msingi ya ukaguzi, wastani wa Instella-MoE 76.7 katika tathmini, ambazo AMD inaziita tokeo thabiti zaidi kati ya miundo iliyofunguliwa kikamilifu. Hiyo inaiweka mbele ya Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1), na OLMoE-1B-7B (61.9), ingawa bado inafuata Qwen3.5-4B-Base (79.5). Inaongoza kwenye WinoGrande ikiwa na alama 86.5 na machapisho 65.7 kwenye HumanEval+. Kwa kazi za muktadha mrefu, wastani wa 41.5 kwenye HELMET na 79.4 kwenye RULE.
Baada ya mafunzo kunoa mfano zaidi. Alama za wastani hupanda kutoka 71.58 baada ya urekebishaji mzuri uliosimamiwa hadi 72.67 baada ya DPO na 73.22 katika usanidi wa "Fikiria", ukipita Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47), na Qwen3.5-73B (69.73B). Kwa kufuata maagizo, IFEval hupanda kutoka 77.08 hadi 83.70.
Kichocheo cha baada ya mafunzo yenyewe kinajulikana. Baada ya SFT kwenye mchanganyiko wa Dolci-Think-SFT-7B na Nemotron, AMD huendesha DPO ikiwa na masasisho ya upendeleo wa vipanga njia na upotevu wa kusawazisha upakiaji umezimwa ili kuepuka uharibifu. Masomo ya uimarishaji kisha huendelea ndani ya mfumo wa Maili wa AMD: hatua 1,400 za RLVR inayofuata maagizo, ikifuatiwa na Unenoaji wa Sera ya Walimu Wengi ambao unarudisha faida bila kuacha utendakazi wa hesabu au msimbo.
Kukamata Leseni
Kuna tahadhari ambayo ni muhimu kwa watumiaji wa kibiashara. Kielelezo cha uzani husafirishwa chini ya Leseni ya UtafitiRAIL, ambayo inadhibiti matumizi kwa madhumuni ya kitaaluma na utafiti pekee, kwa hivyo Instella-MoE si kielelezo cha kujumuika kwa utumaji wa uzalishaji. Nambari ya kanuni ya mafunzo, hata hivyo, ina MIT iliyopewa leseni, na hiyo bila shaka ndiyo rasilimali inayoweza kutumika tena - inapeana maabara zingine mwongozo kamili wa mafunzo kwenye silicon ya AMD.
AMD imechapisha uzani kamili kutoka kwa kila hatua ya mafunzo, mchanganyiko wa data, usanidi wa mafunzo, na msimbo wa uelekezaji kwenye mkusanyiko wa Hugging Face, hazina ya GitHub, na blogu yake ya ROCm. Kiwango hicho cha uwazi - mafunzo-hatua-kwa-hatua-ya-mafunzo, si tu kituo cha mwisho cha ukaguzi - ndicho kinachotofautisha kutolewa "kufunguliwa kikamilifu" kutoka kwa kawaida ya uzito wazi.
Kwanini Hili Ni Muhimu Zaidi ya Vigezo
Subtext ya kutolewa ni ushindani wa vifaa. Mfumo wa ikolojia wa CUDA wa Nvidia na GPU za kiwango cha H100 zimekuwa msingi msingi wa mafunzo ya mfano wa mipaka, na wapinzani wametumia miaka mingi kuthibitisha kwamba vichapuzi vyao vinaweza kushughulikia rundo kamili la mafunzo. Instella-MoE ni kisanii cha kuaminika ambacho laini ya Intelict ya AMD - tayari imetumwa kwa kiwango kikubwa na viboreshaji na maabara za kitaifa - inaweza kufanya zaidi ya mzigo wa makisio. Ikiwa AMD inaweza kuendelea kutoa mifano ya wazi ya ushindani iliyofunzwa kwenye maunzi yake yenyewe, itaimarisha kesi kwa wanunuzi wanaotaka kuvunja mtego wa Nvidia kwenye soko la kompyuta la AI.
Kwa watafiti, rufaa ni uwazi. Matoleo ya wazi kabisa ambayo yanaandika mchanganyiko wa data, mchanganyiko wa mafunzo ya kati, mkakati wa kunereka na mtaala wa RL yanasalia kuwa nadra, na yanaruhusu jumuiya ikague na kutoa madai tena badala ya kuchukua neno la maabara kwa hilo. Instella-MoE inajiunga na orodha ndogo lakini inayokua - ikijumuisha mifano mnene ya AMD ya awali ya Instella - kusukuma kiwango hicho mbele.
Kaa Mbele ya AI
Je! Unataka aina hii ya chanjo ya kina ya kiufundi inapotokea? Alamisha kitovu chetu kwa maendeleo ya hivi punde ya AI na usikose toleo.
Soma habari zaidi za AI →

