Konsorsium institusi riset Jerman lan perusahaan AI wis ngeculake Soofi S 30B-A3B, model basa terbuka sing dikandhakake proyek kasebut entuk skor paling dhuwur ing pathokan Inggris lan Jerman ing antarane model sing mbukak. Dikoordinir dening KI Bundesverband, asosiasi AI nasional Jerman, rilis kasebut minangka salah sawijining model basa gedhe pisanan sing dilatih kabeh ing Cloud AI Industri Deutsche Telekom ing Munich lan dipanggonke minangka alternatif Eropa sing berdaulat kanggo rilis bobot terbuka Amerika Serikat lan Cina sing dominan. Kanggo pangembang sing nelusuri perkembangan AI paling anyar, peluncuran kasebut luwih murah tinimbang skala mentah tinimbang efisiensi lan fokus basa sing ora biasa ing arsitektur.
Desain hibrida kanthi mung 3,2 milyar paramèter aktif
Soofi S minangka model campuran para ahli (MoE) kanthi total 31,6 milyar paramèter, nanging mung ngaktifake 3,2 milyar saben token sing digawe. Sing ndadekake biaya komputasi luwih cedhak karo model 3 milyar parameter tinimbang model kandhel 30 milyar parameter konvensional, pilihan desain sing ngarahake supaya inferensi cukup murah kanggo mlaku ing infrastruktur Eropa tanpa gumantung marang panyedhiya awan ing luar negeri.
Arsitektur kasebut dipinjam saka Nemotron 3 Nano Nvidia, nggabungake lapisan Mamba-2 kanthi lapisan perhatian standar ing tata letak hibrida. Miturut laporan pretraining project, mung 6 saka model 52 lapisan njaga key-nilai (KV) cache - struktur memori sing nyimpen token sadurungé kanggo etungan manungsa waé. Ing trafo konvensional, cache kasebut tuwuh kanthi linear kanthi dawa konteks lan dadi kemacetan utama sajrone inferensi konteks sing dawa.
Payoff praktis katon ing throughput. Kanthi dawa konteks 40.000 token kanthi panjalukan paralel 32, Soofi S ngasilake kira-kira wolung kaping luwih token per detik saben GPU tinimbang model sing padhet ing kisaran parameter 14 nganti 24 milyar. Nalika kacepetan generasi kanggo model konvensional mudhun banget nalika konteks tuwuh, Soofi S tetep meh rata saka 4.000 token nganti 256.000 token. Siji-sijine model sing bisa dibandhingake ing pangukuran konsorsium yaiku Qwen3.5 35B-A3B Alibaba, sing uga nggunakake arsitektur hibrida.
Dilatih kanggo basa Jerman, tanpa ngorbanake basa Inggris
Fokus sing disengaja ing Jerman minangka pusat proyek kasebut. Ing tahap latihan pisanan, Jerman nggawe 7,2 persen saka campuran data; ing tahap kapindho, pangsa kasebut mundhak dadi 15,3 persen. Miturut perbandingan, ing resep referensi Nvidia Nemotron kabeh basa non-Inggris digabungake mung watara 5 persen saka campuran latihan.
Sumber data kalebu teks web Jerman saka HPLT corpus, korpus German Commons sing dilisensi sacara terbuka, bagean Jerman saka FinePDFs lan FineWiki, lan arsip Genios sing dilisensi komersial saka 193 yuta artikel koran sing dijupuk saka 916 publikasi Jerman. Teks Jerman sing diterjemahake kanthi mesin lan digawe sacara sintetik ngrampungake campuran kasebut.
Model kasebut ngolah kira-kira 27 triliun token ing telung fase latihan: kira-kira 20 triliun token web, kode, math, lan teks khusus domain ing fase pisanan; watara 6 triliun token kualitas sing luwih dhuwur ing kaloro; lan fase katelu sing luwih cendhek ngluwihi jendhela konteks nggunakake dokumen nganti siji yuta token.
Asil pathokan: luwih maju ing Jerman lan Inggris, luwih lemah ing matematika
Ing evaluasi marang 16 model mbukak liyane, Soofi S mimpin kabeh model mbukak kanthi skor agregat kanggo Jerman lan Inggris, miturut konsorsium. Iki kalebu OLMo 3 32B saka Allen Institute for AI lan Apertus 70B saka ETH Zurich lan EPFL. Nglawan saben garis dasar kedaulatan Eropa, model kasebut metu ing kabeh pathokan Jerman ing suite kasebut, kadhangkala kanthi margin kaping pindho.
Ing tugas kode, Soofi S ngetung 73,8 persen ing HumanEval, 70,2 ing MBPP, lan 84,2 ing varian MBPP Jerman - asil paling apik ing antarane kanca-kanca open-source. Ing INCLUDE-DE, tes kanggo kawruh regional khusus Jerman, Soofi S nggayuh posisi pertama kanthi 61,2 poin kanthi Qwen3.5 35B-A3B sing luwih gedhe. Dibandhingake karo garis dasar Nemotron, resep data bobot Jerman nambah kemampuan basa kanthi 15,1 poin lan pathokan ilmu GPQA-Diamond kanthi 9,6 poin, tanpa ngrusak kinerja Inggris.
Ana kekirangan sing jelas. Ing matematika kompetisi Jerman (Minerva MATH-DE), Soofi S entuk 56 poin, adoh saka Qwen3.5 35B-A3B ing 76.5 lan Gemma 3 27B ing 65.6. Iki uga nglacak pengambilan faktual sing mbukak ing NaturalQuestions, sing tim kasebut mung duwe udakara 3 milyar paramèter aktif lan mulane kurang disimpen kawruh donya tinimbang model 27B sing padhet. Tes konteks dawa RULER mbukak celah liyane: nalika model kudu ngekstrak tembung sing kerep kedadeyan saka teks sing dawa, tingkat hit bakal mudhun nganti 3 persen ngluwihi 32.000 token, dene model Nemotron sing bisa dibandhingake isih bisa 60 nganti 64 persen.
Dilatih ing 512 Nvidia B200 GPU ing Munich
Latihan kasebut ditindakake ing antarane Maret lan Mei 2026 nganti 512 GPU Nvidia B200 ing Cloud AI Industri Deutsche Telekom ing Munich, kanthi total 253,000 GPU-jam. fasilitas mbukak tanggung ing energi dianyari, digawe adhem karo banyu saka kanal Eisbach, lan feed panas sampah menyang lingkungan Tucherpark lingkungan, miturut laporan. Soofi S minangka salah sawijining latihan utama pisanan sing ditindakake ing infrastruktur iki.
Konsorsium ing mburi model kasebut didanai dening Kementerian Federal Jerman kanggo Urusan Ekonomi lan Energi minangka bagean saka program IPCEI-CIS Eropa. Peserta kalebu Institut Fraunhofer IAIS lan IIS, Pusat Riset Jerman kanggo Kecerdasan Buatan (DFKI), TU Darmstadt, Universitas Würzburg, Pusat Riset L3S, Universitas Ilmu Terapan Berlin, lan perusahaan AI Ellamind lan Merantix Momentum.
Debat babagan 'overtraining'
Ora suwe sawise diluncurake, para kritikus mbantah manawa Soofi S dilatih banget karo standar hukum skala Chinchilla klasik sing diterbitake dening Google DeepMind ing taun 2022, sing nyaranake titik manis 20 token saben parameter. Kanthi 27 triliun token lan kira-kira 30 milyar paramèter, Soofi S ndharat ing sawetara atus token saben parameter; counting mung 3,2 milyar paramèter aktif nyurung rasio menyang ewu.
Michael Fromm, minangka bagean saka pimpinan teknis proyek kasebut, nolak kritik kasebut, kanthi alesan manawa aturan kasebut ora ana ing arsitektur MoE. "Ana riset anyar sing nuduhake manawa undang-undang skala lawas saka model sing padhet ora ditrapake maneh kanggo arsitektur MoE," ujare Fromm, nyatakake yen ahli individu entuk manfaat saka ndeleng dokumen sing padha bola-bali ing dataset sing gedhe lan berkualitas. Minangka titik perbandingan, dheweke nuding Nvidia, sing wis nglatih model dhewe nganti 25 triliun token.
Apa bakal dirilis, lan apa ora
Peneliti ngeculake bobot model bebarengan karo checkpoints penengah sing dipilih, kode latihan lan evaluasi lengkap, lan inventaris data rinci sing nyathet jumlah token mentah, nomer jaman, lan kontribusi efektif saben sumber. Miturut tim kasebut, iki tegese Soofi S ketemu Open Source AI Definition 1.0 saka Open Source Initiative.
Proposal sing luwih ketat kanggo definisi open-data Eropa, sing mbutuhake saben token latihan bisa disebarake kanthi bebas, ora ditemokake amarga 1,3 persen campuran kasebut asale saka korpus Genios sing dilisensi komersial. Laporan kasebut ujar babagan 99 persen data latihan isih bisa direkonstruksi kanthi mandiri. Lisensi sing tepat kanggo rilis model kasebut durung dirampungake nalika diterbitake.
Konsorsium saiki nggoleki mitra industri kanggo tahap sabanjure kanggo nguji Soofi S ing aplikasi sing nglibatake dokumen teknis, generasi kode, lan sistem adhedhasar agen. Kanggo luwih lengkap babagan rilis model bobot mbukak, infrastruktur AI sing berdaulat, lan ekosistem AI Eropa, terusake [jangkoan industri AI] (https://aibuzzwire.news) sing diterbitake ing kene.
Tetep maju ing AI open-source
Rilis bobot mbukak meh saben minggu teka saka laboratorium ing Amerika Serikat, China, lan saiki Eropa, lan jurang antarane model proprietary paling gedhe lan alternatif mbukak sing paling apik terus sempit. Tindakake kabar AI bubar lan analisis pathokan ing kene kanggo gambar lengkap.
Waca liyane jangkoan model AI →


