Sebuah konsorsium lembaga penelitian Jerman dan perusahaan AI telah merilis Soofi S 30B-A3B, sebuah model bahasa terbuka yang menurut proyek tersebut mencapai skor tertinggi pada tolok ukur bahasa Inggris dan Jerman di antara model-model yang sepenuhnya terbuka. Dikoordinasikan oleh KI Bundesverband, asosiasi AI nasional Jerman, rilis ini merupakan salah satu model bahasa besar pertama yang dilatih sepenuhnya pada Industrial AI Cloud milik Deutsche Telekom di Munich dan diposisikan sebagai alternatif berdaulat di Eropa dibandingkan rilis open-weight yang dominan di Amerika Serikat dan Tiongkok. Bagi pengembang yang memantau perkembangan AI terkini, peluncuran ini tidak terlalu menonjol karena skala mentahnya, melainkan karena efisiensi yang tidak biasa dan fokus bahasa yang dimasukkan ke dalam arsitektur.

Desain hybrid dengan hanya 3,2 miliar parameter aktif

Soofi S adalah model campuran ahli (MoE) dengan total 31,6 miliar parameter, namun hanya mengaktifkan sekitar 3,2 miliar per token yang dihasilkan. Hal ini menjadikan biaya komputasinya mendekati model 3 miliar parameter dibandingkan model padat 30 miliar parameter konvensional, sebuah pilihan desain yang bertujuan menjaga inferensi tetap cukup murah untuk dijalankan pada infrastruktur Eropa tanpa bergantung pada penyedia cloud luar negeri.

Arsitekturnya dipinjam dari Nemotron 3 Nano Nvidia, menggabungkan lapisan Mamba-2 dengan lapisan perhatian standar dalam tata letak hybrid. Menurut laporan pra-pelatihan proyek, hanya 6 dari 52 lapisan model yang mempertahankan cache nilai kunci (KV) — struktur memori yang menyimpan token sebelumnya untuk komputasi perhatian. Dalam transformator konvensional, cache tersebut tumbuh secara linier seiring dengan panjang konteks dan menjadi hambatan utama selama inferensi konteks panjang.

Imbalan praktisnya muncul dalam throughput. Dengan panjang konteks 40.000 token dengan 32 permintaan paralel, Soofi S menghasilkan sekitar delapan kali lebih banyak token per detik per GPU dibandingkan model padat dalam rentang 14 hingga 24 miliar parameter. Meskipun kecepatan pembuatan model konvensional menurun tajam seiring dengan berkembangnya konteks, Soofi S tetap hampir datar dari 4,000 token hingga 256,000 token. Satu-satunya model yang sebanding dalam pengukuran konsorsium adalah Qwen3.5 35B-A3B milik Alibaba, yang juga menggunakan arsitektur hybrid.

Dilatih untuk bahasa Jerman, tanpa mengorbankan bahasa Inggris

Fokus yang disengaja pada bahasa Jerman adalah inti dari proyek ini. Pada fase pelatihan pertama, bahasa Jerman mencakup 7,2 persen dari gabungan data; pada tahap kedua, porsinya meningkat menjadi 15,3 persen. Sebagai perbandingan, dalam resep referensi Nemotron Nvidia, semua gabungan bahasa non-Inggris hanya menyumbang sekitar 5 persen dari campuran pelatihan.

Sumber data mencakup teks web Jerman dari korpus HPLT, korpus German Commons yang berlisensi terbuka, FinePDFs dan FineWiki bagian Jerman, dan arsip Genios berlisensi komersial yang berisi 193 juta artikel surat kabar yang diambil dari 916 terbitan Jerman. Teks Jerman yang diterjemahkan dengan mesin dan dibuat secara sintetis melengkapi perpaduan ini.

Model ini memproses sekitar 27 triliun token dalam tiga fase pelatihan: sekitar 20 triliun token web luas, kode, matematika, dan teks khusus domain pada fase pertama; sekitar 6 triliun token berkualitas lebih tinggi pada detik; dan fase ketiga yang lebih pendek memperluas jendela konteks menggunakan dokumen yang panjangnya mencapai satu juta token.

Hasil tolok ukur: unggul dalam bahasa Jerman dan Inggris, lebih lemah dalam matematika

Dalam evaluasi terhadap 16 model terbuka lainnya, Soofi S memimpin semua model terbuka penuh dalam skor agregat untuk bahasa Jerman dan Inggris, menurut konsorsium. Itu termasuk OLMo 3 32B dari Allen Institute for AI dan Apertus 70B dari ETH Zurich dan EPFL. Dibandingkan dengan semua standar negara di Eropa, model ini lebih unggul dibandingkan semua benchmark Jerman, terkadang dengan margin dua digit.

Pada tugas kode, Soofi S mendapat skor 73,8 persen pada HumanEval, 70,2 pada MBPP, dan 84,2 pada varian MBPP Jerman — hasil terbaik di antara rekan-rekan sumber terbuka. Pada INCLUDE-DE, sebuah tes untuk pengetahuan regional khusus Jerman, Soofi S menempati posisi pertama dengan 61,2 poin dengan Qwen3.5 35B-A3B yang lebih besar. Dibandingkan dengan dasar Nemotron, resep data berbobot Jerman meningkatkan kemahiran bahasa sebesar 15,1 poin dan tolok ukur sains GPQA-Diamond sebesar 9,6 poin, tanpa mengurangi kinerja bahasa Inggris.

Ada kelemahan yang jelas. Pada kompetisi matematika Jerman (Minerva MATH-DE), Soofi S mencetak 56 poin, jauh di belakang Qwen3.5 35B-A3B di 76.5 dan Gemma 3 27B di 65.6. Model ini juga mengikuti pengambilan faktual terbuka di NaturalQuestions, yang menurut tim hanya memiliki sekitar 3 miliar parameter aktif dan oleh karena itu lebih sedikit pengetahuan dunia yang tersimpan dibandingkan model 27B yang padat. Pengujian konteks panjang RULER memunculkan kesenjangan lain: ketika model harus mengekstrak kata-kata yang sering muncul dari teks yang panjang, tingkat keberhasilannya turun menjadi sekitar 3 persen melebihi 32.000 token, sedangkan model Nemotron yang sebanding masih mampu mencapai 60 hingga 64 persen.

Dilatih pada 512 GPU Nvidia B200 di Munich

Pelatihan berlangsung antara bulan Maret dan Mei 2026 pada hingga 512 GPU Nvidia B200 di Industrial AI Cloud Deutsche Telekom di Munich, dengan total sekitar 253.000 jam GPU. Fasilitas tersebut sepenuhnya menggunakan energi terbarukan, didinginkan dengan air dari kanal Eisbach, dan menyalurkan limbah panas ke lingkungan sekitar Tucherpark, menurut laporan tersebut. Soofi S adalah salah satu pelatihan besar pertama yang dilakukan pada infrastruktur ini.

Konsorsium di balik model ini didanai oleh Kementerian Federal Jerman untuk Urusan Ekonomi dan Energi sebagai bagian dari program IPCEI-CIS Eropa. Pesertanya antara lain Institut Fraunhofer IAIS dan IIS, Pusat Penelitian Kecerdasan Buatan Jerman (DFKI), TU Darmstadt, Universitas Würzburg, Pusat Penelitian L3S, Universitas Sains Terapan Berlin, dan perusahaan AI Ellamind dan Merantix Momentum.

Perdebatan tentang 'overtraining'

Segera setelah peluncuran, para kritikus berpendapat bahwa Soofi S terlalu dilatih secara berlebihan oleh standar undang-undang penskalaan Chinchilla klasik yang diterbitkan oleh Google DeepMind pada tahun 2022, yang menyarankan batasan kasar 20 token per parameter. Dengan 27 triliun token dan sekitar 30 miliar parameter, Soofi S mendapatkan beberapa ratus token per parameter; menghitung hanya 3,2 miliar parameter aktif yang mendorong rasio tersebut menjadi ribuan.

Michael Fromm, bagian dari pimpinan teknis proyek, menolak kritik tersebut, dengan alasan bahwa peraturan tersebut tidak berlaku pada arsitektur Kementerian Lingkungan Hidup. “Ada penelitian baru yang menunjukkan bahwa undang-undang penskalaan lama dari model padat tidak lagi berlaku untuk arsitektur Kementerian Lingkungan Hidup,” kata Fromm, seraya mencatat bahwa para ahli mendapat manfaat dari melihat dokumen yang sama berulang kali dalam kumpulan data yang besar dan berkualitas tinggi. Sebagai perbandingan, dia menunjuk ke Nvidia, yang telah melatih modelnya sendiri hingga 25 triliun token.

Apa yang dirilis dan apa yang tidak

Para peneliti merilis bobot model bersama dengan pos pemeriksaan perantara yang dipilih, kode pelatihan dan evaluasi yang lengkap, dan inventaris data terperinci yang mencantumkan jumlah token mentah, nomor zaman, dan kontribusi efektif per sumber. Menurut tim, ini berarti Soofi S memenuhi Open Source AI Definition 1.0 dari Open Source Initiative.

Proposal yang lebih ketat untuk definisi data terbuka Eropa, yang mengharuskan setiap token pelatihan dapat didistribusikan secara bebas, tidak terpenuhi karena 1,3 persen dari campuran tersebut berasal dari korpus Genios yang berlisensi komersial. Laporan tersebut menyebutkan sekitar 99 persen data pelatihan masih dapat direkonstruksi secara independen. Lisensi pasti untuk peluncuran model tersebut belum diselesaikan pada saat publikasi.

Konsorsium kini mencari mitra industri untuk tahap selanjutnya guna menguji Soofi S dalam aplikasi yang melibatkan dokumen teknis, pembuatan kode, dan sistem berbasis agen. Untuk informasi lebih lanjut tentang rilis model open-weight, infrastruktur AI yang berdaulat, dan ekosistem AI Eropa, ikuti terus cakupan industri AI yang dipublikasikan di sini.

Tetap terdepan dalam AI sumber terbuka

Rilisan bobot terbuka tiba hampir setiap minggu dari laboratorium di Amerika Serikat, Tiongkok, dan kini di Eropa, dan kesenjangan antara model kepemilikan terbesar dan alternatif terbuka terbaik semakin menyempit. Ikuti berita AI terkini dan analisis benchmark di sini untuk gambaran lengkapnya.

Baca selengkapnya cakupan model AI →