Konsortium institusi penyelidikan Jerman dan syarikat AI telah mengeluarkan Soofi S 30B-A3B, model bahasa terbuka yang menurut projek itu mencapai skor tertinggi pada penanda aras Inggeris dan Jerman dalam kalangan model terbuka sepenuhnya. Diselaraskan oleh KI Bundesverband, persatuan AI kebangsaan Jerman, keluaran ini merupakan salah satu model bahasa besar pertama yang dilatih sepenuhnya pada Awan AI Industri Deutsche Telekom di Munich dan diletakkan sebagai alternatif Eropah yang berdaulat kepada keluaran dominan Amerika Syarikat dan keluaran berat terbuka China. Untuk pembangun yang menjejaki perkembangan AI terbaharu, pelancaran ini kurang ketara untuk skala mentah berbanding kecekapan luar biasa dan tumpuan bahasa yang dimasukkan ke dalam seni bina.

Reka bentuk hibrid dengan hanya 3.2 bilion parameter aktif

Soofi S ialah model campuran pakar (MoE) dengan 31.6 bilion parameter secara keseluruhan, tetapi ia mengaktifkan hanya kira-kira 3.2 bilion bagi setiap token yang dijana. Itu meletakkan kos pengiraannya lebih hampir kepada model 3 bilion parameter berbanding model padat 30 bilion parameter konvensional, pilihan reka bentuk yang bertujuan memastikan inferens cukup murah untuk dijalankan pada infrastruktur Eropah tanpa bergantung pada penyedia awan luar negara.

Seni bina ini dipinjam daripada Nemotron 3 Nano Nvidia, menggabungkan lapisan Mamba-2 dengan lapisan perhatian standard dalam susun atur hibrid. Menurut laporan pralatihan projek, hanya 6 daripada 52 lapisan model mengekalkan cache nilai kunci (KV) — struktur memori yang menyimpan token sebelumnya untuk pengiraan perhatian. Dalam transformer konvensional, cache itu berkembang secara linear dengan panjang konteks dan menjadi kesesakan utama semasa inferens konteks panjang.

Ganjaran praktikal muncul dalam hasil. Dengan panjang konteks 40,000 token dengan 32 permintaan selari, Soofi S menjana kira-kira lapan kali lebih banyak token sesaat setiap GPU daripada model padat dalam julat 14 hingga 24 bilion parameter. Walaupun kelajuan penjanaan untuk model konvensional menurun dengan ketara apabila konteks berkembang, Soofi S kekal hampir mendatar daripada 4,000 token sehingga 256,000 token. Satu-satunya model yang setanding dalam ukuran konsortium ialah Qwen3.5 35B-A3B Alibaba, yang juga menggunakan seni bina hibrid.

Dilatih untuk bahasa Jerman, tanpa mengorbankan bahasa Inggeris

Tumpuan yang disengajakan pada bahasa Jerman adalah penting kepada projek itu. Dalam fasa latihan pertama, bahasa Jerman membentuk 7.2 peratus daripada campuran data; dalam fasa kedua, bahagian itu meningkat kepada 15.3 peratus. Sebagai perbandingan, dalam resipi rujukan Nemotron Nvidia semua gabungan bahasa bukan Inggeris menyumbang hanya sekitar 5 peratus daripada campuran latihan.

Sumber data termasuk teks web Jerman daripada korpus HPLT, korpus German Commons berlesen secara terbuka, bahagian Jerman FinePDFs dan FineWiki, dan arkib Genios berlesen komersial bagi 193 juta artikel akhbar yang diambil daripada 916 penerbitan Jerman. Teks Jerman yang diterjemahkan oleh mesin dan dijana secara sintetik melengkapkan campuran.

Model ini memproses kira-kira 27 trilion token merentasi tiga fasa latihan: kira-kira 20 trilion token web luas, kod, matematik dan teks khusus domain dalam fasa pertama; kira-kira 6 trilion token berkualiti tinggi dalam detik; dan fasa ketiga yang lebih pendek memanjangkan tetingkap konteks menggunakan dokumen sehingga satu juta token panjang.

Keputusan penanda aras: mendahului bahasa Jerman dan Inggeris, lebih lemah dalam matematik

Dalam penilaian terhadap 16 model terbuka lain, Soofi S mengetuai semua model terbuka sepenuhnya pada skor agregat untuk kedua-dua bahasa Jerman dan Inggeris, menurut konsortium itu. Itu termasuk OLMo 3 32B dari Allen Institute for AI dan Apertus 70B dari ETH Zurich dan EPFL. Berbanding dengan setiap garis dasar berdaulat Eropah, model ini muncul di hadapan pada semua penanda aras Jerman dalam suite, kadangkala dengan margin dua digit.

Mengenai tugasan kod, Soofi S mendapat 73.8 peratus pada HumanEval, 70.2 pada MBPP dan 84.2 pada varian MBPP Jerman — hasil terbaik dalam kalangan rakan sebaya sumber terbuka. Pada INCLUDE-DE, ujian untuk pengetahuan serantau khusus Jerman, Soofi S mengikat kedudukan pertama pada 61.2 mata dengan Qwen3.5 35B-A3B yang lebih besar. Berbanding dengan garis dasar Nemotron, resipi data berwajaran Jerman meningkatkan penguasaan bahasa sebanyak 15.1 mata dan penanda aras sains GPQA-Diamond sebanyak 9.6 mata, tanpa menjejaskan prestasi bahasa Inggeris.

Terdapat kelemahan yang jelas. Mengenai matematik pertandingan Jerman (Minerva MATH-DE), Soofi S mendapat 56 mata, jauh di belakang Qwen3.5 35B-A3B pada 76.5 dan Gemma 3 27B pada 65.6. Ia juga menjejaki perolehan fakta terbuka dalam NaturalQuestions, yang disifatkan oleh pasukan hanya mempunyai kira-kira 3 bilion parameter aktif dan oleh itu kurang pengetahuan dunia yang disimpan daripada model 27B yang padat. Ujian konteks panjang RULER menimbulkan satu lagi jurang: apabila model perlu mengekstrak perkataan yang kerap muncul daripada teks yang panjang, kadar hitnya menurun kepada sekitar 3 peratus melebihi 32,000 token, manakala model Nemotron yang setanding masih menguruskan 60 hingga 64 peratus.

Dilatih pada 512 GPU Nvidia B200 di Munich

Latihan berlangsung antara Mac dan Mei 2026 pada sehingga 512 GPU Nvidia B200 di Awan AI Industri Deutsche Telekom di Munich, berjumlah kira-kira 253,000 jam GPU. Kemudahan itu beroperasi sepenuhnya pada tenaga boleh diperbaharui, disejukkan dengan air dari terusan Eisbach, dan menyalurkan sisa haba ke kawasan sekitar Tucherpark, menurut laporan itu. Soofi S ialah salah satu latihan utama pertama yang dijalankan ke atas infrastruktur ini.

Konsortium di sebalik model itu dibiayai oleh Kementerian Hal Ehwal Ekonomi dan Tenaga Persekutuan Jerman sebagai sebahagian daripada program IPCEI-CIS Eropah. Peserta termasuk Institut Fraunhofer IAIS dan IIS, Pusat Penyelidikan Jerman untuk Kepintaran Buatan (DFKI), TU Darmstadt, Universiti Würzburg, Pusat Penyelidikan L3S, Universiti Sains Gunaan Berlin dan syarikat AI Ellamind dan Merantix Momentum.

Perdebatan mengenai 'overtraining'

Tidak lama selepas pelancaran, pengkritik berhujah bahawa Soofi S terlalu terlatih dengan piawaian undang-undang penskalaan Chinchilla klasik yang diterbitkan oleh Google DeepMind pada tahun 2022, yang mencadangkan titik manis kasar sebanyak 20 token setiap parameter. Dengan 27 trilion token dan kira-kira 30 bilion parameter, Soofi S mendarat pada beberapa ratus token setiap parameter; mengira hanya 3.2 bilion parameter aktif menolak nisbah menjadi ribuan.

Michael Fromm, sebahagian daripada kepimpinan teknikal projek itu, menolak kritikan itu, dengan alasan bahawa peraturan tersebut tidak dibawa ke seni bina MoE. "Terdapat penyelidikan baharu yang menunjukkan bahawa undang-undang penskalaan lama daripada model padat tidak lagi terpakai kepada seni bina MoE," kata Fromm, sambil menyatakan bahawa pakar individu mendapat manfaat daripada melihat dokumen yang sama berulang kali dalam dataset yang besar dan berkualiti tinggi. Sebagai titik perbandingan, dia menunjuk kepada Nvidia, yang telah melatih modelnya sendiri sehingga 25 trilion token.

Apa yang dikeluarkan, dan apa yang tidak

Para penyelidik mengeluarkan pemberat model bersama dengan pusat pemeriksaan perantaraan terpilih, kod latihan dan penilaian yang lengkap, dan inventori data terperinci yang menyenaraikan kiraan token mentah, nombor zaman dan sumbangan berkesan bagi setiap sumber. Menurut pasukan itu, ini bermakna Soofi S memenuhi Definisi AI Sumber Terbuka 1.0 daripada Inisiatif Sumber Terbuka.

Cadangan yang lebih ketat untuk definisi data terbuka Eropah, yang memerlukan setiap token latihan boleh diedarkan secara bebas, tidak dipenuhi kerana 1.3 peratus daripada campuran datang daripada korpus Genios berlesen komersial. Laporan itu mengatakan kira-kira 99 peratus daripada data latihan masih boleh dibina semula secara bebas. Lesen tepat untuk keluaran model itu belum dimuktamadkan pada masa penerbitan.

Konsortium itu kini sedang mencari rakan kongsi industri untuk fasa seterusnya untuk menguji Soofi S dalam aplikasi yang melibatkan dokumen teknikal, penjanaan kod dan sistem berasaskan ejen. Untuk mendapatkan maklumat lanjut tentang keluaran model berwajaran terbuka, infrastruktur AI berdaulat dan ekosistem AI Eropah, ikuti liputan industri AI yang diterbitkan di sini.

Kekal pada AI sumber terbuka

Keluaran berat terbuka tiba hampir setiap minggu dari makmal di Amerika Syarikat, China dan kini Eropah, dan jurang antara model proprietari terbesar dan alternatif terbuka terbaik terus mengecil. Ikuti berita terbaharu AI dan analisis penanda aras di sini untuk mendapatkan gambaran penuh.

Baca lebih banyak liputan model AI →