Консорціум німецьких дослідницьких установ і компаній штучного інтелекту випустив Soofi S 30B-A3B, відкриту мовну модель, яка, за словами проекту, досягає найвищих балів за англійською та німецькою тестами серед повністю відкритих моделей. Координований KI Bundesverband, національною асоціацією штучного інтелекту Німеччини, випуск є однією з перших великих мовних моделей, повністю навчених на Industrial AI Cloud Deutsche Telekom у Мюнхені, і позиціонується як суверенна європейська альтернатива домінуючим відкритим випускам США та Китаю. Для розробників, які відстежують [останні розробки штучного інтелекту] (https://aibuzzwire.news), запуск примітний не стільки сирим масштабом, скільки незвичайною ефективністю та мовним фокусом, закладеним в архітектуру.
Гібридний дизайн із лише 3,2 мільярдами активних параметрів
Soofi S — це модель змішаних експертів (MoE) із загальною кількістю 31,6 мільярда параметрів, але вона активує лише близько 3,2 мільярда на згенерований токен. Це робить його обчислювальну вартість ближчою до моделі з 3 мільярдами параметрів, ніж до традиційної щільної моделі з 30 мільярдами параметрів, вибору дизайну, спрямованого на збереження достатньо дешевого висновку для роботи в європейській інфраструктурі без залежності від закордонних постачальників хмарних технологій.
Архітектура запозичена з Nemotron 3 Nano від Nvidia, поєднуючи шари Mamba-2 зі стандартними шарами уваги в гібридному макеті. Згідно зі звітом про підготовку проекту, лише 6 із 52 рівнів моделі підтримують кеш-пам’ять «ключ-значення» (KV) — структуру пам’яті, яка зберігає попередні токени для обчислення уваги. У звичайних трансформаторах цей кеш зростає лінійно з довжиною контексту і стає головним вузьким місцем під час виведення довгоконтексту.
Практична винагорода проявляється в пропускній здатності. При довжині контексту 40 000 токенів із 32 паралельними запитами Soofi S генерує приблизно у вісім разів більше токенів на секунду на GPU, ніж щільні моделі в діапазоні від 14 до 24 мільярдів параметрів. У той час як швидкість генерації для звичайних моделей різко падає зі зростанням контексту, Soofi S залишається майже незмінною від 4000 токенів до 256 000 токенів. Єдиною порівнянною моделлю в вимірюваннях консорціуму є Qwen3.5 35B-A3B від Alibaba, яка також використовує гібридну архітектуру.
Навчався німецькій, не жертвуючи англійською
Навмисний акцент на німецькій мові є центральним у проекті. На першому етапі навчання німецька мова становить 7,2% сукупності даних; на другому етапі ця частка зростає до 15,3 відсотка. Для порівняння, у довідковому рецепті Nemotron від Nvidia на всі неанглійські мови разом припадає лише близько 5 відсотків навчальної суміші.
Джерела даних включають німецький веб-текст із корпусу HPLT, відкритого ліцензованого корпусу German Commons, німецьких частин FinePDF і FineWiki, а також комерційно ліцензованого архіву Genios із 193 мільйонів газетних статей, взятих із 916 німецьких публікацій. Машинно перекладені та синтетично згенеровані німецькі тексти доповнюють суміш.
Модель обробила приблизно 27 трильйонів токенів протягом трьох етапів навчання: близько 20 трильйонів токенів широкої мережі, коду, математики та предметно-спеціального тексту на першому етапі; близько 6 трильйонів високоякісних токенів у другому; і коротша третя фаза, що розширює контекстне вікно за допомогою документів довжиною до мільйона токенів.
Результати контрольних тестів: попереду з німецької та англійської, слабше з математики
За даними консорціуму, в оцінках 16 інших відкритих моделей Soofi S лідирує серед усіх повністю відкритих моделей за сукупними балами як для німецької, так і для англійської мов. Це включає OLMo 3 32B від Інституту штучного інтелекту Аллена та Apertus 70B від ETH Zurich та EPFL. Порівняно з усіма європейськими суверенними базовими показниками, модель виходить вперед за всіма німецькими тестами в наборі, іноді з двозначним відривом.
У кодових завданнях Soofi S набирає 73,8 відсотка на HumanEval, 70,2 на MBPP і 84,2 на німецькому варіанті MBPP — найкращі результати серед аналогів з відкритим кодом. У INCLUDE-DE, тесті на регіональні знання Німеччини, Soofi S посів перше місце з 61,2 балами з більшим Qwen3.5 35B-A3B. Порівняно з базовим рівнем Nemotron, рецепт зважених даних за німецькою мовою покращує рівень володіння мовою на 15,1 бала, а науковий тест GPQA-Diamond на 9,6 бала, без шкоди для продуктивності англійської мови.
Є явні недоліки. На німецькому конкурсі з математики (Minerva MATH-DE) Soofi S набирає 56 балів, значно поступаючись Qwen3.5 35B-A3B з 76,5 і Gemma 3 27B з 65,6. Він також відстає від відкритого фактичного пошуку в NaturalQuestions, якому команда приписує лише близько 3 мільярдів активних параметрів і, отже, менше збережених світових знань, ніж щільна модель 27B. Тест довгоконтекстного тесту RULER виявив ще одну прогалину: коли моделі доводиться витягувати слова, які часто зустрічаються, із довгого тексту, її показник попадання падає приблизно до 3 відсотків понад 32 000 токенів, у той час як порівнянна модель Nemotron все ще справляється з 60–64 відсотками.
Навчання на 512 графічних процесорах Nvidia B200 у Мюнхені
Навчальний запуск проходив у період з березня по травень 2026 року на 512 графічних процесорах Nvidia B200 у Industrial AI Cloud Deutsche Telekom у Мюнхені, загалом близько 253 000 GPU-годин. Об’єкт повністю працює на відновлюваних джерелах енергії, охолоджується водою з каналу Айсбах і подає відпрацьоване тепло в навколишній район Tucherpark, згідно зі звітом. Soofi S був одним із перших великих тренувань, проведених на цій інфраструктурі.
Консорціум, що стоїть за моделлю, фінансується Федеральним міністерством економіки та енергетики Німеччини в рамках європейської програми IPCEI-CIS. Серед учасників – Інститути Фраунгофера IAIS та IIS, Німецький дослідницький центр штучного інтелекту (DFKI), Дармштадтський технічний університет, Вюрцбурзький університет, Дослідницький центр L3S, Берлінський університет прикладних наук, а також компанії зі штучного інтелекту Ellamind і Merantix Momentum.
Дебати щодо «перетренованості»
Незабаром після запуску критики стверджували, що Soofi S був сильно перенапрацьований стандартами класичних законів масштабування Chinchilla, опублікованих Google DeepMind у 2022 році, які передбачали приблизну найкращу точку в 20 токенів на параметр. Маючи 27 трильйонів токенів і приблизно 30 мільярдів параметрів, Soofi S досягає кількох сотень токенів на параметр; враховуючи лише 3,2 мільярда активних параметрів, це співвідношення досягає тисяч.
Майкл Фромм, член технічного керівництва проекту, відкинув цю критику, стверджуючи, що ці правила не поширюються на архітектури Міністерства освіти. «Є нове дослідження, яке показує, що старі закони масштабування щільних моделей більше не застосовуються до архітектур MoE», — сказав Фромм, зазначивши, що окремі експерти отримують вигоду від повторного перегляду одних і тих же документів у великому високоякісному наборі даних. Для порівняння він вказав на Nvidia, яка навчила власні моделі на 25 трильйонах токенів.
Що оприлюднюється, а що ні
Дослідники публікують вагові коефіцієнти моделі разом із вибраними проміжними контрольними точками, повним кодом навчання та оцінювання, а також детальним переліком даних із переліком необроблених токенів, номерів епох і ефективних внесків на джерело. За словами команди, це означає, що Soofi S відповідає Open Source AI Definition 1.0 від Open Source Initiative.
Більш сувора пропозиція щодо європейського визначення відкритих даних, яка б вимагала, щоб кожен окремий навчальний токен міг вільно розповсюджуватися, не виконується, оскільки 1,3 відсотка суміші походить від комерційно ліцензованого корпусу Genios. У звіті говориться, що близько 99 відсотків тренувальних даних все ще можна реконструювати незалежно. Точна ліцензія на випуск моделі не була завершена на момент публікації.
Зараз консорціум шукає галузевих партнерів для наступного етапу тестування Soofi S у програмах, що включають технічну документацію, генерацію коду та системи на основі агентів. Щоб дізнатися більше про випуски відкритих моделей, суверенну інфраструктуру штучного інтелекту та європейську екосистему штучного інтелекту, слідкуйте за [висвітленням індустрії штучного інтелекту] (https://aibuzzwire.news), опублікованим тут.
Будьте попереду щодо штучного інтелекту з відкритим кодом
Відкриті випуски надходять майже щотижня з лабораторій у Сполучених Штатах, Китаї, а тепер і в Європі, і розрив між найбільшими пропрієтарними моделями та найкращими відкритими альтернативами продовжує звужуватися. Стежте за найновішими новинами штучного інтелекту і порівняльним аналізом тут, щоб отримати повну картину.
Докладніше про модель ШІ →



