Немецкая компания Aleph Alpha, занимающаяся искусственным интеллектом, выпустила Kolibri, открытую языковую модель Mixture of Experts, созданную с нуля для немецкого и английского языков. Модель содержит 78,1 миллиарда параметров, но активирует только 3,46 миллиарда из них на каждый токен — около 4,4 процента — и поставляется под разрешительной лицензией Apache 2.0 на Hugging Face. Он принимает до 1 048 576 токенов контекста и позволяет пользователям устанавливать усилие рассуждения для каждого запроса. Для читателей, следящих за экосистемой открытых весов, эта информация находится рядом с нашими последними разработками в области искусственного интеллекта.
Этот релиз представляет собой осознанное заявление о том, каким Aleph Alpha видит свой рынок: суверенное развертывание в регулируемых секторах, таких как государственное управление, промышленность и аэрокосмическая промышленность, где точно знать, где модель была обучена, на каких данных и в каких правовых рамках — это не приятно, а требование к закупкам.
Что такое Колибри на самом деле
Колибри, называемый в технических материалах Колибри-1, представляет собой двуязычный англо-немецкий преобразователь MoE, который, по словам Алеф Альфа, был полностью разработан командами в Германии. Согласно отчету о технических исследованиях компании, команда контролировала весь процесс — данные, архитектуру, инфраструктуру обучения, постобучение и оценку — вместо того, чтобы начинать с контрольной точки другой лаборатории.
Обучение проходило на инфраструктуре, расположенной в Германии и Финляндии. Процесс проектирования явно нацелен на соблюдение Кодекса практики ЕС общего назначения в области искусственного интеллекта, Закона ЕС об искусственном интеллекте и GDPR, и Алеф Альфа является стороной, подписавшей этот Кодекс. Компания заявляет, что ее конвейер данных редактирует личные данные перед обучением, и эта деталь направлена непосредственно на покупателей из государственного сектора, которые не могут по закону вводить данные граждан в модели неясного происхождения.
Он работает на одном графическом процессоре
Возможность развертывания явно была ограничением дизайна, а не второстепенной мыслью. Контрольная точка FP8 весит примерно 78 ГБ и работает на одном NVIDIA B200, B300 или H200 — или на двух графических процессорах H100 SXM5 — обслуживаемых через vLLM со специальными рассуждениями Kolibri и анализаторами вызовов инструментов. Для модели с 78 миллиардами параметров это скромные аппаратные затраты, и это прямая выгода от разреженной конструкции MoE: поскольку на каждый токен активны только 3,46 миллиарда параметров, стоимость вывода отслеживает количество активных параметров, а не их общее количество.
Немногочисленность экспертов и смешанное внимание
Под капотом Kolibri сложены 50 блоков-трансформеров шириной модели 2560. Каждый уровень MoE оценивает всех 384 перенаправленных экспертов с помощью сигмовидного маршрутизатора, отправляет каждый токен 6 лучшим и всегда запускает вместе с ними 1 общего эксперта. Экспертная нагрузка балансируется с помощью двух методов с буквенными названиями — точной квантильной балансировки и внедрения ошибок нагрузки — которые не позволяют маршрутизатору перекладывать весь трафик на горстку специалистов.
Внимание — вот где архитектура становится более интересной. Колибри использует внимание сгруппированных запросов с 48 заголовками запросов и 4 заголовками KV, но слои не являются однородными: каждый пятый блок использует полное внимание без позиционного кодирования, в то время как остальные 40 блоков используют внимание скользящего окна по 512 предыдущим токенам с RoPE. Практическим следствием является эффективность использования памяти — слои скользящего окна содержат KV-кеш фиксированного размера, поэтому только 10 из 50 слоев растут с длиной контекста. Алеф Альфа сообщает, что при согласованных вычислениях гибридная конструкция поддерживает последовательности в четыре раза длиннее, чем эквивалентная модель полного внимания. Вот как модель такого размера требует контекстного окна в один миллион токенов без экзотической инфраструктуры.
Токенизатор, созданный для немецкого языка
Большинство разработчиков пограничных токенизаторов рассматривают немецкий язык как второстепенную мысль, разбивая его длинные составные слова на фрагменты, что приводит к увеличению количества токенов и эффективных затрат. Aleph Alpha атаковала эту проблему напрямую с помощью UniBPE, словаря на 128 000 токенов, который создает слияния так же, как это делает BPE, но оценивает каждое слияние с потерей Unigram.
Цифры подтверждают это. В тексте на немецком языке токенизатор Kolibri достигает 4,90 байт на токен по сравнению с 4,35 для токенизатора GPT-5, что означает на 11,2 процента меньше токенов в немецком веб-тексте. На английском языке Kolibri также выходит вперед: 4,58 байта на токен против 4,67 у GPT-5. Для корпоративных клиентов, оплачивающих токенами, это прямая скидка на каждую немецкоязычную рабочую нагрузку.
Обучение в передовом масштабе
Тренировочный период за Колибри значителен. Предварительное обучение охватывало 20 триллионов токенов на 768 графических процессорах NVIDIA B200, за которыми следовали 3,44 триллиона токенов промежуточного обучения с длиной последовательности в 65 536 токенов. Затем конвейер прошел этапы контролируемой точной настройки и обучения с подкреплением, чтобы создать окончательную модель, способную следовать инструкциям и рассуждать. Компания опубликовала отчет о техническом исследовании, освещающий этот процесс, что является необычным уровнем раскрытия информации для европейской лаборатории и явно направлен на укрепление доверия со стороны регулируемых клиентов.
Что это означает для продвижения ИИ в Европе
Kolibri выходит на рынок, где в разговорах доминируют релизы открытого веса из американских и китайских лабораторий, и где европейские правительства все чаще высказываются о цифровом суверенитете. «Алеф Альфа» делает ставку на то, что часть этого рынка — министерства, оборонная промышленность, критически важная инфраструктура — будет платить за модель, которая не просто будет открытой, но и будет проверяемо европейской в плане обработки данных, места обучения и юридической позиции.
Оправдается ли эта ставка, зависит от вопросов, на которые релиз пока не дает ответов: как Kolibri сравнивает с передовыми открытыми моделями стандартные оценки и как быстро вокруг нее формируется экосистема инструментов. В релизе действительно установлено, что в настоящее время внутри ЕС существуют полноценные возможности обучения в приграничных районах с соответствующей документацией. Для организаций, связанных GDPR и Законом об искусственном интеллекте, эта комбинация может иметь большее значение, чем позиции в списках лидеров.
---
Будьте впереди ИИПолучайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.
Подробнее новости AI →