독일 AI 회사인 Aleph Alpha는 처음부터 독일어와 영어용으로 구축된 개방형 전문가 혼합 언어 모델인 Kolibri를 출시했습니다. 이 모델은 총 781억 개의 매개변수를 포함하지만 토큰당 그 중 34억 6천만 개(약 4.4%)만 ​​활성화하며 Hugging Face의 허용된 Apache 2.0 라이선스에 따라 배송됩니다. 최대 1,048,576개의 컨텍스트 토큰을 허용하며 사용자가 요청별로 추론 노력을 설정할 수 있습니다. 오픈 웨이트 생태계를 추적하는 독자를 위해 이 내용은 최신 AI 개발과 함께 제공됩니다.

이 릴리스는 Aleph Alpha가 시장을 보는 위치에 대한 의도적인 진술입니다. 즉, 공공 행정, 산업, 항공우주와 같은 규제 부문에 주권을 배치하고 모델이 어디에서 훈련되었는지, 어떤 데이터에 대해, 어떤 법적 프레임워크에 따라 훈련되었는지 정확히 아는 것은 있으면 좋은 것이 아니라 조달 요구 사항입니다.

콜리브리의 정체는 무엇인가

기술 자료에서 Kolibri-1이라고 불리는 Kolibri는 Aleph Alpha가 독일 팀에 의해 처음부터 끝까지 개발되었다고 말하는 이중 언어 영어-독일어 MoE 변환기입니다. 회사의 기술 연구 보고서에 따르면 팀은 다른 연구소의 체크포인트에서 시작하는 대신 데이터, 아키텍처, 교육 인프라, 사후 교육 및 평가 등 전체 파이프라인을 제어했습니다.

교육은 독일과 핀란드에 위치한 인프라에서 진행되었습니다. 설계 프로세스는 EU 범용 AI 실행 강령, EU AI 법 및 GDPR 준수를 명시적으로 목표로 삼았으며 Aleph Alpha는 해당 강령의 서명자입니다. 회사는 자사의 데이터 파이프라인이 훈련 전에 개인 데이터를 수정한다고 밝혔는데, 이는 출처가 불분명한 모델에 법적으로 시민 데이터를 공급할 수 없는 공공 부문 구매자를 직접 겨냥한 세부 사항입니다.

단일 GPU에서 실행됩니다.

배포 가능성은 분명히 설계상의 제약이지 나중에 고려한 것이 아닙니다. FP8 체크포인트의 무게는 약 78GB이며 단일 NVIDIA B200, B300 또는 H200 또는 2개의 H100 SXM5 GPU에서 실행되며 전용 Kolibri 추론 및 도구 호출 파서가 있는 vLLM을 통해 제공됩니다. 780억 매개변수 모델의 경우 이는 적당한 하드웨어 공간이며 희소 MoE 설계의 직접적인 보상입니다. 토큰당 활성화된 매개변수가 34억 6천만 개에 불과하므로 추론 비용은 전체가 아닌 활성 매개변수 수를 추적합니다.

희박한 전문가와 하이브리드 관심

후드 아래에서 Kolibri는 모델 너비가 2,560인 변압기 블록 50개를 쌓습니다. 모든 MoE 계층은 시그모이드 라우터를 사용하여 라우팅된 전문가 384명 모두의 점수를 매기고, 각 토큰을 상위 6위까지 보내고, 항상 그들과 함께 1명의 공유 전문가를 실행합니다. 전문가 로드는 라우터가 모든 트래픽을 소수의 전문가에게 축소하는 것을 방지하는 두 가지 기술(정확한 분위수 밸런싱 및 로드 오류 주입)을 사용하여 균형을 이룹니다.

아키텍처가 더욱 흥미로워지는 부분이 주목됩니다. Kolibri는 48개 쿼리 헤드와 4개 KV 헤드로 그룹화된 쿼리 Attention을 사용하지만 레이어가 균일하지 않습니다. 매 5번째 블록마다 위치 인코딩 없이 전체 Attention을 사용하는 반면, 나머지 40개 블록은 RoPE를 통해 512개의 선행 토큰에 대해 슬라이딩 윈도우 Attention을 사용합니다. 실질적인 결과는 메모리 효율성입니다. 슬라이딩 윈도우 레이어는 고정 크기 KV 캐시를 유지하므로 50개 레이어 중 10개 레이어만 컨텍스트 길이에 따라 증가합니다. 일치된 컴퓨팅에서 Aleph Alpha는 하이브리드 디자인이 동등한 전체 주의 모델보다 4배 더 긴 시퀀스를 지원한다고 보고합니다. 이것이 바로 이 규모의 모델이 이국적인 인프라 없이 백만 개의 토큰 컨텍스트 창을 요구하는 방법입니다.

독일어용으로 제작된 토크나이저

대부분의 프론티어 토크나이저는 독일어를 나중에 고려하여 긴 복합어를 조각으로 나누어 토큰 수와 유효 비용을 부풀립니다. Aleph Alpha는 BPE와 같은 방식으로 병합을 구축하지만 Unigram 손실로 각 병합의 점수를 매기는 128,000개의 토큰 어휘인 UniBPE를 통해 이를 직접 공격했습니다.

숫자가 사례를 만듭니다. 독일어 텍스트에서 Kolibri의 토크나이저는 토큰당 4.90바이트에 도달하는데 비해 GPT-5 토크나이저는 4.35바이트입니다. 이는 독일어 웹 텍스트에서 토큰 수가 11.2% 적다는 것을 의미합니다. 영어에서는 실제로 Kolibri가 GPT-5의 4.67에 비해 토큰당 4.58바이트로 앞서 나갑니다. 토큰으로 비용을 지불하는 기업 고객의 경우 이는 모든 독일어 작업 부하에 대한 직접적인 할인입니다.

프론티어 규모의 훈련

Kolibri의 훈련 운영은 상당합니다. 사전 훈련에는 768개의 NVIDIA B200 GPU에서 20조 개의 토큰이 포함되었으며, 그 뒤를 이어 65,536개의 토큰 시퀀스 길이에서 3조 4400억 개의 중간 훈련 토큰이 포함되었습니다. 그런 다음 파이프라인은 감독된 미세 조정 및 강화 학습 단계를 거쳐 최종 지침을 따르고 추론 가능한 모델을 생성했습니다. 회사는 프로세스를 다루는 기술 연구 보고서를 발표했으며, 이는 유럽 연구소에 대한 공개 수준이 이례적이며 규제 대상 고객과의 신뢰 구축을 목표로 하고 있습니다.

유럽의 AI 추진에 대한 의미

Kolibri는 미국과 중국 연구소의 공개 릴리스가 대화를 지배하고 유럽 정부가 디지털 주권에 대해 점점 더 목소리를 높이는 시장에 진출합니다. Aleph Alpha는 해당 시장의 일부(부처, 국방 인접 산업, 중요 인프라)가 단순히 개방형이 아니라 데이터 처리, 교육 위치 및 법적 태도 측면에서 검증된 유럽 모델에 대한 비용을 지불할 것이라고 확신합니다.

그 베팅이 성공할지 여부는 릴리스가 아직 답변하지 않은 질문에 달려 있습니다. Kolibri가 표준 평가에서 프론티어 개방형 모델을 벤치마킹하는 방법과 이를 중심으로 도구 생태계가 얼마나 빨리 형성되는지입니다. 이번 릴리스를 통해 확립된 것은 이제 EU 내에 풀 스택, 국경에 인접한 훈련 능력이 존재하며 그에 맞는 서류 작업이 이루어졌다는 것입니다. GDPR과 AI법이 적용되는 조직의 경우 해당 조합이 리더보드 위치보다 더 중요할 수 있습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →