Perusahaan AI Jerman Aleph Alpha wis ngrilis Kolibri, model basa Mixture-of-Experts bobot mbukak sing dibangun saka wiwitan kanggo Jerman lan Inggris. Model kasebut ngemot 78,1 milyar parameter total nanging mung ngaktifake 3,46 milyar saben token - udakara 4,4 persen - lan dikirim ing lisensi Apache 2.0 sing idin ing Hugging Face. Iki nampa nganti 1.048.576 token konteks lan ngidini pangguna nyetel upaya penalaran saben panyuwunan. Kanggo maca sing nelusuri ekosistem open-weights, iki ndharat bebarengan karo pangembangan AI paling anyar.

Rilis kasebut minangka pratelan sing disengaja babagan ngendi Aleph Alpha ndeleng pasar: penyebaran kedaulatan ing sektor sing diatur kayata administrasi umum, industri, lan aerospace, ing ngendi ngerti persis ing ngendi model dilatih, apa data, lan ing ngendi kerangka hukum ora becik kanggo duwe nanging minangka syarat pengadaan.

Apa sejatine Kolibri

Kolibri, diarani Kolibri-1 ing bahan teknis, minangka trafo MoE Inggris-Jerman dwibahasa sing miturut Aleph Alpha dikembangake dening tim ing Jerman. Miturut laporan riset teknis perusahaan, tim kasebut ngontrol saluran pipa lengkap - data, arsitektur, infrastruktur pelatihan, pasca pelatihan, lan evaluasi - tinimbang miwiti saka pos pemeriksaan lab liyane.

Latihan mbukak infrastruktur sing ana ing Jerman lan Finlandia. Proses desain kasebut kanthi jelas nargetake kepatuhan karo Kode Praktik AI Tujuan Umum EU, Undhang-undhang AI EU, lan GDPR, lan Aleph Alpha minangka tandha saka Kode kasebut. Perusahaan kasebut ujar manawa saluran pipa data nyunting data pribadhi sadurunge latihan, rincian sing dituju langsung kanggo para panuku sektor publik sing ora bisa menehi feed data warga kanthi sah dadi model sing ora jelas.

Iku mlaku ing siji GPU

Deployability jelas dadi kendala desain, dudu afterthought. Checkpoint FP8 bobote kira-kira 78GB lan mlaku ing NVIDIA B200, B300, utawa H200 - utawa ing loro GPU H100 SXM5 - dilayani liwat vLLM kanthi pertimbangan Kolibri khusus lan parser panggilan alat. Kanggo model 78-milyar-parameter, iku tilak hardware andhap asor, lan iku payoff langsung saka desain MoE arang: karo mung 3,46 milyar paramèter aktif saben token, biaya inferensi trek count parameter aktif tinimbang total.

Pakar sing jarang lan perhatian hibrida

Ing kap, Kolibri numpuk 50 blok trafo kanthi jembar model 2.560. Saben lapisan MoE ngetung kabeh 384 ahli sing diarahake kanthi router sigmoid, ngirim saben token menyang ndhuwur 6, lan tansah mbukak 1 pakar bareng bebarengan. Beban ahli diimbangi nggunakake rong teknik kanthi jeneng sup alfabet - Balancing Quantile Exact lan Injeksi Kesalahan Beban - sing nyegah router supaya ora ngrusak kabeh lalu lintas menyang sawetara spesialis.

Manungsa waé ing ngendi arsitektur dadi luwih menarik. Kolibri nggunakake kawigatosan pitakon-klompok kanthi 48 kepala pitakon lan 4 kepala KV, nanging lapisan kasebut ora seragam: saben blok kaping lima nggunakake perhatian lengkap tanpa enkoding posisional, dene 40 blok liyane nggunakake perhatian jendela geser liwat 512 token sadurunge, kanthi RoPE. Konsekuensi praktis yaiku efisiensi memori - lapisan sliding-window nyekel cache KV ukuran tetep, dadi mung 10 saka 50 lapisan sing tuwuh kanthi dawa konteks. Ing komputasi sing cocog, Aleph Alpha nglaporake manawa desain hibrida ndhukung urutan kaping papat luwih dawa tinimbang model perhatian lengkap sing padha. Mangkono model ukuran iki nyatakake jendhela konteks siji-yuta-token tanpa infrastruktur eksotis.

A tokenizer dibangun kanggo Jerman

Umume tokenizer perbatasan nganggep basa Jerman minangka afterthought, misahake tembung majemuk sing dawa dadi pecahan sing nambah jumlah token lan biaya efektif. Aleph Alpha nyerang iki langsung karo UniBPE, kosakata 128,000-token sing digabungake kaya BPE nanging ngetung saben gabungan kanthi mundhut Unigram.

Nomer nggawe kasus. Ing teks Jerman, tokenizer Kolibri tekan 4.90 bita saben token, tinimbang 4.35 kanggo tokenizer GPT-5 - tegese 11.2 persen token luwih sithik ing teks web Jerman. Ing basa Inggris, Kolibri uga luwih maju, kanthi 4.58 bita saben token nglawan GPT-5 4.67. Kanggo pelanggan perusahaan sing mbayar kanthi token, yaiku diskon langsung kanggo saben beban kerja basa Jerman.

Dilatih ing skala wates

Latihan ing mburi Kolibri cukup akeh. Pra-training nutupi 20 triliun token ing 768 NVIDIA B200 GPU, diikuti 3,44 triliun token mid-training kanthi dawa urutan 65,536-token. Pipa kasebut banjur dipindhah liwat tahap-tahap learning fine-tuning lan reinforcement sing diawasi kanggo ngasilake model sing bisa ngetutake instruksi lan nalar. Perusahaan kasebut wis nerbitake laporan riset teknis sing nyakup proses kasebut, tingkat pambocoran sing ora biasa kanggo laboratorium Eropa lan sing jelas ditujokake kanggo mbangun kepercayaan karo pelanggan sing diatur.

Apa tegese kanggo push AI Eropa

Kolibri mlebu pasar ing ngendi rilis bobot mbukak saka lab Amerika lan Cina ndominasi obrolan, lan ing ngendi pamrentah Eropa saya tambah akeh vokal babagan kedaulatan digital. Taruhan Aleph Alpha yaiku irisan pasar kasebut - kementerian, industri sing cedhak karo pertahanan, infrastruktur kritis - bakal mbayar model sing ora mung mbukak bobot nanging mesthi Eropa babagan penanganan data, lokasi latihan, lan postur legal.

Apa taruhan sing dibayar gumantung ing pitakonan sing durung dijawab release: carane Kolibri benchmarks marang model mbukak wates ing evaluasi standar, lan sepira cepet ekosistem alat mbentuk watara. Apa sing diluncurake yaiku kemampuan latihan tumpukan lengkap, jejere saiki ana ing EU, kanthi dokumen sing cocog. Kanggo organisasi sing kaiket GDPR lan Undhang-undhang AI, kombinasi kasebut bisa uga luwih penting tinimbang posisi leaderboard.

---

Tetep Ahead of AI

Entuk warta, analisis, lan terobosan AI paling anyar - kabeh ing sak panggonan.

Waca liyane AI warta →