Công ty AI của Đức Aleph Alpha đã phát hành Kolibri, một mô hình ngôn ngữ Hỗn hợp các chuyên gia có trọng lượng mở được xây dựng từ đầu cho tiếng Đức và tiếng Anh. Mô hình này chứa tổng cộng 78,1 tỷ tham số nhưng chỉ kích hoạt 3,46 tỷ tham số trên mỗi mã thông báo - khoảng 4,4% - và vận chuyển theo giấy phép Apache 2.0 được phép trên Ôm mặt. Nó chấp nhận tới 1.048.576 mã thông báo ngữ cảnh và cho phép người dùng đặt nỗ lực lý luận cho mỗi yêu cầu. Đối với những độc giả đang theo dõi hệ sinh thái trọng lượng mở, điều này sẽ diễn ra cùng với sự phát triển AI mới nhất của chúng tôi.
Bản phát hành này là một tuyên bố có chủ ý về nơi Aleph Alpha nhìn thấy thị trường của mình: triển khai có chủ quyền trong các lĩnh vực được quản lý như hành chính công, công nghiệp và hàng không vũ trụ, nơi biết chính xác nơi mô hình được đào tạo, dữ liệu nào và khuôn khổ pháp lý nào không phải là điều dễ có mà là yêu cầu mua sắm.
Kolibri thực sự là gì
Kolibri, được gọi là Kolibri-1 trong các tài liệu kỹ thuật, là một máy biến áp MoE song ngữ Anh-Đức mà Aleph Alpha cho biết đã được các nhóm ở Đức phát triển từ đầu đến cuối. Theo báo cáo nghiên cứu kỹ thuật của công ty, nhóm đã kiểm soát toàn bộ quy trình – dữ liệu, kiến trúc, cơ sở hạ tầng đào tạo, sau đào tạo và đánh giá – thay vì bắt đầu từ trạm kiểm soát của phòng thí nghiệm khác.
Đào tạo diễn ra trên cơ sở hạ tầng ở Đức và Phần Lan. Quá trình thiết kế nhắm mục tiêu rõ ràng đến việc tuân thủ Quy tắc thực hành AI cho mục đích chung của EU, Đạo luật AI của EU và GDPR, và Aleph Alpha là người ký kết Quy tắc đó. Công ty cho biết đường dẫn dữ liệu của họ sẽ biên tập lại dữ liệu cá nhân trước khi đào tạo, một chi tiết nhắm trực tiếp đến những người mua trong khu vực công, những người không thể cung cấp dữ liệu công dân một cách hợp pháp vào các mô hình có nguồn gốc không rõ ràng.
Nó chạy trên một GPU duy nhất
Khả năng triển khai rõ ràng là một hạn chế trong thiết kế chứ không phải là một vấn đề cần cân nhắc. Điểm kiểm tra FP8 có dung lượng khoảng 78 GB và chạy trên một NVIDIA B200, B300 hoặc H200 duy nhất — hoặc trên hai GPU H100 SXM5 — được cung cấp thông qua vLLM với trình phân tích lệnh gọi công cụ và lý luận Kolibri chuyên dụng. Đối với mô hình 78 tỷ tham số, đó là dấu chân phần cứng khiêm tốn và là kết quả trực tiếp của thiết kế MoE thưa thớt: chỉ với 3,46 tỷ tham số hoạt động trên mỗi mã thông báo, chi phí suy luận sẽ theo dõi số lượng tham số hoạt động thay vì tổng số.
Các chuyên gia thưa thớt và sự chú ý lai
Dưới mui xe, Kolibri xếp 50 khối máy biến áp với chiều rộng mô hình là 2.560. Mỗi lớp MoE chấm điểm tất cả 384 chuyên gia được định tuyến bằng bộ định tuyến sigmoid, gửi từng mã thông báo lên 6 chuyên gia hàng đầu và luôn chạy 1 chuyên gia được chia sẻ cùng với họ. Tải chuyên gia được cân bằng bằng cách sử dụng hai kỹ thuật có tên súp theo thứ tự bảng chữ cái — Cân bằng lượng tử chính xác và Chèn lỗi tải — giúp bộ định tuyến không thu gọn tất cả lưu lượng truy cập vào một số chuyên gia.
Sự chú ý là nơi kiến trúc trở nên thú vị hơn. Kolibri sử dụng sự chú ý truy vấn được nhóm với 48 đầu truy vấn và 4 đầu KV, nhưng các lớp không đồng nhất: mỗi khối thứ năm sử dụng toàn bộ sự chú ý mà không cần mã hóa vị trí, trong khi 40 khối còn lại sử dụng sự chú ý của cửa sổ trượt trên 512 mã thông báo trước đó, với RoPE. Hậu quả thực tế là hiệu quả bộ nhớ - các lớp cửa sổ trượt giữ bộ đệm KV có kích thước cố định, do đó chỉ 10 trong số 50 lớp phát triển theo độ dài ngữ cảnh. Khi tính toán phù hợp, Aleph Alpha báo cáo rằng thiết kế kết hợp hỗ trợ các chuỗi dài hơn bốn lần so với mô hình toàn diện tương đương. Đó là cách một mô hình có quy mô này yêu cầu cửa sổ ngữ cảnh một triệu mã thông báo mà không có cơ sở hạ tầng kỳ lạ.
Một tokenizer được xây dựng cho tiếng Đức
Hầu hết các công cụ mã thông báo biên giới đều coi tiếng Đức như một thứ được suy nghĩ lại, chia các từ ghép dài của nó thành các đoạn làm tăng số lượng mã thông báo và chi phí hiệu quả. Aleph Alpha đã tấn công trực tiếp vấn đề này bằng UniBPE, một vốn từ vựng chứa 128.000 mã thông báo xây dựng sự hợp nhất theo cách BPE thực hiện nhưng lại ghi điểm cho mỗi lần hợp nhất do thua Unigram.
Những con số làm nên trường hợp. Trên văn bản tiếng Đức, mã thông báo của Kolibri đạt 4,90 byte mỗi mã thông báo, so với 4,35 đối với mã thông báo GPT-5 — nghĩa là ít hơn 11,2% mã thông báo trên văn bản web tiếng Đức. Về tiếng Anh, Kolibri thực sự cũng dẫn đầu với 4,58 byte mỗi mã thông báo so với 4,67 của GPT-5. Đối với khách hàng doanh nghiệp thanh toán bằng mã thông báo, đó là khoản giảm giá trực tiếp cho mọi khối lượng công việc bằng tiếng Đức.
Được đào tạo ở quy mô biên giới
Quá trình đào tạo đằng sau Kolibri là rất đáng kể. Quá trình đào tạo trước bao gồm 20 nghìn tỷ mã thông báo trên 768 GPU NVIDIA B200, tiếp theo là 3,44 nghìn tỷ mã thông báo đào tạo giữa kỳ với độ dài chuỗi 65.536 mã thông báo. Sau đó, quy trình chuyển qua các giai đoạn học tăng cường và tinh chỉnh có giám sát để tạo ra mô hình có khả năng suy luận, tuân theo hướng dẫn cuối cùng. Công ty đã xuất bản một báo cáo nghiên cứu kỹ thuật đề cập đến quy trình, một mức độ tiết lộ bất thường đối với một phòng thí nghiệm ở Châu Âu và một báo cáo rõ ràng nhằm mục đích xây dựng niềm tin với những khách hàng được quản lý.
Ý nghĩa của việc thúc đẩy AI của Châu Âu
Kolibri tham gia vào một thị trường nơi các bản phát hành công khai từ các phòng thí nghiệm của Mỹ và Trung Quốc chiếm ưu thế trong cuộc trò chuyện và nơi các chính phủ châu Âu ngày càng lên tiếng về chủ quyền kỹ thuật số. Aleph Alpha đặt cược rằng một phần của thị trường đó - các bộ, ngành công nghiệp quốc phòng liền kề, cơ sở hạ tầng quan trọng - sẽ trả tiền cho một mô hình không chỉ mang tính chất mở mà còn có tính chất châu Âu có thể kiểm chứng được trong việc xử lý dữ liệu, địa điểm đào tạo và tư thế pháp lý.
Việc đặt cược đó có thành công hay không còn phụ thuộc vào các câu hỏi mà bản phát hành chưa trả lời: Kolibri so sánh điểm chuẩn với các mô hình mở biên giới dựa trên các đánh giá tiêu chuẩn như thế nào và hệ sinh thái công cụ hình thành xung quanh nó nhanh như thế nào. Những gì bản phát hành chứng minh là khả năng đào tạo toàn diện, liền kề biên giới hiện đã tồn tại bên trong EU, với các thủ tục giấy tờ phù hợp. Đối với các tổ chức bị ràng buộc bởi GDPR và Đạo luật AI, sự kết hợp đó có thể quan trọng hơn vị trí trên bảng xếp hạng.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →