Một tập đoàn gồm các tổ chức nghiên cứu và công ty AI của Đức đã phát hành Soofi S 30B-A3B, một mô hình ngôn ngữ mở mà dự án cho biết đã đạt được điểm số cao nhất trên cả tiêu chuẩn tiếng Anh và tiếng Đức trong số các mô hình mở hoàn toàn. Được điều phối bởi KI Bundesverband, hiệp hội AI quốc gia của Đức, bản phát hành là một trong những mô hình ngôn ngữ lớn đầu tiên được đào tạo hoàn toàn trên Đám mây AI công nghiệp của Deutsche Telekom ở Munich và được định vị là một giải pháp thay thế có chủ quyền của Châu Âu cho các bản phát hành mở rộng thống trị của Hoa Kỳ và Trung Quốc. Đối với các nhà phát triển đang theo dõi những phát triển AI mới nhất, việc ra mắt không gây chú ý ở quy mô thô mà là ở hiệu quả vượt trội và trọng tâm ngôn ngữ được đưa vào kiến trúc.
Một thiết kế lai chỉ có 3,2 tỷ thông số hoạt động
Soofi S là mô hình hỗn hợp các chuyên gia (MoE) với tổng cộng 31,6 tỷ tham số, nhưng nó chỉ kích hoạt khoảng 3,2 tỷ cho mỗi mã thông báo được tạo. Điều đó khiến chi phí tính toán của nó gần với mô hình 3 tỷ tham số hơn là mô hình dày đặc 30 tỷ tham số thông thường, một lựa chọn thiết kế nhằm mục đích giữ cho hoạt động suy luận đủ rẻ để chạy trên cơ sở hạ tầng châu Âu mà không phụ thuộc vào các nhà cung cấp đám mây ở nước ngoài.
Kiến trúc được mượn từ Nemotron 3 Nano của Nvidia, kết hợp các lớp Mamba-2 với các lớp chú ý tiêu chuẩn trong bố cục kết hợp. Theo báo cáo đào tạo trước của dự án, chỉ 6 trong số 52 lớp của mô hình duy trì bộ nhớ đệm khóa-giá trị (KV) — cấu trúc bộ nhớ lưu trữ các mã thông báo trước đó để tính toán sự chú ý. Trong các máy biến áp thông thường, bộ đệm đó phát triển tuyến tính theo độ dài ngữ cảnh và trở thành nút thắt cổ chai lớn trong quá trình suy luận ngữ cảnh dài.
Phần thưởng thực tế thể hiện ở thông lượng. Với độ dài ngữ cảnh là 40.000 mã thông báo với 32 yêu cầu song song, Soofi S tạo ra số mã thông báo mỗi giây trên mỗi GPU nhiều hơn khoảng 8 lần so với các mô hình dày đặc trong phạm vi 14 đến 24 tỷ tham số. Trong khi tốc độ tạo ra các mẫu thông thường giảm mạnh khi bối cảnh phát triển, Soofi S gần như không thay đổi từ 4.000 mã thông báo xuống còn 256.000 mã thông báo. Mô hình có thể so sánh duy nhất trong các phép đo của tập đoàn là Qwen3.5 35B-A3B của Alibaba, cũng sử dụng kiến trúc lai.
Được đào tạo tiếng Đức mà không phải hy sinh tiếng Anh
Việc tập trung chủ ý vào tiếng Đức là trọng tâm của dự án. Trong giai đoạn đào tạo đầu tiên, tiếng Đức chiếm 7,2% tổng dữ liệu; trong giai đoạn thứ hai, tỷ lệ đó tăng lên 15,3%. Để so sánh, trong công thức tham khảo Nemotron của Nvidia, tất cả các ngôn ngữ không phải tiếng Anh kết hợp lại chỉ chiếm khoảng 5% tổng số đào tạo.
Các nguồn dữ liệu bao gồm văn bản web tiếng Đức từ kho văn bản HPLT, kho văn bản German Commons được cấp phép mở, các phần tiếng Đức của FinePDFs và FineWiki, và kho lưu trữ Genios được cấp phép thương mại gồm 193 triệu bài báo được rút ra từ 916 ấn phẩm của Đức. Các văn bản tiếng Đức được dịch bằng máy và tổng hợp tạo nên sự kết hợp hoàn hảo.
Mô hình đã xử lý khoảng 27 nghìn tỷ mã thông báo trong ba giai đoạn đào tạo: khoảng 20 nghìn tỷ mã thông báo của web rộng, mã, toán học và văn bản theo miền cụ thể trong giai đoạn đầu tiên; khoảng 6 nghìn tỷ mã thông báo chất lượng cao hơn trong giây; và giai đoạn thứ ba ngắn hơn, mở rộng cửa sổ ngữ cảnh bằng cách sử dụng các tài liệu có chiều dài lên tới một triệu mã thông báo.
Kết quả benchmark: vượt trội về tiếng Đức và tiếng Anh, yếu hơn về môn toán
Trong các đánh giá so với 16 mô hình mở khác, Soofi S dẫn đầu tất cả các mô hình mở hoàn toàn về điểm tổng hợp cho cả tiếng Đức và tiếng Anh, theo tập đoàn. Điều đó bao gồm OLMo 3 32B từ Viện AI Allen và Apertus 70B từ ETH Zurich và EPFL. So với mọi đường cơ sở chủ quyền của châu Âu, mô hình này vượt trội hơn tất cả các tiêu chuẩn của Đức trong bộ tiêu chuẩn, đôi khi với lợi nhuận hai chữ số.
Về nhiệm vụ mã, Soofi S đạt 73,8% trên HumanEval, 70,2 trên MBPP và 84,2 trên biến thể MBPP của Đức – kết quả tốt nhất trong số các đồng nghiệp nguồn mở. Trong INCLUDE-DE, một bài kiểm tra kiến thức khu vực dành riêng cho Đức, Soofi S đứng ở vị trí đầu tiên với 61,2 điểm với Qwen3.5 35B-A3B lớn hơn. So với đường cơ sở của Nemotron, công thức dữ liệu theo trọng số của Đức cải thiện trình độ ngôn ngữ lên 15,1 điểm và điểm chuẩn khoa học GPQA-Diamond lên 9,6 điểm mà không ảnh hưởng đến hiệu suất tiếng Anh.
Có điểm yếu rõ ràng. Ở môn thi tiếng Đức (Minerva MATH-DE), Soofi S đạt 56 điểm, xếp sau Qwen3.5 35B-A3B với số điểm 76,5 và Gemma 3 27B với số điểm 65,6. Nó cũng theo đuổi khả năng truy xuất thực tế mở trong NaturalQuestions, nhóm cho rằng chỉ có khoảng 3 tỷ tham số hoạt động và do đó kiến thức thế giới được lưu trữ ít hơn so với mô hình 27B dày đặc. Thử nghiệm ngữ cảnh dài RULER cho thấy một lỗ hổng khác: khi mô hình phải trích xuất các từ xuất hiện thường xuyên từ một văn bản dài, tỷ lệ trúng của nó giảm xuống khoảng 3% sau 32.000 mã thông báo, trong khi mô hình Nemotron tương đương vẫn quản lý được 60 đến 64%.
Được đào tạo trên 512 GPU Nvidia B200 tại Munich
Quá trình đào tạo diễn ra từ tháng 3 đến tháng 5 năm 2026 trên tối đa 512 GPU Nvidia B200 tại Đám mây AI công nghiệp của Deutsche Telekom ở Munich, tổng cộng khoảng 253.000 giờ GPU. Theo báo cáo, cơ sở này hoạt động hoàn toàn bằng năng lượng tái tạo, được làm mát bằng nước từ kênh Eisbach và cung cấp nhiệt thải vào khu vực xung quanh Tucherpark. Soofi S là một trong những hoạt động đào tạo lớn đầu tiên được thực hiện trên cơ sở hạ tầng này.
Hiệp hội đằng sau mô hình này được Bộ Kinh tế và Năng lượng Liên bang Đức tài trợ như một phần của chương trình IPCEI-CIS của Châu Âu. Những người tham gia bao gồm Viện Fraunhofer IAIS và IIS, Trung tâm Nghiên cứu Trí tuệ Nhân tạo Đức (DFKI), TU Darmstadt, Đại học Würzburg, Trung tâm Nghiên cứu L3S, Đại học Khoa học Ứng dụng Berlin và các công ty AI Ellamind và Merantix Momentum.
Tranh cãi về 'tập luyện quá sức'
Ngay sau khi ra mắt, các nhà phê bình lập luận rằng Soofi S đã được đào tạo quá mức theo các tiêu chuẩn của luật chia tỷ lệ Chinchilla cổ điển do Google DeepMind công bố vào năm 2022, trong đó đề xuất mức tối ưu là 20 mã thông báo cho mỗi tham số. Với 27 nghìn tỷ token và khoảng 30 tỷ tham số, Soofi S đạt được vài trăm token cho mỗi tham số; chỉ đếm 3,2 tỷ tham số hoạt động sẽ đẩy tỷ lệ lên hàng nghìn.
Michael Fromm, một phần lãnh đạo kỹ thuật của dự án, đã bác bỏ lời chỉ trích đó, lập luận rằng những quy tắc đó không được áp dụng cho các kiến trúc của MoE. Fromm cho biết: “Có nghiên cứu mới cho thấy rằng các quy luật chia tỷ lệ cũ từ các mô hình dày đặc không còn áp dụng cho kiến trúc MoE nữa”, đồng thời lưu ý rằng các chuyên gia riêng lẻ được hưởng lợi từ việc xem đi xem lại cùng một tài liệu trong một tập dữ liệu lớn, chất lượng cao. Để so sánh, ông chỉ vào Nvidia, công ty đã đào tạo các mô hình của riêng mình lên tới 25 nghìn tỷ token.
Cái gì được phát hành và cái gì không
Các nhà nghiên cứu đang phát hành trọng số mô hình cùng với các điểm kiểm tra trung gian được chọn, mã đào tạo và đánh giá hoàn chỉnh cũng như kho dữ liệu chi tiết liệt kê số lượng mã thông báo thô, số kỷ nguyên và đóng góp hiệu quả cho mỗi nguồn. Theo nhóm, điều này có nghĩa là Soofi S đáp ứng Định nghĩa AI nguồn mở 1.0 từ Sáng kiến nguồn mở.
Đề xuất chặt chẽ hơn về định nghĩa dữ liệu mở của Châu Âu, yêu cầu mọi mã thông báo đào tạo phải được phân phối tự do, không được đáp ứng vì 1,3% hỗn hợp đến từ kho dữ liệu Genios được cấp phép thương mại. Báo cáo cho biết khoảng 99% dữ liệu huấn luyện vẫn có thể được xây dựng lại một cách độc lập. Giấy phép chính xác cho việc phát hành mẫu xe này vẫn chưa được hoàn thiện tại thời điểm xuất bản.
Liên minh hiện đang tìm kiếm các đối tác trong ngành cho giai đoạn tiếp theo để thử nghiệm Soofi S trong các ứng dụng liên quan đến tài liệu kỹ thuật, tạo mã và hệ thống dựa trên tác nhân. Để biết thêm thông tin về các bản phát hành mô hình trọng lượng mở, cơ sở hạ tầng AI có chủ quyền và hệ sinh thái AI châu Âu, hãy theo dõi tin tức về ngành AI được xuất bản tại đây.
Luôn dẫn đầu về AI nguồn mở
Các bản phát hành phiên bản mở gần như được gửi đến hàng tuần từ các phòng thí nghiệm ở Hoa Kỳ, Trung Quốc và bây giờ là Châu Âu, đồng thời khoảng cách giữa các mô hình độc quyền lớn nhất và các lựa chọn thay thế mở tốt nhất ngày càng thu hẹp. Hãy theo dõi tin tức nóng hổi về AI và phân tích điểm chuẩn tại đây để có bức tranh đầy đủ.
Đọc thêm phạm vi đưa tin của mô hình AI →



