Một thiết kế nhỏ nhưng rộng của sự kết hợp giữa các chuyên gia
Theo phân tích chi tiết trong MarkTechPost, Instella-MoE-16B-A3B là mẫu MoE chỉ có bộ giải mã với tổng số 16 tỷ tham số chỉ kích hoạt 2,8 tỷ mỗi mã thông báo. Mỗi lớp trong số 27 lớp của nó sử dụng 2 chuyên gia được chia sẻ cộng với 6 chuyên gia được định tuyến được chọn từ nhóm 64, với kích thước ẩn là 2048, 16 đầu chú ý và vốn từ vựng 128.896 mã thông báo. Mục tiêu Dự đoán nhiều mã thông báo được sử dụng trong cả quá trình đào tạo trước và giữa đào tạo.
Kiến trúc thưa thớt đó — nơi một phần nhỏ của mạng “thức dậy” cho mỗi mã thông báo — chính là logic hiệu quả tương tự đằng sau các mô hình mở chạy với giá rẻ đã định hình lại thị trường trong năm qua. AMD đã huấn luyện mô hình trên 7,1 nghìn tỷ mã thông báo được rút ra từ tập đoàn mở bao gồm Nemotron-CC-v2, MegaMath, FineMath, RefineCode và TxT360, sau đó chạy giai đoạn huấn luyện giữa kỳ trên Dolma3 Dolmino 100B trên ba biến thể dữ liệu được hợp nhất bằng phương pháp tính trọng số trung bình. Giai đoạn ngữ cảnh dài sẽ kéo dài thời lượng từ 4K lên 64K mã thông báo bằng YaRN.
Hai đổi mới cấp hệ thống
Bản phát hành mang hai lựa chọn về cấu trúc mà AMD nêu bật là những chiến thắng có ý nghĩa về mặt kỹ thuật. Đầu tiên là Chú ý tiềm ẩn nhiều đầu có cổng (MLA có cổng) , bổ sung một cổng đầu ra đã học nhẹ cho Chú ý tiềm ẩn nhiều đầu. Phép chiếu tuyến tính chuyên dụng tạo ra một cổng điều hòa đầu vào được áp dụng nhân lên trước phép chiếu đầu ra.
Thứ hai, FarSkip-Collective, là một sơ đồ kết nối chuyển các kích hoạt lỗi thời và một phần vào MoE và các lớp chú ý, chồng chéo giao tiếp song song chuyên gia với tính toán. AMD báo cáo tăng tốc trước đào tạo 12,7% và giảm tới 39,2% thời gian nhận mã thông báo đầu tiên khi phân phối với tính năng song song của chuyên gia. Đối với một công ty quảng cáo phần cứng của mình dựa trên hiệu suất giá cả, đó chính xác là những con số mà người mua muốn thấy.
Điểm chuẩn mạnh cho mô hình mở hoàn toàn
Ở điểm kiểm tra cơ bản, Instella-MoE đạt điểm trung bình 76,7 trong các đánh giá, điều mà AMD gọi là kết quả mạnh nhất trong số các mẫu máy mở hoàn toàn. Điều đó đặt nó trước Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) và OLMoE-1B-7B (61,9), mặc dù nó vẫn xếp sau Qwen3.5-4B-Base (79,5). Nó dẫn đầu trên WinoGrande với số điểm 86,5 và đăng 65,7 trên HumanEval+. Đối với các tác vụ có ngữ cảnh dài, điểm trung bình là 41,5 trên HELMET và 79,4 trên RULER.
Sau đào tạo làm sắc nét mô hình hơn nữa. Điểm trung bình tăng từ 71,58 sau khi tinh chỉnh có giám sát lên 72,67 sau DPO và 73,22 trong cấu hình "Think", đánh bại Olmo3-7B-Think (71,97), Gemma-4-E4B Think (70,47) và Qwen3,5-4B (69,73). Khi làm theo hướng dẫn, IFEval tăng từ 77,08 lên 83,70.
Bản thân công thức sau đào tạo đã đáng chú ý. Sau SFT trên hỗn hợp Dolci-Think-SFT-7B và Nemotron, AMD chạy DPO với các bản cập nhật sai lệch của bộ định tuyến và tính năng mất cân bằng tải phụ bị vô hiệu hóa để tránh suy giảm chất lượng. Sau đó, quá trình học tăng cường sẽ được tiến hành bên trong Khuôn khổ Miles của AMD: 1.400 bước RLVR tuân theo hướng dẫn, tiếp theo là Chưng cất chính sách nhiều giáo viên giúp thu lại lợi ích mà không làm giảm hiệu suất toán học hoặc mã.
Vấn đề cấp phép
Có một cảnh báo quan trọng đối với người dùng thương mại. Mô hình này được vận chuyển theo giấy phép ResearchRAIL, chỉ hạn chế sử dụng cho mục đích học thuật và nghiên cứu, vì vậy Instella-MoE không phải là mô hình thả vào để triển khai sản xuất. Tuy nhiên, cơ sở mã đào tạo được MIT cấp phép và đó được cho là tài sản có thể tái sử dụng nhiều hơn - nó cung cấp cho các phòng thí nghiệm khác một kế hoạch chi tiết cụ thể để đào tạo về silicon của AMD.
AMD đã công bố toàn bộ trọng số từ mọi giai đoạn đào tạo, hỗn hợp dữ liệu, cấu hình đào tạo và mã suy luận trên bộ sưu tập Hugging Face, kho lưu trữ GitHub và blog ROCm của nó. Mức độ cởi mở đó - theo từng giai đoạn đào tạo, không chỉ là điểm kiểm tra cuối cùng - là điểm phân biệt bản phát hành "mở hoàn toàn" với bản phát hành có trọng lượng mở thông thường.
Tại sao điều này lại quan trọng hơn các tiêu chuẩn
Nội dung ẩn ý của việc phát hành là cạnh tranh phần cứng. Hệ sinh thái CUDA của Nvidia và GPU loại H100 đã trở thành nền tảng mặc định cho việc đào tạo mô hình biên giới và những người thách thức đã dành nhiều năm cố gắng chứng minh máy gia tốc của họ có thể xử lý toàn bộ quá trình đào tạo. Instella-MoE là một sản phẩm đáng tin cậy mà dòng Instinct của AMD — đã được triển khai trên quy mô lớn bởi các siêu quy mô và phòng thí nghiệm quốc gia — có thể làm được nhiều việc hơn là khối lượng công việc suy luận. Nếu AMD có thể tiếp tục sản xuất các mô hình mở mang tính cạnh tranh được đào tạo trên phần cứng của riêng mình, điều đó sẽ củng cố thêm khả năng cho những người mua muốn phá vỡ sự thống trị của Nvidia trên thị trường máy tính AI.
Đối với các nhà nghiên cứu, sự hấp dẫn là tính minh bạch. Các bản phát hành mở hoàn toàn ghi lại hỗn hợp dữ liệu, hỗn hợp đào tạo giữa kỳ, chiến lược chắt lọc và chương trình giảng dạy RL vẫn còn hiếm và chúng cho phép cộng đồng kiểm tra và tái tạo các tuyên bố thay vì tin vào lời nói của phòng thí nghiệm. Instella-MoE gia nhập một danh sách nhỏ nhưng đang phát triển - bao gồm cả các mẫu dày đặc Instella trước đây của AMD - thúc đẩy tiêu chuẩn đó phát triển.
Đi trước AI
Bạn muốn loại bảo hiểm kỹ thuật sâu sắc này khi nó xảy ra? Đánh dấu trung tâm của chúng tôi để biết những phát triển AI mới nhất và không bao giờ bỏ lỡ bản phát hành.
Đọc thêm tin tức về AI →

