Tencent đã phát hành và bản xem trước nguồn mở Hy4, một mô hình ngôn ngữ lớn hàng đầu mới từ nhóm Hunyuan mà công ty đang định vị ở biên giới nguồn mở. Các trọng số đã đổ bộ vào Hugging Face, ModelScope, GitCode và CNB vào ngày 28 tháng 8 theo giấy phép Apache 2.0 cho phép, cùng với một biến thể lượng tử hóa FP8 để suy luận rẻ hơn.
Sự ra mắt này làm tăng thêm sự cạnh tranh giữa các phòng thí nghiệm Trung Quốc vận chuyển các mẫu biên giới có trọng lượng mở, một lĩnh vực hiện bao gồm dòng GLM của Z.AI và các mẫu Kimi của Moonshot AI. Bloomberg đưa tin rằng Tencent tuyên bố mô hình mới vượt trội hơn cả hai đối thủ trong thử nghiệm nội bộ - một tuyên bố rằng, giống như tất cả các đánh giá do nhà cung cấp thực hiện, đáng được xem xét kỹ lưỡng. For more context on this story, see our ongoing breaking AI news.
Số tiêu đề
Bản xem trước Hy4 là mô hình Hỗn hợp các chuyên gia (MoE) với tổng số 770 tỷ tham số, trong đó 49 tỷ được kích hoạt trên mỗi mã thông báo. Theo thẻ mô hình chính thức được xuất bản trên kho lưu trữ Tencent-Hunyuan GitHub, xương sống có 78 lớp, 256 chuyên gia được định tuyến cộng với một chuyên gia được chia sẻ và kích hoạt 8 chuyên gia được định tuyến hàng đầu cho mỗi mã thông báo. Lớp dự đoán nhiều mã thông báo gốc (MTP) — tổng cộng 10 tỷ tham số, 0,7 tỷ được kích hoạt — được tích hợp để giải mã đầu cơ.
Cửa sổ ngữ cảnh là thông số kỹ thuật khác của vùng chọn: 1 triệu mã thông báo, độ dài cho phép mô hình xử lý toàn bộ cơ sở mã, tài liệu pháp lý dài hoặc bản ghi cuộc họp kéo dài hàng giờ chỉ trong một lần chuyển.
Kiến trúc mượn từ đối thủ — và được xây dựng dựa trên nó
Ở mức độ thẳng thắn khác thường đối với lần ra mắt hàng đầu, tài liệu của Tencent nói rằng mô-đun chú ý được "lấy cảm hứng từ DeepSeek và GLM". Bản xem trước Hy4 sử dụng Chú ý thưa thớt Gated DeepSeek (Gated DSA) kết hợp với IndexCache để tái sử dụng chỉ mục thưa thớt trên nhiều lớp, trong khi đường dẫn còn lại sử dụng Siêu kết nối nhận dạng (iHC) để mở rộng luồng thông tin giữa các lớp.
Tính cởi mở là vấn đề quan trọng đối với các nhà phát triển khi đánh giá mô hình: sự chú ý thưa thớt là điều làm cho bối cảnh mã thông báo 1 triệu có thể phục vụ được về mặt kinh tế, vì sự chú ý hoàn toàn ngây thơ ở mức độ đó trở nên cực kỳ tốn kém. Cả DeepSeek và Z.AI đều đã xuất xưởng các biến thể của thiết kế này trên các mẫu máy hàng đầu của riêng họ.
Được xây dựng để tăng năng suất, được điều chỉnh bởi các chuyên gia nội bộ
Tencent cho biết họ đã hợp tác với các chuyên gia trong công ty – kỹ sư phần mềm, nhà phát triển trò chơi, nhà phân tích tài chính và chuyên gia bảo mật – và xây dựng dữ liệu đào tạo xung quanh công việc mà họ thực sự giao. Thẻ mô hình nêu bật bốn lĩnh vực trọng tâm:
- Kỹ thuật phần mềm: cải tiến việc lập kế hoạch, gỡ lỗi và xác minh đối với các nhiệm vụ phát triển trong thời gian dài, cùng với lợi ích về "hương vị trực quan" của giao diện người dùng.
- Văn phòng và phân tích: chuyển đổi bối cảnh nhiều tệp lộn xộn thành các tài liệu, bảng tính và bản trình bày có thể chia sẻ với khả năng xử lý phương trình và mô hình tài chính mạnh mẽ hơn.
- Phát triển trò chơi: tạo các nguyên mẫu có thể chơi được từ một lời nhắc duy nhất và hoạt động trôi chảy với các công cụ trò chơi qua nhiều lượt sàng lọc.
- Nghiên cứu khoa học: khẳng định sự tiến bộ trong nghiên cứu AI, động lực học phân tử, vật lý vật chất ngưng tụ và các vấn đề toán học thuần túy.
Tencent cũng cho biết bản xem trước của Hy4 được đồng thiết kế với các sản phẩm của riêng họ, CodeBuddy và WorkBuddy, để lợi ích của mô hình chuyển thành cải tiến sản phẩm.
Điểm chuẩn riêng của Tencent cho thấy điều gì
Sự so sánh cụ thể nhất trong các tài liệu khởi động là một đánh giá song song mù quáng mà Tencent thực hiện với 163 chuyên gia nội bộ đánh giá kết quả đầu ra của 203 nhiệm vụ kỹ thuật. Trong các thử nghiệm đó, bản xem trước Hy4 đạt điểm trung bình là 2,99, cao hơn một chút so với 2,92 của GLM 5.3 (thắng 46,8%, hòa 12,8%, thua 40,4%) và 2,94 của Kimi K3 (thắng 51,2%, hòa 7,9%, thua 40,9%).
Có hai điều cần lưu ý rõ ràng. Đầu tiên, đây là những đánh giá nội bộ của Tencent, không phải điểm chuẩn độc lập; công ty vẫn chưa công bố kết quả được xác minh lần thứ ba trên bảng xếp hạng công khai. Thứ hai, biên độ hẹp - khoảng cách 0,05 đến 0,07 điểm trên thang đánh giá chủ quan của chuyên gia nằm trong phạm vi mà các nhóm xếp hạng khác nhau có thể dễ dàng lật tẩy.
Xác minh độc lập sẽ đến từ các tập hợp công khai khi cộng đồng chạy mô hình thông qua các bộ mã hóa, lý luận và tác nhân được tiêu chuẩn hóa trong những tuần tới.
Giao hàng sớm, có lỗi đã biết
Tencent nói rõ rằng đây là bản xem trước. Thẻ mô hình liệt kê những hạn chế đã biết, bao gồm việc dành nhiều thời gian hơn mức cần thiết để lý luận thông qua các nhiệm vụ phức tạp và xu hướng xác minh quá mức công việc của chính mình. Nhóm nghiên cứu cho biết họ sẽ "giao hàng sớm và nghe xem điều gì bị hỏng", trích dẫn cách tiếp cận đã cải thiện thế hệ Hy3 của họ.
Để triển khai, các trọng số có sẵn ở cả BF16 và FP8, với sự hỗ trợ hàng ngày trong vLLM và SGLang. Tencent xuất bản hình ảnh Docker dựng sẵn cho cả hai, với các công thức đề xuất tính song song tensor trên 8 GPU và giải mã suy đoán dựa trên MTP để phục vụ theo độ trễ. Một quy trình tinh chỉnh và bộ công cụ lượng tử hóa AngelSlim đi kèm với mô hình.
Tại sao nó lại quan trọng
Cuộc đua hạng cân mở ở Trung Quốc đã trở thành cuộc chiến hai mặt trận giữa dòng GLM của Z.AI và các mẫu Kimi của Moonshot, với DeepSeek, Qwen và hiện là một đối thủ Hunyuan lớn hơn nhiều đang đông đúc trên sân. Sự kết hợp giữa cấp phép Apache 2.0 của bản xem trước Hy4, thang đo tham số 770B và bối cảnh mã thông báo 1M đã nâng mức trần về những gì mà bất kỳ ai cũng có thể tải xuống và tự lưu trữ — đồng thời hỗ trợ vLLM và SGLang hàng ngày giúp giảm bớt rào cản đối với việc thực sự chạy nó.
Đối với các doanh nghiệp đang cân nhắc các mô hình mở so với các API đóng của phương Tây, câu hỏi thực tế không còn là liệu một mô hình mở có thể phù hợp với hiệu suất đóng trên giấy hay không, mà là liệu công cụ xung quanh - lượng tử hóa, phục vụ, tinh chỉnh - có đủ trưởng thành hay không. Tencent đang đặt cược rằng việc vận chuyển tất cả cùng một lúc, theo giấy phép cho phép, là cách để Hunyuan quay trở lại cuộc trò chuyện.
Liệu các tuyên bố về điểm chuẩn nội bộ có được giữ vững trong quá trình thử nghiệm độc lập hay không sẽ quyết định xem bản xem trước Hy4 có được ghi nhớ là một bản phát hành nguồn mở biên giới chính hãng hay một điểm chuẩn khác của nhà cung cấp khác trong một lĩnh vực đông đúc hay không. Các trọng số hiện đã được công khai nên phán quyết của cộng đồng sẽ không mất nhiều thời gian.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →