Người mẫu bí ẩn đã dành một tuần để quyến rũ các nhà phát triển dưới cái tên ẩn danh Ox Alpha giờ đã có danh tính chính thức. Z.AI của Trung Quốc đã ra mắt GLM-5.3-Flash, một mẫu máy có trọng lượng mở, đa phương thức nguyên bản được phát hành theo giấy phép MIT cho phép - và công ty cho biết toàn bộ quá trình chạy thử nghiệm tàng hình được thực hiện trên các chip AI do Trung Quốc sản xuất. Sự ra mắt này đã khép lại một trong những trò chơi đoán được theo dõi chặt chẽ nhất trong ngành AI năm nay. Để biết thông tin cơ bản về cách diễn biến câu chuyện, hãy xem sự phát triển AI mới nhất của chúng tôi.
Những gì Z.ai thực sự đã vận chuyển
GLM-5.3-Flash là mô hình kết hợp nhiều chuyên gia với tổng số 320 tỷ thông số và 18 tỷ thông số hoạt động — một mức giảm đáng kể so với 32 tỷ thông số hoạt động của phiên bản tiền nhiệm GLM-4.5. Theo thông báo của Z.ai, đây là mô hình đa phương thức nguyên bản đầu tiên trong dòng GLM-5, chấp nhận đầu vào văn bản và hình ảnh, đồng thời hỗ trợ cửa sổ ngữ cảnh đạt tới một triệu mã thông báo.
Mô hình này được đào tạo trên kho dữ liệu đa phương thức có 30 nghìn tỷ mã thông báo và kiến trúc của nó kết hợp sự chú ý tuyến tính cho các phần phụ thuộc cục bộ với sự chú ý thưa thớt cho bối cảnh toàn cầu. Một thành phần mà Z.ai gọi là IndexPool sẽ nén các nhóm vectơ khóa của bộ chỉ mục để hạn chế độ trễ và mức sử dụng bộ nhớ ở độ dài ngữ cảnh dài. Công ty cho biết khả năng tính toán chú ý ít hơn ba lần và kích thước bộ đệm KV giảm 4,4 lần so với GLM-5.3.
Tuyên bố về điểm chuẩn và giá cả
Trên Chỉ số trí tuệ phân tích nhân tạo v4.1.1, GLM-5.3-Flash đạt 57 điểm — một con số giúp nó đứng đầu bảng xếp hạng mô hình hiện tại của Phân tích nhân tạo, cao hơn nhiều so với mức trung bình so sánh là 18. Z.ai cho biết nó vượt trội hơn GLM-5.2 trong các bài kiểm tra mã hóa và tác nhân được báo cáo với mức giá chỉ bằng 1/10 và tiệm cận với Claude Opus 4.8 của Anthropic về điểm chuẩn mã hóa nội bộ của nó. Trên DeepSWE v1.1, mô hình đạt điểm 63,4 so với 46,2 cho GLM-5.2; trên AutomationBench nó đạt 48,8 so với 26,2. Như testingCatalog đã lưu ý, việc khai thác đánh giá, giới hạn ngữ cảnh và cài đặt tạo khác nhau có nghĩa là việc so sánh kiểm tra chéo phụ thuộc rất nhiều vào từng thiết lập.
Định giá định vị mô hình là cực kỳ rẻ: 0,15 USD trên một triệu mã thông báo đầu vào và 0,50 USD trên một triệu mã thông báo đầu ra, với chiết khấu bộ nhớ đệm nhanh 83%, theo Phân tích nhân tạo. Z.ai trích dẫn chi phí chiết khấu là 0,045 USD cho mỗi nhiệm vụ Chỉ số thông minh.
Góc chip Trung Quốc
Chi tiết có ý nghĩa chiến lược nhất là cơ sở hạ tầng, không phải tình báo. Trước khi ra mắt, mô hình này chạy ẩn danh dưới tên `ox-alpha` trên OpenRouter và OpenCode bắt đầu từ ngày 20 tháng 8 và Z.ai cho biết nó đã trở thành mô hình phổ biến nhất trong tuần trên các dịch vụ đó — với lưu lượng truy cập được phục vụ hoàn toàn trên các máy tăng tốc nội địa Trung Quốc. Để hỗ trợ điều đó, Z.ai đã xây dựng một ngăn phân phát dựa trên SGLang để phân tách mã hóa, điền trước và giải mã, báo cáo mức tăng gấp ba lần về hiệu suất phân phát từ đầu đến cuối trên hàng chục nghìn chip AI Trung Quốc.
Điều đó quan trọng hơn một nhà cung cấp. Đây là một minh chứng công khai rằng mô hình lân cận biên giới của Trung Quốc có thể được phục vụ trên quy mô lớn mà không cần phần cứng Nvidia, một điểm dữ liệu mà các nhà hoạch định chính sách và nhà sản xuất chip phương Tây sẽ không bỏ qua. New Stack tóm tắt việc phát hành là rẻ, tốt và được cung cấp trên chip Trung Quốc - ba phẩm chất hiếm khi được khẳng định cùng nhau cho đến nay.
Cân mở, triển khai thực
Trọng lượng có sẵn trên Ôm mặt theo giấy phép MIT, với việc triển khai cục bộ được hỗ trợ thông qua SGLang, vLLM và TokenSpeed. Người đăng ký Gói mã hóa GLM sẽ nhận được GLM-5.3-Flash trực tuyến ngay lập tức với hạn ngạch có thể sử dụng gấp ba lần GLM-5.3 và khả năng đa phương thức của nó được thể hiện trong ZCode thông qua tích hợp Sử dụng trình duyệt và Sử dụng máy tính.
Lý luận trực quan là trọng tâm của bản phát hành: Z.ai đã đào tạo mô hình để kiểm tra giao diện được hiển thị, lối chơi và đầu ra 3D, sau đó đánh giá và sửa đổi tác phẩm của chính mình từ phản hồi trực quan. Cách tiếp cận tương tự cũng áp dụng cho các tài liệu, bảng tính, bản trình bày và bảng điều khiển - những sản phẩm cơ bản của công việc văn phòng, chính xác là nơi mà đối thủ của Qwen phát hành cùng ngày cũng khẳng định lợi ích lớn nhất của nó.
Quyết định trọng lượng mở có ý nghĩa quan trọng đối với hệ sinh thái ngoài những người có sở thích. Cấp phép của MIT là giấy phép phổ biến dễ dãi nhất trong AI: việc sử dụng, sửa đổi và phân phối lại vì mục đích thương mại không có nghĩa vụ copyleft. Các máy chủ độc lập có thể phân phối GLM-5.3-Flash trên phần cứng của riêng họ, tinh chỉnh nó cho các ngành dọc từ đánh giá pháp lý đến tự động hóa công nghiệp và nhúng nó vào các sản phẩm mà không cần thương lượng các điều khoản — một tùy chọn bị tắt bởi các mô hình biên giới chỉ API.
Tại sao việc phóng lén lút lại hiệu quả
Việc triển khai ẩn danh đã mang lại cho Z.ai thứ mà ngân sách tiếp thị không thể mua được: sự xác thực về thương hiệu. Các nhà phát triển đã áp dụng Ox Alpha dựa trên giá trị của nó mà không cần đến phòng thí nghiệm Trung Quốc hay các phòng thí nghiệm đương nhiệm của Mỹ. Vào thời điểm Bloomberg xác nhận Z.AI là nhà sản xuất và Business Insider tuyên bố "bí ẩn đã được giải quyết", mô hình này đã đứng đầu bảng xếp hạng cộng đồng ở mức trung lập.
Áp lực cạnh tranh hiện đã rõ ràng. Một mô hình đa phương thức với bối cảnh một triệu token, trọng lượng được MIT cấp phép và định giá đầu ra dưới đô la buộc mọi người đương nhiệm phải biện minh cho bảng giá của mình. Biên giới Pareto giữa giá so với hiệu suất - mà các nhà phát triển đánh đổi thực sự cảm thấy - đã được vẽ lại, như nhà bình luận AI Andrew Curran được nhiều người theo dõi đã đưa nó vào X.
Câu hỏi mở là độ bền: liệu các điểm chuẩn có giữ được trong điều kiện sử dụng bất lợi trong thế giới thực hay không và các phòng thí nghiệm phương Tây phản ứng nhanh như thế nào về giá cả. Dù thế nào đi nữa, tuần suy đoán ẩn danh đã kết thúc với một mẫu máy được đặt tên, trọng lượng có thể tải xuống và một đội máy phục vụ không chạy silicon của Mỹ.
---
Đi trước AINhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.
Đọc thêm tin tức về AI →