Amazon Web Services đã bổ sung GLM 5.3 từ Z.ai, nhà phát triển mô hình còn được gọi là Zhipu AI, vào Amazon Bedrock, cung cấp cho khách hàng doanh nghiệp quyền truy cập API được quản lý hoàn toàn vào một trong những mô hình có trọng lượng mở lớn nhất được phát hành trong năm nay. Sự ra mắt, được công bố trên Blog học máy AWS vào ngày 5 tháng 10, giúp mô hình hỗn hợp các chuyên gia tham số 753B có sẵn thông qua cơ sở hạ tầng được quản lý của Bedrock thay vì yêu cầu các công ty tự lưu trữ trọng số.

Theo AWS, GLM 5.3 — được xuất bản trên Hugging Face Hub — được tối ưu hóa cho các tác vụ mã hóa và tác nhân có tầm nhìn dài, trong đó Z.ai báo cáo các khả năng an ninh mạng đáng chú ý. Những điểm mạnh đó phản ánh trực tiếp những gì người mua doanh nghiệp đã rút ra khỏi các API biên giới trong năm nay: lý luận nhiều bước, quy trình công việc được tăng cường bằng công cụ và bối cảnh bền vững trên các cơ sở mã lớn. For more context on this story, see our ongoing AI trends.

Khách hàng của Bedrock thực sự nhận được gì

Việc tích hợp tuân theo cẩm nang truy cập được quản lý tiêu chuẩn của Bedrock, với một số tính năng bổ sung cấp doanh nghiệp:

  • Quyền truy cập API linh hoạt. GLM 5.3 có thể được gọi thông qua API phản hồi và API hoàn thành trò chuyện tương thích với OpenAI — mà AWS đề xuất cho các ứng dụng mới — cũng như thông qua API Bedrock Invoke và Converse gốc. Các nhóm di chuyển quy trình dựa trên OpenAI hiện có có thể nhắm mục tiêu lại mô hình với những thay đổi mã tối thiểu.
  • Suy luận liên khu vực. Mô hình này được triển khai sau hai cấu hình suy luận, us.zai.glm-5.3 dành cho lưu lượng truy cập xuyên khu vực của Hoa Kỳ và Global.zai.glm-5.3 dành cho định tuyến toàn cầu. Yêu cầu sẽ được chuyển đến vùng nguồn mà khách hàng lựa chọn và Bedrock xử lý việc định tuyến an toàn.
  • Bộ nhớ đệm nhắc nhở. Bộ nhớ đệm tự động ngầm định được bật theo mặc định, với các biện pháp kiểm soát bộ nhớ đệm rõ ràng có sẵn trên các API tương thích với OpenAI. Đối với khối lượng công việc tác nhân gửi lại lời nhắc hệ thống lớn hoặc bối cảnh kho lưu trữ mỗi lần, AWS cho biết bộ nhớ đệm giúp giảm cả độ trễ và chi phí đầu vào.
  • Cấp dịch vụ. Khách hàng có thể chọn Flex cho khối lượng công việc được tối ưu hóa về chi phí, ít nhạy cảm về thời gian hơn, Ưu tiên cho lưu lượng truy cập có độ trễ quan trọng ở mức cao hơn hoặc Tiêu chuẩn cho số dư mặc định.

Một lưu ý nổi bật: AWS tuyên bố rằng quyền truy cập vào GLM 5.3 trên Bedrock được cung cấp cho các khách hàng doanh nghiệp đủ điều kiện, đề xuất quy trình giới thiệu có kiểm soát thay vì tự phục vụ mở cho tất cả các tài khoản.

Chia sẻ doanh thu lần đầu tiên cho phòng thí nghiệm Trung Quốc

Ngoài việc tích hợp kỹ thuật, báo chí đưa tin về buổi ra mắt còn mô tả thỏa thuận chia sẻ doanh thu dựa trên việc sử dụng giữa AWS và Z.ai, theo đó nhà cung cấp mô hình kiếm được một phần mức tiêu thụ Bedrock — mẫu thương mại tiêu chuẩn mà Bedrock sử dụng với các đối tác phương Tây, hiện được áp dụng cho mô hình hàng đầu của phòng thí nghiệm biên giới Trung Quốc. Báo chí tài chính đưa tin về thị trường Hồng Kông cho biết cổ phiếu liên quan đến Zhipu đã tăng hơn 7% trong phiên giao dịch sớm sau thông tin này.

Thỏa thuận này quan trọng đối với những gì nó báo hiệu về chiến lược nền tảng. Hyperscalers đã dành hai năm qua để thiết lập các liên minh mang lại cảm giác độc quyền với các phòng thí nghiệm phương Tây; việc mở Bedrock cho một gia đình trọng lượng mở của Trung Quốc sẽ mở rộng phạm vi tiếp cận của nền tảng tới các doanh nghiệp nhạy cảm về chi phí và tới các thị trường nơi người mẫu Hoa Kỳ phải đối mặt với áp lực về giá. Nó cũng cung cấp cho bản phân phối Z.ai mà không có bản phát hành trọng lượng mở nào có thể sánh được: hàng nghìn doanh nghiệp sẽ không bao giờ tải xuống điểm kiểm tra tham số 753B giờ đây có thể gọi nó là SLA.

Từ trọng lượng mở đến API được quản lý

Con đường đến với Bedrock của GLM 5.3 chạy qua cộng đồng trọng lượng mở. Mô hình này đã được xuất bản trên Hugging Face Hub, nơi trọng lượng, điểm chuẩn và điều khoản cấp phép của nó đã thu hút sự chú ý của nhà phát triển trước khi bất kỳ dịch vụ lưu trữ được quản lý nào được cung cấp — một cẩm nang mà Z.ai đã sử dụng trên dòng GLM, bao gồm cả bản phát hành GLM-5.3-Flash được MIT cấp phép chạy trên chip do Trung Quốc sản xuất.

Đối với các doanh nghiệp, phép tính giữa trọng số tải xuống và gọi API luôn phụ thuộc vào hoạt động: việc tự lưu trữ mô hình hỗn hợp các chuyên gia tham số 753B yêu cầu dung lượng GPU nghiêm trọng và độ trưởng thành MLOps mà hầu hết các tổ chức không thể biện minh cho một khối lượng công việc duy nhất. Quyền truy cập được quản lý của Bedrock sẽ loại bỏ rào cản đó trong khi vẫn giữ tùy chọn triển khai kết hợp mở cho các công ty có hạn chế về nơi cư trú dữ liệu.

Bắt đầu, cụ thể

Tài liệu của AWS hướng dẫn cách gọi từ bảng điều khiển Bedrock — nơi mô hình xuất hiện trong sân chơi tiêu chuẩn để kiểm tra nhanh chóng mà không cần mã — và theo lập trình thông qua điểm cuối thời gian chạy nền tảng. Điều kiện tiên quyết là các quyền IAM thông thường để gọi mô hình, bao gồm bedrock:InvokeModel và bedrock:InvokeModelWithResponseStream, cùng với các quyền đối với hồ sơ suy luận liên vùng đã chọn. Python 3.10 trở lên được liệt kê cho các ví dụ về mã.

Đáng chú ý, bài đăng trên AWS bao gồm một bản demo kiểm tra bảo mật tùy chọn được xây dựng bằng Docker và công cụ Strix nguồn mở, chạy GLM 5.3 thông qua Bedrock cho các quy trình công việc liên quan đến bảo mật – một sự bổ sung bất thường nhằm nhấn mạnh định vị an ninh mạng mà Z.ai đã tuyên bố cho mô hình. Đối với một nền tảng nhạy cảm về tuân thủ như AWS, việc giới thiệu mô hình Trung Quốc trong bối cảnh hack-demo là một tín hiệu rõ ràng về khối lượng công việc hỗn hợp mà Z.ai đang theo đuổi.

Kinh tế học hỗn hợp của các chuyên gia

Con số tham số 753B ít quan trọng hơn đối với kích thước của nó so với kiến trúc của nó. Các mô hình hỗn hợp các chuyên gia chỉ kích hoạt một phần tham số của chúng trên mỗi mã thông báo, đó là cách GLM 5.3 có thể cung cấp khả năng ở quy mô biên giới mà không phải trả chi phí suy luận ở quy mô biên giới cho mọi yêu cầu. Kết hợp với bộ nhớ đệm nhanh chóng — trong đó các lời nhắc hệ thống lặp lại và bối cảnh kho lưu trữ được cung cấp từ bộ nhớ đệm với chi phí giảm - tính kinh tế nhắm thẳng vào khối lượng công việc tác nhân có khối lượng lớn đang thống trị ngân sách AI của doanh nghiệp trong năm nay: trợ lý mã hóa, hoạt động bảo mật và quy trình tự động hóa chạy dài hạn.

Sau đó, các cấp dịch vụ của Bedrock cho phép các nhóm vận hành cân đối chi phí với độ trễ trên mỗi khối lượng công việc. Công việc phân tích mã hàng loạt hàng đêm có thể chạy theo mức giá Flex, trong khi người điều khiển bảo mật tương tác thực hiện cấp Ưu tiên — cùng một mô hình nhưng được đo lường khác nhau.

Xem gì

Việc phóng thiết lập ba cuộc thử nghiệm ngắn hạn. Đầu tiên, việc áp dụng: liệu cơ sở kinh doanh của Bedrock coi GLM 5.3 như một giải pháp sản xuất hay một sự quan tâm đến điểm chuẩn. Thứ hai, giá cả: bậc Flex cắt giảm mức độ dịch vụ được tối ưu hóa về độ trễ và giá cả dòng GLM trước đây đã gây áp lực lên các đối thủ phương Tây về chi phí. Thứ ba, phản hồi: các công ty siêu quy mô khác phải đối mặt với lựa chọn tương tự là lưu trữ hoặc nhượng lại phân khúc doanh nghiệp kiểu Trung Quốc.

Đối với các nhóm AI theo dõi tính khả dụng của mô hình, bài học thực tế rất đơn giản — một trong những mô hình trọng lượng mở được theo dõi chặt chẽ nhất năm 2026 hiện chỉ còn một lệnh gọi API dành cho khách hàng AWS và bối cảnh mô hình AI ngày càng cạnh tranh hơn với mọi nền tảng ký hợp đồng với phòng thí nghiệm Trung Quốc.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →