Mistral AI đã phát hành Shieldstral vào ngày 4 tháng 8 năm 2026, một công cụ phân loại an toàn trọng lượng mở gồm 3 tỷ tham số để đánh giá văn bản và hình ảnh dựa trên các chính sách kiểm duyệt được viết bằng ngôn ngữ đơn giản tại thời điểm suy luận, thay vì dựa vào một nhóm danh mục tác hại cố định được đưa vào mô hình trong quá trình đào tạo. Việc phát hành này thể hiện một sự khác biệt đáng chú ý về mặt triết học so với cách xây dựng hầu hết các mô hình lan can ngày nay.

Mô hình này có sẵn trên Hugging Face theo giấy phép Apache 2.0, bao gồm 12 ngôn ngữ và chạy trên một GPU 16 GB. Khi lĩnh vực AI Châu Âu tiếp tục sản xuất các hệ thống trọng lượng mở có tính cạnh tranh, Shieldstral bổ sung thêm một khía cạnh khác vào tin nóng về AI đang định hình lại cách các nhà phát triển tiếp cận vấn đề an toàn.

Shieldstral hoạt động như thế nào

Hầu hết các mô hình lan can đều mã hóa cứng phân loại các loại tác hại thành trọng số của chúng trong quá trình đào tạo, điều đó có nghĩa là việc điều chỉnh chúng cho phù hợp với bối cảnh sản phẩm mới đòi hỏi một chu trình đào tạo lại đầy đủ. Shieldstral thực hiện một cách tiếp cận khác về cơ bản: chính sách kiểm duyệt được cung cấp như một phần đầu vào tại thời điểm suy luận.

Theo phân tích của Unite.AI, cơ chế này giảm mọi nhiệm vụ kiểm duyệt thành việc trả lời câu hỏi nhị phân. Mỗi yêu cầu có ba phần được gắn thẻ: trường `` chứa ngữ cảnh đánh giá và mức độ nghiêm ngặt, trường `` có một câu hỏi có/không, chẳng hạn như "Nội dung này có khuyến khích bạo lực thể chất không?" và trường `` chứa nội dung để đánh giá, có thể là lời nhắc, câu trả lời, cặp câu trả lời nhắc hoặc hình ảnh có văn bản tùy chọn.

Khi suy luận, mô hình chỉ đọc nhật ký cho mã thông báo "có" và "không" và chuẩn hóa softmax thành điểm liên tục, ngưỡng 0,5 cho kết quả nhị phân. Công thức đó cho phép một điểm kiểm tra duy nhất tiếp thu việc phân loại nhanh chóng, kiểm duyệt phản ứng, phát hiện từ chối và phát hiện độc tính như các trường hợp của cùng một vấn đề cơ bản.

Một điểm kiểm tra, nhiều chính sách

Ý nghĩa thực tế là đáng kể. Cùng một điểm kiểm tra có thể sàng lọc một công cụ nghiên cứu an ninh mạng và nền tảng sức khỏe tâm thần theo các tiêu chuẩn hoàn toàn khác nhau mà không cần sửa đổi. Người vận hành viết câu hỏi có/không, cung cấp hướng dẫn mô tả bối cảnh đánh giá và mức độ nghiêm ngặt, đồng thời mô hình trả về điểm an toàn đã hiệu chỉnh từ một đầu ra mã thông báo duy nhất.

Thiết kế thích ứng với chính sách này giải quyết một trong những nỗi thất vọng dai dẳng trong việc triển khai hệ thống an toàn AI: khó khăn trong việc điều chỉnh mức độ kiểm duyệt cho phù hợp với các trường hợp sử dụng cụ thể mà không cần đào tạo lại tốn kém. Một chatbot dịch vụ tài chính, một ứng dụng giáo dục dành cho trẻ em và một diễn đàn mở dành cho các nhà nghiên cứu bảo mật, tất cả đều cần những biện pháp bảo vệ hoàn toàn khác nhau và Shieldstral đặt mục tiêu xử lý cả ba điều này từ cùng một nhóm trọng số.

Kiến trúc và Hiệu suất

Shieldstral được xây dựng trên Ministral-3-3B, mô hình đa phương thức nhỏ của Mistral, với bộ mã hóa tầm nhìn Pixtral xử lý đầu vào hình ảnh. Thẻ mô hình liệt kê một cửa sổ ngữ cảnh 32.000 mã thông báo và Mistral cho biết mô hình này khớp với các mô hình bảo vệ mở có kích thước gấp bảy lần kích thước của nó trên các tiêu chuẩn an toàn văn bản đồng thời thiết lập trạng thái hiện đại mới về kiểm duyệt đa phương thức.

Đó là những tuyên bố mạnh mẽ đối với mô hình tham số 3B và Mistral đã hỗ trợ việc phát hành bằng một lượng tài liệu bất thường. Một báo cáo kỹ thuật mô tả công thức huấn luyện và đánh giá đã được đăng lên arXiv vào ngày 28 tháng 7 năm 2026, theo sau là thẻ mô hình đầy đủ trong tài liệu của Mistral và bản thân các quả tạ, cả hai đều được phát hành vào ngày 4 tháng 8.

Một lời phê bình sắc bén về hiện trạng

Mistral đóng khung bản phát hành Shieldstral xoay quanh một lời phê bình thẳng thắn về cách xây dựng các mô hình lan can thường được xây dựng. Công ty lập luận rằng việc mã hóa cứng các nguyên tắc phân loại có hại thành trọng số mô hình sẽ tạo ra sự thiếu linh hoạt, buộc các nhà phát triển phải đào tạo lại các vòng lặp mỗi khi chính sách thay đổi hoặc sản phẩm mới ra mắt.

Đây không chỉ là một lập luận mang tính kỹ thuật; nó là một tuyên bố định vị cạnh tranh. Bằng cách phát hành mô hình được cấp phép Apache-2.0 có thể tự lưu trữ và điều chỉnh mà không cần đào tạo lại, Mistral đang nhắm mục tiêu đến các nhà phát triển muốn kiểm soát ngăn xếp an toàn của họ mà không cần đến các dịch vụ được quản lý hoặc bộ phân loại độc quyền.

Cách tiếp cận trọng lượng mở cũng giải quyết mối lo ngại ngày càng tăng của người dùng doanh nghiệp: tính không minh bạch của các hệ thống an toàn khép kín. Khi lan can chặn nội dung, người vận hành thường không thể kiểm tra lý do. Thiết kế minh bạch, lấy chính sách làm đầu vào của Shieldstral cho phép các nhà phát triển biết chính xác quy tắc nào đưa ra phán quyết nhất định.

Động lực của trọng lượng mở rộng hơn

Shieldstral ra mắt trong bối cảnh số lượng bản phát hành AI trọng lượng mở tăng vọt trên toàn ngành. Mô hình này tham gia vào danh mục hệ thống mở đang mở rộng của Mistral, củng cố chiến lược cạnh tranh của công ty về khả năng tiếp cận và trải nghiệm của nhà phát triển thay vì quy mô biên giới thô.

Đối với các nhóm xây dựng ứng dụng AI, khả năng chạy trình phân loại an toàn đa phương thức có khả năng trên một GPU cấp độ người tiêu dùng duy nhất mà không cần gửi dữ liệu đến API của bên thứ ba sẽ giúp giảm cả chi phí lẫn rào cản về quyền riêng tư để triển khai kiểm duyệt mạnh mẽ. Điều đó có thể đẩy nhanh việc áp dụng trong các ngành được quản lý, nơi việc lưu trữ dữ liệu và khả năng kiểm toán là không thể thương lượng.

Đi trước AI

Các mô hình an toàn trọng lượng mở như Shieldstral đang thay đổi cách các nhà phát triển suy nghĩ về lan can và tốc độ đổi mới không có dấu hiệu chậm lại. Theo dõi AI Buzz Wire để có báo cáo rõ ràng, thực tế về các mô hình, công cụ và nghiên cứu thúc đẩy lĩnh vực này.

Đọc thêm tin tức về AI →