Mistral AI mengeluarkan Shieldstral pada 4 Ogos 2026, pengelas keselamatan berwajaran terbuka 3 bilion parameter yang menilai teks dan imej terhadap dasar penyederhanaan yang ditulis dalam bahasa biasa pada masa inferens, dan bukannya bergantung pada set kategori bahaya tetap yang dimasukkan ke dalam model semasa latihan. Keluaran ini mewakili perubahan falsafah yang ketara daripada cara kebanyakan model pagar dibina hari ini.

Model ini tersedia pada Hugging Face di bawah lesen Apache 2.0, merangkumi 12 bahasa dan berjalan pada satu GPU 16GB. Memandangkan sektor AI Eropah terus menghasilkan sistem berwajaran terbuka yang kompetitif, Shieldstral menambah dimensi lain pada berita terbaharu AI yang membentuk semula cara pembangun mendekati keselamatan.

Cara Shieldstral Berfungsi

Kebanyakan model pagar mengekod keras taksonomi kategori bahaya ke dalam pemberat mereka semasa latihan, yang bermaksud menyesuaikannya kepada konteks produk baharu memerlukan kitaran latihan semula penuh. Shieldstral mengambil pendekatan yang berbeza secara asas: dasar penyederhanaan dibekalkan sebagai sebahagian daripada input pada masa inferens.

Menurut analisis Unite.AI, mekanisme itu mengurangkan setiap tugas penyederhanaan kepada menjawab soalan binari. Setiap permintaan mempunyai tiga bahagian yang ditag: medan `` yang membawa konteks penilaian dan tahap ketegasan, medan `` dengan satu soalan ya/tidak seperti "Adakah kandungan ini menggalakkan keganasan fizikal?" dan medan `` yang menahan kandungan untuk menilai, yang boleh berupa gesaan, respons, pasangan balasan segera teks atau imej dengan pilihan.

Pada inferens, model hanya membaca logit untuk token "ya" dan "tidak" dan softmax-menormalkannya menjadi skor berterusan, ambang pada 0.5 untuk keputusan binari. Formulasi itu membolehkan satu pusat pemeriksaan menyerap pengelasan segera, penyederhanaan tindak balas, pengesanan penolakan dan pengesanan ketoksikan sebagai contoh masalah asas yang sama.

Satu Pusat Pemeriksaan, Banyak Polisi

Implikasi praktikal adalah penting. Pusat pemeriksaan yang sama boleh menapis alat penyelidikan keselamatan siber dan platform kesihatan mental terhadap standard yang sama sekali berbeza tanpa pengubahsuaian. Operator menulis soalan ya/tidak, membekalkan arahan yang menerangkan konteks penilaian dan ketegasan, dan model mengembalikan skor keselamatan yang ditentukur daripada output token tunggal.

Reka bentuk penyesuaian dasar ini menangani salah satu kekecewaan yang berterusan dalam menggunakan sistem keselamatan AI: kesukaran menyesuaikan penyederhanaan kepada kes penggunaan tertentu tanpa latihan semula yang mahal. Bot sembang perkhidmatan kewangan, apl pendidikan kanak-kanak dan forum terbuka untuk penyelidik keselamatan semuanya memerlukan pagar yang berbeza secara radikal dan Shieldstral bertujuan untuk mengendalikan ketiga-tiga daripada set pemberat yang sama.

Seni Bina dan Prestasi

Shieldstral dibina pada Ministral-3-3B, model multimodal kecil Mistral, dengan pengekod penglihatan Pixtral yang mengendalikan input imej. Kad model menyenaraikan tetingkap konteks 32,000 token, dan Mistral berkata model itu sepadan dengan model pengawal terbuka sehingga tujuh kali ganda saiznya pada penanda aras keselamatan teks sambil menetapkan keadaan seni baharu pada penyederhanaan multimodal.

Itu adalah tuntutan kukuh untuk model parameter 3B, dan Mistral menyokong keluaran itu dengan jumlah dokumentasi yang luar biasa. Laporan teknikal yang menerangkan resipi latihan dan penilaian telah disiarkan ke arXiv pada 28 Julai 2026, diikuti dengan kad model penuh dalam dokumentasi Mistral dan pemberat itu sendiri, kedua-duanya dikeluarkan pada 4 Ogos.

Kritikan Pedas Terhadap Status Quo

Mistral membingkai keluaran Shieldstral di sekeliling kritikan tajam tentang cara model pagar biasanya dibina. Syarikat itu berhujah bahawa pengekodan keras memudaratkan taksonomi ke dalam pemberat model mewujudkan ketidakfleksibelan, memaksa pembangun untuk melatih semula gelung setiap kali dasar berubah atau produk baharu dilancarkan.

Ini lebih daripada hujah teknikal; ia adalah pernyataan kedudukan kompetitif. Dengan mengeluarkan model berlesen Apache-2.0 yang boleh dihoskan sendiri dan disesuaikan tanpa latihan semula, Mistral menyasarkan pembangun yang mahukan kawalan ke atas timbunan keselamatan mereka tanpa overhed perkhidmatan terurus atau pengelas proprietari.

Pendekatan wajaran terbuka juga menangani kebimbangan yang semakin meningkat di kalangan pengguna perusahaan: kelegapan sistem keselamatan tertutup. Apabila pagar menghalang kandungan, pengendali selalunya tidak dapat memeriksa sebabnya. Reka bentuk telus, dasar sebagai input Shieldstral membolehkan pembangun melihat dengan tepat peraturan yang menghasilkan keputusan yang diberikan.

Momentum Wajaran Terbuka yang Lebih Luas

Shieldstral tiba di tengah-tengah lonjakan yang lebih luas dalam keluaran AI berat terbuka di seluruh industri. Model itu menyertai portfolio sistem terbuka Mistral yang berkembang, mengukuhkan strategi syarikat untuk bersaing dalam kebolehcapaian dan pengalaman pembangun berbanding skala sempadan mentah.

Bagi pasukan yang membina aplikasi AI, keupayaan untuk menjalankan pengelas keselamatan berbilang mod yang berkebolehan pada GPU gred pengguna tunggal, tanpa menghantar data kepada API pihak ketiga, mengurangkan kedua-dua kos dan halangan privasi untuk menggunakan penyederhanaan yang teguh. Itu boleh mempercepatkan penggunaan dalam industri terkawal di mana pemastautin data dan kebolehauditan tidak boleh dirunding.

Kekal Mendahului AI

Model keselamatan berat terbuka seperti Shieldstral mengubah cara pemaju berfikir tentang pagar, dan rentak inovasi tidak menunjukkan tanda perlahan. Ikuti AI Buzz Wire untuk mendapatkan laporan yang jelas dan berfakta tentang model, alatan dan penyelidikan yang memajukan bidang tersebut.

Baca lebih banyak berita AI →