Mistral AI Shieldstral را در 4 آگوست 2026 منتشر کرد، یک طبقه‌بندی ایمنی با وزن باز با 3 میلیارد پارامتر که متن و تصاویر را بر اساس خط‌مشی‌های اعتدالی که در زمان استنتاج به زبان ساده نوشته شده‌اند، قضاوت می‌کند، به جای تکیه بر مجموعه ثابتی از دسته‌های آسیب که در طول آموزش در مدل ساخته شده است. انتشار نشان دهنده یک انحراف فلسفی قابل توجه از نحوه ساخت اکثر مدل های گاردریل امروزی است.

این مدل در Hugging Face تحت مجوز آپاچی 2.0 در دسترس است، 12 زبان را پوشش می دهد و با یک پردازنده گرافیکی 16 گیگابایتی اجرا می شود. از آنجایی که بخش هوش مصنوعی اروپا به تولید سیستم‌های با وزن باز رقابتی ادامه می‌دهد، Shieldstral بعد دیگری را به [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) اضافه می‌کند که در حال تغییر نحوه رویکرد توسعه‌دهندگان به ایمنی است.

چگونه Shieldstral کار می کند

اکثر مدل‌های نرده محافظ، طبقه‌بندی دسته‌بندی آسیب‌ها را در وزن‌های خود در طول تمرین کدگذاری می‌کنند، به این معنی که تطبیق آنها با زمینه محصول جدید نیازمند یک چرخه بازآموزی کامل است. Shieldstral اساساً رویکرد متفاوتی دارد: سیاست تعدیل به عنوان بخشی از ورودی در زمان استنتاج ارائه می شود.

با توجه به تجزیه و تحلیل Unite.AI، این مکانیسم هر وظیفه تعدیل را به پاسخگویی به سوالات دودویی کاهش می دهد. هر درخواست دارای سه بخش برچسب‌گذاری شده است: یک فیلد «دستورالعمل» حاوی زمینه ارزیابی و سطح سخت‌گیری، یک فیلد «» با یک سؤال بله/خیر مانند «آیا این محتوا خشونت فیزیکی را ترویج می‌کند؟» و یک فیلد «<سند>» که محتوا را برای قضاوت نگه می‌دارد، که می‌تواند یک درخواست، یک پاسخ، یک عکس فوری-پاسخ با یک جفت متن یا یک گزینه باشد.

در استنباط، مدل فقط لاجیت‌های نشانه‌های «بله» و «خیر» را می‌خواند و softmax آنها را به یک امتیاز پیوسته، با آستانه 0.5 برای یک حکم باینری، عادی می‌کند. این فرمول به یک ایست بازرسی اجازه می‌دهد تا طبقه‌بندی سریع، تعدیل پاسخ، تشخیص امتناع و تشخیص سمیت را به عنوان نمونه‌هایی از همان مشکل اساسی جذب کند.

یک ایست بازرسی، بسیاری از سیاست ها

مفهوم عملی آن قابل توجه است. همان ایست بازرسی می‌تواند ابزار تحقیق امنیت سایبری و پلتفرم سلامت روان را در برابر استانداردهای کاملاً متفاوت بدون تغییر بررسی کند. یک اپراتور یک سوال بله/خیر می‌نویسد، دستورالعملی را ارائه می‌کند که زمینه ارزیابی و سخت‌گیری را توصیف می‌کند، و مدل یک امتیاز ایمنی کالیبره‌شده را از یک خروجی توکن برمی‌گرداند.

این طراحی تطبیقی ​​با خط مشی، یکی از ناامیدی‌های مداوم در استقرار سیستم‌های ایمنی هوش مصنوعی را برطرف می‌کند: دشواری تنظیم اعتدال برای موارد استفاده خاص بدون آموزش مجدد پرهزینه. یک چت ربات خدمات مالی، یک برنامه آموزشی برای کودکان و یک انجمن باز برای محققان امنیتی، همگی به نرده‌های محافظ کاملاً متفاوتی نیاز دارند و هدف Shieldstral این است که هر سه را از یک مجموعه وزنی مدیریت کند.

معماری و عملکرد

Shieldstral بر روی Ministral-3-3B، مدل کوچک چندوجهی Mistral، با یک رمزگذار بینایی Pixtral که ورودی های تصویر را مدیریت می کند، ساخته شده است. کارت مدل یک پنجره زمینه 32000 توکن را فهرست می‌کند و Mistral می‌گوید این مدل با مدل‌های گارد باز تا هفت برابر اندازه آن در معیارهای ایمنی متن مطابقت دارد و در عین حال وضعیت جدیدی از هنر را در تعدیل چند وجهی ایجاد می‌کند.

اینها ادعاهای قوی برای یک مدل با پارامتر 3B هستند، و Mistral از انتشار آن با مقدار غیرمعمول اسناد پشتیبانی کرد. یک گزارش فنی که دستورالعمل آموزشی و ارزیابی را تشریح می‌کند در 28 ژوئیه 2026 در arXiv پست شد و به دنبال آن کارت مدل کامل در مستندات Mistral و خود وزن‌ها که هر دو در 4 اوت منتشر شدند، ارسال شد.

نقدی دقیق از وضعیت موجود

میسترال انتشار Shieldstral را حول یک انتقاد برجسته از نحوه ساخت مدل‌های نرده محافظ معمولی قاب‌بندی کرد. این شرکت استدلال می‌کند که کدگذاری سخت طبقه‌بندی‌ها به وزن مدل‌ها، انعطاف‌ناپذیری ایجاد می‌کند و توسعه‌دهندگان را مجبور می‌کند هر بار که یک سیاست تغییر می‌کند یا محصول جدیدی راه‌اندازی می‌شود، حلقه‌ها را دوباره آموزش دهند.

این بیش از یک استدلال فنی است. این یک بیانیه موقعیت یابی رقابتی است. Mistral با انتشار یک مدل دارای مجوز Apache-2.0 که می‌تواند بدون آموزش مجدد میزبانی شود و سازگار شود، توسعه‌دهندگانی را هدف قرار می‌دهد که می‌خواهند روی پشته ایمنی خود بدون سربار سرویس‌های مدیریت شده یا طبقه‌بندی‌کننده‌های اختصاصی کنترل داشته باشند.

رویکرد وزن‌های باز به نگرانی فزاینده‌ای در میان کاربران سازمانی می‌پردازد: کدورت سیستم‌های ایمنی بسته. هنگامی که یک نرده محافظ محتوا را مسدود می کند، اپراتورها اغلب نمی توانند دلیل آن را بررسی کنند. طراحی شفاف و سیاستی به عنوان ورودی Shieldstral به توسعه دهندگان این امکان را می دهد که ببینند دقیقاً کدام قانون یک حکم معین را ایجاد کرده است.

حرکت وزنه های باز گسترده تر

Shieldstral در بحبوحه جهش گسترده‌تر انتشارات هوش مصنوعی وزن باز در سراسر صنعت وارد می‌شود. این مدل به مجموعه رو به گسترش سیستم‌های باز Mistral می‌پیوندد و استراتژی شرکت را برای رقابت در دسترسی و تجربه توسعه‌دهنده به جای مقیاس مرزی خام تقویت می‌کند.

برای تیم‌هایی که برنامه‌های هوش مصنوعی می‌سازند، توانایی اجرای یک طبقه‌بندی کننده ایمنی چندوجهی توانا بر روی یک واحد پردازش گرافیکی درجه یک مصرف‌کننده، بدون ارسال داده‌ها به یک API شخص ثالث، هم هزینه و هم مانع حفظ حریم خصوصی را برای به کارگیری اعتدال قوی کاهش می‌دهد. این امر می تواند پذیرش در صنایع تحت نظارت را تسریع کند، جایی که اقامت داده ها و قابلیت حسابرسی غیرقابل مذاکره هستند.

از هوش مصنوعی جلوتر بمانید

مدل‌های ایمنی با وزن باز مانند Shieldstral در حال تغییر نحوه تفکر توسعه‌دهندگان در مورد نرده‌های محافظ هستند و سرعت نوآوری هیچ نشانه‌ای از کاهش نشان نمی‌دهد. [AI Buzz Wire] (https://aibuzzwire.news) را برای گزارش واضح و واقعی در مورد مدل‌ها، ابزارها و تحقیقاتی که در این زمینه پیشرفت می‌کنند، دنبال کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →