Mistral AI Shieldstral را در 4 آگوست 2026 منتشر کرد، یک طبقهبندی ایمنی با وزن باز با 3 میلیارد پارامتر که متن و تصاویر را بر اساس خطمشیهای اعتدالی که در زمان استنتاج به زبان ساده نوشته شدهاند، قضاوت میکند، به جای تکیه بر مجموعه ثابتی از دستههای آسیب که در طول آموزش در مدل ساخته شده است. انتشار نشان دهنده یک انحراف فلسفی قابل توجه از نحوه ساخت اکثر مدل های گاردریل امروزی است.
این مدل در Hugging Face تحت مجوز آپاچی 2.0 در دسترس است، 12 زبان را پوشش می دهد و با یک پردازنده گرافیکی 16 گیگابایتی اجرا می شود. از آنجایی که بخش هوش مصنوعی اروپا به تولید سیستمهای با وزن باز رقابتی ادامه میدهد، Shieldstral بعد دیگری را به [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) اضافه میکند که در حال تغییر نحوه رویکرد توسعهدهندگان به ایمنی است.
چگونه Shieldstral کار می کند
اکثر مدلهای نرده محافظ، طبقهبندی دستهبندی آسیبها را در وزنهای خود در طول تمرین کدگذاری میکنند، به این معنی که تطبیق آنها با زمینه محصول جدید نیازمند یک چرخه بازآموزی کامل است. Shieldstral اساساً رویکرد متفاوتی دارد: سیاست تعدیل به عنوان بخشی از ورودی در زمان استنتاج ارائه می شود.
با توجه به تجزیه و تحلیل Unite.AI، این مکانیسم هر وظیفه تعدیل را به پاسخگویی به سوالات دودویی کاهش می دهد. هر درخواست دارای سه بخش برچسبگذاری شده است: یک فیلد «دستورالعمل» حاوی زمینه ارزیابی و سطح سختگیری، یک فیلد «
در استنباط، مدل فقط لاجیتهای نشانههای «بله» و «خیر» را میخواند و softmax آنها را به یک امتیاز پیوسته، با آستانه 0.5 برای یک حکم باینری، عادی میکند. این فرمول به یک ایست بازرسی اجازه میدهد تا طبقهبندی سریع، تعدیل پاسخ، تشخیص امتناع و تشخیص سمیت را به عنوان نمونههایی از همان مشکل اساسی جذب کند.
یک ایست بازرسی، بسیاری از سیاست ها
مفهوم عملی آن قابل توجه است. همان ایست بازرسی میتواند ابزار تحقیق امنیت سایبری و پلتفرم سلامت روان را در برابر استانداردهای کاملاً متفاوت بدون تغییر بررسی کند. یک اپراتور یک سوال بله/خیر مینویسد، دستورالعملی را ارائه میکند که زمینه ارزیابی و سختگیری را توصیف میکند، و مدل یک امتیاز ایمنی کالیبرهشده را از یک خروجی توکن برمیگرداند.
این طراحی تطبیقی با خط مشی، یکی از ناامیدیهای مداوم در استقرار سیستمهای ایمنی هوش مصنوعی را برطرف میکند: دشواری تنظیم اعتدال برای موارد استفاده خاص بدون آموزش مجدد پرهزینه. یک چت ربات خدمات مالی، یک برنامه آموزشی برای کودکان و یک انجمن باز برای محققان امنیتی، همگی به نردههای محافظ کاملاً متفاوتی نیاز دارند و هدف Shieldstral این است که هر سه را از یک مجموعه وزنی مدیریت کند.
معماری و عملکرد
Shieldstral بر روی Ministral-3-3B، مدل کوچک چندوجهی Mistral، با یک رمزگذار بینایی Pixtral که ورودی های تصویر را مدیریت می کند، ساخته شده است. کارت مدل یک پنجره زمینه 32000 توکن را فهرست میکند و Mistral میگوید این مدل با مدلهای گارد باز تا هفت برابر اندازه آن در معیارهای ایمنی متن مطابقت دارد و در عین حال وضعیت جدیدی از هنر را در تعدیل چند وجهی ایجاد میکند.
اینها ادعاهای قوی برای یک مدل با پارامتر 3B هستند، و Mistral از انتشار آن با مقدار غیرمعمول اسناد پشتیبانی کرد. یک گزارش فنی که دستورالعمل آموزشی و ارزیابی را تشریح میکند در 28 ژوئیه 2026 در arXiv پست شد و به دنبال آن کارت مدل کامل در مستندات Mistral و خود وزنها که هر دو در 4 اوت منتشر شدند، ارسال شد.
نقدی دقیق از وضعیت موجود
میسترال انتشار Shieldstral را حول یک انتقاد برجسته از نحوه ساخت مدلهای نرده محافظ معمولی قاببندی کرد. این شرکت استدلال میکند که کدگذاری سخت طبقهبندیها به وزن مدلها، انعطافناپذیری ایجاد میکند و توسعهدهندگان را مجبور میکند هر بار که یک سیاست تغییر میکند یا محصول جدیدی راهاندازی میشود، حلقهها را دوباره آموزش دهند.
این بیش از یک استدلال فنی است. این یک بیانیه موقعیت یابی رقابتی است. Mistral با انتشار یک مدل دارای مجوز Apache-2.0 که میتواند بدون آموزش مجدد میزبانی شود و سازگار شود، توسعهدهندگانی را هدف قرار میدهد که میخواهند روی پشته ایمنی خود بدون سربار سرویسهای مدیریت شده یا طبقهبندیکنندههای اختصاصی کنترل داشته باشند.
رویکرد وزنهای باز به نگرانی فزایندهای در میان کاربران سازمانی میپردازد: کدورت سیستمهای ایمنی بسته. هنگامی که یک نرده محافظ محتوا را مسدود می کند، اپراتورها اغلب نمی توانند دلیل آن را بررسی کنند. طراحی شفاف و سیاستی به عنوان ورودی Shieldstral به توسعه دهندگان این امکان را می دهد که ببینند دقیقاً کدام قانون یک حکم معین را ایجاد کرده است.
حرکت وزنه های باز گسترده تر
Shieldstral در بحبوحه جهش گستردهتر انتشارات هوش مصنوعی وزن باز در سراسر صنعت وارد میشود. این مدل به مجموعه رو به گسترش سیستمهای باز Mistral میپیوندد و استراتژی شرکت را برای رقابت در دسترسی و تجربه توسعهدهنده به جای مقیاس مرزی خام تقویت میکند.
برای تیمهایی که برنامههای هوش مصنوعی میسازند، توانایی اجرای یک طبقهبندی کننده ایمنی چندوجهی توانا بر روی یک واحد پردازش گرافیکی درجه یک مصرفکننده، بدون ارسال دادهها به یک API شخص ثالث، هم هزینه و هم مانع حفظ حریم خصوصی را برای به کارگیری اعتدال قوی کاهش میدهد. این امر می تواند پذیرش در صنایع تحت نظارت را تسریع کند، جایی که اقامت داده ها و قابلیت حسابرسی غیرقابل مذاکره هستند.
از هوش مصنوعی جلوتر بمانید
مدلهای ایمنی با وزن باز مانند Shieldstral در حال تغییر نحوه تفکر توسعهدهندگان در مورد نردههای محافظ هستند و سرعت نوآوری هیچ نشانهای از کاهش نشان نمیدهد. [AI Buzz Wire] (https://aibuzzwire.news) را برای گزارش واضح و واقعی در مورد مدلها، ابزارها و تحقیقاتی که در این زمینه پیشرفت میکنند، دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →