أصدرت Mistral AI جهاز Shieldstral في 4 أغسطس 2026، وهو مصنف أمان ذو أوزان مفتوحة مكون من 3 مليارات معلمة يحكم على النصوص والصور مقابل سياسات الإشراف المكتوبة بلغة واضحة في وقت الاستدلال، بدلاً من الاعتماد على مجموعة ثابتة من فئات الضرر المضمنة في النموذج أثناء التدريب. يمثل الإصدار خروجًا فلسفيًا ملحوظًا عن كيفية بناء معظم نماذج الدرابزين اليوم.

النموذج متاح على Hugging Face بموجب ترخيص Apache 2.0، ويغطي 12 لغة، ويعمل على وحدة معالجة رسومات واحدة بسعة 16 جيجابايت. مع استمرار قطاع الذكاء الاصطناعي الأوروبي في إنتاج أنظمة تنافسية مفتوحة الوزن، تضيف شركة Shieldstral بُعدًا آخر إلى أخبار الذكاء الاصطناعي العاجلة التي تعيد تشكيل كيفية تعامل المطورين مع السلامة.

كيف يعمل شيلدسترال

تقوم معظم نماذج الدرابزين بترميز تصنيف فئات الضرر في أوزانها أثناء التدريب، مما يعني أن تكييفها مع سياق منتج جديد يتطلب دورة إعادة تدريب كاملة. يتخذ Shieldstral نهجًا مختلفًا بشكل أساسي: يتم توفير سياسة الإشراف كجزء من الإدخال في وقت الاستدلال.

وفقًا لتحليل Unite.AI، فإن الآلية تقلل كل مهمة إشراف إلى إجابة ثنائية للأسئلة. يحتوي كل طلب على ثلاثة أجزاء ذات علامات: حقل `<إرشاد>` يتضمن سياق التقييم ومستوى الصرامة، وحقل `<استعلام>` به سؤال واحد بنعم/لا مثل "هل يشجع هذا المحتوى على العنف الجسدي؟"، وحقل `<مستند>` يشتمل على المحتوى الذي سيتم الحكم عليه، والذي يمكن أن يكون مطالبة، أو إجابة، أو زوجًا من الاستجابة السريعة، أو صورة بنص اختياري.

عند الاستدلال، يقرأ النموذج فقط سجلات الرموز المميزة "نعم" و"لا" ويقوم softmax بتطبيعها في درجة مستمرة، عند عتبة 0.5 للحكم الثنائي. تتيح هذه الصيغة لنقطة تفتيش واحدة استيعاب التصنيف الفوري، واعتدال الاستجابة، واكتشاف الرفض، واكتشاف السمية كأمثلة لنفس المشكلة الأساسية.

نقطة تفتيش واحدة، سياسات متعددة

التأثير العملي مهم. ومن الممكن أن تقوم نفس نقطة التفتيش بفحص أداة أبحاث الأمن السيبراني ومنصة الصحة العقلية في مقابل معايير مختلفة تماما دون تعديل. يكتب المشغل سؤال نعم/لا، ويقدم تعليمات تصف سياق التقييم وصرامة التقييم، ويعيد النموذج درجة أمان تمت معايرتها من مخرج رمزي واحد.

يعالج هذا التصميم المتكيف مع السياسات أحد الإحباطات المستمرة في نشر أنظمة أمان الذكاء الاصطناعي: صعوبة تكييف الاعتدال مع حالات استخدام محددة دون إعادة تدريب باهظة الثمن. يحتاج برنامج الدردشة الآلي للخدمات المالية، والتطبيق التعليمي للأطفال، والمنتدى المفتوح للباحثين في مجال الأمن، إلى حواجز حماية مختلفة جذريًا، ويهدف Shieldstral إلى التعامل مع الثلاثة من نفس مجموعة الأوزان.

الهندسة المعمارية والأداء

تم بناء Shieldstral على Ministral-3-3B، وهو نموذج صغير متعدد الوسائط من Mistral، مع جهاز تشفير رؤية Pixtral يتعامل مع مدخلات الصور. تسرد بطاقة النموذج نافذة سياق مكونة من 32000 رمز مميز، وتقول ميسترال إن النموذج يطابق نماذج الحماية المفتوحة بما يصل إلى سبعة أضعاف حجمها في معايير أمان النص مع وضع حالة جديدة من التقدم في الإشراف متعدد الوسائط.

هذه مطالبات قوية لنموذج 3B، وقد دعمت ميسترال الإصدار بكمية غير عادية من الوثائق. تم نشر تقرير فني يصف وصفة التدريب والتقييم على arXiv في 28 يوليو 2026، متبوعًا ببطاقة النموذج الكاملة في وثائق ميسترال والأوزان نفسها، وكلاهما صدر في 4 أغسطس.

نقد واضح للوضع الراهن

قامت ميسترال بتأطير إصدار Shieldstral حول نقد محدد لكيفية إنشاء نماذج الدرابزين عادةً. تجادل الشركة بأن التصنيفات الضارة ذات الترميز الصعب في أوزان النماذج تخلق عدم المرونة، مما يجبر المطورين على إعادة التدريب في كل مرة تتغير فيها السياسة أو يتم إطلاق منتج جديد.

هذه أكثر من مجرد حجة فنية. إنه بيان تحديد المواقع التنافسية. من خلال إطلاق نموذج مرخص من Apache-2.0 والذي يمكن استضافته ذاتيًا وتكييفه دون إعادة التدريب، تستهدف ميسترال المطورين الذين يريدون التحكم في حزمة الأمان الخاصة بهم دون تحمل تكاليف الخدمات المُدارة أو المصنفات الخاصة.

يعالج نهج الأوزان المفتوحة أيضًا القلق المتزايد بين مستخدمي المؤسسات: عتامة أنظمة السلامة المغلقة. عندما يحجب حاجز الحماية المحتوى، لا يتمكن المشغلون في كثير من الأحيان من التحقق من السبب. يتيح تصميم Shieldstral الشفاف للسياسة كمدخل للمطورين معرفة القاعدة التي أنتجت حكمًا معينًا بالضبط.

الزخم الأوسع للأوزان المفتوحة

يصل Shieldstral وسط طفرة أوسع في إصدارات الذكاء الاصطناعي ذات الوزن المفتوح عبر الصناعة. وينضم هذا النموذج إلى محفظة ميسترال المتوسعة من الأنظمة المفتوحة، مما يعزز استراتيجية الشركة المتمثلة في التنافس على إمكانية الوصول وتجربة المطورين بدلاً من النطاق الحدودي الأولي.

بالنسبة للفرق التي تقوم ببناء تطبيقات الذكاء الاصطناعي، فإن القدرة على تشغيل مصنف أمان متعدد الوسائط قادر على وحدة معالجة رسومات واحدة من فئة المستهلك، دون إرسال البيانات إلى واجهة برمجة تطبيقات تابعة لجهة خارجية، يقلل من التكلفة وحاجز الخصوصية لنشر الإشراف القوي. ويمكن أن يؤدي ذلك إلى تسريع عملية التبني في الصناعات المنظمة حيث لا يمكن التفاوض على مكان إقامة البيانات وقابلية التدقيق.

ابق في صدارة الذكاء الاصطناعي

تعمل نماذج السلامة ذات الوزن المفتوح مثل Shieldstral على تغيير طريقة تفكير المطورين في حواجز الحماية، ولا تظهر وتيرة الابتكار أي علامة على التباطؤ. تابع AI Buzz Wire للحصول على تقارير واضحة وواقعية حول النماذج والأدوات والأبحاث التي تعمل على تطوير هذا المجال.

اقرأ المزيد من أخبار الذكاء الاصطناعي →