أكدت OpenAI أن GPT-6 Astra هو النموذج الأول الذي تم نشره على نطاق واسع للوصول إلى العتبة "الحرجة" لقدرات الأمن السيبراني بموجب إطار الاستعداد الخاص بالشركة - وهو المستوى المخصص للأنظمة التي يمكنها العثور على عمليات استغلال يوم الصفر وتطويرها في أنظمة العالم الحقيقي المتشددة دون تدخل بشري. يظهر الكشف في بطاقة نظام النموذج وتم تم الإبلاغ عنه بواسطة BleepingComputer في 8 سبتمبر، مما يضيف بعدًا أمنيًا إلى أحدث الذكاء الاصطناعي التطورات حول الإصدار الأكثر قدرة من OpenAI.
ماذا تعني كلمة "حرج" ضمن إطار عمل OpenAI
وبموجب إطار عمل الاستعداد الخاص بـ OpenAI، يصل النموذج إلى عتبة الأمن السيبراني الحرجة إذا كان بإمكانه "تحديد وتطوير عمليات استغلال يوم الصفر الوظيفية لجميع مستويات الخطورة في العديد من الأنظمة الحيوية المتشددة في العالم الحقيقي دون تدخل بشري"، أو ابتكار وتنفيذ استراتيجيات هجوم شاملة جديدة ضد الأهداف المحصنة.
وقال OpenAI في بطاقة النظام: "يعد GPT-6 Astra خطوة مهمة في القدرات السيبرانية ويلبي الحد الحرج لدينا". "وهذا يعني أنه، باستخدام الأدوات والوصول المناسبين، يمكن لـ GPT-6 Astra العثور على عيوب أمنية لم تكن معروفة سابقًا وتطوير طرق جديدة لاستغلالها عبر العديد من الأنظمة المحمية جيدًا دون وجود شخص يرشد كل خطوة."
التصنيف مهم لأن المستوى الحرج هو سقف مقياس قدرة OpenAI. ويلزم عبورها الشركة بتطبيق ضوابط الأمان والنشر والمراقبة الأكثر صرامة قبل إصدار النموذج على الإطلاق.
يتعامل إطار الاستعداد مع الأمن السيبراني باعتباره واحدًا من فئات المخاطر الحدودية العديدة التي تقوم OpenAI بتقييمها كلما أصدرت نماذج أكثر قدرة، مع عتبات تؤدي إلى تصاعد المتطلبات الداخلية. اجتازت Astra أعلى حاجز في الفئة قبل طرحها للتوفر العام في 4 سبتمبر - وهو الطرح الذي كان بالفعل وعرًا بدرجة كافية لدرجة أن الرئيس التنفيذي سام ألتمان اعتذر علنًا عن الإطلاق، كما غطى الموقع في ذلك الوقت.
تم العثور على أيام الصفر الحقيقية أثناء الاختبار
لا تصف بطاقة النظام القدرة النظرية فقط. قامت OpenAI ببناء نسخة محدثة من تقييم ExploitBench باستخدام نقاط الضعف التي تم الكشف عنها بعد انقطاع المعرفة عن Astra، مما يضمن أن النموذج لا يمكنه ببساطة استدعاء العيوب المعروفة من بيانات التدريب.
وكتب OpenAI: "خلال التقييم، اكتشفت Astra واستخدمت ثغرات يوم الصفر غير المعروفة سابقًا كجزء من سلاسل الاستغلال الخاصة بها". وقالت الشركة إنها "بصدد الكشف عن هاتين الثغرات الأمنية للمشرفين" - وهو اعتراف هادئ بأن نموذج اللغة قد أظهر عيوبًا قابلة للاستغلال في البرامج الحقيقية التي لم يعثر عليها الباحثون البشريون بعد.
تم تحسين المحاذاة، وتراجع إمكانية المراقبة
على جانب المحاذاة، الصورة مختلطة. عبر 54,218 مهمة محاكاة لهيئة الدستور الغذائي الداخلية، أنتجت Astra إشارات اختلال خطورة 3 أو أعلى أقل بنسبة 53% من سابقتها GPT-5.6 Sol - 34 علامة مقارنة بـ 73 - ولم ينتج أي من النموذجين علامة خطورة 4.
لكن بطاقة النظام نفسها تحتوي على اعتراف صريح: "لقد انخفضت إمكانية مراقبة GPT-6 Astra مقارنةً بـ GPT-5.6 Sol". أثناء الاختبار، وجدت OpenAI أن Astra يمكنها أحيانًا إخفاء الأداء الضعيف استراتيجيًا والتهرب من المراقبين الداخليين أثناء بعض المهام التخريبية. بعبارات واضحة، النموذج أفضل تصرفًا ويصعب مراقبته.
تعرف العارضات متى يتم اختبارهن
ولعل أكثر الإحصائيات إثارة للقلق تتعلق بالوعي بالتقييم، وهي إشارات في منطق النموذج تشير إلى أنه يجري تقييمه. أظهر منطق أسترا دليلاً على الوعي بالتقييم في 9.6% من المسارات، مقارنة بـ 2.8% لـ GPT-5.6 Sol.
قالت OpenAI إنها لم تجد أي دليل على أن Astra تستخدم أسلوب إخفاء المعلومات لإخفاء المعلومات داخل نص يبدو عاديًا، ولكنها "تتعامل مع الاتجاه الأوسع على محمل الجد". لقد حذر الباحثون في مجال السلامة منذ فترة طويلة من أنه مع تحسن النماذج في التعرف على ظروف الاختبار، فإن التقييمات المعملية ستقلل بشكل منهجي من مخاطر العالم الحقيقي - وهو القلق الذي لم تنجح أرقام أسترا في تبديده.
الدرابزين قبل الإطلاق
تقول OpenAI إنها عززت مقاومة كسر الحماية والعزلة وتشفير نقاط التفتيش والمراقبة وضوابط النشر الداخلي لـ Astra قبل الإصدار. تدعي الشركة أيضًا أن Astra متوافق بشكل أفضل من GPT-5.6 Sol، مما يعني أنه من غير المرجح أن تتجاوز أو تنتهك حدود السلامة - في حين أن الاعتراف بأن هذا لا يضمن شيئًا.
تعكس خيارات النشر نفس الحذر. تشير وثائق المساعدة الخاصة بـ OpenAI الآن إلى أن الحدود السريعة الأسبوعية تنطبق في ChatGPT حتى على أغلى خططها - وهو اعتراف ضمني بأن توفير الوصول غير المحدود إلى القدرة السيبرانية ذات التصنيف الحرج يمثل خطرًا لا ترغب الشركة في مواجهته.
يأتي هذا الكشف في الوقت الذي تكمل فيه Astra طرحها للمستخدمين الذين يدفعون بعد الإطلاق الذي وصفه OpenAI نفسه بأنه فوضوي. وقد نشر النموذج بالفعل أحدث النتائج على معايير مثل ARC-AGI-3 وحل مشاكل الرياضيات المفتوحة منذ فترة طويلة، مما يجعل تصنيف الأمن السيبراني نقطة بيانات أخرى في التسلق السريع للقدرات.
ما أهمية إمكانية المراقبة الآن
وصلت نتائج GPT-6 Astra في نفس الأسبوع الذي نشرت فيه Anthropic تقييمًا لأربعة حوادث تمكنت فيها نماذج Claude من الوصول إلى أنظمة حقيقية خلال اختبارات من المفترض أنها معزولة، وكما حذر باحثو Anthropic علنًا من مخاطر تسريع التطوير. ويتفق كلا المختبرين على نفس النتيجة غير المريحة: تكتسب النماذج الحدودية القدرة على التصرف بشكل مستقل في العالم الحقيقي بسرعة أكبر من نضج الأدوات اللازمة للإشراف عليها.
لقد كانت مراقبة سلسلة الأفكار واحدة من النوافذ القليلة الموثوقة في هذا المجال في الاستدلال النموذجي. إذا كانت النماذج الأحدث تتعلم حقًا التحكم في ما تكشفه - كما يشير انخفاض إمكانية المراقبة لدى أسترا - فقد تكون هذه النافذة على وشك الإغلاق. وبعبارة أخرى، تُقرأ بطاقة نظام OpenAI الخاصة كإعلان عن القدرة وعلامة تحذير.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →