OpenAI نے تصدیق کی ہے کہ GPT-6 Astra وہ پہلا ماڈل ہے جو اس نے کمپنی کے تیاری کے فریم ورک کے تحت سائبر سیکیورٹی کی صلاحیتوں کے لیے "کریٹیکل" حد تک پہنچنے کے لیے وسیع پیمانے پر تعینات کیا ہے - یہ سطح ایسے نظاموں کے لیے مخصوص ہے جو انسانی مداخلت کے بغیر سخت حقیقی دنیا کے نظاموں میں صفر دن کے کارناموں کو تلاش اور ترقی کر سکتے ہیں۔ یہ انکشاف ماڈل کے سسٹم کارڈ میں ظاہر ہوتا ہے اور اسے BleepingComputer کی طرف سے رپورٹ کیا گیا تھا OpenAI کی سب سے زیادہ قابل ریلیز کے ارد گرد۔
OpenAI کے فریم ورک کے تحت "تنقیدی" کا کیا مطلب ہے۔
OpenAI کے تیاری کے فریم ورک کے تحت، ایک ماڈل سائبرسیکیوریٹی کی سنگین حد تک پہنچ جاتا ہے اگر وہ "انسانی مداخلت کے بغیر بہت سے سخت حقیقی دنیا کے اہم نظاموں میں تمام شدت کی سطحوں کے فعال صفر دن کے کارناموں کی شناخت اور ترقی کر سکتا ہے،" یا نئے اختتام سے آخر تک حملے کے سخت اہداف کے خلاف حکمت عملی وضع کر کے ان پر عمل درآمد کر سکتا ہے۔
OpenAI نے سسٹم کارڈ میں کہا، "GPT-6 Astra سائبر صلاحیتوں میں ایک اہم قدم ہے اور ہماری اہم حد کو پورا کرتا ہے۔" "اس کا مطلب یہ ہے کہ، صحیح ٹولز اور رسائی کے ساتھ، GPT-6 Astra پہلے سے نامعلوم سیکورٹی خامیوں کو تلاش کر سکتا ہے اور ہر قدم کی رہنمائی کیے بغیر بہت سے محفوظ نظاموں میں ان کا فائدہ اٹھانے کے نئے طریقے تیار کر سکتا ہے۔"
درجہ بندی اہمیت رکھتی ہے کیونکہ تنقید OpenAI کی صلاحیت کے پیمانے کی حد ہے۔ اس کو عبور کرنا کمپنی کو پابند کرتا ہے کہ وہ اپنی سخت ترین سیکیورٹی، تعیناتی، اور نگرانی کے کنٹرولز کو لاگو کرے، اس سے پہلے کہ ماڈل کو بالکل بھی جاری کیا جائے۔
تیاری کا فریم ورک سائبرسیکیوریٹی کو کئی فرنٹیئر رسک زمروں میں سے ایک کے طور پر دیکھتا ہے جس کا اوپن اے آئی اس وقت جائزہ لیتا ہے جب وہ زیادہ قابل ماڈلز جاری کرتا ہے، ان حدوں کے ساتھ جو اندرونی ضروریات کو بڑھاتے ہیں۔ Astra نے 4 ستمبر کو اپنی عام دستیابی کے رول آؤٹ سے پہلے زمرہ میں سب سے زیادہ بار کو صاف کیا - ایک رول آؤٹ جو پہلے ہی کافی گڑبڑ تھا کہ سی ای او سیم آلٹ مین نے اس لانچ کے لیے عوامی طور پر معذرت کی، جیسا کہ اس وقت سائٹ کا احاطہ کیا گیا تھا۔
اسے جانچ کے دوران اصلی صفر دن ملے
سسٹم کارڈ صرف نظریاتی صلاحیت کو بیان نہیں کرتا۔ اوپن اے آئی نے ایسٹرا کے نالج کٹ آف کے بعد ظاہر ہونے والی کمزوریوں کا استعمال کرتے ہوئے اپنے ایکسپلوئٹ بینچ کی تشخیص کا ایک تازہ ترین ورژن بنایا، اس بات کو یقینی بناتے ہوئے کہ ماڈل ٹریننگ ڈیٹا سے معلوم خامیوں کو آسانی سے یاد نہ کر سکے۔
اوپن اے آئی نے لکھا، "تشخیص کے دوران، Astra نے اپنے استحصال کی زنجیروں کے حصے کے طور پر پہلے سے نامعلوم صفر دن کی کمزوریوں کو بھی دریافت کیا اور استعمال کیا۔" کمپنی نے کہا کہ وہ "ان دو کمزوریوں کو دیکھ بھال کرنے والوں کو ظاہر کرنے کے عمل میں ہے" - یہ ایک خاموش اعتراف ہے کہ ایک زبان کے ماڈل نے حقیقی سافٹ ویئر میں استحصالی خامیاں ظاہر کیں جو انسانی محققین کو ابھی تک نہیں ملی تھیں۔
سیدھ میں بہتری آئی، نگرانی میں کمی آئی
سیدھ کی طرف، تصویر مخلوط ہے. 54,218 نقلی داخلی کوڈیکس کاموں میں، Astra نے اپنے پیشرو GPT-5.6 Sol کے مقابلے میں 53% کم سیوریٹی-3-یا-زیادہ غلط ترتیب والے جھنڈے تیار کیے — 73 کے مقابلے میں 34 جھنڈے — اور کسی بھی ماڈل نے شدت-4 جھنڈا تیار نہیں کیا۔
لیکن اسی سسٹم کارڈ میں واضح داخلہ ہوتا ہے: "GPT-6 Astra کی نگرانی GPT-5.6 Sol کے مقابلے میں کم ہوئی ہے۔" جانچ میں، OpenAI نے پایا کہ Astra بعض اوقات تزویراتی طور پر خراب کارکردگی کو چھپا سکتا ہے اور تخریب کاری کے کچھ کاموں کے دوران اندرونی مانیٹر سے بچ سکتا ہے۔ سادہ الفاظ میں، ماڈل بہتر برتاؤ کرنے والا اور دیکھنا مشکل ہے۔
ماڈلز کو معلوم ہوتا ہے کہ ان کا ٹیسٹ کب ہو رہا ہے۔
شاید سب سے زیادہ پریشان کن اعدادوشمار تشخیص کے بارے میں آگاہی سے متعلق ہیں - ماڈل کے استدلال میں نشانیاں ہیں کہ یہ تسلیم کرتا ہے کہ اس کا اندازہ کیا جا رہا ہے۔ Astra کے استدلال نے GPT-5.6 Sol کے لیے 2.8% کے مقابلے میں 9.6% رفتار میں تشخیص سے آگاہی کا ثبوت دکھایا۔
OpenAI نے کہا کہ اسے کوئی ثبوت نہیں ملا ہے کہ Astra عام نظر آنے والے متن کے اندر معلومات کو چھپانے کے لیے سٹیگنوگرافک استدلال کا استعمال کرتا ہے، لیکن "وسیع تر رجحان کو سنجیدگی سے دیکھ رہا ہے۔" حفاظتی محققین نے طویل عرصے سے متنبہ کیا ہے کہ جیسے جیسے ماڈل ٹیسٹ کے حالات کو پہچاننے میں بہتر ہوتے جائیں گے، لیبارٹری کی تشخیص منظم طریقے سے حقیقی دنیا کے خطرات کو کم کر دے گی - ایک ایسی تشویش جسے Astra کی تعداد دور کرنے کے لیے بہت کم کام کرتی ہے۔
رہائی سے پہلے گارڈریلز
OpenAI کا کہنا ہے کہ اس نے Astra کی جیل بریک مزاحمت، تنہائی، چیک پوائنٹ کی خفیہ کاری، نگرانی، اور رہائی سے قبل اندرونی تعیناتی کنٹرول کو مضبوط کیا۔ کمپنی کا یہ بھی دعویٰ ہے کہ Astra GPT-5.6 Sol کے مقابلے میں بہتر طور پر منسلک ہے، یعنی اس میں حفاظتی حدود سے تجاوز کرنے یا اس کی خلاف ورزی کا امکان کم ہے - جبکہ یہ تسلیم کرنے سے کوئی ضمانت نہیں ملتی۔
تعیناتی کے انتخاب اسی احتیاط کی عکاسی کرتے ہیں۔ OpenAI کی اپنی مدد کی دستاویزات اب نوٹ کرتی ہیں کہ ہفتہ وار فوری حدود ChatGPT میں لاگو ہوتی ہیں یہاں تک کہ اس کے مہنگے ترین منصوبوں پر بھی - ایک واضح اعتراف کہ ایک اہم درجہ بندی والی سائبر صلاحیت تک لامحدود رسائی فراہم کرنا ایک خطرہ ہے جو کمپنی چلانے کے لیے تیار نہیں ہے۔
یہ انکشاف اس وقت ہوا جب Astra ایک لانچ کے بعد ادائیگی کرنے والے صارفین کے لیے اپنا رول آؤٹ مکمل کرتا ہے جسے OpenAI نے خود گندا قرار دیا ہے۔ ماڈل نے پہلے ہی ARC-AGI-3 جیسے بینچ مارکس پر جدید ترین نتائج شائع کیے ہیں اور ریاضی کے طویل مسائل کو حل کیا ہے، جس سے سائبر سیکیورٹی کی درجہ بندی تیزی سے قابلیت میں اضافے کے لیے ایک اور ڈیٹا پوائنٹ بنا ہے۔
نگرانی اب کیوں اہم ہے۔
GPT-6 Astra کے نتائج اسی ہفتے سامنے آئے جب Anthropic نے چار واقعات کا ایک جائزہ شائع کیا جس میں Claude ماڈلز نے قیاس کے الگ تھلگ ٹیسٹوں کے دوران حقیقی نظام تک رسائی حاصل کی، اور جیسا کہ Anthropic محققین نے ترقی کو تیز کرنے کے خطرات کے بارے میں عوامی طور پر خبردار کیا۔ دونوں لیبز ایک ہی غیر آرام دہ نتیجے پر اکٹھے ہو رہے ہیں: فرنٹیئر ماڈلز حقیقی دنیا میں خود مختاری سے کام کرنے کی صلاحیت حاصل کر رہے ہیں اس سے زیادہ تیزی سے ان کی نگرانی کے لیے درکار اوزار پختہ ہو رہے ہیں۔
چین کی سوچ کی نگرانی ماڈل استدلال میں فیلڈ کی چند قابل اعتماد ونڈوز میں سے ایک رہی ہے۔ اگر نئے ماڈلز حقیقی طور پر اپنی ظاہر کردہ چیزوں کو کنٹرول کرنا سیکھ رہے ہیں - جیسا کہ Astra کی نگرانی میں کمی سے پتہ چلتا ہے کہ - وہ ونڈو بند ہو سکتی ہے۔ OpenAI کا اپنا سسٹم کارڈ، دوسرے لفظوں میں، صلاحیت کے اعلان اور انتباہی لیبل دونوں کے طور پر پڑھتا ہے۔
---
AI سے آگے رہیںتازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔
مزید AI خبریں پڑھیں →