خلصت مراجعة شاملة للسلامة أجرتها Common Sense Media إلى أن وضع ChatGPT for Teens الخاص بـ OpenAI يشكل "خطرًا غير مقبول" للمستخدمين الذين تقل أعمارهم عن 18 عامًا - وهو أسوأ تصنيف لمجموعة المراقبة - بعد أقل من شهرين من إطلاق المنتج مع وعود بالحماية المضمنة. كما ذكرت NPR، وجدت المجموعة أن معظم الضمانات المعلن عنها للوضع لم تعمل كما وعدت في اختبارها.

تصل هذه النتائج إلى لحظة حساسة بالنسبة لـ OpenAI، التي أطلقت ChatGPT للمراهقين في أغسطس كتجربة مخصصة للمستخدمين القاصرين، كاملة مع الضوابط الأبوية وحواجز حماية أكثر صرامة. لقد وثقت تغطيتنا السابقة أن صناعة الذكاء الاصطناعي تعمل على تعزيز سلامة الشباب؛ يعد التقرير الجديد أول تدقيق مستقل رئيسي حول ما إذا كانت إجراءات الحماية التي يوفرها وضع المراهقين تصمد في الممارسة العملية.

ما هي الوسائط التي تم اختبارها حسب المنطق السليم

اختبر الباحثون في معهد سلامة الذكاء الاصطناعي للشباب التابع للمجموعة أكثر من 4000 مطالبة قبل وبعد إطلاق وضع المراهقين، وفقًا للتغطية التي أجراها مكتب الأخبار الوطني وشركة Fast Company التابعة لمجموعة Sinclair Broadcast Group. توصي المجموعة بإيقاف OpenAI مؤقتًا تسويق وضع المراهقين ومنع المراهقين من استخدام ChatGPT حتى تطور الشركة ما تسميه "تجربة آمنة ومناسبة تنمويًا".

وقالت مراجعة المنتج التي أجرتها المنظمة: "بعض وسائل الحماية المعلن عنها في ChatGPT صمدت أمام اختباراتنا، بما في ذلك رفضها لعب الأدوار الجنسية الصريحة". "لكن البعض الآخر فشل - وبعضهم أصبح أسوأ مع وضع المراهقين الجديد. نحن قلقون من أن ChatGPT للمراهقين يمكن أن يمنح الآباء ثقة زائفة في حواجز الحماية التي لا تعمل في كثير من الأحيان."

تنبيهات الوالدين التي لم يتم إطلاقها

وكانت النتيجة الأكثر إثارة للدهشة في التقرير هي نظام إشعار الوالدين. أنشأ الباحثون أكثر من عشرة حسابات أبلغت عن سن المراهقة وتم ربطها بحساب أحد الوالدين، ثم أشركوا برنامج الدردشة الآلي في محادثات تحتوي على إشارات صريحة إلى أفكار انتحارية، أو إيذاء النفس، أو الأكل المضطرب. الحسابات مبنية على شخصيات خيالية.

وفقًا للتقرير، لم يتلق المختبرون أي تنبيهات أبوية من الحسابات الجديدة التي قدمت هذه الإشارات. وصلت التنبيهات فقط للحسابات الأخرى التي لديها أسابيع من سجل المحادثات الذي يغطي مواضيع مماثلة - وهي فجوة تشير إلى أن نظام الإشعارات يعتمد على السياق المتراكم أكثر من اعتماده على مدى خطورة ما يكشفه المراهق في محادثة معينة.

وجدت المراجعة أيضًا أن ChatGPT للمراهقين أخطأت أكثر من حالة واحدة من كل أربع حالات تبرر إحالة أزمة الصحة العقلية، وفقًا لما تم تقييمه من قبل لجنة من المتخصصين المرخصين في مجال الصحة العقلية للأطفال الذين قاموا بمراجعة المطالبات.

حواجز حماية العمل المدرسي "سهلة التجاوز"

وبعيدًا عن اكتشاف الأزمات، وجدت هيئة الرقابة أن الميزة التي تهدف إلى منع الطلاب من استخدام برنامج الدردشة الآلي للغش في الواجبات المدرسية كان من السهل تجاوزها أو تعطيلها تمامًا.

قال جيم ستاير، المؤسس والرئيس التنفيذي لشركة Common Sense Media، في تعليقات أوردتها The National News Desk: "يمكنك أن تطلب منهم أن يكتبوا لك ورقة بحثية، ورقة معقدة لك وسوف تفعل ذلك، بل وستخبرك بكيفية التحرير بطريقة لا يعرفها معلمك". "وبالتالي، فهو يتعارض مع عملية التعلم. إنه يتعارض مع العملية الأساسية ويتعين على الأطفال القيام بالعمل بأنفسهم."

كما تبين أيضًا أن حواجز حماية المحتوى والتنبؤ بالعمر وتذكيرات الاستراحة غير فعالة في الاختبار. إحدى نقاط البيانات التي تم الاستشهاد بها على نطاق واسع: قالت OpenAI إن المستخدم المراهق العادي يقضي أقل من 15 دقيقة يوميًا على ChatGPT. لكن من بين نسبة صغيرة من المراهقين الذين يقضون أكثر من ثلاث ساعات متتالية يوميًا - أقل من 2% من المستخدمين - أنهى نصفهم تقريبًا محادثتهم في غضون خمس دقائق من تلقي تذكير بالاستراحة، مما يشير إلى أن الوكزات نادرًا ما تقاطع الجلسات الممتدة.

OpenAI تتراجع عن المنهجية

وقالت OpenAI، في بيان ردًا على التقرير، إنها "ملتزمة بشدة" بسلامة المراهقين وأشارت إلى الضمانات التي بنتها والأدوات التي توفرها للآباء.

وقال متحدث باسم OpenAI: "نحن نرحب بالتقييم المستقل الصارم، لكننا لا نعتقد أن اختبار Common Sense Media يعكس بدقة كيفية عمل إجراءات الحماية الخاصة بالمراهقين في ChatGPT في الممارسة العملية أو وجهات نظر الخبراء حول كيفية دعم الذكاء الاصطناعي للمراهقين". وقالت الشركة إن مراجعتها لمنهجية المجموعة أظهرت أن "الجزء الأكبر من اختباراتهم ربما يكون قد بدأ وانتهى قبل اكتمال تفعيل أدوات الرقابة الأبوية، مما يجعل النتائج التي توصلوا إليها غير دقيقة"، مضيفة أن مثل هذه الاختبارات لن تحدد ما إذا كانت إشعارات سلامة الوالدين تعمل على النحو المصمم لها.

وقال ستاير إن منظمته كانت على اتصال مع OpenAI بشأن النتائج، كما هو الحال مع ممارساتها القياسية أثناء تقييمات المنتج، والتزمت بالنتائج. وقال: "نحن ندعم بنسبة 100% جودة أبحاثنا واختباراتنا وحقيقة أننا وصفنا هذا المنتج بأنه "خطر غير مقبول"، مقارنًا بسلامة السيارات: "لن تطرح سيارة في السوق إذا لم تنجح في اختبار التصادم".

تسليط الضوء بشكل متزايد على الذكاء الاصطناعي والقاصرين

ويأتي النزاع وسط تدقيق مكثف لكيفية تأثير روبوتات الدردشة المدعمة بالذكاء الاصطناعي على المستخدمين الشباب، من المناطق التعليمية التي تقيد الوصول إلى المشرعين الذين يدرسون متطلبات التحقق من العمر. أصبحت عمليات التدقيق المستقلة مثل هذه بمثابة أرض اختبار فعلية لمطالبات شركات الذكاء الاصطناعي المتعلقة بسلامة الشباب في تسويقها.

يتفق الطرفان على شيء واحد: نظام إشعار الوالدين هو جوهر الأمر. إذا فشلت التنبيهات في إطلاق التنبيهات عندما يثير حساب مراهق جديد لأول مرة أفكارًا حول إيذاء النفس، فإن ميزة الأمان الأكثر أهمية تفشل في اللحظة الأكثر أهمية. يقول OpenAI أن الاختبار كان معيبًا؛ تقول شركة Common Sense Media أن المنتج تم شحنه قبل أن يصبح جاهزًا. سوف يقوم المنظمون وأولياء الأمور الآن بتقييم من هو على حق - وتواجه شركة OpenAI ضغوطًا متزايدة لإصلاح الثغرات أو سحب المنتج.

لمزيد من التغطية حول سلامة الذكاء الاصطناعي وسياساته وتطورات صناعة الذكاء الاصطناعي التي تشكلها، تابع تطور هذه القصة.

---

ابقَ في طليعة الذكاء الاصطناعي

احصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →