Common Sense Mediaによる広範な安全性レビューでは、OpenAIのChatGPT for Teensモードは18歳未満のユーザーに「容認できないリスク」をもたらすと結論付けており、監視団体の最悪の評価となっているが、組み込みの保護機能を約束した製品の発売から2カ月も経たないうちに判明した。 NPR が報じたように、同グループは、このモードで宣伝されている安全対策のほとんどがテストで約束どおりに機能しないことを発見しました。
この調査結果は、ペアレンタルコントロールとより厳格なガードレールを備えた未成年ユーザー向けの専用エクスペリエンスとして、ChatGPT for Teens を 8 月にローンチした OpenAI にとって、微妙な時期に当たりました。私たちの以前の報道では、AI 業界 が青少年の安全を推進したり引っ張ったりしていることが文書化されています。新しい報告書は、ティーンモードの保護が実際に機能するかどうかについての最初の大規模な独立監査である。
常識メディアがテストしたこと
シンクレア・ブロードキャスト・グループのナショナル・ニュース・デスクとファスト・カンパニーの報道によると、同グループのユースAI安全研究所の研究者らは、ティーンモードの発売前後に4,000以上のプロンプトをテストしたという。同グループは、OpenAIに対し、同社が「安全で発達上適切なエクスペリエンス」と呼ぶものを開発するまで、ティーンモードのマーケティングを一時停止し、十代の若者がChatGPTを使用できないようにすることを推奨している。
同団体の製品レビューでは、「露骨な性的ロールプレイの拒否など、ChatGPTが宣伝している保護機能の一部は、我々のテストに耐えた」としている。 「しかし、他のものは失敗し、いくつかは新しいティーンモードで悪化しました。私たちは、ChatGPT for Teensが、頻繁に機能しないガードレールに対する誤った信頼を親に与える可能性があることを懸念しています。」
起動されなかった保護者向けアラート
この報告書の最も印象的な発見は、保護者への通知システムに関するものでした。研究者らは、十代の年齢を自己申告し、親のアカウントにリンクされた十数個のアカウントを作成し、自殺念慮、自傷行為、摂食障害への明確な言及を含む会話にチャットボットを参加させた。アカウントは架空の人物に基づいて作成されました。
レポートによると、テスターはこれらの参照を行った新しいアカウントから保護者への警告を受け取っていませんでした。アラートは、同様のテーマをカバーする数週間の会話履歴がある他のアカウントにのみ到着しました。このギャップは、通知システムが、特定の会話で 10 代の若者が開示した内容の重大度よりも、蓄積されたコンテキストに依存していることを示唆しています。
また、このレビューでは、プロンプトをレビューした認定児童メンタルヘルス専門家委員会の判断によると、ChatGPT for Teens はメンタルヘルス危機の紹介を正当化する事例の 4 件に 1 件以上を見逃していたことも判明しました。
学業のガードレール「迂回が簡単」
監視機関は、危機を検知するだけでなく、学生がチャットボットを使用して学業をカンニングすることを防ぐことを目的とした機能が、簡単にバイパスまたは完全に無効化できることを発見しました。
コモン・センス・メディアの創設者兼最高経営責任者(CEO)のジム・ステイヤー氏は、ナショナル・ニュース・デスクが報じたコメントの中で、「論文を書くように頼めば、洗練された論文を書いてくれるよう頼めば、それは実現してくれるし、教師が知らない方法で編集する方法も教えてくれるだろう」と述べた。 「したがって、それが学習の妨げとなっています。基本的なプロセスが妨げられ、子供たちは自分たちで作業をしなければなりません。」
コンテンツのガードレール、年齢予測、休憩リマインダーもテストでは効果がないことが判明しました。広く引用されているデータ ポイントの 1 つは、OpenAI によると、平均的な 10 代のユーザーが ChatGPT に費やす時間は 1 日あたり 15 分未満です。しかし、1日連続3時間以上過ごす10代の少数派(ユーザーの2%未満)では、半数近くが休憩リマインダーを受け取ってから5分以内に会話を終えており、ナッジによって長時間のセッションが中断されることはほとんどなかったことを示唆している。
OpenAI が手法を押し戻す
OpenAIはこの報道に応じた声明の中で、同社が青少年の安全に「深く取り組んでいる」と述べ、自社が構築した安全装置と保護者に提供しているツールを指摘した。
OpenAIの広報担当者は、「厳格な独立した評価は歓迎するが、Common Sense MediaのテストがChatGPTの10代の保護策が実際にどのように機能するか、あるいはAIが10代をどのようにサポートできるかについての専門家の見解を正確に反映しているとは考えていない」と述べた。同社は、同グループの方法論を検討した結果、「テストの大部分がペアレンタルコントロールの有効化が完了する前に開始され終了した可能性があり、結果が不正確になっている可能性がある」ことが示されたと述べ、そのようなテストではペアレンタルコントロールの安全通知が設計どおりに機能するかどうかを確立するものではないと付け加えた。
ステイヤー氏は、同氏の組織は製品評価時の標準的な慣行と同様に、調査結果についてOpenAIと連絡を取り、結果を支持していると述べた。同氏は、「われわれは研究とテストの質、そしてこの製品を『容認できないリスク』と認定したという事実を100%支持する」と述べ、自動車の安全性との比較を引き合いに出し、「衝突試験に合格しなければ、車は市場に出すことはできない」と語った。
AI と未成年者に対する注目の高まり
この論争は、学区が年齢確認要件を検討する議員らへのアクセスを制限するなど、AIチャットボットが若者ユーザーにどのような影響を与えるかについての監視が強化される中で起こった。今回のような独立した監査は、AI企業がマーケティングにおいて青少年の安全を主張するための事実上の実験場となりつつある。
双方とも、親への通知システムが核心であるという点で同意している。新しい 10 代のアカウントが最初に自傷行為の考えを引き起こしたときにアラートが起動しない場合、最も重要な安全機能が最も重要な瞬間に機能しなくなることになります。 OpenAIはテストに欠陥があったと主張している。 Common Sense Mediaによると、製品は準備が整う前に出荷されたという。規制当局と保護者は今後、どちらが正しいのかを検討することになる。そしてOpenAIは、溝を修正するか製品を撤回するよう求める圧力が高まることに直面している。
AI の安全性、政策、およびそれらを形作る AI 業界の発展 についてさらに詳しく知りたい場合は、このストーリーの展開に従ってください。
---
AI の先を行く最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→