2人目の数学者は、OpenAIの著名な数学的進歩の背後にあるデータを巡る非倫理的かつ「不誠実な」行為で公に非難し、同氏とChatGPTとの私的なやりとりが先月大々的に発表された結果に寄与していないと同社が証明できなかったと述べた。

水曜日にThe Vergeが報じたマストドンに関する一連の投稿の中で、数学者アンドレアス・トムは、OpenAIの発表前に彼と彼の同僚がChatGPTと交わした会話がモデルの成功に影響を与えた可能性があると懸念を表明した。彼の介入は、ニューヨーク大学の数学教授 トリスタン バックマスターが、OpenAI のモデルが自社の Codex ツールの自身の使用から恩恵を受けていたかどうかを公に疑問視し、研究室にとっての勝利の瞬間を、トレーニング データの出所をめぐる継続的な論争に変えた数日後に行われました。 この件の詳細は、人工知能の最新情報をご覧ください。

躍進から反発へ

8月、OpenAIは、自社のシステムが数学と理論コンピュータサイエンスで10の重要な成果を生み出し、それぞれが機械検証されたリーン証明でチェックされたと発表した。これは、ミレニアム賞の問題に対する同社の主張する解決策と並んで、このサイトが当時取り上げていたマイルストーンだった。 10 件の結果のうちの 1 つは、群理論における長年の未解決の問題である、いわゆる 非ソフィック群 の存在を確立しました。

この結果は新たな論争の中心となっている。 The Verge によると、OpenAI は、その証明が Thom 氏と同じく数学者 Gábor Kun 氏による以前の研究に大きく基づいていることを認めました。そして、当初彼らの最近の貢献を認めていなかったことに対する数学界からの批判を受けて、同社はひっそりと記事を修正しました。

トムにとって、この承認は不快な疑問を引き起こした。モデルはどのようにして彼とクンのテクニックをこれほど詳細に制御するようになったのか?

トムが答えられなかったという質問

トム氏は「OpenAIによるわれわれの技術の詳細な制御」に衝撃を受けたと述べ、当時それが解決への最も明白な道筋でも、最も有望な道筋でもなかったと述べた。彼は OpenAI の研究者である Sébastien BubeckMark Sellke (後者はハーバード大学の統計学者でもある) に電子メールを書き、ChatGPT とのやりとりが「トレーニング データの一部だったのか、推論プロセスにアクセスできたのか」、したがって結果に貢献した可能性があるかどうかを尋ねました。

彼が受け取った答えは、彼の会話に直接アクセスできるかどうかのみを扱っており、会話が会社のモデルのトレーニングと改善に使用される膨大なデータプールに入ったかどうかについては言及されていませんでした。 「そのような資格、説明、証拠は与えられていない」とトムは書いた。 「控えめに言っても、これは不誠実だと思います。」

ザ・ヴァージが引用したフォローアップの中で、同氏は非難をさらに強めた、「セルケ氏の断定的な回答は、少なくとも不当に広範で、重大な誤解を招くものだった。振り返ってみれば、明らかに不誠実だった。」

トムの議論は、OpenAIが何をしたかというよりも、誰が立証責任を負うかということについてである。同氏によると、研究者には同社のトレーニングパイプラインをリバースエンジニアリングする能力が備わっていないという。 「それに関連するデータを持っているのはOpenAIだけだ」と同氏は書いた。したがって、企業がユーザーデータが自社の結果に寄与したことを否定したいのであれば、OpenAIには関連するデータセットを開示して、顧客とのやり取りをどのように利用しているかを明らかにすることでそれを証明する責任がある。

OpenAI の慎重な拒否

The Vergeによると、この論争は、バックマスター氏が人類研究者のレベント・アルポージ氏と個人的に進めていた研究である、自社が主張するナビエ・ストークスの躍進に対する同社の対応を反映しているという。この結果を発表したブログ投稿の中で、OpenAIは次のように述べている。「私たち(研究者とエージェント)は、彼らが一般に公開するまで、いかなる手段によっても彼らの研究内容を確認していませんでした。特に、この問題を解決するために特定のユーザーデータにアクセスしたことはありません。」

しかし、同じ投稿では間接的な経路があることを認めており、「可能性は低いが、当社の製品の使用から得られた匿名化されたデータが当社のモデルの改善に役立っていた可能性は排除できない」としている。

トムにとって、その区別こそが問題なのです。 「匿名化は名前を削除するかもしれないが、数学的アイデアの知的内容を削除するものではない」と彼は書いた。 OpenAIはThe Vergeのコメント要請にすぐには応じなかった。

同氏は、ユーザーから提供された非公開研究がモデルの改善に役立ち、そのモデルを同社が同意や適切な開示、クレジットなしで、まったく同じユーザーを出版まで競争させるために使用した場合、「倫理的に弁護できない」と付け加えた。

数学についてのくつろぎ

ミレニアム賞をめぐる状況は、神経を静めるにはほとんど役に立たなかった。 OpenAIは、他の研究者が大きな進歩を遂げ、研究者らが何年もかけて取り組んできた結果を事実上競い合っているというネット上の噂を聞いて、この問題を追及したと発表した。

多くの研究者がThe Vergeに語ったところによると、もし数学者たちが、ブレイクスルーが差し迫っているという噂さえ、栄光を求める豊富な資源を持つハイテク巨人との競争に火をつける可能性があると信じるようになったら、こうした行為が数学をより秘密主義的な状態に追い込むことになるのではないかと心配しているという。 The Verge の関連記事「OpenAI のずるい数学的進歩が学術界に悪寒をもたらす」は、現場の雰囲気を捉えています。

このエピソードは、AI企業と、ますます彼らとの衝突が増えている研究コミュニティにとって、微妙な瞬間に直面している。個々の結果の利点が何であれ、トム氏が説明する非対称性は構造的なものです。研究室はユーザー インタラクションを大規模に取り込むことができますが、そのデータを生成する人々は何が取られたかを監査する方法がありません。企業がトレーニング パイプラインを公開して精査するか、顧客との会話とモデル トレーニングの間に厳格で検証可能なファイアウォールを設置するまで、「私たちはあなたのデータを使用しませんでした」という記述には暗黙のアスタリスクが付けられることになります。そして、あらゆるブレークスルーには数学者が登場し、その証明を求める他の分野の研究者も増えるでしょう。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →