OpenAIの共同創設者で現在はThinking Machinesの主任研究員を務めるジョン・シュルマン氏は、再帰的な自己改善、つまりAIシステム自体の開発が加速するのはおよそ3~4年以内になると予想しており、そのスケジュールでは同氏はこの分野でより積極的な予測者の一人に数えられると述べた。シュルマン氏は金曜日に公開されたドワルケシュ・ポッドキャストのラウンドテーブル・エピソードでこの推定値を示し、その中でフロンティア・ラボの研究者3名が業界が実際に限界にどれだけ近づいているかについて公然と議論した。
Nvidia CEOのジェンセン・ファンが「AGIが到来した」と宣言し、25人のフィールズ・メダリストのグループがAIベンチマークの追跡が数学に悪影響を及ぼしていると警告する騒々しい週のさなか、この会話は、最前線に近い研究者たちが進歩についてどのように考えているかについて、珍しく無防備な様子を見せた。 最新の AI 開発 を追跡している読者にとって、このエピソードは有益なカウンターウェイトです。これらはシステムを構築している人々であり、お互いに激しく意見が異なります。
テーブルにいたのは誰ですか
司会者のドワルケシュ・パテル氏は、ゲストたちが「ややオープンな研究室や企業」と呼ばれる場所で働いており、記録上で発言できることを意味するため、パネルを集めたと語った。 Schulman 氏に加わったのは、オープンソース モデルを開発する新興企業 Zyphra の最高技術責任者である Beren Millidge 氏と、Baseten のモデル トレーニング責任者である Charlie O'Neill 氏です。
シュルマン氏の経歴は、彼のタイムラインでの話に特別な重みを与えている。彼は OpenAI を共同設立し、ChatGPT の背後にある技術を生み出したヒューマン フィードバック研究からの強化学習を主導し、その後 Thinking Machines に入社し、現在主任研究員を務めています。
特異点に対する訴訟、鋼鉄人
パテル氏は鋭い質問で始めた。数十億の超知能システムが世界を変革することなく 2036 年が到来したとしたら、その技術的な理由は何だったのだろうか? Millidge 氏は、懐疑論に対する最も強力な根拠を提示し、研究者が提示したベンチマークはすべてモデルが上回るものの、現実世界の影響は期待を裏切るという、ほぼモラベックのパラドックス スタイルのパターンと彼が呼んだものについて説明しました。
ミリリッジ氏は、「シミュレーションと現実のギャップが依然として根強く残っており、それが何らかの形ですべてを妨げている」と述べ、AIが「人々がベンチマークに入れるすべてのことにおいて非常に優れている」ようになる世界について、それ以上一般化することなく説明した。同氏は、強化学習が実際にすでに一般化している証拠を指摘し、この結果が起こる可能性は低いと考えていると付け加えた。
シュルマン氏は、進歩は自動的に起こるものではないということにほぼ同意した。人間は今日のモデルに比べて真の利点を持っており、新しいモデルがリリースされるたびに、ある分野では追いつく一方で、他の分野ではボトルネックが残る、これが過去数回の製品サイクルを特徴づけてきたパターンである、と同氏は述べた。
急速なタイムライン: 2 年、3 ~ 4 年、5 ~ 10 年
パテル氏が数字を要求すると、パネルが分裂した。 AI によって有能なホワイトカラーの生産性が 10 倍向上するのはいつになるのかとの質問に対し、シュルマン氏は最初に数字を挙げることを拒否し、「私なら 2 年だと思います」と答えた。 Millidge氏は、「実際にそのことはなんとなくわかる」と述べ、一部のカテゴリーの仕事ではその利益がすでに10倍を超えていると主張した。オニール氏は最も保守的で、「5年から10年」と答えた。
パテルはその後、シナリオを「基本的に単なるASI」と特徴付けてさらに推し進めた。シュルマン氏は「3~4年はかかるだろう」と答え、AI研究自体を自動化することは「AIにとって最も難しいことではない。なぜなら、現在の技術ではすでにアプローチできる作業がたくさんあるからだ」と付け加えた。このやりとりは、この推定値が他の研究者からの反発がほとんどなかったことで注目に値した。
自動化された研究者が実際にどのように訓練されるか
エピソードのかなりの部分は、シュルマン氏が想定していたシナリオの仕組みについて扱った。AI研究を自動化できるAIシステムがどのように訓練されるのかという質問に対し、シュルマン氏は「研究者の好みを吸収するために人間のフィードバックから学習することと、多段階の研究を行うことを伴う多くの練習環境を作成することの組み合わせ」と説明した。
その答えは、業界の資金の行方につながります。 Google が最近完了した Mechanize 社との契約は、エージェントをトレーニングするための模擬作業環境を構築する新興企業であり、まさに、より大きなモデルだけでなく、より良いトレーニング場が次の能力向上を促進するというこの賭けを反映しています。 Schulman 氏はまた、核となる問題についても警告しました。自然データに基づいて構築された報酬関数は特定するのが難しく、ユーザーがコード編集を受け入れたかどうかなどの表面的なシグナルがトレーニングを誤解させる可能性があるということです。
蒸留と集中化
シュルマン氏の最も具体的な予測の 1 つは、業界構造に関するものでした。同氏は「集中力と戦う主なものは蒸留だと思う」と述べ、強化学習を通じて学習した能力は比較的簡単に小規模なモデルに移植でき、フロンティアトレーニングを実施する余裕のある少数の企業を超えてフロンティアに隣接する能力を広げることができると主張した。
人間に何が残るかという問題について、シュルマンはきっぱりと答えた。 「人間にとって最後の仕事、あるいは人間にとって最も長く続く役割は、目的を定義し、実際に何を望むのかを決めることだと思います」と彼は言う。パテル氏が「調整は最後の仕事だ」と要約すると、シュルマン氏も「調整は一種の答えだ」と同意し、同時にそれは正しい目標を見つけ出し、それを実際に達成することに分解できると指摘した。
エピソードがタイムラインの議論のどこに当てはまるか
このエピソードのサブタイトル「我々は天井近くにはいない」は、その道がどれほどでこぼこであるかについて議論しながらも、研究者たちが将来の実質的な滑走路を見据えているという全体的な趣旨を捉えている。議論は、何が中国の研究室の進歩を推進しているのか、長期的な強化学習が一般知性を引き出すことができるのか、なぜRLがこれほどうまく機能し始めたのか、など多岐にわたる。
今月、タイムラインを巡る公の議論があらゆる方面で激化している。ブルームバーグによると、フアン氏の「AGIが到来した」という宣言は、科学的な主張ではなくビジネスケースとして解釈したアナリストから懐疑的な見方をされた一方、OpenAIの最高経営責任者(CEO)サム・アルトマン氏は従業員に対し、安全性への懸念が高まる中、同社は最先端の開発を遅らせることにも前向きであると語ったという。シュルマン氏の再帰的自己改善の期間は 3 ~ 4 年で、マーケティングとモラトリアムの間のどこかに位置します。これは、現在この分野を推進している技術を構築した実績を持つ人物からの実際の見積もりです。
同氏が正しいかどうかは、強化学習が過去のトレーニング環境を一般化し続けるかどうか、ベンチマークのパフォーマンスと実際の経済価値との間のギャップが縮小し続けるかどうかなど、委員会が丸印を付けただけの質問に依存するだろう。
AI の先を行く
フロンティアの研究者たちは公の場で AI の限界について議論しています。そのストーリーの発展を追ってください。
AI Buzz Wire で AI ニュースをもっと読む