大規模な言語モデルが 5 年生以降の教材をまったく参照しない場合はどうなるのでしょうか? 7 人の研究者チームがその質問に文字通り答えました。彼らは、米国の小学校カリキュラムに合わせてフィルタリングされたコーパスでゼロからトレーニングされた 50 億パラメータの LLM である LittleLearner を構築し、より多くのパラメータ、より多くのトレーニング後のプロンプト、より賢いプロンプトなどを使ってモデルをトレーニング前データが教えたものを超えられるかどうかをテストしました。彼らの報告によれば、答えは「ノー」だという。

論文「LittleLearner: 教育的に制御された知識露出下の言語モデル」は、Fanfei Li、Jana Zeller、Manuel Prada-Corral、Thaddäus Wiedemer、Prasanna Mayilvahanan、Ryan Cotterell、Wieland Brendel によって 8 月 13 日に arXiv に投稿されました。 8月16日までに、これはハッカーニュースで200以上の賛成票を集めて急上昇中の議論の主題となり、研究者や実践者らが業界で人気の仮定、つまりトレーニング後に何もないところから能力を呼び出すことができるということが何を意味するのかを議論した。これはまさに、私たちが AI 研究報道 で注目している種類の注意深く逆張りの実験です。

知識の境界線を持つサンドボックス

現代の LLM は基本的にあらゆるものについてトレーニングされるため、実証されたスキルがトレーニング中に本当に学習されたものか、それとも単に適切なプロンプトによって引き出されたものなのかを判断することはほぼ不可能です。チームの解決策は、トレーニングの配分自体を制限することでした。 FineWeb-Edu から始めて、幼稚園から 5 年生までの Common Core 標準に合わせた 5 段階のフィルタリング パイプラインを通じて、LittleCurriculum と呼ばれる 880 億トークンのコーパスを抽出しました。5 年生以上で教えられる概念、事実、語彙は明示的に除外されました。

このコーパスでは、3 つのスケール (0.6B、1.3B、および 5B パラメーター) でモデルを最初からトレーニングし、それぞれが同じアーキテクチャとトークン バジェットのフィルターされていないデータでトレーニングされた一致する制御モデルとともに出荷されました。その結果、自由形式の評価に十分な流暢性を備えたモデルが完成しました。ブラウザでホストされた 5B バージョンとチャットできますが、明確で解釈可能な知識境界を備えています。それが小学校のカリキュラムに含まれていない場合、モデルはそれを認識することはありません。

獲得ではなく、勧誘

核心的な発見は率直です。モデルをよりスマートにするための標準ツールキットは、LittleLearner がすでに知っていたことを拡張しましたが、範囲外のパフォーマンスを有意義に改善するものはありませんでした。

スケーリングは、モデルの制御された知識内で精度を向上させ、同じ学習軌道に沿って適度に拡張しましたが、5 年生の教材を超える能力を必要とする問題にはほとんど効果がありませんでした。 GRPO による ポストトレーニング (推論モデル ブームの多くの背後にある強化学習手法) は、対象範囲内の幼稚園から高校までの能力を大幅に向上させましたが、対象範囲外のデータでトレーニングした場合でも、幼稚園から 5 年生を超える能力は回復できませんでした。そして、コンテキスト内学習、知識をプロンプトに詰め込む日常の魔法は、モデルが持っているものを活用するのに役立ちましたが、境界を越えて新しい推論を解き放つことはできませんでした。

つまり、事前トレーニング フィルターは有効な能力の上限を設定します。著者らは、この分野が常に曖昧にしてきた区別の証拠として結果を組み立てています。事前トレーニングで取得します。

クリーンなコントロール、パブリックチェックポイント

方法論こそが主張に説得力を与えるのである。すべての LittleLearner モデルには、一致するフィルタリングされていないコントロール (同じアーキテクチャ、同じトークン数、同じトレーニング レシピ) が同梱されているため、チームは動作の違いをカリキュラム フィルタのみに起因させることができます。 MathCAMPS ベンチマークで事後トレーニングを受けた数学の専門家は、研究者が学年ごとに成績を評価し、範囲内の能力がどこで終わるのかを正確に追跡できるようにしました。そして、ほとんどのフロンティア論文とは異なり、コーパス、HuggingFace の 3 つのスケールすべてのベースおよびトレーニング後のチェックポイント、ホストされたチャット デモなど、すべてが公開されているため、独立したチームが自分たちで境界を調査できます。

このオープンさがハッカーニュースの議論に拍車をかけている。コメント投稿者は、ホストされたモデルの知識エッジでの動作 (5 年生を超えたときに棄権するか、推測するか、幻覚を起こすかなど) をテストし、その影響について議論しています。この結果を推論モデルの誇大宣伝にとって悪い知らせであると解釈する人もいれば、Web スケールの事前トレーニング データには小学校の概念よりはるかに多くの概念が含まれているため、フロンティア モデルの上限はそれに応じて高いと指摘する人もいます。この論文の著者自身もこの点については慎重である。彼らの主張は、既知の管理された教育を用いたモデルに対して標準的な介入では何ができなかったかに関するものであり、フロンティア研究室に関する直接の予測ではない。

教室を超えて重要な理由

この実験は、AI における生の議論を直接物語っています。 AI ラボは、強化学習によって基本モデルが本来の能力をはるかに超えて拡張できるという考えに基づいて、トレーニング後の計画に数十億ドルを費やしています。 LittleLearner は、これらの利益は主に、事前トレーニング データがサポートする内容の範囲内に存在し、その範囲内に収まる可能性があることを示唆しています。これは、データのキュレーションをもっと重視し、「緊急の」トレーニング後の機能の主張を懐疑的に扱うことに対する議論です。

リリースは単なる論文ではなく、本物の研究手段でもあります。チームは LittleCurriculum とすべてのモデル チェックポイントをオープンにリリースし、プロジェクト ページには、サンドボックスが可能にする実験の概要が示されています。RL が能力に報酬を与えるのではなく本当に能力を生み出すことができるかどうか、モデルが導入時に負の数などの真に新しい概念をどのようにサンプル効率的に学習するか、分数を学習する際にマシンと子供が同様のエクスポージャを必要とするか、または同様の間違いを犯すかどうかです。

明確な管理がめったに行われない分野にとって、明示的に指定された教育を受けたモデルは貴重な贈り物です。そして他のすべての人にとって、これは机の上にピン留めする価値のある思い出です。モデルや人は、教えられていないことを論理的に理解することはできません。

AI の一歩先を行く

AI を再構築する研究に関する査読レベルの報道が毎日配信されます。 最新の AI 開発 のハブをブックマークしてください。

AIニュースをもっと読む→