新しいオープンソース プロジェクトが、機械学習の頑固な制限の 1 つである学習を決して停止しない言語モデルの構築に取り組むことで注目を集めています。 mini-AGI と呼ばれるこのプロジェクトは、独自のアーキテクチャを構築し、8GB の VRAM を備えた単一の GPU 上でゼロからトレーニングし、読み取ったすべてのものから学習を続ける継続的な学習バイトレベルの言語モデルであると説明しています。
このプロジェクトは週末に Hacker News に掲載され、ポイントは 100 ポイントをはるかに超えました。GitHub 上のリポジトリは MIT ライセンスに基づいてリリースされています。プロジェクトの README によると、目標は、控えめな消費者向けハードウェアでも、致命的な忘れを起こすことなく、単一のデータ ストリームからの継続的な学習が可能であることを実証することです。 この件の詳細は、AIニュースをご覧ください。
重みは VRAM ではなくディスク上にあります
mini-AGI の背後にある中心的なトリックは、型破りなメモリ管理スキームです。すべてのモデル パラメーターを GPU メモリに保持する代わりに、システムはその重みを通常のファイルとしてディスクに保存し、必要に応じてグラフィックス カードにページングします。
この設計の選択は重要な結果をもたらします。モデルのパラメーター数は、VRAM ではなく空きディスク容量によって制限されます。 README には、このモデルはトレーニング中に容量が不足した場合に新しい容量を拡張し、何も要求されていない容量を削減できると記載されています。トレーニングと推論はまったく同じコード パスで実行されるため、個別の微調整体制や凍結された基本モデルはありません。プロジェクトの言葉を借りれば、読み取りとトレーニングは同じイベントです。
このシステムは、少なくとも 8GB VRAM GPU を搭載した PC またはラップトップ、つまり多くの開発者がすでに所有しているハードウェアをターゲットとしています。
継続的な学習が難しい理由
現在利用可能なほとんどの言語モデルは、同じライフサイクルに従います。つまり、ラボがモデルをトレーニングし、凍結し、出荷します。ユーザーはエッジの周りを微調整できますが、基本の重みが再び変更されることはありません。プロジェクトの動機に関するセクションでは、これによって個人が所有するすべてのモデルが「自分という薄い層が上に置かれた他人のモデル」になり、出荷したその日から学習が止まってしまう、と主張している。
この障害は機械学習の研究ではよく知られているもので、壊滅的な忘却、つまりニューラル ネットワークが新しいデータでトレーニングされたときに以前に学習した知識を上書きする傾向があります。毎日の情報の流れから継続的に学習するモデルは、通常、以前に知っていたすべての情報を劣化させます。
README には、設計を形成する制約の概要が記載されています。モデルは 8 GB の VRAM に適合する必要がありますが、量子化を使用する必要はありません。これは、トレーニングには重み自体の約 3 倍のメモリを追加する勾配とオプティマイザ状態が必要であるためです。そして、終わりのないテキストの流れから新しい内容を吸収しながら、すでに学んだことを保持することを忘れてはなりません。
自身を構築するバイトレベルのモデル
mini-AGI はトークンではなくバイト レベルで動作し、文字のストリームを一度に 1 チャンクずつ読み取り、各チャンクで勾配ステップを実行します。同プロジェクトでは、このモデルは「独自のアーキテクチャを組み立てる」とも述べており、トレーニング開始前に作成者によって構造が固定される従来のモデルとは区別されている。
このアプローチは意図的に実験的なものです。これは訓練体制の小規模なデモンストレーションであり、フロンティアシステムへの挑戦ではありません。
重要な注意事項
プロジェクトの作成者は、システムの現在の状態について明確に述べています。 README 自身の言葉によれば、mini-AGI は「小さなおもちゃレベルのモデル」であり、読者はフロンティアレベルの機能を期待すべきではありません。この演習のポイントは、単一のデータ ストリームから致命的な忘れを起こすことなく継続的に学習することはまったく可能であり、ほぼ誰でもアクセスできるハードウェア上で可能であることを示すことです。
モデルの重量はまだ公開されていません。トレーニング実行は学習中のコーパスに対する最初のパスをまだ完了中であり、著者はそのパスが完了したら重みが解放されると述べていますが、現在のペースでは数週間かかります。それまでは、オブザーバーはプロジェクト ページでトレーニング実行の履歴からサンプルを検査し、読み取りの過程でモデルがどのように改善されたかを確認できます。
なぜそれが重要なのか
モデルがより有能なサイズにスケールアップするときにこのアプローチが有効であれば、別の種類の AI の所有権を示すことになります。つまり、個人のモデルは自分のマシン上に存在し、フィードされるドキュメントやデータから学習し続け、ベンダーのリリース スケジュールによって重みが固定されることはありません。
このプロジェクトは、AI における興味深い研究のすべてが最先端で行われているわけではないことを思い出させるものでもあります。 mini-AGI は、単一のコンシューマ GPU、通常のディスク スペース、および MIT ライセンスを使用して、大規模な研究室がほとんど回避してきた質問、つまり、次に遭遇するものから継続的に、つまり人間の行動を学習するモデルを構築できるかどうかという質問に答えようとしています。
コードとドキュメントは、互換性のあるハードウェアを持っていて、フォローしたり、プロジェクトをフォークしたり、必要に応じてモデルのトレーニングを継続したりしたい人は誰でも、GitHub で入手できます。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →