Meta の Superintelligence Labs は、消費者グレードの GPU でローカルに AI エージェントを実行するように設計された、Apache 2.0 ライセンスに基づいて公開された 300 億パラメータの AI モデルである Muse Glimmer をリリースしました。このウェイトはHugging Faceで入手可能で、CEOのマーク・ザッカーバーグ氏がAIの将来に関する6,500ワードのエッセイで新しく発表したオープンウェイト・エコシステムへの同社の最新の取り組みを示している。
このリリースは、開発者がインテリジェント システムを構築および展開する方法を再構築する AI 業界の報道の広範な波 の最中に発表されました。 Meta 氏によると、開発者は、クラウドでホストされている API にデータを送信せずに、ローカル コーディング、関数呼び出し、自律エージェント、審査員としての LLM 評価タスクに Muse Glimmer を使用できるとのことです。
オンデバイス エージェント向けに構築
Meta は、Muse Glimmer を特定の運用上の制約に対するソリューションとして位置づけています。クラウドホスト型モデルには永続的なネットワーク アクセスと中央インフラストラクチャが必要であり、遅延、コスト、プライバシーの問題が発生する可能性があります。同社は代わりに、スケジュール、メッセージ、ファイル、その他のプライベート コンテキストにアクセスする必要があるパーソナル エージェントなど、デバイス上の存在を必要とするワークロード向けのモデルを提案しています。
このモデルは、専用の知覚エンコーダを通じてインターリーブされたテキストと画像を受け入れ、エージェントがスクリーンショット、グラフ、ドキュメントを会話の一部として解釈できるようにします。 Meta の報告によると、このマルチモーダル機能により、エージェントはビジュアル インターフェイスについて推論できるようになります。この機能は、グラフィック ソフトウェアや Web ページと対話するツールを構築するチームにとって重要な機能です。
Muse Glimmer は、OpenClaw やその他のエージェント オーケストレーション パターンもサポートしており、カスタム スキャフォールドの詳細はモデルの開発者ドキュメントで説明されています。このモデルに基づいて構築されたローカル コーディング エージェントは、アクセスするリポジトリ、端末、テスト環境、コマンドを決定できますが、組織はタスクの成功を測定する前に利用可能なコマンドとリポジトリを定義する必要があるとメタは警告しています。
ライバルに対するパフォーマンスのベンチマーク
Meta の内部ベンチマーク テストでは、8 つの一般代理店ベンチマークのうち 5 つで、Muse Glimmer が Google の Gemma4-31B および Alibaba の Qwen3.6-27B よりも優れています。エージェントスコアの合計では、Muse Glimmer は 74.6 に達しましたが、Gemma4-31B では 61.7、Qwen3.6-27B では 71.1 でした。
このモデルは WildClawBench で 47.6 を記録し、Gemma4-31B の 37.6 および Qwen3.6-27B の 43.2 を上回りました。一般的な AI アシスタントのベンチマークである GAIA2 では、競合モデルの 36.4 および 40.0 と比較して、Muse Glimmer のスコアは 43.3 でした。実際のコンピュータ環境内でエージェントが動作する能力をテストする OSWorld-Verified では、グループ内で最大の差が生じました。Muse Glimmer は 65.9 に達し、Gemma4-31B の 58.5 に達しました。
すべてのカテゴリーがメタのモデルを支持したわけではありません。 SkillsBench では、Qwen3.6-27B が 46.6 のスコアでリードし、Muse Glimmer が 44.3 を記録しました。 Qwen3.6-27B は GDPval-AA でも 1,141 でリードし、Muse Glimmer の 953 を上回りました。
コーディング結果は競争環境を示す
Muse Glimmer のコーディング ベンチマークは、より狭い競争状況を示しています。このモデルは、SWE-Bench Pro のスコア 51.2 をリードしました。これに対し、Gemma4-31B のスコアは 36.9、Qwen3.6-27B のスコアは 50.2 でした。しかし、SWE-Bench Verified では Qwen3.6-27B が 77.2 で Muse Glimmer の 76.0 に対してリードし、ターミナルベンチ 2.1 では 60.7 対 Muse Glimmer の 51.7 でリードしました。
Meta が提供した資料では、失敗したツール呼び出しに対する再試行トレーニング、つまりエージェントがエラーから自動的に回復できるようにする動作についても説明しています。同社は、この機能には、特にツールがソースコードを変更したり外部システムを呼び出したりする可能性がある場合、繰り返しの試行を制御する必要があると指摘しています。
ザッカーバーグの無差別級ビジョン
Muse Glimmer のリリースは、ザッカーバーグ氏が AI 開発のビジョンを説明する長いエッセイを出版したのと同時期に行われます。ロイター通信とブルームバーグによると、メタCEOはこのエッセイを利用してオープンウェイトアプローチを擁護し、広く利用可能なモデルが少数の企業の手にAIの力が集中することを防ぐと主張した。
伝えられるところによると、ザッカーバーグ氏は、単一の実体が超知能システムを制御するリスクについて警告し、単一の慈悲深い超知能などというものは存在しないと述べた。この発言は、Metaのオープンウェイト戦略を技術哲学であると同時に、OpenAIやAnthropicなどのクローズドモデルのライバルに対する競争姿勢として位置づけている。
ニューヨーク・タイムズ紙は、ミューズ・グリマーについて、消費者が家庭で利用できるメタ社のAI機能のオープンソース版であると説明し、ウォール・ストリート・ジャーナル紙は、このエッセイはザッカーバーグ氏のAIの世界観をこれまでで最も詳細に表現していると指摘した。
チームに関する実際的な考慮事項
Meta のベンチマークは、標準化されたテストでのパフォーマンスを示していますが、組織がローカル エージェントを独自のファイル、カレンダー、メッセージング システム、または内部ツールに接続した後にローカル エージェントがどのように動作するかは示していません。同社は、スクリーンショット読み取りモデルは表示されたものを解釈できるが、ローカル テストではアクセス許可、表示レイアウト、ドキュメント形式、接続されたツールから返されるエラーをカバーする必要があることを認めています。
Muse Glimmer を評価している組織に対して、Meta では、展開前にエージェントで使用できるコマンドとリポジトリを定義することをお勧めします。このモデルの安全性関連の評価には CI Memories テストと Siren AgentDojo テストが含まれますが、同社はそれぞれに異なる対策を使用しています。
このリリースにより、Meta は無差別級分野で Google の Gemma シリーズや Alibaba の Qwen モデルと直接競合することになります。 Apache 2.0 ライセンスにより商用利用が可能になったことにより、Muse Glimmer は、クラウド API に伴うコストやプライバシーのトレードオフを伴うことなく、エージェント機能を必要とする開発者の間での採用を加速できる可能性があります。
AI の先を行く
AI モデルの最新の開発、無差別リリース、業界を形作る競争力学については、AI Buzz Wire にアクセスして包括的な報道をご覧ください。
AIニュースをもっと読む→