Metaは火曜日、Muse CodeコーディングエージェントとメタモデルAPIを強化するモデルの最新バージョンであるMuse Spark 1.3をリリースし、このアップデートによりエージェントタスクとコーディングタスク全体のパフォーマンスが向上したと述べた。 MetaのAI研究ブログで公開されたこの発表は、競合他社がより速く、より安く、より高性能なシステムを容赦ないペースで出荷してきた1年を経て、同社がモデルラインの競争力を維持するために取り組んでいる中で行われた。 Meta の AI 推進とより広範な AI ニュース速報 サイクルをさらに詳しく取り上げるため、この出版物ではすべての主要モデルのリリースを追跡しています。

メタが言うことは新しいこと

Meta のブログ投稿によると、Muse Spark 1.3 は、ユーザーと協力し、単一の長いスレッド内で複数のワークフローをジャグリングすることにより、「長期的な作業をより効果的に持続できる」ように設計されています。同社によれば、このモデルは、無制限の目標が与えられた場合、ツールを使用して乱雑で矛盾するソース全体にわたって独自のコンテキストを生成し、計画内のギャップを積極的に修正し、最終成果物に至るまでの過程で学習した内容を追跡します。

メタ氏はまた、モデルがさまざまなエージェント環境、つまりチャットボットではなくエージェントとして機能するときにモデルを囲むツール、メモリ、フィードバック ループの足場に一般化できるように、モデルがさまざまなハーネスのセットにわたってトレーニングされたことも強調しました。

応答するだけではなく、コラボレーションするために構築

発表の中で繰り返し取り上げられるテーマはコラボレーションです。 Meta氏によると、Muse Spark 1.3は、プロンプトがあいまいな場合には明確な質問をし、行き詰まった場合にはユーザーに呼びかけ、結果的なアクションを実行する前に確認を行うという。長時間のタスクでは、モデルはユーザーの好みに合わせて、進捗状況を頻繁に更新するか、バックグラウンドで静かに動作します。

同社はまた、このモデルは、以前の Muse Spark モデルよりも複雑で長い形式の命令に確実に従っており、制約がなくなったり、要求されたワークフローから逸脱したりすることなく、複数ステップのタスクにわたって詳細な要件を維持できると述べています。

自分自身の限界をよりよく認識する

メタは、調整された自己知識と呼ばれるものの改善を強調しました。このモデルは「何ができるのか、何ができないのか、何が分かっていて何が分からないのか、そしていつハードルにぶつかったのかを、幻覚を見せるのではなく、よりよく理解できる」ように訓練されたと同社は書いている。マルチタスクにも特に注目が集まっています。このモデルは、ユーザーが以前のリクエストを中断したり、過去のリクエストを無視したりした場合でも、乱雑なシングルスレッドのコンテキスト内で受信プロンプトを正しいタスクにより正確にマップするようになりました。

Muse コードとメタモデル API によるロールアウト

Muse Spark 1.3 は、Meta のターミナルベースのコーディング エージェントである Muse Code で、Meta Model API を通じて直ちに展開されます。注目すべき注意点が 1 つあります。これまで利用可能だった推論モードは現在も公開されていますが、メタ氏によると、「最大推論」は「追加の安全性テストが終了した直後」にのみ登場するとのことです。

安全性審査の背後にモードをゲートするというこの決定は、評価が追いつくまで研究室が最も性能の高い構成を抑制する傾向が強まっており、ここ数カ月業界全体で見られるパターンを反映している。メタ氏は、このリリース全体を、マーク・ザッカーバーグ氏が昨年研究活動を再編して以来、同社のAI戦略の中心に据えてきた野心である「パーソナル・スーパーインテリジェンス」に向けたステップとして組み立てた。

開発者からの早期の注意

このリリースは Hacker News で即座に注目を集め、記事は数時間以内に数百の賛成票を集めました。開発者の Simon Willison 氏は、恒例の自転車に乗ったペリカンの SVG ベンチマークを新しいモデルに対して実行し、Muse Spark 1.3 は 1 回あたり約 4 セントのコストで、1.2 よりも著しく良い結果をもたらしたと報告しました。

コミュニティの迅速な精査は、これらのリリースの視聴者がどれほど劇的に成熟したかを反映しています。 Muse Code 自体は、Muse Spark 1.2 を利用して 8 月初旬にリリースされたばかりで、開発者たちはそれ以来、古いゲーム バイナリのリバース エンジニアリングから日常的なバグ修正に至るまで、あらゆる作業にこのシステムを導入してきました。 Hacker News のコメント投稿者は、1.3 をその前任者と好意的に比較しましたが、他のコメント投稿者は、タスクに応じて Meta のモデルと GLM-5.3-Flash のようなライバルモデルの間を行き来していると指摘しました。

競争力のある状況

リリースに関するコンテキストは、変更ログと同じくらい重要です。 Googleは今週、Gemini 3.8 Flashとそれに付随するサイバー重視の亜種を出荷した(Ars Technicaが指摘したように、約6週間で3番目のFlashクラスモデル)一方、OpenAIはAstraモデルを巡る世間の話題と格闘し続けている。このような状況を背景に、Meta は Muse Spark 1.3 を、ヘッドラインを追いかけるベンチマーク リーダーではなく、実用的なエージェントの主力製品として位置づけています。

改善が十分であるかどうかは、メタがモデルとともに公開した評価によって決定され、最終的には過去 1 か月間 Muse コードのストレス テストに費やした開発者の手に委ねられます。同社は評価の詳細を記した報告書を添付することを約束し、より有能な推論モードがすぐそこまで来ていると述べた。

今のところ、Meta のメッセージは単純明快です。コードを記述してエージェントを実行するために使用するモデルは、コンテキストを保持し、自身の計画を修正し、いつ助けを求めるべきかを知るなど、ジョブの地味な部分で改良されただけです。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→