Nvidiaが支援するアメリカの新興企業であるReflection AIは10月5日、同社初の無差別級モデルであるBeam​​と呼ばれる専門家まばらな混合システムを導入した。同社はこれを、現在中国の研究機関が独占している無差別級のフロンティアに対するこれまでで最も強力な西洋の挑戦と位置づけている。 Reflection 自身のブログで公開され、ロイター、TechCrunch、Fortune、Semafor によってすぐに取り上げられたこの発表には、ひねりが加えられています。モデルはまだダウンロードできません。

Beamは、同社が最終的なレッドチーム化と評価と呼ぶものを受けている。サインアッププロセスを通じて早期アクセスが可能であり、Reflection は今月後半にウェイト、技術レポート、モデルカード、開発者アーティファクトをリリースすると述べています。それが実現すると、Beam は米国の研究機関がこれまでに公開したオープンウェイト リリースの中で最大規模のリリースとなり、多くのオープンソース コミュニティで中国モデルをデフォルトの選択肢にしてきたリリースのリズムとオープン性に米国企業が匹敵できるかどうかを試す、これまでで最も明確なテストとなる。無差別級レースやフィールドを動かすその他すべてのことを継続的に報道するには、AI ニュース ホームページをブックマークしてください。

ビームの背後にある数字

Beam は、合計 5,010 億のパラメーターを備えた疎な専門家混合モデルで、そのうち約 230 億がトークンごとにアクティブです。 Reflectionは、ウェブや独自のライセンスデータセットから抽出した23兆8000億個のトークンに基づいてモデルを事前トレーニングしたと述べ、ベースモデルは同様のサイズのオープンベースモデルと同等かそれを上回るパフォーマンスを発揮すると主張している。

より特徴的な主張は強化学習に関するものです。 Reflection は、大規模なハイコンピューティング RL を維持するためのアルゴリズム、トレーニング環境、インフラストラクチャを構築しました。同社の報告によると、同社の RL の実行により、4 週間のトレーニングで 10,500 個の NVIDIA GB300 GPU で 1 億回以上のロールアウトが生成されました。これは、オープンウェイト リリースとしては異常に多額の RL 投資であり、Reflection は、それがフロンティア推論の計算効率と呼ばれる Beam の競争力のあるパフォーマンスのおかげであると認めています。

ベンチマーク: 競争力はあるが、まだ主導的ではない

Reflection が公開したベンチマーク テーブルによれば、Beam は無差別級の中で確固たる地位を占めており、中国最大手のモデルには劣りますが、いくつかの有名ブランドよりも上か、同等の位置にあります。

SWE-Bench Pro v2-Hard では、Beam のスコアは 77.2 で、同じ列の GLM 5.3 の 88.2 と Kim K3 の 88.2 に次ぐものの、Inkling の 56.9 を大きく上回っています。 SWE-Bench Pro v1 では、Beam のスコアは 65.5 で、Inkling (54.3)、Nemotron 3 Ultra (46.4)、GLM 5.2 (62.1) を上回り、Qwen 3.8-Max は 67.7 を記録しました。 DeepSWE v1.1 エージェント コーディング ベンチマークでは、Beam は 44.4 を記録し、GLM 5.2 の 44.0 と同レベルで、GLM 5.3 (61.0)、Qwen 3.8-Max (51.0)、DeepSeek V4.1 Flash (74.2) を下回っています。

同社自身の枠組みは、Beam の位置付けについて率直に述べています。 Reflection はブログ投稿の中で、Beam が「西洋のオープンウェイトのフロンティアを前進させ」、「GLM 5.2 のようなより大きなオープンモデルと競争力があり、コーディングやエージェントタスクに関しては Qwen 3.8-Max に近づいている」と書いています。また、Kimi K3のようなフロンティアオープンモデルが「本来の機能においては依然として先を行っている」ことも認めている。

2 つの注意点を強調しておきます。まず、ここでのすべての数値は重量発表に先立って Reflection によって自己報告されており、独立した検証は技術レポートとチェックポイントが公開されて初めて可能になります。第 2 に、会社独自のテーブルのいくつかのセルが未報告としてマークされているため、現時点では完全な同一比較は不可能です。

効率に関する議論

Reflection が Beam の本当の利点として売り込んでいるのは、生のリーダーボードの順位ではなく、推論時のコストです。トークンごとに有効になるのは 5,010 億のパラメーターのうち 230 億のみであるため、同社は、Beam は大規模な高密度モデルの数分の 1 の計算コストでニアフロンティアのエージェントおよびコーディングのパフォーマンスを実現できると主張しています。このポジショニングは、中国のオープンウェイト ファミリを新興企業の間で非常に人気にした戦略を反映しています。つまり、常時接続のエージェントを経済的に実行可能な価格で十分に強力な機能を備えているということです。

効率性に関する主張が独立したベンチマークに耐えられれば、リーダーボードの差よりも重要になる可能性があります。何千もの並列コーディング エージェントを実行しているチームは、1 桁のベンチマーク ポイントよりも、完了したタスクごとのコストを重視します。

地政学的な底流

この発表に関する報道は、オープンソース モデルのリリースとしては驚くほど地政学的なものでした。ロイターは、BeamをReflectionの「中国のオープンモデルに対抗する」「最初のAIモデル」と評した。フォーチュン誌はビーム社が「アメリカにとって中国と競争するための最良のチャンス」になり得るかどうかを尋ね、セマフォー氏はビーム社を「中国の研究機関に対する西側のオープンソースの答え」と位置づけた。

この枠組みは、2026 年後半のオープンウェイト エコシステムの状態を反映しています。最も有能なダウンロード可能なモデルは、Z.ai の GLM ファミリー、Moonshot の Kim ライン、Alibaba の Qwen、DeepSeek などの中国の研究所から圧倒的に提供されています。アメリカの研究所は、その代わりに API の収益に賭けて、ベストウェイトをほぼ非公開のままにしています。 Reflection はその逆に賭けています。つまり、オープンな西側フロンティア モデルが開発者エコシステムを引きつけることができ、Nvidia の支援によってコンピューティングの滑走路が確保できるということです。

次に何が起こるか

今月後半のウェイト リリースでは、Reflection 独自の評価以外で Beam がどのように動作するか、ウェイトにどのようなライセンスが伴うか、独立した負荷の下でも効率が維持できるかどうかなど、重要な疑問に答えることができます。それまでは、ビームは有望なベンチマークテーブルであり、登録フォームであり、アメリカの研究所が今年行った最も重要な無差別級の約束であり続けます。

GLM、Kimi、Qwen で標準化するか、Beam を待つかを決定する開発者にとって、実際的なアドバイスは、技術レポートとサードパーティの評価が決定するまで最終決定を保留することです。無差別級にはアメリカ人選手が新規参戦しており、久しぶりに最後尾からのスタートではない。

AI の一歩先を行く

無差別級のフロンティアは毎週移動し、ラボは誰も追跡できないほど早くリリースされます。 AI Buzz Wire で AI ニュースをもっと読む では、モデルの発売、ベンチマークの内訳、その背後にあるビジネス ストーリーについてご覧いただけます。

最新の AI 開発についてはこちらをご覧ください。