自律型 AI エージェントを評価するためのシミュレートされたデジタル環境を構築する新興企業である Patronus AI は、信頼性の高いエージェント テストの需要が急増する中、シリーズ B ラウンドで 5,000 万ドルを調達しました。 TechCrunchの報告によると、このラウンドはGreenfield Partnersが主導し、Notable Capital、Lightspeed、Datadog、Samsungが参加し、同社の総資金調達額は7,000万ドルとなったという。
新たな問題: 近道をするエージェント この件の詳細は、人工知能の最新情報をご覧ください。
AI エージェントが質問に答えることから、複雑な複数ステップのタスクを自律的に実行するように進化するにつれて、モデルプロバイダーやそのようなエージェントを構築する新興企業は、システムが広範囲のシナリオにわたって確実に動作するという保証を必要としています。 AI ラボは、モデルの能力を誇示するためにベンチマークを使用することがよくありますが、エージェント指向のベンチマークでの高いスコアは、AI が実際に現実世界のジョブを正しく実行できることを証明するものではありません。
Patronus AI はこのギャップに注目します。元メタ AI 研究者のアナンド・カナッパン氏とレベッカ・キアン氏によって 2023 年に設立されたサンフランシスコに本拠を置くこの会社は、「デジタル ワールド モデル」と呼ばれるもの、つまり Web サイトのレプリカと、エージェントがトレーニング後にストレス テストを受ける社内システムを構築しています。エージェントは強化学習を使用して評価され、タスクの正常な完了に繰り返し報酬を与え、エラーにペナルティを与えます。
自動運転車からの借用
同社は、ウェイモが自動運転車を訓練した方法と自社のアプローチを比較しており、まず合成ワールドを構築して、悪天候やボールを追いかける子供などの稀な危険に対して車両をテストする。 AI エージェントとの主な違いは、AI エージェントは近道をする傾向があり、タスクが成功したように見えても、タスクを正しく完了できないことを意味します。
「パトロナスは、ハッキングを発見し、モデルに責任を負わせていることを確認するのが非常に上手です」と、ノータブル・キャピタルのマネージング・ディレクター、グレン・ソロモン氏は言う。 Solomon 氏は、同社のシミュレート環境に対する需要はほぼ飽くなきものであると述べました。現在、ほぼすべてのフロンティア AI ラボと多くの新興スタートアップ企業が顧客となっており、Patronus の収益は過去 1 年間で 15 倍に増加しました。
検証可能なタスクを超えた拡張
Patronus は現在、ソフトウェア エンジニアリングと金融、つまり結果が比較的簡単に検証できる 2 つの領域にシミュレートされたデジタル世界を提供しています。しかし同社は、これらはほんの始まりにすぎないと考えている。 「今日、私たちは検証可能な問題、すぐに確認して検証できる問題に重点を置いていますが、検証できない、または検証するのが非常に難しい領域はさらに山ほどあります」とカナッパン氏は述べた。
目標は、長期にわたってエージェントをテストできる十分な環境を構築することです。 「私たちは、10 時間、10 日、または 10 週間実行できるエージェントを運用できる環境を実際に構築できるようにしたいと考えています」とKannappan 氏は述べています。プロセスが検証可能であるからといって、プロセスが単純であるとは限りません。数日間にわたるワークフローの途中でエージェントの失敗を発見できることは、会社の価値提案の中心です。
この資金は、広範な AI 業界が進歩を測定する方法に取り組んでいるときにも到着します。ベンチマーク スコアは議論の対象となっており、実際のタスクを真に改善することなく、ゲーム固有のテストに合わせてモデルを最適化できると批評家が主張しています。 Patronus のシミュレートされた環境は、成功の唯一の証拠がリーダーボードの数字ではなく、正しく完了したジョブであるという、オープンエンドのシナリオでエージェントをテストする代替手段を提供します。
企業顧客にとって、その違いは重要です。ベンチマークには合格したものの、実稼働コードベースにバグを黙って持ち込むコーディング エージェントや、数値の四捨五入を誤った財務エージェントは、低いテスト スコアが示唆するよりもはるかに大きな損害を引き起こす可能性があります。導入前にサンドボックスでこれらの障害を検出することで、Patronus は評価を後付けではなく信頼の前提条件として位置づけています。
混雑したフィールドでの独特のアプローチ
ライバルについては、主に AI ラボがエージェントの行動を評価するために構築した内部評価チームと競合しているとパトロナスは考えています。 Mercor や Surge などのヒューマンデータ企業は強化学習でモデル作成者を支援していますが、Patronus は人間の介入なしにエージェントの動作を評価することで異なる運用を行っており、コストのかかる手動レビューが必要となる障害の検出を自動化しています。
このラウンドは、エージェントの評価が AI スタックの基礎層になるという投資家への確信を示しています。旅行の予約から財務分析の実施に至るまで、エージェントがより自律的な作業を担うようになるにつれ、それらのシステムが導入前に信頼できるものであることを証明できる新興企業は、エージェント型 AI 時代への不可欠なゲートキーパーとしての地位を確立しつつあります。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →


