元 OpenAI 研究者によって設立された新しい AI スタートアップ企業は、まったく新しいクラスのモデルと呼ばれるもの、つまりエッセイを書くこともできないモデルを立ち上げましたが、それがまさに重要だと述べています。

TypeSafe AI は火曜日、Jev という名前の最初の「System One Model」のリリースを発表し、早期アクセスですぐに利用可能になりました。同社はディオゴ・アルメイダによって設立されました。彼は、ChatGPT の指示に従って行う研究は、OpenAI で貢献した研究から生まれたと述べています。 2年間隠密生活を続けてきたが、業界がチャットに執着するあまり、自動化が実際にどこで失敗するのかが見えにくくなっていると同氏は主張している。 この件の詳細は、人工知能の最新情報をご覧ください。

「モデルは何年もチャットにおいて超人的な能力を発揮してきたのに、自動化はどこに行ったのでしょうか?」アルメイダは創刊記事にこう書いています。 「それが過去 4 年間の私の疑問でした。」

「System One」モデルの実際とは

この名前は、心理学における、速く本能的な思考とゆっくりとした意図的な推論の区別に由来しています。大規模な言語モデルがトークンごとにテキスト トークンを生成する場合 (柔軟で汎用性があり、時折確信犯的なナンセンスが発生しやすい)、TypeSafe の Jev はより狭い範囲のことを行うように構築されています。つまり、非構造化状態を入力として受け取り、調整された確率が付加された型付けされた構造化された決定を返します。

同社はJevを「フロンティアインテリジェンスの機能呼び出し、つまり構造化されていない状態を入力し、型付けされた確率的な決定を出力する」と説明している。考えられる出力は事前に定義されており、モデルは自由形式の文字列を生成しないため、TypeSafe は型エラー (同社によれば、この特性は統計的にあり得ることではなく数学的に保証されているとしている) を生成することはできず、テキスト生成モデルのように幻覚を起こすこともないと主張している。

ローンチポストによれば、このアーキテクチャは 3 つの点で主流の実践から逸脱しています。それは、新しいモデル アーキテクチャ、すべての出力を逐次ではなく 1 回のクエリで生成する並列サンプラー、そして同社が調整された意思決定のための強化学習 (RLCD) と呼ぶトレーニング方法です。これは、人間の好みやプログラムで検証可能な出力ではなく、認識論的に正直な確率を最適化します。

主張: 100 倍高速、コストは数分の一

TypeSafe が公開する数値は積極的です。同社によれば、Jev は、分類、ルーティング、スコアリング、抽出、分岐の決定など、いわゆる「System One 型」タスクに関して既存のフロンティア LLM と同等のインテリジェンスを提供し、フロンティア モデルのエンドツーエンド応答時間は 3 ~ 329 秒であるのに対し、70 ~ 500 ミリ秒で応答します。これにより、40 倍から 200 倍の速度が得られると同社は述べています。

価格も同様に型破りで、出力はトークンごとに生成されるのではなく並行して計算されるため、入力トークン 100 万個あたり 0.042 ドルで、出力トークンは無料です。同社は投稿の中で、価格設定が大規模に持続可能であることをまだ証明できないことを認めた。

投稿では、「並外れた主張には並外れた証拠が必要だ」と書かれ、その後、どのような証拠があるかを提示した。

領収書と懐疑論者の意見

TypeSafe は、Jev と GPT-5.6 Terra を比較する並列デモを公開しました。GPT-5.6 Terra は、同様のインテリジェンスを備えた最も同等のフロンティア モデルであると説明しており、記録された実行における唯一の意見の相違は、真に曖昧な判断に関係していると述べています。また、固定計算グラフ内で最大の外部モデル(OpenAIのAstraとAnthropicのFable)のコンセンサスに対してモデルを測定する新しい「ワークフロー評価」手法も導入し、Jevは「ほぼ2桁のパレートフロンティアを所有している」と主張している。

注目すべきは、同社が「antibenchmaxxing」というタイトルの付随投稿を公開し、従来のベンチマークを回避する理由を説明し、ソフトウェアワークフロー内の構造化された意思決定用に設計されたモデルが有意義なグローバル比較に抵抗すると主張したことだ。

この発表が数時間以内に数百ポイントを集めた Hacker News での反応は、純粋な興奮から鋭い懐疑論まで多岐にわたりました。数人のコメント投稿者は、公開された証拠の大部分が、再現可能なサードパーティによる評価ではなく、Doom ゲームプレイ ループに動力を供給するモデルを示すデモビデオなどで構成されていると指摘しました。このアプローチは、LLM の代替ではなく、ワークロードのスライスに役立つ、非常に高速なフロンティア品質の分類器として最もよく理解されていると主張する人もいます。

同情的な観察者でさえ、立証責任を明確に定めている。あるコメント投稿者は、「確かに、彼らは懐疑論者として話しているが、数本のデモビデオ以外には大量の証拠を提供していない」と書いている。 「ライブデモの方がはるかに説得力があるでしょう。」

とにかくそれが重要な理由

ピッチは本当に痛いところに着地する。商用ソフトウェアにおける実稼働 LLM 呼び出しの大部分は、まったく生成的ではありません。それらは、散文に包まれた二分法判断、カテゴリ割り当て、およびルーティング決定です。モデルがこれらの呼び出しを 70 ミリ秒で調整された信頼性で実行でき、出力コストが実質的にゼロになれば、AI を活用したソフトウェアの経済性は大きく変わります。リアルタイム ユーザー インターフェイスが実用的になり、LLM で自動化するには高すぎたパイプライン ステップが安価になり、どこでも実行できるようになります。

TypeSafe が提案するユースケースには、データの分類とルーティング、LLM 出力の検証と保護、ジェイルブレイクの検出、大規模なデータセットに対するマップ削減分析が含まれます。ワークロードでは、周囲のコードがモデルの自由度を制限し、エラーをキャッチする可能性があります。

同社は未解決の疑問について率直に答えている。同社が公開した評価は米国西海岸のラップトップから実行されており、長期的な価格の持続可能性は依然として証明されていない。 Jev のインテリジェンスに関する主張が独立したテストとの接触に耐えられるかどうかによって、「System One モデル」がカテゴリになるか、それとも好奇心の対象になるかが決まります。

現在、同社Webサイトから早期アクセスが開始されている。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →