Cohere は、企業の大規模な取り込みを目的としたドキュメント解析モデルである Parse 5 (parse-v5.0) をリリースしました。現在、待機リストなしで一般提供されています。 MarkTechPost で詳しく説明されているように、このリリースは、ほとんどの企業がリーダーボードでの順位よりもページあたりのコストを重視するという賭けです。 VentureBeat は率直に要約しています: Parse 5 は「ポイントではベンチマークに負けていますが、ページあたりのコストでは勝っています。」

Parse 5 とは実際には何なのか この件の詳細は、人工知能の最新情報をご覧ください。

Parse 5 は、Cohere Labs の North-Micro-Vision-Instruct アーキテクチャに基づいて構築された 23 億パラメータのビジョン言語モデルで、8,192 トークンのコンテキスト ウィンドウと約 4.6 GB のフットプリントを備えています。 PDF、PowerPoint、または JPEG ページを Base64 でエンコードされた入力として受け取り、単一パスで Markdown を返します。読み取り順のテキスト、HTML としてレンダリングされた表、リスト、フォームのキーと値のペア、画像の説明、およびビジュアル要素の境界ボックス座標です。

注目すべきアーキテクチャ上の選択は、何を削除するかです。モデルの前に個別の OCR ステージはありません。レイアウトの検出、テキスト認識、構造化が 1 つのネットワーク内で行われるため、展開が簡素化され、従来のドキュメント パイプラインにおける連鎖エラーの一般的な原因が排除されます。

Cohereは、アラビア語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、スペイン語の9言語を安定している言語として挙げていますが、他の言語については精度が低いもののゼロショットサポートを行っています。

2 つの出力モード

デフォルト モードでは、Parse 5 はページごとに Markdown 文字列を返します。 `output_format="blocks"` で有効になる 2 番目のモードは、代わりに型指定されたブロックを返します。各テーブル ブロックには HTML、その境界ボックス、および説明が含まれます。この 2 番目のモードは、引用レベルのトレーサビリティを可能にするものです。企業は、解析された図がページのどこから来たのかを正確に指摘できます。これは、文書を検索拡張生成システムにフィードする規制産業にとって重要です。

ベンチマークの警告

Cohere は、Parse 5 の ParseBench スコアが 79.2 であると報告しており、Mistral OCR 4 の 74.5、Azure Document Intelligence の 74.3、Databricks AI Parse の 72.4 を上回っています。しかし、MarkTechPost の分析 によって詳細に明らかにされる重要なアスタリスクがあります。

ParseBench は、人間が検証した約 2,078 のエンタープライズ ページの LlamaIndex ベンチマークであり、表、グラフ、コンテンツの忠実性、セマンティックな書式設定、視覚的基礎の 5 つの側面にわたってスコア付けされています。 Cohere の 79.2 の平均値は、これら 5 つの次元のうち、チャートと視覚的根拠を落とした 3 つだけです。まさに、ほとんどのパーサーのパフォーマンスが最も悪い 2 つの次元です。公開されている 5 次元リーダーボードでは、同じベンダーの全体的なスコアははるかに低く、Mistral OCR 4 と Databricks AI Parse が 60.68、Azure Document Intelligence (Layout) が 59.64、LlamaParse Agentic が 84.88 でトップとなっています。 Parse 5 は現在、そのリーダーボードにリストされていません。

言い換えれば、79.2 はベンダーが報告したサブセット スコアであり、ベンチマークの王冠ではありません。 Azure の 3 次元平均は 74.3 となり、Cohere の方法論と正確に一致します。そのため、対象とするサブセット内では少なくとも比較は同等です。

価格計算

Cohereの位置付けが具体化されるのはコストの議論だ。 Parse API の価格は、1,000 ページあたり 1.50 ドル、つまり 1 ページあたり 0.0015 ドルです。専用の容量を好む組織の場合、シングルテナントの Model Vault オファリングは、Medium インスタンスでは 1 時間あたり 4.00 ドル (月額 2,500 ドル)、XL では 1 時間あたり 7.00 ドル (月額 4,300 ドル) で実行されます。

クロスオーバー ポイントは、どちらかの数値だけよりも重要です。従量制料金では、Medium Vault インスタンスは月間約 167 万ページ、XL は約 287 万ページで損益分岐点になります。これらのボリューム未満では、必要に応じて API を呼び出す方がコストが安くなります。これらを上回ると、通常、最初に Vault の採用を促進するデータ常駐の利点を考慮する前に、専用容量が価格で勝ちます。

可用性

Parse 5 は、Cohere Parse API、Microsoft Foundry、AWS SageMaker、およびシングルテナントの Model Vault デプロイメントを通じて一般提供されます。アクセスを制御する研究ライセンスはありません。Cohere はこれを初日から運用インフラストラクチャとして扱います。

企業バイヤーにとっての意味

このリリースは、エンタープライズ AI のより広範なパターンを反映しています。つまり、フロンティア隣接機能は低コストで実行できるほど小さくなり、ベンダーは素のスコアではなくユニット エコノミクスで競争するようになっています。 1,000 ページあたり 1.50 ドルでドキュメントを解析する 2.3B パラメータ モデルは、これまで高価な商用 OCR スイートか脆弱な社内パイプラインのいずれかを必要としていたワークロードのコストを圧縮します。

このリリースには、Cohere がその始まりをどのように見ているかについても書かれています。同社は、エンタープライズ ビジネスを、フロンティアを追い求めるのではなく、導入の実用性、つまり企業環境内で安価に、非公開で、予測どおりに実行されるモデルに賭けています。ドキュメント パーサーは、フロンティア推論モデルに比べれば地味ですが、ドキュメントの取り込みは、今日企業がページごとの利益を測定できる数少ない AI ワークロードの 1 つであり、Cohere がその計算を所有したいと考えているのは明らかです。

購入者にとって、ベンチマーク分析からの実践的なアドバイスは、Cohere 自体がフレームワークを構成する方法と同じように Parse 5 を扱うことです。特にチャートや視覚的基礎がワークロードの中心である場合は、報告されるスコアで省略されている要素であるため、自分のドキュメントに対してテストするための主張として扱います。大量のテキストと表を大量に取り込む場合、価格パフォーマンスのケースは単純です。チャートがどのような意味を持っているかを解析するために、公開リーダーボードのリーダーは依然として最初に評価する価値があります。

---

AIの最新情報をお届け

AIの最新ニュース、分析、ブレイクスルーを一箇所で。

AIニュースをもっと読む →