Cohere 发布了 Parse 5 (parse-v5.0),这是一种旨在大容量企业摄取的文档解析模型,现已普遍可用,无需等待。正如 MarkTechPost 所详述,该版本是一个赌注,即大多数企业更关心每页成本而不是排行榜位置 - 一个赌注VentureBeat 直言不讳地总结道:Parse 5“在分数上失去了基准。它在每页成本上获胜。”

Parse 5 实际上是什么 更多相关背景,请参阅我们的AI新闻

Parse 5 是一个拥有 23 亿个参数的视觉语言模型,基于 Cohere Labs 的 North-Micro-Vision-Instruct 架构构建,具有 8,192 个令牌上下文窗口,占用空间约为 4.6GB。它采用 PDF、PowerPoint 或 JPEG 页面作为 base64 编码的输入,并一次性返回 Markdown:按阅读顺序的文本、呈现为 HTML 的表格、列表、表单键值对、图像描述和视觉元素的边界框坐标。

值得注意的架构选择是它删除的内容。模型前面没有单独的 OCR 阶段 - 布局检测、文本识别和结构化在一个网络内进行,这简化了部署并消除了传统文档管道中级联错误的常见来源。

Cohere 将九种语言列为稳定语言——阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语和西班牙语——对其他精度较低的语言提供零样本支持。

两种输出模式

在默认模式下,Parse 5 每页返回一个 Markdown 字符串。第二种模式通过 `output_format="blocks"` 启用,返回类型化块,其中每个表块都包含其 HTML、边界框和描述。第二种模式使引文级别的可追溯性成为可能——企业可以准确地指出页面上解析的数字的来源,这对于将文档输入检索增强生成系统的受监管行业很重要。

基准警告

Cohere 报告 Parse 5 的 ParseBench 得分为 79.2,领先于 Mistral OCR 4 的 74.5、Azure Document Intelligence 的 74.3 和 Databricks AI Parse 的 72.4。但是,MarkTechPost 的分析 详细解压了一个重要的星号。

ParseBench 是一个 LlamaIndex 基准测试,对大约 2,078 个经过人工验证的企业页面进行了评分,涵盖五个维度:表格、图表、内容忠实度、语义格式和视觉基础。 Cohere 的 79.2 只平均了这五个维度中的三个,放弃了图表和视觉基础——这正是大多数解析器表现最差的两个维度。在公共五维排行榜上,这些供应商的总体得分要低得多:Mistral OCR 4 和 Databricks AI Parse 得分为 60.68,Azure 文档智能(布局)得分为 59.64,LlamaParse Agentic 得分为 84.88。 Parse 5 目前未列在该排行榜上。

换句话说,79.2 是供应商报告的子集分数,而不是基准分数。 Azure 的三维平均值确实为 74.3,与 Cohere 的方法完全匹配,因此在其涵盖的子集中进行的比较至少是同类比较。

定价数学

成本争论是 Cohere 的定位变得具体的地方。 Parse API 的定价为每 1,000 个页面 1.50 美元 - 每页 0.0015 美元。对于喜欢专用容量的组织,单租户 Model Vault 产品在中型实例上运行每小时 4.00 美元(每月 2,500 美元),在 XL 上运行每小时 7.00 美元(每月 4,300 美元)。

交叉点比任何一个数字都更重要。按照计量费率,Medium Vault 实例每月大约 167 万页实现盈亏平衡,XL 则约为 287 万页。低于这些量,根据需要调用 API 的成本会更低;高于它们的是,在考虑通常首先推动 Vault 采用的数据驻留优势之前,专用容量在价格上获胜。

可用性

Parse 5 通常可通过 Cohere Parse API、Microsoft Foundry、AWS SageMaker 和单租户 Model Vault 部署使用。没有研究许可证限制访问——Cohere 从第一天起就将其视为生产基础设施。

这对企业买家意味着什么

该版本反映了企业人工智能中更广泛的模式:前沿能力变得足够小,可以廉价运行,供应商越来越多地在单位经济效益而不是原始分数上进行竞争。 2.3B 参数模型以每千页 1.50 美元的价格解析文档,从而压缩了工作负载的成本,而过去需要昂贵的商业 OCR 套件或脆弱的内部管道。

该新闻稿还透露了 Cohere 的开放方向。该公司将其企业业务押注于部署实用性——在企业环境中廉价、私密且可预测地运行的模型——而不是追逐前沿。与前沿推理模型相比,文档解析器显得乏善可陈,但文档摄取是当今企业可以衡量每页回报的少数人工智能工作负载之一,而 Cohere 显然希望拥有这一数学能力。

对于购买者来说,基准分析的实用建议是按照 Cohere 本身的框架来对待 Parse 5——作为根据您自己的文档进行测试的声明,特别是如果图表和视觉基础是您的工作量的核心,因为这些是其报告分数忽略的维度。对于大容量、文本和表格较多的摄取,性价比非常简单;为了解析图表的含义,公共排行榜的领导者仍然值得首先评估。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →