Cohere выпустила Parse 5 (parse-v5.0), модель синтаксического анализа документов, предназначенную для обработки больших объемов корпоративных документов, и теперь она общедоступна без списка ожидания. Как подробно описано в MarkTechPost, этот релиз представляет собой ставку на то, что большинство предприятий больше заботится о стоимости страницы, чем о позиции в таблице лидеров. VentureBeat подвел итог: Parse 5 «теряет эталон по баллам. Он выигрывает по стоимости страницы».

Что на самом деле представляет собой Parse 5 Подробнее об этой истории — в нашем тенденции ИИ.

Parse 5 — это языковая модель машинного зрения с 2,3 миллиарда параметров, построенная на архитектуре North-Micro-Vision-Instruct от Cohere Labs, с контекстным окном из 8192 токенов и занимаемым объемом примерно 4,6 ГБ. Он принимает страницу PDF, PowerPoint или JPEG в качестве входных данных в кодировке Base64 и возвращает Markdown за один проход: текст в порядке чтения, таблицы, отображаемые как HTML, списки, пары «ключ-значение», описания изображений и координаты ограничительной рамки для визуальных элементов.

Примечательный архитектурный выбор – это то, что он удаляет. Перед моделью нет отдельного этапа OCR — обнаружение макета, распознавание текста и структурирование происходят внутри одной сети, что упрощает развертывание и устраняет общий источник каскадных ошибок в традиционных конвейерах документов.

Cohere называет девять стабильных языков — арабский, английский, французский, немецкий, итальянский, японский, корейский, португальский и испанский — с нулевой поддержкой других с более низкой точностью.

Два режима вывода

В режиме по умолчанию Parse 5 возвращает строку Markdown на каждой странице. Второй режим, активируемый с помощью `output_format="blocks"`, вместо этого возвращает типизированные блоки, где каждый блок таблицы содержит свой HTML, ограничивающую рамку и описание. Именно второй режим делает возможным отслеживание на уровне цитирования — предприятие может точно указать, откуда на странице взялась проанализированная цифра, что важно для регулируемых отраслей, передающих документы в системы генерации с расширенным поиском.

Предостережение относительно эталонного теста

Cohere сообщает о показателе ParseBench 79,2 для Parse 5, опережая Mistral OCR 4 с 74,5, Azure Document Intelligence с 74,3 и Databricks AI Parse с 72,4. Но есть важная звездочка, которую анализ MarkTechPost подробно раскрывает.

ParseBench — это тест LlamaIndex, включающий около 2078 проверенных человеком корпоративных страниц, оцениваемых по пяти измерениям: таблицы, диаграммы, достоверность контента, семантическое форматирование и визуальное обоснование. Показатель Cohere 79,2 усредняет только три из этих пяти измерений, пропуская диаграммы и визуальное обоснование — именно в этих двух измерениях большинство парсеров работают хуже всего. В общедоступной пятимерной таблице лидеров те же поставщики в целом набрали гораздо более низкие баллы: Mistral OCR 4 и Databricks AI Parse с 60,68, Azure Document Intelligence (Layout) с 59,64, а LlamaParse Agentic лидирует с 84,88. Parse 5 в настоящее время не указан в этой таблице лидеров.

Другими словами, 79,2 — это показатель подмножества, заявленный поставщиком, а не эталонный показатель. Трехмерное среднее значение Azure действительно составляет 74,3, что точно соответствует методологии Cohere, поэтому сравнение проводится, по крайней мере, в пределах охватываемого подмножества.

Математика ценообразования

Аргумент стоимости – вот где позиционирование Cohere становится конкретным. Стоимость API Parse составляет 1,50 доллара США за 1000 страниц — 0,0015 доллара США за страницу. Для организаций, предпочитающих выделенную емкость, одноарендное предложение Model Vault стоит 4 доллара США в час (2500 долларов США в месяц) на экземпляре Medium или 7 долларов США в час (4300 долларов США в месяц) на экземпляре XL.

Точка пересечения имеет большее значение, чем любое число по отдельности. При дозированных тарифах экземпляр Medium Vault выходит на уровень безубыточности примерно на уровне 1,67 миллиона страниц в месяц, а экземпляр XL — примерно на 2,87 миллиона. Ниже этих объемов вызов API по мере необходимости обходится дешевле; выше них выделенная емкость выигрывает по цене без учета преимуществ постоянного хранения данных, которые обычно в первую очередь способствуют внедрению Vault.

Доступность

Parse 5 обычно доступен через API Cohere Parse, Microsoft Foundry, AWS SageMaker и однотенантные развертывания Model Vault. Доступ к лицензии на исследования отсутствует — Cohere с первого дня рассматривает это как производственную инфраструктуру.

Что это значит для корпоративных покупателей

Этот релиз отражает более широкую картину в корпоративном ИИ: смежные возможности становятся достаточно маленькими, чтобы работать дешево, а поставщики все чаще конкурируют на основе юнит-экономики, а не на чистых показателях. Модель с 2,3 миллиарда параметров, которая анализирует документы по цене 1,50 доллара США за тысячу страниц, сокращает стоимость рабочей нагрузки, которая раньше требовала либо дорогих коммерческих пакетов оптического распознавания символов, либо хрупких внутренних конвейеров.

В релизе также говорится о том, где Cohere видит свое открытие. Компания сделала ставку в своем корпоративном бизнесе на практичность развертывания — модели, которые работают дешево, конфиденциально и предсказуемо внутри корпоративной среды — вместо того, чтобы гоняться за новизной. Анализатор документов выглядит непривлекательно по сравнению с передовыми моделями рассуждения, но прием документов — одна из немногих рабочих нагрузок ИИ, где предприятия сегодня могут измерить отдачу от страницы, и Cohere явно хочет владеть этой математикой.

Практический совет для покупателей, основанный на сравнительном анализе, заключается в том, чтобы относиться к Parse 5 так, как его формулирует сам Cohere, — как к требованию к тестированию на основе ваших собственных документов, особенно если диаграммы и визуальное обоснование занимают центральное место в вашей рабочей нагрузке, поскольку это те измерения, которые его заявленная оценка не учитывается. Для больших объемов обработки большого количества текста и таблиц соотношение цены и качества является простым; Для анализа того, какое значение имеют диаграммы, в первую очередь стоит оценить лидеров публичной таблицы лидеров.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →