Cohere випустила Parse 5 (parse-v5.0), модель аналізу документів, спрямовану на завантаження великого обсягу корпоративних даних, і тепер вона загальнодоступна без списку очікування. Як уточнює MarkTechPost, випуск є впевненим, що більшість підприємств більше дбає про вартість сторінки, ніж про позицію в таблиці лідерів. VentureBeat прямо резюмував: Parse 5 «втрачає еталон за балами. Він виграє за ціною сторінки».

Що таке Parse 5 насправді For more context on this story, see our ongoing artificial intelligence updates.

Parse 5 — це мовна модель бачення з 2,3 мільярда параметрів, побудована на архітектурі Cohere Labs North-Micro-Vision-Instruct, з контекстним вікном із 8192 маркерів і розміром приблизно 4,6 ГБ. Він приймає сторінку PDF, PowerPoint або JPEG як вхідні дані в кодуванні base64 і повертає Markdown за один прохід: текст у порядку читання, таблиці, відтворені як HTML, списки, форми пар ключ-значення, описи зображень і координати обмежувальної рамки для візуальних елементів.

Примітний архітектурний вибір - це те, що він видаляє. Перед моделлю немає окремого етапу OCR — виявлення макета, розпізнавання тексту та структурування відбуваються в одній мережі, що спрощує розгортання та усуває поширене джерело каскадних помилок у традиційних конвеєрах документів.

Cohere перераховує дев’ять мов як стабільні — арабську, англійську, французьку, німецьку, італійську, японську, корейську, португальську та іспанську — з нульовою підтримкою інших із меншою точністю.

Два режими виведення

У режимі за замовчуванням Parse 5 повертає рядок Markdown на сторінку. Другий режим, увімкнений за допомогою `output_format="blocks"`, натомість повертає введені блоки, де кожен блок таблиці містить свій HTML, обмежувальну рамку та опис. Цей другий режим робить можливим відстеження рівня цитування — підприємство може вказати, звідки саме на сторінці надійшло проаналізоване число, що має значення для регульованих галузей, які передають документи в системи генерації з доповненим пошуком.

Застереження щодо тесту

Cohere повідомляє про оцінку ParseBench 79,2 для Parse 5, випереджаючи Mistral OCR 4 з 74,5, Azure Document Intelligence з 74,3 і Databricks AI Parse з 72,4. Але є важлива зірочка, яку аналіз MarkTechPost детально розпаковує.

ParseBench — це тест LlamaIndex приблизно 2078 корпоративних сторінок, перевірених людьми, оцінених за п’ятьма параметрами: таблиці, діаграми, точність вмісту, семантичне форматування та візуальне обґрунтування. Cohere 79.2 усереднює лише три з цих п’яти вимірів, діаграми та візуальне обґрунтування — саме ті два виміри, де більшість парсерів працюють найгірше. У загальнодоступній п’ятивимірній таблиці лідерів ті самі постачальники отримали набагато нижчий загальний результат: Mistral OCR 4 і Databricks AI Parse — 60,68, Azure Document Intelligence (Layout) — 59,64, а LlamaParse Agentic лідирує в рейтингу — 84,88. Parse 5 наразі не внесено до списку лідерів.

Іншими словами, 79,2 — це оцінка підмножини, яку повідомляє постачальник, а не еталонна корона. Тривимірне середнє значення Azure справді досягає 74,3, що точно відповідає методології Cohere, тому порівняння є принаймні яблуком із яблуком у підмножині, яку воно охоплює.

Математика ціноутворення

Аргумент вартості - це те, де позиціонування Cohere стає конкретним. Ціна API Parse становить 1,50 доларів США за 1000 сторінок — 0,0015 доларів США за сторінку. Для організацій, які віддають перевагу виділеній потужності, пропозиція Model Vault для одного клієнта коштує 4,00 дол. США на годину (2500 дол. США на місяць) на інсталяції Medium або 7,00 дол. США на годину (4300 дол. США на місяць) на XL.

Точка перетину має більше значення, ніж будь-яке число окремо. При вимірюваних показниках примірник Medium Vault беззбитковість складає приблизно 1,67 мільйона сторінок на місяць, а XL – приблизно 2,87 мільйона. Нижче цих обсягів виклик API за потреби є дешевшим; вище, виділена ємність виграє в ціні, не враховуючи переваги резидентності даних, які зазвичай спонукають до впровадження Vault.

Наявність

Parse 5 зазвичай доступний через API Cohere Parse, Microsoft Foundry, AWS SageMaker і розгортання Model Vault для одного клієнта. Немає доступу до дослідницької ліцензії — Cohere розглядає це як виробничу інфраструктуру з першого дня.

Що це означає для корпоративних покупців

Випуск відображає ширшу модель корпоративного штучного інтелекту: суміжних можливостей стає достатньо мало, щоб бути дешевими, а постачальники все більше конкурують за одиницю економіки, а не за загальними показниками. Модель із параметрами 2,3 В, яка аналізує документи за ціною 1,50 доларів США за тисячу сторінок, скорочує вартість робочого навантаження, для якого раніше були потрібні або дорогі комерційні пакети OCR, або крихкі внутрішні конвеєри.

У випуску також сказано дещо про те, де Cohere бачить своє відкриття. Компанія зробила ставку в корпоративному бізнесі на практичність розгортання — моделі, які працюють дешево, приватно та передбачувано в корпоративному середовищі — а не на гонитві за кордоном. Синтаксичний аналізатор документів виглядає непривабливо порівняно з передовими моделями міркування, але прийом документів є одним із небагатьох робочих навантажень штучного інтелекту, де сьогодні підприємства можуть вимірювати віддачу від сторінки, і Cohere явно хоче володіти цією математикою.

Для покупців практична порада в результаті порівняльного аналізу полягає в тому, щоб розглядати Parse 5 так, як це визначає сам Cohere — як вимогу для тестування на основі ваших власних документів, особливо якщо діаграми та візуальне обґрунтування є ключовими у вашому робочому навантаженні, оскільки це параметри, які опускаються в повідомлених оцінках. Для надсилання великого обсягу тексту та таблиць співвідношення ціни та продуктивності є простим; для аналізу того, де діаграми несуть значення, лідери публічної таблиці лідерів залишаються вартими оцінки в першу чергу.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →