Cohere a publié Parse 5 (parse-v5.0), un modèle d'analyse de documents destiné à l'ingestion de gros volumes par les entreprises, et il est désormais généralement disponible sans liste d'attente. Comme détaillé par MarkTechPost, la version est un pari que la plupart des entreprises se soucient davantage du coût par page que de la position dans le classement - un pari VentureBeat résume sans détour : Parse 5 "perd la référence en termes de points. Il gagne en termes de coût par page."
Qu'est-ce que l'analyse 5 ? Pour plus de contexte sur cette histoire, consultez notre couverture de l'industrie de l'IA.
Parse 5 est un modèle de langage de vision de 2,3 milliards de paramètres construit sur l'architecture North-Micro-Vision-Instruct de Cohere Labs, avec une fenêtre contextuelle de 8 192 jetons et une empreinte d'environ 4,6 Go. Il prend une page PDF, PowerPoint ou JPEG comme entrée codée en base64 et renvoie Markdown en un seul passage : texte dans l'ordre de lecture, tableaux rendus au format HTML, listes, paires clé-valeur de formulaire, descriptions d'images et coordonnées du cadre de délimitation pour les éléments visuels.
Le choix architectural notable est ce qu’il supprime. Il n'y a pas d'étape OCR distincte devant le modèle : la détection de la mise en page, la reconnaissance du texte et la structuration s'effectuent au sein d'un seul réseau, ce qui simplifie le déploiement et élimine une source courante d'erreurs en cascade dans les pipelines de documents traditionnels.
Cohere répertorie neuf langues comme stables – arabe, anglais, français, allemand, italien, japonais, coréen, portugais et espagnol – avec une prise en charge sans tir pour les autres avec une précision inférieure.
Deux modes de sortie
Dans son mode par défaut, Parse 5 renvoie une chaîne Markdown par page. Un deuxième mode, activé avec `output_format="blocks"`, renvoie à la place des blocs typés, où chaque bloc de table porte son code HTML, son cadre de délimitation et une description. C’est ce deuxième mode qui rend possible la traçabilité au niveau des citations : une entreprise peut indiquer exactement d’où provient un chiffre analysé sur la page, ce qui est important pour les industries réglementées qui alimentent les documents dans des systèmes de génération augmentée par récupération.
La mise en garde sur les références
Cohere rapporte un score ParseBench de 79,2 pour Parse 5, devant Mistral OCR 4 à 74,5, Azure Document Intelligence à 74,3 et Databricks AI Parse à 72,4. Mais il y a un astérisque important que l'analyse de MarkTechPost décompresse en détail.
ParseBench est une référence LlamaIndex d'environ 2 078 pages d'entreprise vérifiées par l'homme, notées selon cinq dimensions : tableaux, graphiques, fidélité du contenu, formatage sémantique et fondement visuel. Le 79,2 de Cohere ne prend en moyenne que trois de ces cinq dimensions, supprimant les graphiques et les bases visuelles – précisément les deux dimensions dans lesquelles la plupart des analyseurs fonctionnent le moins bien. Dans le classement public à cinq dimensions, les mêmes fournisseurs obtiennent des scores globalement bien inférieurs : Mistral OCR 4 et Databricks AI Parse à 60,68, Azure Document Intelligence (Layout) à 59,64, avec LlamaParse Agentic en tête du classement à 84,88. Parse 5 n'est actuellement pas répertorié dans ce classement.
En d’autres termes, le 79,2 est un score de sous-ensemble déclaré par le fournisseur, et non une couronne de référence. La moyenne tridimensionnelle d'Azure s'élève à 74,3, ce qui correspond exactement à la méthodologie de Cohere. La comparaison est donc au moins comparable à celle des pommes dans le sous-ensemble qu'elle couvre.
Le calcul des prix
C'est dans l'argument du coût que le positionnement de Cohere se concrétise. L'API Parse est au prix de 1,50 $ pour 1 000 pages, soit 0,0015 $ par page. Pour les organisations qui préfèrent une capacité dédiée, l'offre Model Vault à locataire unique coûte 4,00 $ par heure (2 500 $ par mois) sur une instance Medium, ou 7,00 $ par heure (4 300 $ par mois) sur XL.
Le point de croisement compte plus que l’un ou l’autre nombre seul. Aux tarifs mesurés, une instance Medium Vault atteint le seuil de rentabilité à environ 1,67 million de pages par mois, et XL à environ 2,87 millions. En dessous de ces volumes, appeler l'API selon les besoins est moins cher ; au-dessus d'eux, la capacité dédiée gagne en prix avant de prendre en compte les avantages de résidence des données qui conduisent généralement en premier lieu à l'adoption de Vault.
Disponibilité
Parse 5 est généralement disponible via l'API Cohere Parse, Microsoft Foundry, AWS SageMaker et les déploiements Model Vault à locataire unique. Il n’existe pas de licence de recherche pour contrôler l’accès – Cohere traite cela comme une infrastructure de production dès le premier jour.
Ce que cela signifie pour les acheteurs d'entreprise
Cette version reflète un modèle plus large en matière d’IA d’entreprise : les capacités frontalières deviennent suffisamment petites pour fonctionner à moindre coût, et les fournisseurs se font de plus en plus concurrence sur le plan économique unitaire plutôt que sur les scores bruts. Un modèle de 2,3 milliards de paramètres qui analyse les documents à 1,50 $ pour mille pages réduit le coût d'une charge de travail qui nécessitait auparavant soit des suites OCR commerciales coûteuses, soit des pipelines internes fragiles.
Le communiqué dit également quelque chose sur l'endroit où Cohere voit son ouverture. L’entreprise a axé son activité d’entreprise sur la praticité du déploiement – des modèles qui fonctionnent à moindre coût, de manière privée et prévisible dans les environnements d’entreprise – plutôt que de repousser les limites. Un analyseur de documents n'est pas glamour à côté des modèles de raisonnement frontaliers, mais l'ingestion de documents est l'une des rares charges de travail d'IA où les entreprises peuvent mesurer le retour par page aujourd'hui, et Cohere veut clairement s'approprier ces calculs.
Pour les acheteurs, le conseil pratique de l'analyse de référence est de traiter Parse 5 de la même manière que Cohere lui-même le présente - comme une prétention de tester par rapport à vos propres documents, en particulier si les graphiques et les bases visuelles sont au cœur de votre charge de travail, puisque ce sont les dimensions que son score rapporté omet. Pour l’ingestion de gros volumes de texte et de tableaux, le rapport qualité-prix est simple ; Pour analyser où les graphiques ont une signification, les leaders du classement public méritent d'être évalués en premier.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →