Cohere har släppt Parse 5 (parse-v5.0), en dokumentanalysmodell som syftar till att ta in stora volymer av företag, och den är nu allmänt tillgänglig utan väntelista. Som beskrivs av MarkTechPost, är utgåvan en satsning på mer än en satsning på en satsning på en satsning på en position per sida VentureBeat sammanfattat rakt på sak: Parse 5 "förlorar riktmärket på poäng. Det vinner på kostnad per sida."

Vad Parse 5 faktiskt är For more context on this story, see our ongoing artificial intelligence updates.

Parse 5 är en visionspråkmodell med 2,3 miljarder parametrar byggd på Cohere Labs North-Micro-Vision-Instruct-arkitektur, med ett kontextfönster på 8 192 token och ett fotavtryck på ungefär 4,6 GB. Det tar en PDF-, PowerPoint- eller JPEG-sida som en base64-kodad indata och returnerar Markdown i ett enda pass: text i läsordning, tabeller renderade som HTML, listor, bildnyckel-värdepar, bildbeskrivningar och markeringsrutakoordinater för visuella element.

Det anmärkningsvärda arkitektoniska valet är vad det tar bort. Det finns inget separat OCR-steg framför modellen – layoutdetektering, textigenkänning och strukturering sker inom ett nätverk, vilket förenklar driftsättningen och eliminerar en vanlig källa till kaskadfel i traditionella dokumentpipelines.

Cohere listar nio språk som stabila – arabiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska och spanska – med noll-shot-stöd för andra med lägre noggrannhet.

Två utgångslägen

I standardläget returnerar Parse 5 en Markdown-sträng per sida. Ett andra läge, aktiverat med `output_format="blocks"`, returnerar maskinskrivna block istället, där varje tabellblock har sin HTML, sin begränsningsram och en beskrivning. Det andra läget är det som gör spårbarhet på citeringsnivå möjlig – ett företag kan peka tillbaka till exakt var på sidan en tolkad figur kom ifrån, vilket är viktigt för reglerade industrier som matar in dokument till system för återvinningsförstärkt generation.

The Benchmark Caveat

Cohere rapporterar ett ParseBench-poäng på 79,2 för Parse 5, före Mistral OCR 4 på 74,5, Azure Document Intelligence på 74,3 och Databricks AI Parse på 72,4. Men det finns en viktig asterisk som MarkTechPosts analys.

ParseBench är ett LlamaIndex-riktmärke med ungefär 2 078 människoverifierade företagssidor med poäng i fem dimensioner: tabeller, diagram, innehållstrohet, semantisk formatering och visuell grund. Cohere's 79.2 är i genomsnitt bara tre av dessa fem dimensioner, fallande diagram och visuell jordning - exakt de två dimensionerna där de flesta analyserare presterar sämst. På den offentliga femdimensionella topplistan får samma leverantörer mycket lägre totalt sett: Mistral OCR 4 och Databricks AI Parse på 60,68, Azure Document Intelligence (layout) på 59,64, med LlamaParse Agentic som leder tavlan på 84,88. Parse 5 är för närvarande inte listad på den topplistan.

Med andra ord, 79.2 är en leverantörsrapporterad delmängdspoäng, inte en benchmark-krona. Azures tredimensionella medelvärde fungerar till 74,3, vilket matchar Coheres metod exakt - så jämförelsen är åtminstone äpplen-till-äpplen inom den delmängd som den täcker.

Prissättningsmatematiken

Kostnadsargumentet är där Coheres positionering blir konkret. Parse API kostar 1,50 USD per 1 000 sidor – 0,0015 USD per sida. För organisationer som föredrar dedikerad kapacitet, kostar modellvalvet med en hyresgäst 4,00 USD per timme (2 500 USD per månad) på en Medium-instans, eller 7,00 USD per timme (4 300 USD per månad) på XL.

Övergångspunkten är viktigare än båda siffrorna ensamma. Till uppmätta priser går en Medium Vault-instans jämnt ut med ungefär 1,67 miljoner sidor per månad och XL med ungefär 2,87 miljoner. Under dessa volymer är det billigare att anropa API vid behov; ovanför dem vinner dedikerad kapacitet på priset innan man tar hänsyn till fördelarna med data-residency som vanligtvis driver Vault-anpassningen i första hand.

Tillgänglighet

Parse 5 är allmänt tillgängligt via Cohere Parse API, Microsoft Foundry, AWS SageMaker och modellvalv med en hyresgäst. Det finns ingen tillgång till forskningslicenser – Cohere behandlar detta som produktionsinfrastruktur från dag ett.

Vad det betyder för företagsköpare

Utgåvan speglar ett bredare mönster inom företags-AI: kapacitet nära gränsen blir tillräckligt liten för att kunna köras billigt, och leverantörer konkurrerar i allt högre grad på enhetsekonomi snarare än råresultat. En 2,3B-parametermodell som analyserar dokument för 1,50 USD per tusen sidor komprimerar kostnaden för en arbetsbelastning som tidigare krävde antingen dyra kommersiella OCR-sviter eller sköra interna pipelines.

Releasen säger också något om var Cohere ser sin öppning. Företaget har satsat sin företagsverksamhet på praktisk driftsättning – modeller som körs billigt, privat och förutsägbart i företagsmiljöer – snarare än att jaga gränsen. En dokumenttolkare är oglamorös bredvid frontierresonemangsmodeller, men dokumentintag är en av få AI-arbetsbelastningar där företag kan mäta avkastningen per sida idag, och Cohere vill helt klart äga den matematiken.

För köpare är det praktiska rådet från benchmarkanalysen att behandla Parse 5 som Cohere själv ramar in det - som ett anspråk på att testa mot dina egna dokument, särskilt om diagram och visuell grund är centrala för din arbetsbelastning, eftersom det är de dimensioner som dess rapporterade poäng utelämnar. För stora volymer, text-och-bord-tunga intag, pris-prestanda fall är okomplicerat; för att analysera där diagram har betydelsen, förblir den offentliga topplistans ledare värda att utvärdera först.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →