Cohere ha rilasciato Parse 5 (parse-v5.0), un modello di analisi dei documenti mirato all'acquisizione aziendale di volumi elevati, ed è ora generalmente disponibile senza lista d'attesa. Come dettagliato da MarkTechPost, il rilascio è una scommessa sul fatto che la maggior parte delle aziende si preoccupa più del costo per pagina che della posizione in classifica: una scommessa VentureBeat riassume senza mezzi termini: Parse 5 "perde il benchmark in termini di punti. Vince in termini di costo per pagina."

Cos'è in realtà Parse 5 Per maggiori informazioni su questa storia, consulta la nostra aggiornamenti sull'intelligenza artificiale.

Parse 5 è un modello di linguaggio visivo da 2,3 miliardi di parametri costruito sull'architettura North-Micro-Vision-Instruct di Cohere Labs, con una finestra di contesto da 8.192 token e un ingombro di circa 4,6 GB. Richiede una pagina PDF, PowerPoint o JPEG come input con codifica base64 e restituisce Markdown in un unico passaggio: testo in ordine di lettura, tabelle rese come HTML, elenchi, coppie chiave-valore del modulo, descrizioni di immagini e coordinate del riquadro di delimitazione per gli elementi visivi.

La scelta architettonica notevole è ciò che rimuove. Non esiste una fase OCR separata davanti al modello: il rilevamento del layout, il riconoscimento del testo e la strutturazione avvengono all'interno di un'unica rete, il che semplifica l'implementazione ed elimina una fonte comune di errori a cascata nelle tradizionali pipeline di documenti.

Cohere elenca nove lingue come stabili: arabo, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese e spagnolo, con supporto zero-shot per altre con precisione inferiore.

Due modalità di uscita

Nella sua modalità predefinita, Parse 5 restituisce una stringa Markdown per pagina. Una seconda modalità, abilitata con `output_format="blocks"`, restituisce invece blocchi digitati, dove ogni blocco di tabella porta il suo HTML, il suo riquadro di delimitazione e una descrizione. Questa seconda modalità è ciò che rende possibile la tracciabilità a livello di citazione: un’azienda può indicare esattamente il punto della pagina da cui proviene una cifra analizzata, il che è importante per le industrie regolamentate che inseriscono i documenti nei sistemi di generazione aumentata del recupero.

Avvertenza sul benchmark

Cohere riporta un punteggio ParseBench di 79,2 per Parse 5, davanti a Mistral OCR 4 a 74,5, Azure Document Intelligence a 74,3 e Databricks AI Parse a 72,4. Ma c'è un asterisco importante che l'analisi di MarkTechPost spiega in dettaglio.

ParseBench è un benchmark LlamaIndex di circa 2.078 pagine aziendali verificate da esseri umani valutate in cinque dimensioni: tabelle, grafici, fedeltà dei contenuti, formattazione semantica e base visiva. Il 79,2 di Cohere calcola la media solo di tre di queste cinque dimensioni, perdendo grafici e basi visive: proprio le due dimensioni in cui la maggior parte dei parser ha prestazioni peggiori. Nella classifica pubblica a cinque dimensioni, gli stessi fornitori ottengono un punteggio complessivo molto più basso: Mistral OCR 4 e Databricks AI Parse a 60,68, Azure Document Intelligence (Layout) a 59,64, con LlamaParse Agentic in testa alla classifica a 84,88. Parse 5 non è attualmente elencato in quella classifica.

In altre parole, 79,2 è un punteggio di sottoinsieme riportato dal fornitore, non una corona di riferimento. La media tridimensionale di Azure arriva a 74,3, corrispondendo esattamente alla metodologia di Cohere, quindi il confronto è almeno da mele a mele all'interno del sottoinsieme che copre.

La matematica dei prezzi

L'argomento dei costi è il punto in cui il posizionamento di Cohere diventa concreto. Il prezzo dell'API Parse è di $ 1,50 per 1.000 pagine: $ 0,0015 per pagina. Per le organizzazioni che preferiscono la capacità dedicata, l'offerta Model Vault a tenant singolo costa $ 4,00 l'ora ($ 2.500 al mese) su un'istanza media o $ 7,00 l'ora ($ 4.300 al mese) su XL.

Il punto di crossover conta più di entrambi i numeri presi singolarmente. A tariffe misurate, un'istanza Medium Vault raggiunge il pareggio con circa 1,67 milioni di pagine al mese e XL con circa 2,87 milioni. Al di sotto di questi volumi, chiamare l'API secondo necessità è più economico; al di sopra di essi, la capacità dedicata vince in termini di prezzo prima di tenere conto dei vantaggi di residenza dei dati che di solito guidano in primo luogo l'adozione di Vault.

Disponibilità

Parse 5 è generalmente disponibile tramite l'API Cohere Parse, Microsoft Foundry, AWS SageMaker e le distribuzioni Model Vault a tenant singolo. Non esiste alcuna limitazione dell’accesso alla licenza di ricerca: Cohere la tratta come un’infrastruttura di produzione sin dal primo giorno.

Cosa significa per gli acquirenti aziendali

Il rilascio riflette un modello più ampio nell’intelligenza artificiale aziendale: le capacità adiacenti alla frontiera stanno diventando abbastanza piccole da costare a buon mercato e i fornitori competono sempre più sull’economia unitaria piuttosto che sui punteggi grezzi. Un modello di parametri da 2,3 B che analizza i documenti a 1,50 dollari per mille pagine comprime il costo di un carico di lavoro che prima richiedeva costose suite OCR commerciali o fragili pipeline interne.

Il comunicato dice anche qualcosa su dove Cohere vedrà la sua apertura. L’azienda ha puntato la propria attività aziendale sulla praticità dell’implementazione – modelli che funzionano in modo economico, privato e prevedibile all’interno degli ambienti aziendali – piuttosto che inseguire la frontiera. Un analizzatore di documenti non è affascinante rispetto ai modelli di ragionamento di frontiera, ma l'acquisizione di documenti è uno dei pochi carichi di lavoro di intelligenza artificiale in cui oggi le aziende possono misurare il rendimento per pagina, e Cohere vuole chiaramente far propria questa matematica.

Per gli acquirenti, il consiglio pratico derivante dall'analisi benchmark è di trattare Parse 5 nel modo in cui lo stesso Cohere lo inquadra: come un'affermazione da testare rispetto ai propri documenti, in particolare se grafici e basi visive sono centrali per il carico di lavoro, poiché queste sono le dimensioni che il punteggio riportato omette. Per l'acquisizione di volumi elevati, con un uso intensivo di testo e tabelle, il rapporto prezzo-prestazioni è semplice; per analizzare il significato dei grafici, vale la pena valutare per primi i leader della classifica pubblica.

---

Rimani Aggiornato sull'IA

Le ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.

Leggi altre notizie sull'IA →