Cohere는 대규모 기업 수집을 목표로 하는 문서 구문 분석 모델인 Parse 5(parse-v5.0)를 출시했으며 이제 대기자 명단 없이 일반적으로 사용할 수 있습니다. MarkTechPost에 자세히 설명된 바와 같이 이번 릴리스는 대부분의 기업이 리더보드 위치보다 페이지당 비용에 더 관심을 갖는다는 점을 의미합니다. VentureBeat는 직설적으로 요약합니다. Parse 5는 "포인트 측면에서 벤치마크를 잃었습니다. 페이지당 비용 측면에서 승리했습니다."
Parse 5가 실제로 무엇인지 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.
Parse 5는 Cohere Labs의 North-Micro-Vision-Instruct 아키텍처를 기반으로 구축된 23억 매개변수의 비전 언어 모델로, 8,192개의 토큰 컨텍스트 창과 약 4.6GB의 설치 공간을 갖추고 있습니다. PDF, PowerPoint 또는 JPEG 페이지를 base64로 인코딩된 입력으로 사용하고 단일 패스로 Markdown을 반환합니다. 즉, 읽기 순서의 텍스트, HTML로 렌더링된 테이블, 목록, 양식 키-값 쌍, 이미지 설명 및 시각적 요소에 대한 경계 상자 좌표를 반환합니다.
주목할만한 아키텍처 선택은 제거되는 것입니다. 모델 앞에 별도의 OCR 단계가 없습니다. 레이아웃 감지, 텍스트 인식 및 구조화가 하나의 네트워크 내에서 발생하므로 배포가 단순화되고 기존 문서 파이프라인에서 연쇄 오류의 일반적인 원인이 제거됩니다.
Cohere는 아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 스페인어 등 9개 언어를 안정적으로 나열하고 있으며 다른 언어는 정확도가 낮더라도 제로샷을 지원합니다.
두 가지 출력 모드
기본 모드에서 Parse 5는 페이지당 Markdown 문자열을 반환합니다. `output_format="blocks"`로 활성화된 두 번째 모드는 대신 입력된 블록을 반환합니다. 여기서 각 테이블 블록은 HTML, 경계 상자 및 설명을 전달합니다. 두 번째 모드는 인용 수준의 추적성을 가능하게 합니다. 기업은 구문 분석된 수치가 페이지에서 정확히 어디에서 왔는지 다시 가리킬 수 있으며, 이는 검색 증강 생성 시스템에 문서를 공급하는 규제 산업에 중요합니다.
벤치마크 주의사항
Cohere는 Parse 5의 ParseBench 점수 79.2점을 보고했으며, 이는 Mistral OCR 4의 74.5점, Azure Document Intelligence의 74.3점, Databricks AI Parse의 72.4점보다 앞서 있습니다. 하지만 MarkTechPost의 분석에서 자세히 설명하는 중요한 별표가 있습니다.
ParseBench는 테이블, 차트, 콘텐츠 충실도, 의미 체계 형식 및 시각적 기반이라는 5가지 차원에 걸쳐 점수가 매겨진 대략 2,078개의 인간 검증 기업 페이지에 대한 LlamaIndex 벤치마크입니다. Cohere의 79.2는 5개 차원 중 3개 차원(드롭 차트 및 시각적 기반)만을 평균화합니다. 정확히 말하면 대부분의 파서 성능이 가장 낮은 두 차원입니다. 공개 5차원 순위표에서는 동일한 공급업체가 전반적으로 훨씬 낮은 점수를 받았습니다. Mistral OCR 4 및 Databricks AI Parse는 60.68점, Azure Document Intelligence(레이아웃)는 59.64점, LlamaParse Agentic이 84.88점으로 선두를 달리고 있습니다. Parse 5는 현재 해당 순위표에 나열되어 있지 않습니다.
즉, 79.2는 벤치마크 크라운이 아니라 벤더가 보고한 하위 집합 점수입니다. Azure의 3차원 평균은 74.3으로 계산되어 Cohere의 방법론과 정확하게 일치합니다. 따라서 비교는 포함되는 하위 집합 내에서 최소한 동일합니다.
가격 계산
비용 논쟁은 Cohere의 포지셔닝이 구체화되는 부분입니다. Parse API의 가격은 1,000페이지당 $1.50(페이지당 $0.0015)입니다. 전용 용량을 선호하는 조직의 경우 단일 테넌트 Model Vault 제품은 중간 인스턴스에서 시간당 $4.00(월 $2,500), XL에서 시간당 $7.00(월 $4,300)를 실행합니다.
교차점은 숫자보다 더 중요합니다. 측정된 요금으로 Medium Vault 인스턴스는 월별 약 167만 페이지, XL은 약 287만 페이지로 중단됩니다. 해당 볼륨 이하에서는 필요에 따라 API를 호출하는 것이 더 저렴합니다. 그 위에는 일반적으로 Vault 채택을 촉진하는 데이터 상주 이점을 고려하기 전에 전용 용량이 가격 측면에서 승리합니다.
가용성
Parse 5는 일반적으로 Cohere Parse API, Microsoft Foundry, AWS SageMaker 및 단일 테넌트 Model Vault 배포를 통해 사용할 수 있습니다. 연구 라이센스 게이팅 액세스는 없습니다. Cohere는 이를 처음부터 생산 인프라로 취급합니다.
기업 구매자에게 미치는 영향
이 릴리스는 엔터프라이즈 AI의 더 광범위한 패턴을 반영합니다. 국경에 인접한 기능은 저렴하게 운영될 만큼 작아지고 있으며, 공급업체는 원점수가 아닌 단위 경제성에 대해 점점 더 경쟁하고 있습니다. 1,000페이지당 1.50달러로 문서를 구문 분석하는 2.3B 매개변수 모델은 고가의 상업용 OCR 제품군이나 취약한 사내 파이프라인이 필요했던 작업 부하의 비용을 압축합니다.
이 릴리스에는 Cohere가 오프닝을 보는 위치에 대한 내용도 나와 있습니다. 이 회사는 경계를 쫓기보다는 기업 환경 내에서 저렴하고 개인적이며 예측 가능하게 실행되는 모델인 배포 실용성에 엔터프라이즈 비즈니스를 걸었습니다. 문서 파서는 프론티어 추론 모델에 비하면 매력이 없지만 문서 수집은 오늘날 기업이 페이지당 수익을 측정할 수 있는 몇 안 되는 AI 워크로드 중 하나이며 Cohere는 분명히 그 수학을 소유하고 싶어합니다.
구매자의 경우, 벤치마크 분석의 실질적인 조언은 Parse 5를 Cohere 자체가 프레임하는 방식으로 처리하라는 것입니다. 특히 차트와 시각적 기반이 보고된 점수에서 누락된 차원이기 때문에 차트와 시각적 기반이 워크로드의 핵심인 경우 자신의 문서에 대한 테스트를 위한 주장으로 간주됩니다. 대용량, 텍스트 및 테이블이 많은 수집의 경우 가격 대비 성능이 간단합니다. 차트의 의미를 분석하기 위해 공개 리더보드의 리더를 먼저 평가할 가치가 있습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →