Cohere ได้เปิดตัว Parse 5 (parse-v5.0) ซึ่งเป็นโมเดลการแยกวิเคราะห์เอกสารที่มุ่งเป้าไปที่การนำเข้าระดับองค์กรที่มีปริมาณมาก และตอนนี้ก็พร้อมใช้งานโดยทั่วไปแล้วโดยไม่ต้องรอคิว ตามรายละเอียดโดย MarkTechPost การเปิดตัวนี้เป็นเดิมพันที่องค์กรส่วนใหญ่ให้ความสำคัญกับต้นทุนต่อหน้ามากกว่าตำแหน่งกระดานผู้นำ ซึ่งเป็นเดิมพัน VentureBeat สรุปอย่างตรงไปตรงมา: Parse 5 "เสียคะแนนมาตรฐานไป แต่ชนะในด้านต้นทุนต่อหน้า"

จริงๆ แล้ว Parse 5 คืออะไร For more context on this story, see our ongoing AI news.

Parse 5 เป็นโมเดลภาษาวิชั่น 2.3 พันล้านพารามิเตอร์ ที่สร้างขึ้นบนสถาปัตยกรรม North-Micro-Vision-Instruct ของ Cohere Labs พร้อมด้วยหน้าต่างบริบท 8,192 โทเค็น และเนื้อที่ประมาณ 4.6GB ใช้หน้า PDF, PowerPoint หรือ JPEG เป็นอินพุตที่เข้ารหัส base64 และส่งกลับ Markdown ในรอบเดียว: ข้อความตามลำดับการอ่าน ตารางที่แสดงผลเป็น HTML รายการ คู่คีย์-ค่าของแบบฟอร์ม คำอธิบายรูปภาพ และพิกัดกล่องขอบเขตสำหรับองค์ประกอบภาพ

ตัวเลือกทางสถาปัตยกรรมที่โดดเด่นคือสิ่งที่เอาออกไป ด้านหน้าโมเดลไม่มีขั้นตอน OCR แยกกัน การตรวจจับเค้าโครง การจดจำข้อความ และการจัดโครงสร้างเกิดขึ้นภายในเครือข่ายเดียว ซึ่งช่วยลดความยุ่งยากในการปรับใช้ และกำจัดแหล่งที่มาของข้อผิดพลาดแบบเรียงซ้อนในไปป์ไลน์เอกสารแบบเดิม

Cohere แสดงรายการภาษาเก้าภาษาที่มีความเสถียร — อารบิก อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส และสเปน — พร้อมการสนับสนุนแบบ Zero-Shot สำหรับภาษาอื่นๆ ที่มีความแม่นยำต่ำกว่า

สองโหมดเอาต์พุต

ในโหมดเริ่มต้น Parse 5 ส่งกลับสตริง Markdown ต่อหน้า โหมดที่สองซึ่งเปิดใช้งานด้วย `output_format="blocks"` จะส่งกลับบล็อกที่พิมพ์แทน โดยที่แต่ละบล็อกตารางจะมี HTML กล่องขอบเขต และคำอธิบาย โหมดที่สองคือสิ่งที่ทำให้การตรวจสอบย้อนกลับระดับการอ้างอิงเป็นไปได้ องค์กรสามารถชี้กลับไปยังตำแหน่งที่แน่ชัดที่ตัวเลขที่แยกวิเคราะห์มาจากที่ใดบนหน้า ซึ่งมีความสำคัญสำหรับอุตสาหกรรมที่ได้รับการควบคุม การป้อนเอกสารเข้าสู่ระบบการสร้างการดึงข้อมูลแบบเสริม

ข้อแม้มาตรฐาน

Cohere รายงานคะแนน ParseBench ที่ 79.2 สำหรับ Parse 5 ก่อนหน้า Mistral OCR 4 ที่ 74.5, Azure Document Intelligence ที่ 74.3 และ Databricks AI Parse ที่ 72.4 แต่มีเครื่องหมายดอกจันสำคัญที่ การวิเคราะห์ของ MarkTechPost จะคลายรายละเอียดออก

ParseBench เป็นเกณฑ์มาตรฐาน LlamaIndex ของเพจองค์กรที่ผ่านการตรวจสอบโดยมนุษย์ประมาณ 2,078 เพจ ซึ่งทำคะแนนในห้ามิติ: ตาราง แผนภูมิ ความซื่อสัตย์ของเนื้อหา การจัดรูปแบบความหมาย และการต่อสายดินด้วยภาพ 79.2 ของ Cohere เฉลี่ยเพียงสามในห้ามิตินั้น แผนภูมิที่ลดลงและการต่อสายดินที่มองเห็น ซึ่งเป็นสองมิติที่ parsers ส่วนใหญ่ทำงานได้แย่ที่สุด บนกระดานผู้นำแบบห้ามิติสาธารณะ ผู้จำหน่ายรายเดียวกันได้คะแนนโดยรวมต่ำกว่ามาก: Mistral OCR 4 และ Databricks AI Parse ที่ 60.68, Azure Document Intelligence (Layout) ที่ 59.64 โดย LlamaParse Agentic เป็นผู้นำที่ 84.88 ขณะนี้ Parse 5 ไม่มีอยู่ในกระดานผู้นำนั้น

กล่าวอีกนัยหนึ่ง 79.2 เป็นคะแนนชุดย่อยที่ผู้ขายรายงาน ไม่ใช่มงกุฎมาตรฐาน ค่าเฉลี่ยสามมิติของ Azure ได้ผลถึง 74.3 ซึ่งตรงกับวิธีการของ Cohere ทุกประการ ดังนั้นการเปรียบเทียบก็คืออย่างน้อยแอปเปิ้ลต่อแอปเปิ้ลภายในเซตย่อยที่ครอบคลุม

คณิตศาสตร์การกำหนดราคา

ข้อโต้แย้งเรื่องต้นทุนคือจุดที่การวางตำแหน่งของ Cohere เป็นรูปธรรม Parse API มีราคาอยู่ที่ 1.50 ดอลลาร์สหรัฐฯ ต่อ 1,000 หน้า — 0.0015 ดอลลาร์สหรัฐฯ ต่อหน้า สำหรับองค์กรที่ต้องการความจุเฉพาะ ข้อเสนอ Model Vault สำหรับผู้เช่ารายเดียวจะคิดค่าบริการ 4.00 USD ต่อชั่วโมง ($2,500 ต่อเดือน) บนอินสแตนซ์ขนาดกลาง หรือ 7.00 USD ต่อชั่วโมง ($4,300 ต่อเดือน) บน XL

จุดครอสโอเวอร์มีความสำคัญมากกว่าตัวเลขตัวใดตัวหนึ่งเพียงอย่างเดียว ในอัตราที่วัดตามมิเตอร์ อินสแตนซ์ Medium Vault จะคุ้มทุนที่ประมาณ 1.67 ล้านหน้าต่อเดือน และ XL ที่ประมาณ 2.87 ล้านหน้า หากต่ำกว่าปริมาณดังกล่าว การเรียก API ตามความจำเป็นจะมีราคาถูกกว่า เหนือสิ่งอื่นใด ความจุเฉพาะได้รับชัยชนะเหนือราคาก่อนที่จะคำนึงถึงผลประโยชน์ด้านถิ่นที่อยู่ของข้อมูลที่มักจะผลักดันให้เกิดการใช้ห้องนิรภัยตั้งแต่แรก

ว่าง

โดยทั่วไป Parse 5 พร้อมใช้งานผ่านการปรับใช้ Cohere Parse API, Microsoft Foundry, AWS SageMaker และการปรับใช้ Model Vault ผู้เช่ารายเดียว ไม่มีใบอนุญาตการวิจัยที่เข้าถึงได้ — Cohere ถือว่าสิ่งนี้เป็นโครงสร้างพื้นฐานการผลิตตั้งแต่วันแรก

ความหมายสำหรับผู้ซื้อระดับองค์กร

การเปิดตัวครั้งนี้สะท้อนให้เห็นถึงรูปแบบที่กว้างขึ้นใน AI ระดับองค์กร: ความสามารถที่อยู่ติดกันชายแดนนั้นมีขนาดเล็กพอที่จะใช้งานในราคาถูก และผู้จำหน่ายก็กำลังแข่งขันกันมากขึ้นในเรื่องเศรษฐศาสตร์ต่อหน่วยมากกว่าคะแนนดิบ โมเดลพารามิเตอร์ 2.3B ที่แยกวิเคราะห์เอกสารที่ 1.50 ดอลลาร์สหรัฐฯ ต่อพันหน้า จะช่วยลดต้นทุนของปริมาณงานที่เคยต้องใช้ชุด OCR เชิงพาณิชย์ราคาแพงหรือไปป์ไลน์ภายในองค์กรที่เปราะบาง

การเปิดตัวยังกล่าวถึงบางอย่างเกี่ยวกับจุดที่ Cohere เห็นการเปิดตัว บริษัทได้เดิมพันธุรกิจระดับองค์กรไว้ที่การใช้งานจริง ซึ่งเป็นโมเดลที่ทำงานในราคาถูก เป็นส่วนตัว และคาดการณ์ได้ภายในสภาพแวดล้อมขององค์กร แทนที่จะไล่ล่าพรมแดน โปรแกรมแยกวิเคราะห์เอกสารนั้นดูไม่น่าดึงดูดเมื่อเทียบกับโมเดลการให้เหตุผลระดับแนวหน้า แต่การนำเข้าเอกสารเป็นหนึ่งในเวิร์กโหลด AI ไม่กี่อย่างที่องค์กรต่างๆ สามารถวัดผลตอบแทนต่อหน้าได้ในปัจจุบัน และ Cohere ต้องการเป็นเจ้าของคณิตศาสตร์นั้นอย่างชัดเจน

สำหรับผู้ซื้อ คำแนะนำที่เป็นประโยชน์จากการวิเคราะห์เกณฑ์มาตรฐานคือให้ปฏิบัติต่อ Parse 5 ในแบบที่ Cohere กำหนดกรอบไว้ — เป็นการอ้างสิทธิ์ในการทดสอบกับเอกสารของคุณเอง โดยเฉพาะอย่างยิ่งหากแผนภูมิและการต่อสายดินด้วยภาพเป็นศูนย์กลางของปริมาณงานของคุณ เนื่องจากสิ่งเหล่านี้เป็นมิติข้อมูลที่คะแนนที่รายงานละไว้ สำหรับการนำเข้าข้อความและตารางจำนวนมาก ปริมาณมาก กรณีด้านประสิทธิภาพด้านราคานั้นตรงไปตรงมา สำหรับการแยกวิเคราะห์ว่าแผนภูมิมีความหมายอย่างไร ผู้นำของกระดานผู้นำสาธารณะยังคงคุ้มค่าที่จะประเมินก่อน

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →