Cohere הוציאה את Parse 5 (parse-v5.0), מודל לניתוח מסמכים שמטרתו הטמעת ארגונים בנפח גבוה, וכעת הוא זמין באופן כללי ללא רשימת המתנה. כפי שפורט על ידי MarkTechPost, ההפצה היא יותר מהימור על עלות לכל מיקום בארגון - יותר מהימור על הימור לכל מיקום. VentureBeat סיכם בבוטות: ניתוח 5 "מאבד את המדד בנקודות. הוא מנצח בעלות לדף."
מה זה בעצם ניתוח 5 For more context on this story, see our ongoing latest AI developments.
ניתוח 5 הוא מודל שפת ראייה של 2.3 מיליארד פרמטרים שנבנה על ארכיטקטורת North-Micro-Vision-Instruct של Cohere Labs, עם חלון הקשר של 8,192 אסימונים וטביעת רגל של כ-4.6GB. זה לוקח דף PDF, PowerPoint או JPEG כקלט מקודד base64 ומחזיר Markdown במעבר אחד: טקסט בסדר קריאה, טבלאות המעובדות כ-HTML, רשימות, צמדי מפתח-ערך, תיאורי תמונה וקואורדינטות של תיבה תוחמת עבור אלמנטים חזותיים.
הבחירה האדריכלית הבולטת היא מה שהיא מסירה. אין שלב OCR נפרד מול המודל - זיהוי פריסה, זיהוי טקסט ומבנה מתרחשים בתוך רשת אחת, מה שמפשט את הפריסה ומבטל מקור נפוץ לשגיאות מדורגות בצינורות מסמכים מסורתיים.
Cohere מפרטת תשע שפות יציבות - ערבית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית וספרדית - עם תמיכה אפסית עבור אחרות ברמת דיוק נמוכה יותר.
שני מצבי פלט
במצב ברירת המחדל שלו, ניתוח 5 מחזיר מחרוזת Markdown לכל עמוד. מצב שני, המופעל עם `output_format="blocks"`, מחזיר בלוקים מוקלדים במקום, כאשר כל בלוק טבלה נושא את ה-HTML שלו, התיבה התוחמת שלו ותיאור. המצב השני הזה הוא מה שמאפשר מעקב ברמת הציטוט - ארגון יכול להצביע בדיוק על המקום שממנו בדף הגיעה דמות מנותחת, מה שחשוב לתעשיות מוסדרות שמזינות מסמכים למערכות דור מוגברות שליפה.
אזהרה בנצ'מרק
Cohere מדווח על ציון ParseBench של 79.2 עבור Parse 5, לפני Mistral OCR 4 ב-74.5, Azure Document Intelligence ב-74.3, ו-Databricks AI Parse ב-72.4. אבל יש כוכבית חשובה שהניתוח של MarkTechPost ב-59.64, כאשר LlamaParse Agentic מובילה ב-84.88. ניתוח 5 אינו רשום כרגע ב-Leaderboard זה.
במילים אחרות, ה-79.2 הוא ציון משנה המדווח על ידי ספקים, לא כתר אמת מידה. הממוצע התלת מימדי של Azure אכן מגיע ל-74.3, תואם בדיוק את המתודולוגיה של Cohere - כך שההשוואה היא לפחות תפוחים לתפוחים בתוך תת-הקבוצה שהיא מכסה.
מתמטיקה לתמחור
טיעון העלות הוא המקום שבו המיקום של קוהר הופך להיות קונקרטי. מחיר ה-API של Parse הוא $1.50 לכל 1,000 דפים - $0.0015 לעמוד. עבור ארגונים המעדיפים קיבולת ייעודית, הצעת הכספת של דייר יחיד עולה $4.00 לשעה ($2,500 לחודש) במופע בינוני, או $7.00 לשעה ($4,300 לחודש) ב-XL.
נקודת ההצלבה חשובה יותר מכל אחד מהמספרים לבדו. בתעריפים מדודים, מופע Medium Vault משתק ב-1.67 מיליון דפים לחודש בערך, ו-XL ב-2.87 מיליון בערך. מתחת לנפחים אלה, קריאת ה-API לפי הצורך זולה יותר; מעליהם, קיבולת ייעודית מנצחת במחיר לפני שמביאים בחשבון את היתרונות של תושבות הנתונים שבדרך כלל מניעה את אימוץ הכספת מלכתחילה.
זמינות
Parse 5 זמין בדרך כלל דרך ה-Cohere Parse API, Microsoft Foundry, AWS SageMaker ופריסות Model Vault עם דייר יחיד. אין רישיון מחקר שמגדיר גישה - Cohere מתייחסת לזה כאל תשתית ייצור מהיום הראשון.
מה זה אומר עבור קונים ארגוניים
המהדורה משקפת דפוס רחב יותר בבינה מלאכותית ארגונית: יכולת צמודה לגבולות הופכת קטנה מספיק כדי לפעול בזול, והספקים מתחרים יותר ויותר על כלכלת יחידה ולא על ציונים גולמיים. מודל של 2.3B פרמטרים שמנתח מסמכים ב-$1.50 לאלף עמודים דוחס את העלות של עומס עבודה שדרש בעבר חבילות OCR מסחריות יקרות או צינורות פנימיים שבירים.
המהדורה גם אומרת משהו על המקום שבו Cohere רואה את הפתיחה שלו. החברה התמקדה בפעילות הארגונית שלה על פרקטיות הפריסה - מודלים הפועלים בזול, באופן פרטי וצפוי בתוך סביבות ארגוניות - במקום לרדוף אחרי הגבול. מנתח מסמכים אינו זוהר לצד מודלים של חשיבה גבולית, אבל הטמעת מסמכים היא אחד מעומסי העבודה הבודדים של AI שבהם ארגונים יכולים למדוד את התשואה לעמוד כיום, וברור ש-Cohere רוצה להיות הבעלים של המתמטיקה הזו.
עבור קונים, העצה המעשית מניתוח הבנצ'מרק היא להתייחס ל-Perse 5 באופן שבו Cohere עצמה ממסגרת אותו - כטענה לבדיקה מול המסמכים שלך, במיוחד אם תרשימים והתבססות חזותית הם מרכזיים בעומס העבודה שלך, שכן אלו הממדים שהציון המדווח שלו משמיט. עבור נפח גבוה, טקסט ושולחן כבד, המקרה של מחיר-ביצועים הוא פשוט; לניתוח היכן לתרשימים יש משמעות, המנהיגים של ה-Leaderboard הציבורי נשארים ראויים להערכה תחילה.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →