מעבדת הבינה המלאכותית הסינית DeepSeek שלחה בשקט את deepseek-v4-flash-vision-exp, גרסה ניסיונית של דגם ה-V4-Flash שלה שיכולה לקבל תמונות לצד טקסט, מה שסוגר את אחד הפערים הבולטים ביותר במשפחת דגמי הדגל שלה. המהדורה, המתועדת בדפי ה-API הרשמיים של החברה, מגיעה שבועות ספורים לאחר רענון ה-V4-Flash-0731 ו-V4-Pro-0813 ונותנת למפתחים דרך מבוקשת להזין צילומי מסך, תרשימים ותמונות ישירות לאחד מהדגמים הזולים ביותר בתעשייה. עבור צוותים שעוקבים אחר התפתחויות הבינה המלאכותיות האחרונות, זהו אות נוסף לכך ש-DeepSeek מתכוונת להשוות יריבות מערביות תכונה עבור תכונה תוך פגיעה אגרסיבית במחיר.
מה עושה הדגם החדש
לפי תיעוד ה-API של DeepSeek, `deepseek-v4-flash-vision-exp` מאפשר למשתמשים "לבקש מהמודל לתאר תמונות, לקרוא טקסט מצילומי מסך, לנתח תרשימים ועוד." המודל מקבל קובצי JPEG, PNG, GIF ו-WebP, כאשר הפורמט מזוהה מתוכן הקובץ בפועל ולא משם הקובץ או סוג MIME המוצהר - פרט קטן אך מתחשב שמונע באגים עם סיומת לא תואמות.
מפתחים יכולים להעביר תמונות בשלוש דרכים: כתובות URL של נתונים מוטבעות ב-base64 (בכפוף להגבלת גוף הבקשה של 48 MiB), כתובות URL חיצוניות נגישות לציבור (עד 8,192 תווים, 32 MiB לתמונה, עם חלון הורדה של 60 שניות), או דרך ה-API של Files. הכל משתמש בפורמט ה-Chat Completions הסטנדרטי התואם OpenAI, וניתן להגיע למודל גם דרך נקודת הקצה התואמת Anthropic של DeepSeek - כלומר קוד SDK של קלוד הקיים יכול להחליף קצה אחורי עם שינויים מינימליים.
תמחור: חזון גבול בתעריפי סחורות
המודל הניסיוני יורש את גיליון המחירים האגרסיבי של V4-Flash. אסימוני קלט עולים 0.22 דולר למיליון בשיא ו-0.44 דולר בשיא עבור החמצות של מטמון, וירדו עד ל-0.007 דולר למיליון בכניסות למטמון בשעות השפל. אסימוני פלט מתומחרים ב-0.66 דולר למיליון מחוץ לשיא ו-1.32 דולר בשיא. תמונות מומרות לאסימונים על סמך מידותיהן ומחויבות יחד עם אסימוני טקסט.
התמחור הזה חשוב מכיוון שהוא מפחית באופן דרמטי הצעות רב-מודאליות דומות מספקיות גדולות בארה"ב, וממשיך את מלחמת המחירים שניהלה DeepSeek כל השנה. המודל נושא גם את מפרטי הכותרות של המשפחה: חלון הקשר של 1 מיליון טוקנים, עד 384K אסימונים של תפוקה מקסימלית, תמיכה במצבי חשיבה וחוסר חשיבה, פלט JSON, קריאות לכלים ומגבלה במקביל של 2,500 - מפרטים הממצבים אותו כסוס עבודה אמיתי עבור עומסי ייצור בנפחים גבוהים במקום עומסי עבודה מחקריים.
מדוע מפתחים היו נואשים מזה
ההשקה נחתה ב-Hacker News, שם היא צברה במהירות יותר מ-450 נקודות - ולהתלהבות יש סיפור מקור ספציפי. V4-Flash-0731 לטקסט בלבד של DeepSeek פיתח מוניטין של מאמין שהוא יכול לראות. מפתחים מרובים דיווחו שהדגם יניח שיש לו יכולות ראייה, ואז יאלתר דרכים לעקיפת הבעיה כאשר הוא גילה שהוא לא יכול - כולל המצאת כלי ניתוח תמונות מבוססי טקסט ושליפה של צילומי מסך מהמכשירים המחוברים לפני שיבין שאין לו דרך לצפות בהם.
"שמעתי ש-DeepSeek v4 Flash 0731 הניח לעתים קרובות שיש לו יכולות ראייה ולאחר מכן פונה להמצאת כלי ניתוח תמונות מבוססי טקסט כאשר הוא מגלה שהוא למעשה לא יכול לראות", כתב אחד המגיבים, מהדהד דיווחים של כמה אחרים. לכל מי שמשתמש במודל כסוכן בצינורות קידוד או אוטומציה, גרסת החזון החדשה אמורה לחסל קטגוריה שלמה של כשלים מונעי בלבול.
התפיסה של 800x800
השחרור אינו חף ממגבלות, והביקורת החריפה ביותר על האקר ניוז מכוונת למספר אחד: רזולוציית תמונה. התיעוד קובע שלפני ההסקה, כל תמונה משתנה אוטומטית כך שספירת הפיקסלים הכוללת שלה תואמת בערך תמונה של 800x800, תוך שמירה על יחס רוחב-גובה.
"זה שימושי אבל עבור OCR והרבה יישומים אחרים זה צריך להיות קצת יותר גבוה (למשל: הכנסת עמוד מלא בגודל A4 / Letter)", טען מפתח אחד, כשאחר השיב בבוטות שהכובע בגודל 800x800 "הורג הרבה מקרי שימוש". עבור מסמכים צפופים, סריקות של עמודים מלאים או איתור באגים של ממשק משתמש עדין, תקרת הרזולוציה יכולה לדחוף מפתחים לעבר חלופות ברזולוציה גבוהה יותר - ויקרה יותר. פתרון פופולרי אחד שהוצע בשרשור: לפצל דפים גדולים לאריחים ולהאכיל אותם בנפרד.
השאלה הפתוחה הנוספת היא פתיחות. DeepSeek בנתה את המוניטין שלה על שחרור משקולות פתוחות, אך החברה לא אמרה אם גרסת החזון תבוא בעקבותיה. מגיבים שיערו שזה עשוי לנבוע מהמחקר האחרון של החברה "חשיבה עם פרימיטיביות חזותית", שלפי הדיווחים הובטחו לו משקלים, אך דבר לא אושר. יש לציין שהמודל רשום כניסיוני - הסיומת "-exp" - מאותת ש-DeepSeek מצפה לחזור על עצמו.
שחרור שקט אך אסטרטגי
ירידת הראייה ממשיכה שלב עמוס עבור המעבדה המבוססת על האנגג'ואו, שבילתה באוגוסט במשלוח עדכונים קבועים: V4-Flash-0731, מסגרת DeepSeek Harness מוכוונת סוכן, רענון V4-Pro-0813 ועכשיו קלט רב-מודאלי. במקום השקה שובר קופות בודדת, DeepSeek מבצעת קצב של מהדורות מהירות ומצטברות ששומרות את הדגמים שלה בתוך שרשרת כלים למפתחים - אותה אסטרטגיית תפיסת קרקע שמעבדות מערביות נוקטות עם סוכני קידוד.
עבור תעשיית הבינה המלאכותית בכלל, המסר מוכר אך עדיין לא נוח לבעלי תפקידים: יכולות שפעם הצדיקו תמחור פרימיום - הבנת תמונה בהקשר של מיליון אסימונים - מגיעות כעת לכמה סנטים למיליון אסימונים. התווית הניסיונית נותנת ל-DeepSeek מקום לחדד את המודל, אך מפתחים כבר החלו לחבר אותו לזרימות עבודה מונחות צילום מסך. השאלה היא כבר לא האם DeepSeek יכולה להתאים את מערך התכונות הרב-מודאלי של מתחרותיה, אלא באיזו מהירות שאר השוק מסתגל למחירים שלו.
הישאר לפני AI
לגרסה העדכנית ביותר של דגמי AI, קרבות בנצ'מרק וניתוחי תעשייה, סימני AI Buzz Wire.
קרא עוד חדשות AI →