قام مختبر الذكاء الاصطناعي الصيني DeepSeek بشحن deepseek-v4-flash-vision-exp بهدوء، وهي نسخة تجريبية من نموذج V4-Flash الذي يمكنه قبول الصور بجانب النص، مما يسد واحدة من أكثر الفجوات الصارخة في عائلة نماذجه الرئيسية. يصل الإصدار، الموثق على صفحات واجهة برمجة التطبيقات (API) الرسمية للشركة، بعد أسابيع فقط من تحديث V4-Flash-0731 وV4-Pro-0813 ويمنح المطورين طريقة مطلوبة منذ فترة طويلة لتغذية لقطات الشاشة والرسوم البيانية والصور مباشرة في أحد أرخص نماذج الحدود في الصناعة. بالنسبة للفرق التي تتتبع [أحدث تطورات الذكاء الاصطناعي] (https://aibuzzwire.news)، فهذه إشارة أخرى إلى أن DeepSeek تعتزم مطابقة المنافسين الغربيين من حيث الميزة مقابل الميزة مع تقويضهم بقوة من حيث السعر.

ما يفعله النموذج الجديد

وفقًا لوثائق واجهة برمجة التطبيقات الخاصة بـ DeepSeek، يتيح Deepseek-v4-flash-vision-exp للمستخدمين "مطالبة النموذج بوصف الصور وقراءة النص من لقطات الشاشة وتحليل المخططات والمزيد." يقبل النموذج ملفات JPEG، وPNG، وGIF، وWebP، بالتنسيق الذي تم اكتشافه من محتوى الملف الفعلي بدلاً من اسم الملف أو نوع MIME المعلن - وهي تفاصيل صغيرة ولكنها مدروسة تمنع أخطاء الامتدادات غير المتطابقة.

يمكن للمطورين تمرير الصور بثلاث طرق: عناوين URL للبيانات المضمنة بتشفير Base64 (تخضع لحد نص الطلب البالغ 48 ميجابايت)، أو عناوين URL الخارجية التي يمكن الوصول إليها بشكل عام (ما يصل إلى 8192 حرفًا، 32 ميجابايت لكل صورة، مع نافذة تنزيل مدتها 60 ثانية)، أو من خلال Files API. يستخدم كل شيء تنسيق Chat Completions القياسي المتوافق مع OpenAI، ويمكن الوصول إلى النموذج أيضًا عبر نقطة النهاية المتوافقة مع DeepSeek Anthropic - مما يعني أن كود Claude SDK الحالي يمكنه تبديل الواجهة الخلفية بأقل قدر من التغييرات.

التسعير: رؤية حدودية بأسعار السلع الأساسية

يرث النموذج التجريبي ورقة الأسعار القوية لـ V4-Flash. تبلغ تكلفة رموز الإدخال 0.22 دولارًا أمريكيًا لكل مليون خارج أوقات الذروة و0.44 دولارًا أمريكيًا في أوقات الذروة لأخطاء ذاكرة التخزين المؤقت، وتنخفض إلى ما يصل إلى 0.007 دولار أمريكي لكل مليون نتيجة لذاكرة التخزين المؤقت خلال ساعات خارج أوقات الذروة. يبلغ سعر رموز الإخراج 0.66 دولارًا أمريكيًا لكل مليون خارج أوقات الذروة و1.32 دولارًا أمريكيًا في أوقات الذروة. يتم تحويل الصور إلى رموز مميزة بناءً على أبعادها ويتم إصدار فاتورة بها مع الرموز النصية.

هذا التسعير مهم لأنه يقوض بشكل كبير عروض الوسائط المتعددة القابلة للمقارنة من كبار مقدمي الخدمات في الولايات المتحدة، مما يؤدي إلى استمرار حرب الأسعار التي شنتها DeepSeek طوال العام. يحمل النموذج أيضًا المواصفات الرئيسية للعائلة: نافذة سياق مكونة من مليون رمز مميز، وما يصل إلى 384 ألف رمز مميز من الحد الأقصى للإنتاج، ودعم أوضاع التفكير وعدم التفكير، ومخرجات JSON، واستدعاءات الأدوات، وحد التزامن البالغ 2500 - المواصفات التي تضعه كعمود عمل حقيقي لأحمال عمل الإنتاج كبيرة الحجم بدلاً من لعبة بحثية.

لماذا كان المطورون في حاجة ماسة إلى هذا

وصل الإطلاق إلى Hacker News، حيث جمع بسرعة أكثر من 450 نقطة - وكان للحماس قصة أصل محددة. لقد اكتسب جهاز V4-Flash-0731 النصي فقط الخاص بـ DeepSeek سمعة طيبة في الاعتقاد بأنه يستطيع الرؤية. أفاد العديد من المطورين أن النموذج سيفترض أن لديه قدرات رؤية، ثم يرتجل حلولاً معقدة عندما يكتشف أنه لا يستطيع ذلك - بما في ذلك اختراع أدوات تحليل الصور المستندة إلى النص وسحب لقطات الشاشة من الأجهزة المتصلة قبل أن يدرك أنه ليس لديه طريقة لمشاهدتها.

"لقد سمعت أن DeepSeek v4 Flash 0731 افترض في كثير من الأحيان أن لديه قدرات رؤية ثم يلجأ إلى اختراع أدوات تحليل الصور المستندة إلى النص عندما يجد أنه في الواقع لا يستطيع الرؤية،" كتب أحد المعلقين، مرددًا تقارير من عدة آخرين. بالنسبة لأي شخص يستخدم النموذج كعامل في الترميز أو مسارات التشغيل الآلي، يجب أن يزيل متغير الرؤية الجديد فئة كاملة من حالات الفشل الناجمة عن الارتباك.

الصيد 800x800

الإصدار لا يخلو من القيود، وقد استهدفت أشد الانتقادات على موقع Hacker News رقمًا واحدًا: دقة الصورة. تنص الوثائق على أنه قبل الاستدلال، يتم تغيير حجم كل صورة تلقائيًا بحيث يتطابق إجمالي عدد وحدات البكسل الخاصة بها تقريبًا مع صورة مقاس 800 × 800، مع الحفاظ على نسبة العرض إلى الارتفاع.

"إنه مفيد ولكن بالنسبة للتعرف الضوئي على الحروف والعديد من التطبيقات الأخرى، يجب أن يكون أعلى قليلاً (على سبيل المثال: وضع صفحة كاملة بحجم A4 / Letter)،" قال أحد المطورين، وأجاب آخر بصراحة أن الحد الأقصى 800 × 800 "يقتل الكثير من حالات الاستخدام". بالنسبة للمستندات الكثيفة، أو عمليات المسح الضوئي لصفحة كاملة، أو تصحيح أخطاء واجهة المستخدم الدقيقة، يمكن أن يدفع سقف الدقة المطورين نحو بدائل ذات دقة أعلى - وأكثر تكلفة. أحد الحلول الشائعة المقترحة في الموضوع: تقسيم الصفحات الكبيرة إلى مربعات وإطعامها بشكل منفصل.

السؤال المفتوح الآخر هو الانفتاح. لقد بنى DeepSeek سمعته على إطلاق الأوزان المفتوحة، لكن الشركة لم تذكر ما إذا كان متغير الرؤية سيتبع أم لا. وتكهن المعلقون بأنه قد يكون مستمدًا من بحث الشركة الأخير "التفكير باستخدام البدائيات البصرية"، والذي ورد أنه تم الوعد بأوزان له، ولكن لم يتم تأكيد أي شيء. ومن الجدير بالذكر أن النموذج مدرج على أنه تجريبي - اللاحقة "-exp" - مما يشير إلى أن DeepSeek تتوقع تكراره.

إصدار هادئ ولكنه استراتيجي

يستمر انخفاض الرؤية في امتداد مزدحم للمختبر الذي يقع مقره في مدينة هانغتشو، والذي قضى شهر أغسطس في شحن تحديثات ثابتة: V4-Flash-0731، وإطار عمل DeepSeek Harness الموجه نحو الوكيل، وتحديث V4-Pro-0813، والآن المدخلات متعددة الوسائط. بدلاً من إطلاق منتج واحد ناجح، تنفذ DeepSeek إيقاعًا من الإصدارات السريعة والمتزايدة التي تحافظ على نماذجها داخل سلاسل أدوات المطورين - وهي نفس استراتيجية الاستيلاء على الأراضي التي تتبعها المختبرات الغربية مع وكلاء البرمجة.

بالنسبة لصناعة الذكاء الاصطناعي بشكل عام، الرسالة مألوفة ولكنها لا تزال غير مريحة للشركات القائمة: القدرات التي بررت ذات يوم التسعير المتميز - فهم الصورة في سياق مليون رمز - تصل الآن إلى بضعة سنتات لكل مليون رمز. يمنح الملصق التجريبي مساحة لـ DeepSeek لتحسين النموذج، لكن المطورين بدأوا بالفعل في توصيله إلى سير عمل يعتمد على لقطات الشاشة. لم يعد السؤال هو ما إذا كان DeepSeek قادرًا على مضاهاة مجموعة الميزات المتعددة الوسائط التي يقدمها منافسوه، ولكن مدى سرعة تكيف بقية السوق مع أسعاره.

البقاء في صدارة الذكاء الاصطناعي

للحصول على أحدث إصدارات نماذج الذكاء الاصطناعي والمعارك المعيارية وتحليلات الصناعة، ضع إشارة مرجعية على AI Buzz Wire.

اقرأ المزيد من أخبار الذكاء الاصطناعي →