آزمایشگاه هوش مصنوعی چینی DeepSeek بی سر و صدا deepseek-v4-flash-vision-exp را ارسال کرده است، یک نسخه آزمایشی از مدل V4-Flash خود که می تواند تصاویر را در کنار متن بپذیرد، و یکی از برجسته ترین شکاف ها را در خانواده مدل های پرچمدار خود از بین می برد. این نسخه که در صفحات رسمی API این شرکت ثبت شده است، تنها چند هفته پس از به‌روزرسانی V4-Flash-0731 و V4-Pro-0813 ارائه می‌شود و به توسعه‌دهندگان روشی طولانی درخواست می‌کند تا تصاویر، نمودارها و عکس‌ها را مستقیماً در یکی از ارزان‌ترین مدل‌های سطح مرزی صنعت تغذیه کنند. برای تیم‌هایی که [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) را ردیابی می‌کنند، سیگنال دیگری است که DeepSeek قصد دارد با رقبای غربی ویژگی به ویژگی مطابقت دهد و در عین حال قیمت آن‌ها را به شدت کاهش دهد.

کاری که مدل جدید انجام می دهد

طبق مستندات API DeepSeek، «deepseek-v4-flash-vision-exp» به کاربران این امکان را می دهد که «از مدل بخواهند تصاویر را توصیف کند، متن را از اسکرین شات بخواند، نمودارها را تجزیه و تحلیل کند و موارد دیگر». این مدل فایل‌های JPEG، PNG، GIF، و WebP را می‌پذیرد، با قالبی که از محتوای فایل واقعی به جای نام فایل یا نوع MIME اعلام‌شده شناسایی می‌شود - یک جزئیات کوچک اما متفکرانه که از اشکالات ناهماهنگ پسوند جلوگیری می‌کند.

توسعه‌دهندگان می‌توانند تصاویر را به سه روش ارسال کنند: URLهای داده درون‌خطی با کد base64 (مشروط به محدودیت بدنه درخواست 48 مگابایت)، URL‌های خارجی قابل دسترسی عمومی (حداکثر 8192 کاراکتر، 32 مگابایت در هر تصویر، با یک پنجره دانلود 60 ثانیه‌ای)، یا از طریق Files API. همه چیز از فرمت استاندارد Chat Completions سازگار با OpenAI استفاده می‌کند، و این مدل از طریق نقطه پایانی سازگار با Anthropic DeepSeek نیز قابل دسترسی است - به این معنی که کد Claude SDK موجود می‌تواند با کمترین تغییرات، backendها را تغییر دهد.

قیمت گذاری: چشم انداز مرزی در نرخ کالا

مدل آزمایشی برگه قیمت تهاجمی V4-Flash را به ارث برده است. توکن های ورودی 0.22 دلار به ازای هر میلیون در خارج از پیک و 0.44 دلار در زمان اوج برای از دست دادن حافظه پنهان هزینه دارند، که به 0.007 دلار در هر میلیون در هنگام بازدید از حافظه پنهان در ساعات غیر اوج مصرف کاهش می یابد. توکن های خروجی 0.66 دلار به ازای هر میلیون خارج از پیک و 1.32 دلار در اوج قیمت هستند. تصاویر بر اساس ابعادشان به توکن تبدیل می شوند و همراه با توکن های متنی صورتحساب می شوند.

این قیمت گذاری اهمیت دارد زیرا به طور چشمگیری از عرضه های چندوجهی قابل مقایسه از ارائه دهندگان بزرگ ایالات متحده می کاهد و به جنگ قیمتی که DeepSeek در تمام سال به راه انداخته است ادامه می دهد. این مدل همچنین مشخصات اصلی خانواده را دارد: یک پنجره زمینه 1 میلیون رمزی، حداکثر خروجی تا 384 هزار توکن، پشتیبانی از حالت‌های فکری و غیر فکری، خروجی JSON، تماس‌های ابزار، و محدودیت همزمانی 2500 - مشخصاتی که آن را به عنوان یک نیروی کار واقعی برای تولید با حجم بالا قرار می‌دهد تا یک تحقیق با حجم بالا.

چرا توسعه دهندگان برای این ناامید بودند

پرتاب در هکر نیوز فرود آمد، جایی که به سرعت بیش از 450 امتیاز جمع آوری کرد - و این شور و شوق داستان منشأ خاصی دارد. V4-Flash-0731 فقط متنی DeepSeek به دلیل باور که می تواند ببیند شهرت پیدا کرده بود. چندین توسعه‌دهنده گزارش دادند که این مدل دارای قابلیت‌های بینایی است، سپس وقتی متوجه شد نمی‌تواند راه‌حل‌های پیچیده‌ای را بداهه بنویسد - از جمله اختراع ابزارهای تجزیه و تحلیل تصویر مبتنی بر متن و کشیدن اسکرین‌شات از دستگاه‌های متصل قبل از اینکه متوجه شود راهی برای مشاهده آنها ندارد.

یکی از نظردهنده‌ها نوشت: «شنیده‌ام که DeepSeek v4 Flash 0731 مکرراً تصور می‌کرد که قابلیت‌های بینایی دارد و سپس وقتی متوجه شد که واقعاً نمی‌تواند ببیند، به اختراع ابزارهای تجزیه و تحلیل تصویر مبتنی بر متن متوسل می‌شود.» برای هر کسی که از این مدل به عنوان عاملی در خطوط لوله کدگذاری یا اتوماسیون استفاده می کند، نوع چشم انداز جدید باید یک دسته کامل از خرابی های ناشی از سردرگمی را حذف کند.

گیره 800x800

انتشار بدون محدودیت نیست و تندترین انتقادها در هکر نیوز یک عدد را هدف قرار داده است: وضوح تصویر. مستندات بیان می‌کنند که قبل از استنتاج، اندازه هر تصویر به‌طور خودکار تغییر می‌کند تا تعداد کل پیکسل‌های آن تقریباً با تصویر 800x800 مطابقت داشته باشد و نسبت تصویر حفظ شود.

یکی از توسعه دهندگان استدلال کرد: "این مفید است اما برای OCR و بسیاری از برنامه های دیگر باید کمی بالاتر باشد (مثلاً: قرار دادن یک صفحه کامل A4 / Letter)" و دیگری به صراحت پاسخ داد که درپوش 800x800 "موارد استفاده زیادی را از بین می برد." برای اسناد متراکم، اسکن‌های تمام صفحه، یا اشکال‌زدایی UI دقیق، سقف وضوح می‌تواند توسعه‌دهندگان را به سمت گزینه‌های با وضوح بالاتر و گران‌تر سوق دهد. یکی از راه‌حل‌های محبوب پیشنهاد شده در این موضوع: صفحات بزرگ را به کاشی‌ها تقسیم کنید و آنها را جداگانه تغذیه کنید.

سوال باز دیگر باز بودن است. DeepSeek شهرت خود را بر روی انتشار وزنه های باز ایجاد کرد، اما این شرکت نگفته است که آیا نوع ویژن نیز به دنبال خواهد داشت یا خیر. مفسران حدس می زنند که ممکن است از تحقیقات اخیر شرکت "تفکر با ویژوال اولیه" نشات گرفته باشد، که طبق گزارش ها وعده وزن برای آن داده شده بود، اما هیچ چیز تایید نشده است. قابل ذکر است، این مدل به عنوان آزمایشی - پسوند "-exp" - نشان می دهد که DeepSeek انتظار دارد تکرار شود.

انتشار آرام اما استراتژیک

افت چشم انداز همچنان به مسیر شلوغی برای آزمایشگاه مستقر در هانگژو ادامه می دهد، که در ماه اوت به روزرسانی های ثابت را ارسال کرده است: V4-Flash-0731، چارچوب DeepSeek Harness مبتنی بر عامل، تازه سازی V4-Pro-0813، و اکنون ورودی چندوجهی. DeepSeek به‌جای یک راه‌اندازی پرفروش، مجموعه‌ای از نسخه‌های سریع و افزایشی را اجرا می‌کند که مدل‌هایش را در زنجیره‌های ابزار توسعه‌دهنده نگه می‌دارد - همان استراتژی تصاحب زمین که آزمایشگاه‌های غربی با عوامل برنامه‌نویسی دنبال می‌کنند.

برای صنعت هوش مصنوعی به طور کلی، این پیام آشنا است اما هنوز برای متصدیان فعلی ناخوشایند است: قابلیت‌هایی که زمانی قیمت‌گذاری ممتاز را توجیه می‌کردند - درک تصویر در زمینه میلیون توکن - اکنون به چند سنت در هر میلیون توکن می‌رسند. برچسب آزمایشی به DeepSeek فضا می‌دهد تا مدل را اصلاح کند، اما توسعه‌دهندگان قبلاً آن را به جریان‌های کاری مبتنی بر اسکرین‌شات متصل کرده‌اند. سوال دیگر این نیست که آیا DeepSeek می‌تواند با مجموعه ویژگی‌های چندوجهی رقبای خود مطابقت داشته باشد، بلکه این است که بقیه بازار چقدر سریع با قیمت‌های آن سازگار می‌شوند.

از هوش مصنوعی جلوتر بمانید

برای آخرین نسخه‌های مدل هوش مصنوعی، نبردهای معیار، و تحلیل صنعت، [AI Buzz Wire] (https://aibuzzwire.news) را نشانک‌گذاری کنید.

بیشتر بخوانید اخبار هوش مصنوعی →