آزمایشگاه هوش مصنوعی چینی DeepSeek بی سر و صدا deepseek-v4-flash-vision-exp را ارسال کرده است، یک نسخه آزمایشی از مدل V4-Flash خود که می تواند تصاویر را در کنار متن بپذیرد، و یکی از برجسته ترین شکاف ها را در خانواده مدل های پرچمدار خود از بین می برد. این نسخه که در صفحات رسمی API این شرکت ثبت شده است، تنها چند هفته پس از بهروزرسانی V4-Flash-0731 و V4-Pro-0813 ارائه میشود و به توسعهدهندگان روشی طولانی درخواست میکند تا تصاویر، نمودارها و عکسها را مستقیماً در یکی از ارزانترین مدلهای سطح مرزی صنعت تغذیه کنند. برای تیمهایی که [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) را ردیابی میکنند، سیگنال دیگری است که DeepSeek قصد دارد با رقبای غربی ویژگی به ویژگی مطابقت دهد و در عین حال قیمت آنها را به شدت کاهش دهد.
کاری که مدل جدید انجام می دهد
طبق مستندات API DeepSeek، «deepseek-v4-flash-vision-exp» به کاربران این امکان را می دهد که «از مدل بخواهند تصاویر را توصیف کند، متن را از اسکرین شات بخواند، نمودارها را تجزیه و تحلیل کند و موارد دیگر». این مدل فایلهای JPEG، PNG، GIF، و WebP را میپذیرد، با قالبی که از محتوای فایل واقعی به جای نام فایل یا نوع MIME اعلامشده شناسایی میشود - یک جزئیات کوچک اما متفکرانه که از اشکالات ناهماهنگ پسوند جلوگیری میکند.
توسعهدهندگان میتوانند تصاویر را به سه روش ارسال کنند: URLهای داده درونخطی با کد base64 (مشروط به محدودیت بدنه درخواست 48 مگابایت)، URLهای خارجی قابل دسترسی عمومی (حداکثر 8192 کاراکتر، 32 مگابایت در هر تصویر، با یک پنجره دانلود 60 ثانیهای)، یا از طریق Files API. همه چیز از فرمت استاندارد Chat Completions سازگار با OpenAI استفاده میکند، و این مدل از طریق نقطه پایانی سازگار با Anthropic DeepSeek نیز قابل دسترسی است - به این معنی که کد Claude SDK موجود میتواند با کمترین تغییرات، backendها را تغییر دهد.
قیمت گذاری: چشم انداز مرزی در نرخ کالا
مدل آزمایشی برگه قیمت تهاجمی V4-Flash را به ارث برده است. توکن های ورودی 0.22 دلار به ازای هر میلیون در خارج از پیک و 0.44 دلار در زمان اوج برای از دست دادن حافظه پنهان هزینه دارند، که به 0.007 دلار در هر میلیون در هنگام بازدید از حافظه پنهان در ساعات غیر اوج مصرف کاهش می یابد. توکن های خروجی 0.66 دلار به ازای هر میلیون خارج از پیک و 1.32 دلار در اوج قیمت هستند. تصاویر بر اساس ابعادشان به توکن تبدیل می شوند و همراه با توکن های متنی صورتحساب می شوند.
این قیمت گذاری اهمیت دارد زیرا به طور چشمگیری از عرضه های چندوجهی قابل مقایسه از ارائه دهندگان بزرگ ایالات متحده می کاهد و به جنگ قیمتی که DeepSeek در تمام سال به راه انداخته است ادامه می دهد. این مدل همچنین مشخصات اصلی خانواده را دارد: یک پنجره زمینه 1 میلیون رمزی، حداکثر خروجی تا 384 هزار توکن، پشتیبانی از حالتهای فکری و غیر فکری، خروجی JSON، تماسهای ابزار، و محدودیت همزمانی 2500 - مشخصاتی که آن را به عنوان یک نیروی کار واقعی برای تولید با حجم بالا قرار میدهد تا یک تحقیق با حجم بالا.
چرا توسعه دهندگان برای این ناامید بودند
پرتاب در هکر نیوز فرود آمد، جایی که به سرعت بیش از 450 امتیاز جمع آوری کرد - و این شور و شوق داستان منشأ خاصی دارد. V4-Flash-0731 فقط متنی DeepSeek به دلیل باور که می تواند ببیند شهرت پیدا کرده بود. چندین توسعهدهنده گزارش دادند که این مدل دارای قابلیتهای بینایی است، سپس وقتی متوجه شد نمیتواند راهحلهای پیچیدهای را بداهه بنویسد - از جمله اختراع ابزارهای تجزیه و تحلیل تصویر مبتنی بر متن و کشیدن اسکرینشات از دستگاههای متصل قبل از اینکه متوجه شود راهی برای مشاهده آنها ندارد.
یکی از نظردهندهها نوشت: «شنیدهام که DeepSeek v4 Flash 0731 مکرراً تصور میکرد که قابلیتهای بینایی دارد و سپس وقتی متوجه شد که واقعاً نمیتواند ببیند، به اختراع ابزارهای تجزیه و تحلیل تصویر مبتنی بر متن متوسل میشود.» برای هر کسی که از این مدل به عنوان عاملی در خطوط لوله کدگذاری یا اتوماسیون استفاده می کند، نوع چشم انداز جدید باید یک دسته کامل از خرابی های ناشی از سردرگمی را حذف کند.
گیره 800x800
انتشار بدون محدودیت نیست و تندترین انتقادها در هکر نیوز یک عدد را هدف قرار داده است: وضوح تصویر. مستندات بیان میکنند که قبل از استنتاج، اندازه هر تصویر بهطور خودکار تغییر میکند تا تعداد کل پیکسلهای آن تقریباً با تصویر 800x800 مطابقت داشته باشد و نسبت تصویر حفظ شود.
یکی از توسعه دهندگان استدلال کرد: "این مفید است اما برای OCR و بسیاری از برنامه های دیگر باید کمی بالاتر باشد (مثلاً: قرار دادن یک صفحه کامل A4 / Letter)" و دیگری به صراحت پاسخ داد که درپوش 800x800 "موارد استفاده زیادی را از بین می برد." برای اسناد متراکم، اسکنهای تمام صفحه، یا اشکالزدایی UI دقیق، سقف وضوح میتواند توسعهدهندگان را به سمت گزینههای با وضوح بالاتر و گرانتر سوق دهد. یکی از راهحلهای محبوب پیشنهاد شده در این موضوع: صفحات بزرگ را به کاشیها تقسیم کنید و آنها را جداگانه تغذیه کنید.
سوال باز دیگر باز بودن است. DeepSeek شهرت خود را بر روی انتشار وزنه های باز ایجاد کرد، اما این شرکت نگفته است که آیا نوع ویژن نیز به دنبال خواهد داشت یا خیر. مفسران حدس می زنند که ممکن است از تحقیقات اخیر شرکت "تفکر با ویژوال اولیه" نشات گرفته باشد، که طبق گزارش ها وعده وزن برای آن داده شده بود، اما هیچ چیز تایید نشده است. قابل ذکر است، این مدل به عنوان آزمایشی - پسوند "-exp" - نشان می دهد که DeepSeek انتظار دارد تکرار شود.
انتشار آرام اما استراتژیک
افت چشم انداز همچنان به مسیر شلوغی برای آزمایشگاه مستقر در هانگژو ادامه می دهد، که در ماه اوت به روزرسانی های ثابت را ارسال کرده است: V4-Flash-0731، چارچوب DeepSeek Harness مبتنی بر عامل، تازه سازی V4-Pro-0813، و اکنون ورودی چندوجهی. DeepSeek بهجای یک راهاندازی پرفروش، مجموعهای از نسخههای سریع و افزایشی را اجرا میکند که مدلهایش را در زنجیرههای ابزار توسعهدهنده نگه میدارد - همان استراتژی تصاحب زمین که آزمایشگاههای غربی با عوامل برنامهنویسی دنبال میکنند.
برای صنعت هوش مصنوعی به طور کلی، این پیام آشنا است اما هنوز برای متصدیان فعلی ناخوشایند است: قابلیتهایی که زمانی قیمتگذاری ممتاز را توجیه میکردند - درک تصویر در زمینه میلیون توکن - اکنون به چند سنت در هر میلیون توکن میرسند. برچسب آزمایشی به DeepSeek فضا میدهد تا مدل را اصلاح کند، اما توسعهدهندگان قبلاً آن را به جریانهای کاری مبتنی بر اسکرینشات متصل کردهاند. سوال دیگر این نیست که آیا DeepSeek میتواند با مجموعه ویژگیهای چندوجهی رقبای خود مطابقت داشته باشد، بلکه این است که بقیه بازار چقدر سریع با قیمتهای آن سازگار میشوند.
از هوش مصنوعی جلوتر بمانید
برای آخرین نسخههای مدل هوش مصنوعی، نبردهای معیار، و تحلیل صنعت، [AI Buzz Wire] (https://aibuzzwire.news) را نشانکگذاری کنید.
بیشتر بخوانید اخبار هوش مصنوعی →