Kinesiska AI-labbet DeepSeek har i tysthet skickat deepseek-v4-flash-vision-exp, en experimentell version av sin V4-Flash-modell som kan acceptera bilder tillsammans med text, vilket täpper till en av de mest påfallande luckorna i sin flaggskeppsmodellfamilj. Releasen, dokumenterad på företagets officiella API-sidor, kommer bara några veckor efter att V4-Flash-0731 och V4-Pro-0813 uppdateras och ger utvecklare ett länge efterfrågat sätt att mata in skärmdumpar, diagram och foton direkt till en av branschens billigaste frontier-tier-modeller. För team som spårar den senaste AI-utvecklingen, är det ytterligare en signal att DeepSeek avser att matcha västerländska rivaler funktion-för-funktion samtidigt som de underskrider dem aggressivt i pris.

Vad den nya modellen gör

Enligt DeepSeeks API-dokumentation låter `deepseek-v4-flash-vision-exp` användare "be modellen att beskriva bilder, läsa text från skärmdumpar, analysera diagram och mer." Modellen accepterar JPEG-, PNG-, GIF- och WebP-filer, med formatet som detekteras från det faktiska filinnehållet snarare än filnamnet eller den deklarerade MIME-typen - en liten men genomtänkt detalj som förhindrar felmatchade tilläggsfel.

Utvecklare kan skicka bilder på tre sätt: base64-kodade inline-datawebbadresser (med förbehåll för en gräns på 48 MiB förfrågan), externa webbadresser som är offentligt tillgängliga (upp till 8 192 tecken, 32 MiB per bild, med ett 60-sekunders nedladdningsfönster) eller via Files API. Allt använder det vanliga OpenAI-kompatibla Chat Completions-formatet, och modellen är också tillgänglig via DeepSeeks Anthropic-kompatibla slutpunkt – vilket innebär att befintlig Claude SDK-kod kan byta backends med minimala ändringar.

Prissättning: gränsvision till råvarupriser

Den experimentella modellen ärver V4-Flashs aggressiva prislista. Indatatokens kostar 0,22 USD per miljon under lågtrafik och 0,44 USD som topp för cachemissar, och sjunker till så lite som 0,007 USD per miljon för cacheträffar under lågtrafik. Output-tokens är prissatta till $0,66 per miljon lågtrafik och $1,32 vid topp. Bilder konverteras till tokens baserat på deras mått och faktureras tillsammans med textpolletter.

Den prissättningen spelar roll eftersom den dramatiskt underskrider jämförbara multimodala erbjudanden från stora amerikanska leverantörer, vilket fortsätter priskriget DeepSeek har fört hela året. Modellen bär också över familjens rubrikspecifikationer: ett 1 miljon tokens kontextfönster, upp till 384 000 tokens för maximal produktion, stöd för tänkande och icke-tänkande lägen, JSON-utdata, verktygsanrop och en samtidighetsgräns på 2 500 – specifikationer som positionerar den som en äkta arbetshäst för högvolymproduktion av forskningsarbetsbelastningar snarare än en arbetsbelastning för forskning.

Varför utvecklare var desperata efter detta

Lanseringen landade på Hacker News, där den snabbt samlade mer än 450 poäng - och entusiasmen har en specifik ursprungshistoria. DeepSeeks text-only V4-Flash-0731 hade utvecklat ett rykte om att tro att den kunde se. Flera utvecklare rapporterade att modellen skulle anta att den hade synförmåga och sedan improvisera utarbetade lösningar när den upptäckte att den inte kunde - inklusive att uppfinna textbaserade bildanalysverktyg och dra skärmdumpar från anslutna enheter innan de insåg att det inte fanns något sätt att se dem.

"Jag har hört att DeepSeek v4 Flash 0731 ofta har antagit att den har synförmåga och sedan tillgriper att uppfinna textbaserade bildanalysverktyg när den upptäcker att den faktiskt inte kan se", skrev en kommentator, som upprepade rapporter från flera andra. För alla som använder modellen som en agent i kodnings- eller automationspipelines bör den nya visionvarianten eliminera en hel kategori av förvirringsdrivna misslyckanden.

Fångsten på 800x800

Utgivningen är inte utan begränsningar, och den skarpaste kritiken mot Hacker News riktade sig mot ett nummer: bildupplösning. Dokumentationen säger att innan slutledning ändras storleken på varje bild automatiskt så att dess totala pixelantal ungefär matchar en bild på 800x800, vilket bibehåller bildförhållandet.

"Det är användbart men för OCR och många andra applikationer måste det vara lite högre (t.ex. att lägga in en hel sida i A4/Letter-storlek)," hävdade en utvecklare, medan en annan svarade rakt på sak att 800x800-locket "dödar många användningsfall." För täta dokument, helsidesskanningar eller finkornig UI-felsökning kan upplösningstaket driva utvecklare mot högre upplösning – och dyrare – alternativ. En populär lösning som föreslås i tråden: dela upp stora sidor i brickor och mata dem separat.

Den andra öppna frågan är öppenhet. DeepSeek byggde sitt rykte på att släppa öppna vikter, men företaget har inte sagt om visionvarianten kommer att följa. Kommentarer spekulerade att det kan härröra från företagets senaste "Thinking with Visual Primitives" forskning, för vilken vikter enligt uppgift utlovades, men ingenting har bekräftats. Speciellt är modellen listad som experimentell - "-exp"-suffixet - vilket signalerar att DeepSeek förväntar sig att upprepas.

En tyst men strategisk release

Synnedgången fortsätter en hektisk sträcka för det Hangzhou-baserade labbet, som har tillbringat augusti med att leverera stadiga uppdateringar: V4-Flash-0731, det agentorienterade ramverket DeepSeek Harness, V4-Pro-0813-uppdateringen och nu multimodal input. Snarare än en enda storsäljande lansering, utför DeepSeek en takt av snabba, inkrementella utgåvor som håller sina modeller i utvecklarverktygskedjor - samma land-grab-strategi som västerländska labb efterföljer med kodningsagenter.

För AI-branschen i stort är budskapet bekant men fortfarande obekvämt för etablerade operatörer: funktioner som en gång motiverade premiumprissättning - bildförståelse i ett miljon-token-sammanhang - kommer nu fram till några cent per miljon tokens. Den experimentella etiketten ger DeepSeek utrymme att förfina modellen, men utvecklare har redan börjat koppla in den i skärmdumpsdrivna arbetsflöden. Frågan är inte längre om DeepSeek kan matcha den multimodala funktionsuppsättningen av sina rivaler, utan hur snabbt resten av marknaden anpassar sig till sina priser.

Ligg före AI

För de senaste AI-modellsläppen, benchmark-strider och branschanalyser, bokmärk AI Buzz Wire.

Läs mer AI-nyheter →