Čínská laboratoř umělé inteligence DeepSeek v tichosti odeslala deepseek-v4-flash-vision-exp, experimentální verzi svého modelu V4-Flash, který dokáže přijímat obrázky vedle textu, čímž zaplňuje jednu z nejkřiklavějších mezer v rodině svých vlajkových modelů. Vydání, zdokumentované na oficiálních stránkách API společnosti, přichází jen několik týdnů po aktualizaci V4-Flash-0731 a V4-Pro-0813 a poskytuje vývojářům dlouho požadovaný způsob, jak vkládat screenshoty, grafy a fotografie přímo do jednoho z nejlevnějších hraničních modelů v oboru. Pro týmy sledující [nejnovější vývoj AI] (https://aibuzzwire.news) je to další signál, že DeepSeek se hodlá vyrovnat západním soupeřům, pokud jde o funkce, a zároveň je agresivně podbízet cenou.

Co nový model umí

Podle dokumentace API DeepSeek umožňuje `deepseek-v4-flash-vision-exp` uživatelům "požádat model o popis obrázků, čtení textu ze snímků obrazovky, analýzu grafů a další." Model akceptuje soubory JPEG, PNG, GIF a WebP, přičemž formát je detekován ze skutečného obsahu souboru spíše než z názvu souboru nebo deklarovaného typu MIME – malý, ale promyšlený detail, který zabraňuje chybám v neshodných příponách.

Vývojáři mohou předávat obrázky třemi způsoby: vložené datové URL zakódované v base64 (s omezením na 48 MiB těla požadavku), veřejně přístupné externí URL (až 8 192 znaků, 32 MiB na obrázek, s 60sekundovým oknem stahování) nebo prostřednictvím Files API. Vše používá standardní formát Chat Completions kompatibilní s OpenAI a model je také dosažitelný prostřednictvím koncového bodu DeepSeek kompatibilního s Anthropic – což znamená, že stávající kód Claude SDK může přepínat backendy s minimálními změnami.

Ceny: hraniční vize za komoditní sazby

Experimentální model zdědil agresivní ceník V4-Flash. Vstupní tokeny stojí 0,22 USD za milion mimo špičku a 0,44 USD ve špičce za vynechání mezipaměti, což klesá na pouhých 0,007 USD za milion na přístupech do mezipaměti během hodin mimo špičku. Výstupní tokeny mají cenu 0,66 USD za milion mimo špičku a 1,32 USD ve špičce. Obrázky jsou převedeny na tokeny na základě jejich rozměrů a účtovány společně s textovými tokeny.

Na této ceně záleží, protože dramaticky podbízí srovnatelné multimodální nabídky od hlavních amerických poskytovatelů, což pokračuje v cenové válce, kterou DeepSeek celý rok vedl. Model také přenáší hlavní specifikace rodiny: kontextové okno s 1 milionem tokenů, až 384 000 tokenů maximálního výstupu, podpora režimů myšlení a nemyšlení, výstup JSON, volání nástrojů a limit souběžnosti 2 500 – specifikace, které jej staví jako skutečného tahouna pro velkoobjemové výzkumné produkční úlohy spíše než jako hračku.

Proč z toho byli vývojáři zoufalí

Spuštění přistálo na Hacker News, kde rychle nasbíralo více než 450 bodů – a nadšení má specifický původ. Pouze textový V4-Flash-0731 od DeepSeek si vybudoval reputaci za to, že věří, že vidí. Několik vývojářů uvedlo, že model předpokládá, že má schopnosti vidění, a poté improvizuje propracovaná řešení, když zjistí, že to není možné – včetně vynalézání textových nástrojů pro analýzu obrazu a stahování snímků obrazovky z připojených zařízení, než si uvědomí, že je nemá jak zobrazit.

„Slyšel jsem, že DeepSeek v4 Flash 0731 často předpokládal, že má schopnosti vidění, a když zjistí, že ve skutečnosti nevidí, uchýlil se k vynalézání textových nástrojů pro analýzu obrazu,“ napsal jeden z komentujících a zopakoval zprávy od několika dalších. Pro každého, kdo používá model jako agenta v kanálech kódování nebo automatizace, by nová varianta vize měla eliminovat celou kategorii selhání způsobených zmatkem.

Úlovek 800x800

Vydání není bez omezení a nejostřejší kritika na Hacker News směřovala na jediné číslo: rozlišení obrazu. Dokumentace uvádí, že před odvozením se velikost každého obrázku automaticky změní tak, aby jeho celkový počet pixelů zhruba odpovídal obrázku 800 x 800, přičemž se zachová poměr stran.

"Je to užitečné, ale pro OCR a mnoho dalších aplikací to musí být o něco vyšší (např.: vložit celou stránku o velikosti A4 / Letter)," argumentoval jeden vývojář a druhý bez obalu odpověděl, že omezení 800x800 "zabíjí spoustu případů použití." U hustých dokumentů, celostránkových skenů nebo jemnozrnného ladění uživatelského rozhraní by strop rozlišení mohl vývojáře tlačit k vyšším rozlišením – a dražším – alternativám. Jedno oblíbené řešení navržené ve vláknu: rozdělte velké stránky na dlaždice a podávejte je samostatně.

Další otevřenou otázkou je otevřenost. DeepSeek si vybudoval reputaci na uvolňování otevřených vah, ale zda bude následovat varianta vize, společnost neuvedla. Komentátoři spekulovali, že může pocházet z nedávného výzkumu společnosti „Thinking with Visual Primitives“, pro který byly údajně přislíbeny váhy, ale nic nebylo potvrzeno. Je pozoruhodné, že model je uveden jako experimentální – přípona „-exp“ – signalizující, že DeepSeek očekává iteraci.

Tiché, ale strategické vydání

Pokles vize pokračuje v rušném úseku pro laboratoř v Hangzhou, která strávila srpen neustálými aktualizacemi: V4-Flash-0731, framework DeepSeek Harness orientovaný na agenty, obnova V4-Pro-0813 a nyní multimodální vstup. Namísto jediného senzačního spuštění DeepSeek provádí kadenci rychlých, postupných verzí, které udržují jeho modely uvnitř vývojářských nástrojů – stejná strategie, jakou západní laboratoře provádějí s kódovacími agenty.

Pro průmysl umělé inteligence je tato zpráva obecně známá, ale pro stávající provozovatele stále nepříjemná: schopnosti, které kdysi ospravedlňovaly prémiové ceny – porozumění obrazu v kontextu milionu tokenů – nyní dosahují několika centů za milion tokenů. Experimentální označení dává DeepSeek prostor pro upřesnění modelu, ale vývojáři jej již začali zapojovat do pracovních postupů řízených snímky obrazovky. Otázkou již není, zda se DeepSeek dokáže vyrovnat multimodální sadě funkcí svých soupeřů, ale jak rychle se zbytek trhu přizpůsobí jeho cenám.

Udržujte si náskok před umělou inteligencí

Chcete-li získat nejnovější verze modelů umělé inteligence, srovnávací bitvy a průmyslové analýzy, vytvořte si záložku [AI Buzz Wire] (https://aibuzzwire.news).

Přečtěte si další zprávy o AI →