Het Chinese AI-laboratorium DeepSeek heeft stilletjes deepseek-v4-flash-vision-exp uitgebracht, een experimentele versie van zijn V4-Flash-model dat afbeeldingen naast tekst kan accepteren, waarmee een van de meest opvallende hiaten in zijn vlaggenschipmodelfamilie wordt gedicht. De release, gedocumenteerd op de officiële API-pagina's van het bedrijf, arriveert slechts enkele weken nadat de V4-Flash-0731 en V4-Pro-0813 zijn vernieuwd en biedt ontwikkelaars een langgevraagde manier om schermafbeeldingen, grafieken en foto's rechtstreeks in een van de goedkoopste frontier-tier-modellen in de branche te plaatsen. Voor teams die [de nieuwste AI-ontwikkelingen] (https://aibuzzwire.news) volgen, is dit een ander signaal dat DeepSeek van plan is de westerse rivalen functie voor functie te evenaren en ze op agressieve wijze te onderbieden op prijs.
Wat het nieuwe model doet
Volgens de API-documentatie van DeepSeek kunnen gebruikers met `deepseek-v4-flash-vision-exp` "het model vragen om afbeeldingen te beschrijven, tekst uit schermafbeeldingen te lezen, grafieken te analyseren en meer." Het model accepteert JPEG-, PNG-, GIF- en WebP-bestanden, waarbij het formaat wordt gedetecteerd op basis van de daadwerkelijke bestandsinhoud in plaats van de bestandsnaam of het opgegeven MIME-type - een klein maar doordacht detail dat fouten met niet-overeenkomende extensies voorkomt.
Ontwikkelaars kunnen afbeeldingen op drie manieren doorgeven: base64-gecodeerde inline gegevens-URL's (onderworpen aan een verzoektekstlimiet van 48 MiB), openbaar toegankelijke externe URL's (tot 8.192 tekens, 32 MiB per afbeelding, met een downloadvenster van 60 seconden), of via de Files API. Alles maakt gebruik van het standaard OpenAI-compatibele Chat Completions-formaat, en het model is ook bereikbaar via het Anthropic-compatibele eindpunt van DeepSeek – wat betekent dat bestaande Claude SDK-code met minimale wijzigingen van backend kan wisselen.
Prijzen: grensvisie op grondstoffenprijzen
Het experimentele model erft het agressieve prijsoverzicht van V4-Flash. Invoertokens kosten $0,22 per miljoen buiten de piekuren en $0,44 tijdens de piekuren voor cachemissers, en dalen tot slechts $0,007 per miljoen voor cachehits tijdens de daluren. Outputtokens kosten $0,66 per miljoen buiten de piekuren en $1,32 per miljoen tijdens de piekuren. Afbeeldingen worden omgezet in tokens op basis van hun afmetingen en samen met teksttokens gefactureerd.
Die prijsstelling is van belang omdat het vergelijkbare multimodale aanbiedingen van grote Amerikaanse aanbieders dramatisch ondermijnt, waardoor de prijzenoorlog die DeepSeek het hele jaar heeft gevoerd, wordt voortgezet. Het model neemt ook de belangrijkste specificaties van de familie over: een contextvenster van 1 miljoen tokens, maximaal 384.000 tokens met maximale output, ondersteuning voor denk- en niet-denkmodi, JSON-uitvoer, toolaanroepen en een gelijktijdigheidslimiet van 2.500 – specificaties die het positioneren als een echt werkpaard voor productieworkloads met grote volumes in plaats van als onderzoeksspeeltje.
Waarom ontwikkelaars hier zo wanhopig op uit waren
De lancering kwam terecht op Hacker News, waar het al snel meer dan 450 punten verzamelde – en het enthousiasme heeft een specifiek oorsprongsverhaal. De alleen-tekst-V4-Flash-0731 van DeepSeek had de reputatie opgebouwd dat hij geloofde dat hij kon zien. Meerdere ontwikkelaars meldden dat het model zou aannemen dat het over visuele capaciteiten beschikt, en vervolgens uitgebreide oplossingen zou improviseren als het ontdekte dat dit niet mogelijk was - inclusief het uitvinden van op tekst gebaseerde beeldanalysetools en het trekken van schermafbeeldingen van aangesloten apparaten voordat ze zich realiseerden dat het deze niet kon bekijken.
"Ik heb gehoord dat DeepSeek v4 Flash 0731 vaak heeft aangenomen dat het over visuele mogelijkheden beschikt en vervolgens zijn toevlucht neemt tot het uitvinden van op tekst gebaseerde beeldanalysetools als het ontdekt dat het eigenlijk niet kan zien", schreef een commentator, in navolging van rapporten van verschillende anderen. Voor iedereen die het model gebruikt als agent in coderings- of automatiseringspijplijnen, zou de nieuwe visievariant een hele categorie van door verwarring veroorzaakte mislukkingen moeten elimineren.
De vangst van 800x800
De release is niet zonder beperkingen, en de scherpste kritiek op Hacker News richtte zich op één ding: de beeldresolutie. De documentatie stelt dat vóór de conclusie het formaat van elke afbeelding automatisch wordt aangepast, zodat het totale aantal pixels ongeveer overeenkomt met een afbeelding van 800x800, waarbij de beeldverhouding behouden blijft.
"Het is nuttig, maar voor OCR en veel andere toepassingen moet het iets hoger zijn (bijvoorbeeld: een volledige pagina van A4-/Letter-formaat plaatsen)", betoogde een ontwikkelaar, terwijl een ander botweg antwoordde dat de limiet van 800 x 800 "veel gebruiksscenario's doodt." Voor compacte documenten, scans van volledige pagina's of fijnmazige UI-foutopsporing zou het resolutieplafond ontwikkelaars naar hogere resolutie (en duurdere) alternatieven kunnen duwen. Een populaire oplossing die in de thread wordt voorgesteld: splits grote pagina's in tegels en voer ze afzonderlijk in.
De andere open vraag is openheid. DeepSeek heeft zijn reputatie opgebouwd met het vrijgeven van open gewichten, maar het bedrijf heeft niet gezegd of de vision-variant zal volgen. Commentatoren speculeerden dat dit zou kunnen voortkomen uit het recente onderzoek van het bedrijf 'Thinking with Visual Primitives', waarvoor naar verluidt gewichten waren beloofd, maar er is niets bevestigd. Opvallend is dat het model als experimenteel wordt vermeld (het achtervoegsel "-exp"), wat aangeeft dat DeepSeek verwacht dat het zal herhalen.
Een rustige maar strategische release
De vision drop zet een druk traject voort voor het in Hangzhou gevestigde laboratorium, dat in augustus regelmatig updates heeft verzonden: V4-Flash-0731, het agentgeoriënteerde DeepSeek Harness-framework, de V4-Pro-0813-vernieuwing en nu multimodale invoer. In plaats van een enkele blockbuster-lancering voert DeepSeek een reeks snelle, incrementele releases uit die de modellen binnen de toolchains van ontwikkelaars houden – dezelfde landroofstrategie die westerse laboratoria volgen met codeeragenten.
Voor de AI-industrie in het algemeen is de boodschap bekend, maar nog steeds ongemakkelijk voor de gevestigde exploitanten: mogelijkheden die ooit premiumprijzen rechtvaardigden – beeldbegrip in de context van een miljoen tokens – komen nu uit op een paar cent per miljoen tokens. Het experimentele label geeft DeepSeek de ruimte om het model te verfijnen, maar ontwikkelaars zijn al begonnen het in screenshot-gestuurde workflows te integreren. De vraag is niet langer of DeepSeek de multimodale functies van zijn rivalen kan evenaren, maar hoe snel de rest van de markt zich aanpast aan zijn prijzen.
Blijf AI een stap voor
Voor de nieuwste releases van AI-modellen, benchmarkgevechten en sectoranalyses kunt u een bladwijzer maken voor AI Buzz Wire.
Lees meer AI-nieuws →