DeepSeek heeft zijn API-assortiment geüpdatet met een nieuw vlaggenschipmodel, V4 Pro, terwijl de prijzen op het hele platform scherp zijn gestegen – een beslissende wending ten opzichte van de bodemprijsstrategie die het Chinese laboratorium beroemd maakte en rivalen tot een prijzenoorlog dwong. Voor een sector die elke DeepSeek-prijsverlaging heeft gezien als een marktbewegende gebeurtenis, is de ommekeer net zo belangrijk. Volg onze AI-nieuwsverslaggeving voor het laatste nieuws over de modelmarkt.

De officiële API-documentatie van het bedrijf, die deze week is bijgewerkt, bevat nu twee modellen: deepseek-v4-flash, met de DeepSeek-V4-Flash-0731-versie, en deepseek-v4-pro, met de nieuwe DeepSeek-V4-Pro-0813-build. Beide bieden een contextvenster van 1 miljoen tokens, een maximale output van maximaal 384.000 tokens en dubbele denk- en niet-denkmodi, en beide kunnen worden gebruikt als backend-modellen in agenttools zoals Claude Code, GitHub Copilot en OpenCode. DeepSeek levert ook een preview voor ontwikkelaars van "DeepSeek Harness", een toolkit voor agent-ontwikkelaars. Voor meer context over dit verhaal, zie ons AI-nieuws.

Wat V4 Pro kost

Het nieuwe vlaggenschip heeft precies drie keer de prijs van Flash op elk niveau, volgens de gepubliceerde prijzen van DeepSeek. Per 1 miljoen tokens vermeldt V4 Pro $0,022 voor in de cache opgeslagen invoertokens en $0,66 voor niet-in de cache opgeslagen invoer tijdens de daluren, en $1,98 per 1 miljoen uitvoertokens. Op het hoogtepunt verdubbelen deze cijfers tot $0,044, $1,32 en $3,96. Ter vergelijking: V4 Flash vermeldt $0,007/$0,014 voor cachehits, $0,22/$0,44 voor cachemissers en $0,66/$1,32 voor uitvoer.

Piekuren worden gedefinieerd als 01:00–04:00 uur en 06:00–10:00 UTC, waarbij de daluren op precies de helft van de piekuren worden vastgesteld. Gelijktijdigheid is ook gelaagd: Flash-klanten krijgen 2.500 gelijktijdige verzoeken, terwijl Pro-accounts een maximum van 500 hebben.

Prijzen tot wel tienvoudig

De lancering sluit een week af waarin de prijstransformatie van DeepSeek onmogelijk te missen was. De Wall Street Journal meldde op 14 augustus dat DeepSeek de prijzen van AI-modellen ongeveer verviervoudigd had. InfoWorld meldde dezelfde dag dat de prijzen van sommige V4's meer dan tien keer waren gestegen, daarbij verwijzend naar de vraag naar AI die de capaciteit van het bedrijf onder druk zette. Engadget vertelde de lezers dat de modellen "op het punt stonden vier keer zoveel te kosten".

Op 17 augustus meldde Tech Times dat de prijzen van V4 API's tijdens de piekuren nu verviervoudigen, terwijl de Zuid-Koreaanse Seoul Economic Daily de steilste stijgingen tot wel twaalf keer opvoerde en deze stap omschreef als een Chinese AI-race die omdraaide naar winst. De aan de Chinese staat gelieerde Global Times beschreef de verhogingen als onderdeel van een streven naar “gezondere commercialisering” – een signaal dat Beijing duurzame eenheidseconomie, en niet alleen marktaandeel, als de prioriteit ziet voor zijn AI-kampioenen.

Van prijsoorlogswapen tot premiumproduct

De strategiewijziging is ingrijpend. DeepSeek bouwde zijn wereldwijde reputatie op dankzij agressieve prijzen: eind juli werd het onlangs uitgebrachte V4 Flash-model vergeleken met OpenAI's GPT-5.6 Luna tegen 60% lagere kosten, waardoor een race naar de bodem werd versneld waarbij elke API-provider onder druk kwam te staan. Nu rekent hetzelfde laboratorium premiumtarieven aan: de piekproductieprijs van V4 Pro van $ 3,96 per miljoen tokens ligt ruim boven wat klanten uit het Flash-tijdperk gewend waren te betalen.

De introductie van piek- en daluren is op zichzelf een instrument voor capaciteitsbeheer. Door tijdens de drukste uren het dubbele in rekening te brengen – en de gelijktijdigheid voor het premiummodel te verminderen – kan DeepSeek rantsoen berekenen voor werklasten met een hogere marge, een draaiboek dat bekend is bij cloudproviders en elektriciteitsmarkten.

Een portefeuille met twee niveaus voor het agententijdperk

De splitsing tussen de twee modellen is ontworpen voor verschillende kopers. Flash is met zijn gelijktijdigheidslimiet van 2.500 verzoeken en minimale cache-hit-prijzen gepositioneerd voor grootschalig productieverkeer en kostengevoelige applicaties. Pro, met 500 gelijktijdige verzoeken en het drievoudige van de prijs, richt zich op werklasten die veel redeneren vereisen, waarbij het contextvenster van 1 miljoen tokens en het uitvoerplafond van 384.000 tokens ertoe doen: lange agentische sessies, grote codebase-analyse en pijpleidingen met veel documenten.

DeepSeek zoekt ook ontwikkelaars waar ze al werken. Beide modellen zijn direct bruikbaar als backends binnen Claude Code, GitHub Copilot en OpenCode, en de API spreekt zowel OpenAI- als Anthropic-compatibele formaten – wat betekent dat migraties van westerse providers een configuratiewijziging van één regel kunnen zijn. De nieuwe preview voor ontwikkelaars van "DeepSeek Harness" breidt die strategie uit naar bouwers van agent-harness.

Wat het betekent voor ontwikkelaars

Voor ontwikkelaars die kostengevoelige applicaties hebben gebouwd in de veronderstelling dat DeepSeek altijd de koopjesoptie zou zijn, is de boodschap dat het tijdperk van eindeloos dalende tokenprijzen voorbij is, tenminste in het Chinese laboratorium. Cachevriendelijke architecturen betalen nu een 30x lagere invoersnelheid dan cache-miss-aanroepen op beide modellen, waardoor prompt-caching-discipline veel waardevoller wordt dan modelkeuze. En voor de bredere markt verwijdert de spil van DeepSeek de meest agressieve prijszetter van de markt – een stil geschenk aan OpenAI, Anthropic en Google, die het hele jaar door zowel op kosten als op capaciteit hebben geconcurreerd.

Of de benchmarks van V4 Pro de premie rechtvaardigen, moet nog worden getest door onafhankelijke beoordelaars. Wat al duidelijk is, is de bedrijfslogica: na twee jaar subsidiëren van het AI-gebruik in de wereld wil DeepSeek ervoor betaald worden.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →