Inception Labs heeft dinsdag Mercury 2.5 uitgebracht, een nieuwe versie van zijn commerciële diffusietaalmodel dat het bedrijf beschrijft als de meest capabele diffusie-LLM op de markt en, voor zover het bekend is, het grootste diffusietaalmodel dat ooit is getraind. Volgens de aankondiging van het bedrijf levert het model een toename van 40% in intelligentie ten opzichte van zijn voorganger, Mercury 2, terwijl het hetzelfde lage latentie- en goedkope weergaveprofiel behoudt dat de diffusiearchitectuur aantrekkelijk heeft gemaakt voor werklasten met een hoog volume.
Het bedrijf, geleid door CEO Stefano Ermon, beweert dat Mercury 2.5 vergelijkbaar is met kostengeoptimaliseerde frontier-modellen, waaronder GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite en Claude Haiku 4.5. Deze vergelijkingen zijn door leveranciers gerapporteerd en zijn nog niet geverifieerd door onafhankelijke benchmarks, maar ze positioneren een diffusiemodel – lang een onderzoeksnieuwsgierigheid – als een productiealternatief voor de autoregressieve gevestigde exploitanten. Voor het laatste nieuws over AI-modellen volgt u de voortdurende modeldekking van AI Buzz Wire. laatste AI-modelnieuws
Snelheid, context en prijs
De krantenkoppen zijn agressief. Inception Labs zegt dat Mercury 2.5 1.107 tokens per seconde genereert op algemeen beschikbare NVIDIA GPU's, met een contextvenster van 260.000 tokens. De prijzen zijn vastgesteld op $0,20 per miljoen inputtokens en $0,75 per miljoen outputtokens, met een lanceringspromotie waarbij het model met 80% wordt verdisconteerd tot $0,04 per miljoen input en $0,15 per miljoen output.
Wat de mogelijkheden betreft, wordt het model geleverd met afstembare redeneringen – waardoor ontwikkelaars per verzoek latentie kunnen inruilen voor diepgang – samen met parallelle toolaanroepen en schema-uitgelijnde JSON-uitvoer voor gestructureerde generatie. Het bedrijf beschouwt de release als het eerste resultaat van een trainingscyclus die wordt aangestuurd door productietelemetrie: sinds de lancering van Mercury 2 hebben duizenden ontwikkelaars ermee gebouwd, tientallen bedrijven hebben het geïmplementeerd en het gebruik is met meer dan een orde van grootte toegenomen.
Waarom diffusiemodellen tekst sneller genereren
Reguliere LLM's van OpenAI, Google en Anthropic zijn autoregressief: ze genereren tekst token voor token, waarbij elk token afhankelijk is van alles dat ervoor is gegenereerd. Die opeenvolgende afhankelijkheid legt een harde vloer onder de generatiesnelheid. Diffusietaalmodellen beginnen in plaats daarvan met een blok ruis en verfijnen iteratief alle tokens parallel, wat een veel hogere doorvoer op conventionele GPU-hardware mogelijk maakt zodra het model is getraind om netjes te convergeren.
Historisch gezien is de afweging kwaliteit geweest: diffusiemodellen hebben autoregressieve modellen gevolgd op het gebied van redeneren en het volgen van instructies. De kerngok van Inception Labs – en de claim die ten grondslag ligt aan Mercury 2.5 – is dat deze kloof kleiner is geworden tot het punt waarop diffusie wint op de as die de meeste klanten daadwerkelijk voelen: latentie en kosten bij productievolume.
Productieclaims van vroege klanten
De aankondiging leunt zwaar op klantimplementaties in plaats van op benchmarktabellen. OpenCall, dat AI-telefoonagenten bouwt voor live klantgesprekken, meldde dat de overstap naar Mercury de gemiddelde responslatentie van het model op ongeveer 170 milliseconden bracht. Oliver Silverstein, mede-oprichter en CEO van OpenCall, zei dat de P99-responstijd van het bedrijf daalde van enkele minuten naar één seconde, en de mediaan van 0,4 seconden naar minder dan 0,2 – cijfers die hij beschreef als aanzienlijk sneller dan welke andere provider het bedrijf ook had getest, ook als redenering mogelijk was.
Augment Code, een maker van AI-coderingsassistenten, gebruikt Mercury voor contextverdichting, modelrouting en zoeken naar MCP-tools. Volgens Inception Labs verminderde het verplaatsen van verdichtingswerklasten naar Mercury de latentie van die stap met 82%, van ongeveer 150 seconden naar 27 seconden, en werden de kosten met 90% verlaagd, terwijl de kwaliteit behouden bleef. De use case illustreert waar de economie knelt: coderingsagenten maken veel kleine ondersteunende modeloproepen rond elke primaire generatie, en de latentie en kosten lopen op bij die oproepen.
NVIDIA, wiens hardware het model beheert, heeft ook een bijdrage geleverd. Shruti Koparkar, een senior productmanager bij NVIDIA's Accelerated Computing Group, zei dat Inception geavanceerde diffusiegebaseerde taalmodellen heeft op de NVIDIA AI-infrastructuur, en dat de kwaliteitsverbetering van Mercury 2.5 met aanhoudende snelheden laat zien hoe snel nieuwe architecturen kunnen uitgroeien tot productieklare systemen.
Previews van Mercury Voice en Mercury Router
Naast het model kondigde Inception Labs previews aan van twee nieuwe producten. Mercury Voice is een diffusie-LLM die is geoptimaliseerd voor stemagenten met de kleinste latentiebudgetten, waarbij de reclametijd tot de eerste token minder dan 170 milliseconden bedraagt. Mercury Router gebruikt een diffusiemodel om inkomende aanwijzingen te begrijpen en deze door te sturen naar het model – open of gesloten – dat de beste mix van kwaliteit, snelheid en kosten biedt, waardoor Inception als een laag boven zijn concurrenten en één van hen wordt gepositioneerd.
Mercury 2.5 is beschikbaar via Inception's eigen API, maar ook via Baseten en OpenRouter. Enterprise-implementaties voegen speciale capaciteit, automatische schaling, nalevingscontroles en configureerbare gegevensretentie toe. Het bedrijf biedt 100 miljoen gratis tokens aan aan ontwikkelaars die de API proberen.
Het bedrijf zei ook dat het al begonnen is met het trainen van zijn volgende model – het grootste tot nu toe, dat in de komende maanden op de markt zal worden gebracht – dat het omschrijft als een sprong in capaciteit die niets inlevert op de snelheid of symbolische efficiëntie van de verspreiding. Als die bewering klopt, zal de druk op autoregressieve gevestigde spelers het eerst voelbaar zijn op de grondstoffenniveaus van de markt, waar prijs en latentie de meeste contracten bepalen.
Blijf AI een stap voor
Volg de nieuwste AI-ontwikkelingen en het laatste nieuws over kunstmatige intelligentie terwijl nieuwe modelarchitecturen de productie in rennen.
Lees meer AI-nieuws →