Inception Labs släppte Mercury 2.5 på tisdagen, en ny version av sin kommersiella spridningsspråkmodell som företaget beskriver som den mest kapabla diffusions-LLM på marknaden och, såvitt de vet, den största spridningsspråksmodellen som någonsin utbildats. Enligt företagets tillkännagivande, levererar modellen en 40% ökning av intelligensen jämfört med sin föregångare, Mercury 2, samtidigt som den behåller samma låga latens- och lågkostnadsserveringsprofil som har gjort diffusionsarkitekturen attraktiv för arbetsbelastningar med stora volymer.

Företaget, som leds av vd Stefano Ermon, hävdar att Mercury 2.5 är jämförbar med kostnadsoptimerade frontiermodeller inklusive GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite och Claude Haiku 4.5. Dessa jämförelser är leverantörsrapporterade och har ännu inte verifierats av oberoende riktmärken, men de positionerar en spridningsmodell - länge en forskningsnyfikenhet - som ett produktionsalternativ till de autoregressiva dominerande företagen. För de senaste nyheterna om AI-modeller, följ AI Buzz Wires pågående modellbevakning. senaste nyheterna om AI-modeller

Hastighet, sammanhang och pris

Rubriksiffrorna är aggressiva. Inception Labs säger att Mercury 2.5 genererar 1 107 tokens per sekund på allmänt tillgängliga NVIDIA GPU:er, med ett sammanhangsfönster på 260 000 tokens. Prissättningen är satt till $0,20 per miljon inmatade tokens och $0,75 per miljon output-tokens, med en lanseringskampanj som rabatterar modellen med 80 % till $0,04 per miljon input och $0,15 per miljon output.

På kapacitetssidan levereras modellen med inställbara resonemang – så att utvecklare kan byta latens mot djup på basis av förfrågan – tillsammans med parallella verktygsanrop och schemajusterad JSON-utdata för strukturerad generering. Företaget ramar in releasen som det första resultatet av en träningsslinga som drivs av produktionstelemetri: sedan Mercury 2 lanserades har tusentals utvecklare byggt med den, dussintals företag har implementerat den och användningen har ökat med mer än en storleksordning.

Varför diffusionsmodeller genererar text snabbare

Mainstream LLM:er från OpenAI, Google och Anthropic är autoregressiva: de genererar text en token i taget, med varje token beroende av allt som genererats före den. Det sekventiella beroendet sätter ett hårt golv under generationshastighet. Spridningsspråksmodeller börjar istället med ett block av brus och förfinar iterativt alla tokens parallellt, vilket tillåter mycket högre genomströmning på konventionell GPU-hårdvara när modellen väl har tränats för att konvergera rent.

Avvägningen har historiskt sett varit kvalitet: diffusionsmodeller har följt autoregressiva på resonemang och instruktionsföljande riktmärken. Inception Labs kärnsatsning – och påståendet bakom Mercury 2.5 – är att detta gap har minskat till den punkt där diffusion vinner på den axel som de flesta kunder faktiskt känner: latens och kostnad vid produktionsvolym.

Produktionsanspråk från tidiga kunder

Tillkännagivandet lutar sig mycket mot kunddistributioner snarare än benchmarktabeller. OpenCall, som bygger AI-telefonagenter för live kundsamtal, rapporterade att flytten till Mercury förde dess medianmodellsvarslatens till ungefär 170 millisekunder. Oliver Silverstein, OpenCalls medgrundare och VD, sa att företagets P99-svarstid sjönk från flera minuter till en sekund, och dess median från 0,4 sekunder till under 0,2 – siffror som han beskrev som betydligt snabbare än någon annan leverantör som företaget hade testat, inklusive med resonemang aktiverat.

Augment Code, en AI-kodningsassistent, använder Mercury för kontextkomprimering, modellrouting och MCP-verktygssökning. Enligt Inception Labs minskade flyttningen av komprimeringsarbetsbelastningar till Mercury stegets latens med 82 %, från ungefär 150 sekunder till 27 sekunder, och minskade kostnaden med 90 % samtidigt som kvaliteten bibehölls. Användningsfallet illustrerar var ekonomin biter: kodningsagenter gör många små stödmodellanrop runt varje primär generation, och latens- och kostnadssammansättningar över dessa samtal.

NVIDIA, vars hårdvara driver modellen, vägde också in. Shruti Koparkar, en senior produktchef i NVIDIAs Accelerated Computing Group, sa att Inception har avancerade diffusionsbaserade språkmodeller på NVIDIA AI-infrastruktur, och att Mercury 2.5:s kvalitetsstegring med ihållande hastigheter visar hur snabbt nya system kan utvecklas till produktions-läser.

Förhandsvisningar av Mercury Voice och Mercury Router

Vid sidan av modellen tillkännagav Inception Labs förhandsvisningar av två nya produkter. Mercury Voice är en diffusions-LLM optimerad för röstagenter med de snästa latensbudgetarna, annonseringstid till första token under 170 millisekunder. Mercury Router använder en diffusionsmodell för att förstå inkommande meddelanden och dirigera dem till vilken modell - öppen eller stängd - som erbjuder den bästa blandningen av kvalitet, hastighet och kostnad, vilket placerar Inception som ett lager över sina konkurrenter såväl som en av dem.

Mercury 2.5 är tillgängligt via Inceptions eget API samt genom Baseten och OpenRouter. Enterprise-distributioner lägger till dedikerad kapacitet, automatisk skalning, efterlevnadskontroller och konfigurerbar datalagring. Företaget erbjuder 100 miljoner gratis tokens till utvecklare som provar API.

Företaget sa också att det redan har börjat träna sin nästa modell - den största hittills, som är inriktad på lansering under de kommande månaderna - som det beskriver som ett språng i förmåga som inte ger upp någon av spridningens hastighet eller symboliska effektivitet. Om det påståendet håller, kommer trycket på autoregressiva etablerade operatörer att märkas först i råvarunivåerna på marknaden, där pris och latens avgör de flesta kontrakt.

Stay ahead of AI

Följ den senaste AI-utvecklingen och de senaste nyheterna om artificiell intelligens när nya modellarkitekturer börjar produceras.

Läs mer AI-nyheter →