Inception Labs a lansat marți Mercury 2.5, o nouă versiune a modelului său comercial de limbaj de difuziune pe care compania îl descrie drept cel mai capabil LLM de difuzare de pe piață și, din cunoștințele sale, cel mai mare model de limbaj de difuzare antrenat vreodată. Potrivit anunțului companiei, modelul oferă o creștere cu 40% a inteligenței față de predecesorul său, Mercury 2, păstrând în același timp același profil de servire cu latență redusă și costuri reduse, care a făcut ca arhitectura de difuzare să fie atractivă pentru sarcini de lucru cu volum mare.

Compania, condusă de CEO Stefano Ermon, susține că Mercury 2.5 este comparabil cu modelele de frontieră optimizate din punct de vedere al costurilor, inclusiv GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite și Claude Haiku 4.5. Aceste comparații sunt raportate de furnizor și nu au fost încă verificate de benchmark-uri independente, dar poziționează un model de difuzare - o curiozitate de cercetare de lungă durată - ca o alternativă de producție la operatorii autoregresivi. Pentru cele mai recente știri despre modelele AI, urmăriți acoperirea în curs de desfășurare a modelelor AI Buzz Wire. cele mai recente știri despre modelul AI

Viteză, context și preț

Numerele din titlu sunt agresive. Inception Labs spune că Mercury 2.5 generează 1.107 de jetoane pe secundă pe GPU-uri NVIDIA disponibile pe scară largă, cu o fereastră de context de 260.000 de jetoane. Prețul este stabilit la 0,20 USD per milion de jetoane de intrare și 0,75 USD per milion de jetoane de ieșire, cu o promoție de lansare care reduce modelul cu 80% la 0,04 USD per milion de intrare și 0,15 USD per milion de ieșiri.

În ceea ce privește capacitatea, modelul este livrat cu un raționament reglabil - permițând dezvoltatorilor să schimbe latența pentru profunzime pe bază de cerere - împreună cu apeluri de instrumente paralele și ieșire JSON aliniată la schemă pentru generare structurată. Compania încadrează lansarea ca primul rezultat al unei bucle de antrenament condusă de telemetria de producție: de la lansarea lui Mercury 2, mii de dezvoltatori l-au construit cu acesta, zeci de întreprinderi l-au implementat, iar utilizarea a crescut cu mai mult de un ordin de mărime.

De ce modelele de difuzie generează text mai rapid

LLM-urile principale de la OpenAI, Google și Anthropic sunt autoregresive: generează text câte un token, fiecare token fiind condiționat de tot ceea ce este generat înainte. Această dependență secvențială pune o podea tare sub viteza generației. Modelele de limbaj de difuzie încep în schimb cu un bloc de zgomot și rafinează iterativ toate token-urile în paralel, ceea ce permite un debit mult mai mare pe hardware-ul GPU convențional, odată ce modelul este antrenat să convergă în mod curat.

Schimbarea a fost din punct de vedere istoric calitatea: modelele de difuzie au urmat modelele autoregresive pe criterii de referință privind raționamentul și instrucțiunile. Pariul de bază al Inception Labs - și afirmația care stă la baza Mercury 2.5 - este că acest decalaj s-a redus până la punctul în care difuzarea câștigă pe axa pe care o simt de fapt majoritatea clienților: latența și costul la volumul de producție.

Pretenții de producție de la clienții primii

Anunțul se bazează în mare măsură pe implementările clienților, mai degrabă decât pe tabele de referință. OpenCall, care creează agenți de telefonie AI pentru apelurile live ale clienților, a raportat că mutarea la Mercury a adus latența medie de răspuns a modelului său la aproximativ 170 de milisecunde. Oliver Silverstein, co-fondatorul și CEO al OpenCall, a declarat că timpul de răspuns al companiei P99 a scăzut de la câteva minute la o secundă, iar mediana sa de la 0,4 secunde la sub 0,2 - cifre pe care le-a descris ca fiind semnificativ mai rapide decât orice alt furnizor testat de companie, inclusiv cu raționamentul activat.

Augment Code, un producător de asistent de codare AI, folosește Mercury pentru compactarea contextului, rutarea modelului și căutarea instrumentelor MCP. Potrivit Inception Labs, mutarea sarcinilor de lucru de compactare la Mercury a redus latența acelui pas cu 82%, de la aproximativ 150 de secunde la 27 de secunde și a redus costul cu 90%, menținând în același timp calitatea. Cazul de utilizare ilustrează situația economică: agenții de codificare efectuează multe apeluri de model de sprijin mici în jurul fiecărei generații primare, iar latența și costurile sunt compuse pentru aceste apeluri.

NVIDIA, al cărei hardware rulează modelul, a jucat și ea în greutate. Shruti Koparkar, un senior manager de produse în cadrul NVIDIA Accelerated Computing Group, a declarat că Inception are modele avansate de limbaj bazate pe difuzie pe infrastructura AI NVIDIA și că creșterea calității Mercury 2.5 cu viteze susținute arată cât de repede se pot maturiza noile arhitecturi gata de producție.

Mercury Voice și Mercury Router Previews

Alături de model, Inception Labs a anunțat previzualizări a două produse noi. Mercury Voice este un LLM de difuzie optimizat pentru agenții vocali cu cele mai strânse bugete de latență, timp de publicitate până la primul simbol sub 170 de milisecunde. Mercury Router folosește un model de difuzie pentru a înțelege solicitările primite și pentru a le direcționa către orice model - deschis sau închis - oferă cea mai bună combinație de calitate, viteză și cost, poziționând Inception ca un strat deasupra concurenților săi, precum și unul dintre ei.

Mercury 2.5 este disponibil prin intermediul propriului API al Inception, precum și prin Baseten și OpenRouter. Implementările pentru întreprinderi adaugă capacitate dedicată, scalare automată, controale de conformitate și păstrare configurabilă a datelor. Compania oferă 100 de milioane de jetoane gratuite dezvoltatorilor care încearcă API-ul.

Compania a mai spus că a început deja să antreneze următorul său model – cel mai mare de până acum, care urmează să fie lansat în lunile următoare – pe care îl descrie ca un salt în capacitate care nu renunță la viteza difuzării sau eficiența token-ului. Dacă această afirmație este valabilă, presiunea asupra operatorilor autoregresivi se va simți mai întâi pe nivelurile de mărfuri ale pieței, unde prețul și latența decid majoritatea contractelor.

Stai înaintea AI

Urmărește cele mai recente dezvoltări ale inteligenței artificiale și știri de ultimă oră în materie de inteligență artificială, pe măsură ce noile arhitecturi modele intră în producție.

Citiți mai multe știri AI →