Společnost Inception Labs v úterý vydala Mercury 2.5, novou verzi svého komerčního jazykového modelu difúze, který společnost popisuje jako nejschopnější difúzní LLM na trhu a pokud je jí známo, největší difúzní jazykový model, jaký byl kdy trénován. Podle oznámení společnosti poskytuje tento model 40% nárůst inteligence oproti svému předchůdci Mercury 2, přičemž si zachovává stejnou nízkou latenci a nízkonákladový profil obsluhy, díky kterému je architektura difúze atraktivní pro velké objemy pracovních zátěží.
Společnost vedená generálním ředitelem Stefanem Ermonem tvrdí, že Mercury 2.5 je srovnatelný s cenově optimalizovanými hraničními modely včetně GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite a Claude Haiku 4.5. Tato srovnání jsou hlášena prodejci a dosud nebyla ověřena nezávislými srovnávacími testy, ale staví model difúze – dlouhou dobu výzkumnou kuriozitu – jako produkční alternativu k autoregresivním zavedeným společnostem. Chcete-li získat nejnovější zprávy o modelech AI, sledujte průběžné pokrytí modelů AI Buzz Wire. nejnovější zprávy o modelu AI
Rychlost, kontext a cena
Čísla v titulku jsou agresivní. Inception Labs říká, že Mercury 2.5 generuje 1 107 tokenů za sekundu na široce dostupných GPU NVIDIA s kontextovým oknem 260 000 tokenů. Cena je stanovena na 0,20 USD za milion vstupních tokenů a 0,75 USD za milion výstupních tokenů, přičemž propagační akce zlevňuje model o 80 % na 0,04 USD za milion vstupu a 0,15 USD za milion výstupu.
Na straně schopností je model dodáván s laditelným uvažováním – což umožňuje vývojářům měnit latenci za hloubku na základě požadavku – spolu s paralelními voláními nástrojů a výstupem JSON se schématem pro strukturované generování. Společnost koncipuje vydání jako první výsledek tréninkové smyčky poháněné produkční telemetrií: od uvedení Mercury 2 s ním stavěly tisíce vývojářů, nasadily ho desítky podniků a využití vzrostlo o více než řád.
Proč difúzní modely generují text rychleji
Mainstreamové LLM od OpenAI, Google a Anthropic jsou autoregresivní: generují text po jednom tokenu, přičemž každý token je podmíněn vším vygenerovaným před ním. Tato sekvenční závislost klade tvrdé dno pod generační rychlost. Difúzní jazykové modely místo toho začínají blokem šumu a iterativně zpřesňují všechny tokeny paralelně, což umožňuje mnohem vyšší propustnost na konvenčním hardwaru GPU, jakmile je model trénován tak, aby se čistě sbližoval.
Kompromisem byla historicky kvalita: modely difúze zaostávaly za autoregresivními modely uvažování a benchmarků podle instrukcí. Základní sázka Inception Labs – a tvrzení, na kterém se zakládá Mercury 2.5 – je, že tato mezera se zmenšila do bodu, kdy difúze vítězí na ose, kterou většina zákazníků skutečně cítí: latence a náklady na objem výroby.
Výrobní nároky od prvních zákazníků
Oznámení se do značné míry opírá o zákaznická nasazení spíše než o benchmarkové tabulky. Společnost OpenCall, která vytváří telefonní agenty s umělou inteligencí pro živé hovory zákazníků, uvedla, že přechod na Mercury přinesl střední latenci odezvy modelu na zhruba 170 milisekund. Oliver Silverstein, spoluzakladatel a generální ředitel OpenCall, uvedl, že doba odezvy P99 společnosti klesla z několika minut na jednu sekundu a její medián z 0,4 sekundy pod 0,2 – čísla, která popsal jako výrazně rychlejší než u kteréhokoli jiného poskytovatele, kterého společnost testovala, včetně aktivovaného uvažování.
Augment Code, pomocný výrobce kódování AI, používá Mercury pro komprimaci kontextu, směrování modelu a vyhledávání nástrojů MCP. Podle Inception Labs přesunutí zátěže zhutňování na Mercury snížilo latenci tohoto kroku o 82 %, ze zhruba 150 sekund na 27 sekund, a snížilo jeho náklady o 90 % při zachování kvality. Případ použití ilustruje, kde je ekonomický problém: kódovací agenti uskutečňují mnoho malých podpůrných modelových volání kolem každé primární generace a latence a náklady se u těchto volání skládají.
NVIDIA, jejíž hardware model provozuje, také zavážila. Shruti Koparkar, senior manažer produktu v NVIDIA's Accelerated Computing Group, řekl, že Inception má pokročilé jazykové modely založené na difúzi v infrastruktuře NVIDIA AI a že zvýšení kvality Mercury 2.5 s udržitelnými rychlostmi ukazuje, jak rychle mohou nové architektury připravené pro výrobu dospět k produkci.
Náhledy Mercury Voice a Mercury Router
Vedle modelu oznámily Inception Labs ukázky dvou nových produktů. Mercury Voice je difúzní LLM optimalizovaná pro hlasové agenty s nejpřísnějšími rozpočty na latenci, doba inzerce do prvního tokenu pod 170 milisekund. Mercury Router používá difúzní model k pochopení příchozích výzev a jejich směrování do libovolného modelu – otevřeného nebo zavřeného – nabízí nejlepší kombinaci kvality, rychlosti a ceny, čímž se Inception umisťuje jako vrstva nad své konkurenty, stejně jako jeden z nich.
Mercury 2.5 je k dispozici prostřednictvím vlastního API Inception a také prostřednictvím Baseten a OpenRouter. Podniková nasazení přidávají vyhrazenou kapacitu, automatické škálování, kontroly souladu a konfigurovatelné uchovávání dat. Společnost nabízí 100 milionů bezplatných tokenů vývojářům, kteří zkoušejí API.
Společnost také uvedla, že již začala trénovat svůj další model – jeho dosud největší, jehož vydání se plánuje v nadcházejících měsících – což popisuje jako skok ve schopnosti, který se nevzdává rychlosti šíření ani účinnosti tokenů. Pokud bude toto tvrzení platit, tlak na autoregresivní zavedené společnosti se nejprve projeví na komoditních úrovních trhu, kde o většině kontraktů rozhoduje cena a latence.
Stay Ahead of AI
Sledujte nejnovější vývoj umělé inteligence a nejnovější novinky v oblasti umělé inteligence, protože nové modelové architektury se řítí do výroby.
Přečtěte si další zprávy o AI →