Inception Labs wypuściło we wtorek Mercury 2.5, nową wersję swojego komercyjnego modelu języka dyfuzyjnego, który firma opisuje jako najbardziej wydajny LLM na rynku i, według jej wiedzy, największy model języka dyfuzyjnego, jaki kiedykolwiek wytrenowano. Zgodnie z zapowiedzią firmy model zapewnia o 40% więcej inteligencji w porównaniu ze swoim poprzednikiem, Mercury 2, zachowując przy tym ten sam profil obsługi charakteryzujący się niskimi opóźnieniami i niskim kosztem, który uczynił architekturę dyfuzyjną atrakcyjną w przypadku dużych obciążeń.
Firma, na której czele stoi dyrektor generalny Stefano Ermon, twierdzi, że Mercury 2.5 jest porównywalny z zoptymalizowanymi kosztowo modelami frontowymi, w tym GPT-5.6 Luna (niski), Gemini 3.5 Flash-Lite i Claude Haiku 4.5. Porównania te są zgłaszane przez dostawców i nie zostały jeszcze zweryfikowane przez niezależne testy porównawcze, ale pozycjonują model dyfuzyjny – od dawna ciekawostka badawcza – jako produkcyjna alternatywa dla dominujących autoregresyjnych producentów. Aby uzyskać najnowsze wiadomości dotyczące modeli AI, śledź bieżące informacje o modelach AI Buzz Wire. najnowsze wiadomości dotyczące modelu AI
Szybkość, kontekst i cena
Liczby w nagłówkach są agresywne. Inception Labs twierdzi, że Mercury 2.5 generuje 1107 tokenów na sekundę na powszechnie dostępnych procesorach graficznych NVIDIA, przy oknie kontekstowym wynoszącym 260 000 tokenów. Ceny ustalono na 0,20 USD za milion tokenów wejściowych i 0,75 USD za milion tokenów wyjściowych, a promocja na wprowadzenie na rynek obniża model o 80% do 0,04 USD za milion wejściowych i 0,15 USD za milion wyjściowych.
Jeśli chodzi o możliwości, model jest wyposażony w dostrajalne rozumowanie — umożliwiające programistom zamianę opóźnień na głębokość w zależności od żądania — wraz z równoległymi wywołaniami narzędzi i danymi wyjściowymi JSON dostosowanymi do schematu na potrzeby generowania strukturalnego. Firma określa tę publikację jako pierwszy wynik pętli szkoleniowej opartej na telemetrii produkcyjnej: od czasu premiery Mercury 2 tysiące programistów tworzyło przy jej użyciu, wdrożyły go dziesiątki przedsiębiorstw, a wykorzystanie wzrosło o ponad rząd wielkości.
Dlaczego modele dyfuzyjne generują tekst szybciej
Mainstreamowe LLM z OpenAI, Google i Anthropic są autoregresyjne: generują tekst po jednym tokenie na raz, przy czym każdy token jest uwarunkowany wszystkim, co zostało wygenerowane przed nim. Ta sekwencyjna zależność powoduje, że prędkość generacji jest twarda. Zamiast tego modele języka dyfuzyjnego zaczynają od bloku szumu i iteracyjnie udoskonalają wszystkie tokeny równolegle, co pozwala na znacznie wyższą przepustowość na konwencjonalnym sprzęcie GPU, gdy model zostanie przeszkolony do czystej zbieżności.
W przeszłości kompromisem była jakość: modele dyfuzji ustępowały modelom autoregresyjnym w zakresie wzorców rozumowania i podążania za instrukcjami. Podstawowym założeniem Inception Labs — i twierdzeniem leżącym u podstaw Mercury 2.5 — jest to, że różnica ta zawęziła się do punktu, w którym dyfuzja wygrywa w osi, którą faktycznie odczuwa większość klientów: opóźnienia i koszty w stosunku do wielkości produkcji.
Roszczenia produkcyjne od pierwszych klientów
Ogłoszenie opiera się w dużej mierze na wdrożeniach klientów, a nie na tabelach porównawczych. Firma OpenCall, która tworzy agenty telefoniczne oparte na sztucznej inteligencji do obsługi połączeń z klientami na żywo, poinformowała, że przejście na firmę Mercury spowodowało, że mediana opóźnienia odpowiedzi w modelu wyniosła około 170 milisekund. Oliver Silverstein, współzałożyciel i dyrektor generalny OpenCall, powiedział, że czas reakcji firmy P99 spadł z kilku minut do jednej sekundy, a mediana z 0,4 sekundy do poniżej 0,2 – to wartości, które określił jako znacznie szybsze niż jakikolwiek inny dostawca testowany przez firmę, w tym z włączoną funkcją wnioskowania.
Augment Code, kreator asystentów kodowania AI, wykorzystuje Mercury do zagęszczania kontekstu, wyznaczania tras modeli i wyszukiwania narzędzi MCP. Według Inception Labs przeniesienie zadań związanych z zagęszczaniem na platformę Mercury skróciło opóźnienie tego etapu o 82%, z około 150 sekund do 27 sekund, i zmniejszyło jego koszt o 90% przy jednoczesnym zachowaniu jakości. Przypadek użycia ilustruje, gdzie leży problem ekonomiczny: agenci kodujący wykonują wiele małych wywołań modeli pomocniczych wokół każdej generacji podstawowej, a opóźnienia i koszty zwiększają się w przypadku tych wywołań.
Firma NVIDIA, której sprzęt obsługuje ten model, również zabrała głos. Shruti Koparkar, starszy menedżer ds. produktu w grupie Accelerated Computing Group firmy NVIDIA, powiedziała, że Inception ma zaawansowane modele językowe oparte na dyfuzji w infrastrukturze AI NVIDIA, a wzrost jakości Mercury 2.5 przy stałych prędkościach pokazuje, jak szybko nowe architektury mogą przekształcić się w systemy gotowe do produkcji.
Podgląd Mercury Voice i Mercury Router
Oprócz modelu Inception Labs ogłosiło zapowiedzi dwóch nowych produktów. Mercury Voice to rozproszona usługa LLM zoptymalizowana dla agentów głosowych z najmniejszymi budżetami na opóźnienia i czasem reklamowym do pierwszego tokena poniżej 170 milisekund. Mercury Router wykorzystuje model dyfuzyjny, aby zrozumieć przychodzące podpowiedzi i przekierować je do dowolnego modelu — otwartego lub zamkniętego — oferującego najlepsze połączenie jakości, szybkości i kosztów, pozycjonując Incepcję jako warstwę wyższą od swoich konkurentów, a także jedną z nich.
Mercury 2.5 jest dostępny poprzez własne API Inception, a także poprzez Baseten i OpenRouter. Wdrożenia w przedsiębiorstwach dodają dedykowaną pojemność, automatyczne skalowanie, kontrolę zgodności i konfigurowalne przechowywanie danych. Firma oferuje 100 milionów darmowych tokenów programistom wypróbowującym API.
Firma poinformowała również, że rozpoczęła już szkolenie w zakresie swojego kolejnego modelu – największego jak dotąd, którego premiera ma nastąpić w nadchodzących miesiącach – który opisuje jako skok w zakresie możliwości, który nie rezygnuje z szybkości rozpowszechniania ani wydajności tokena. Jeśli to twierdzenie się potwierdzi, presja na autoregresyjnych operatorów zasiedziałych będzie odczuwalna w pierwszej kolejności na poziomach rynku towarowego, gdzie cena i opóźnienie decydują o większości kontraktów.
Wyprzedź sztuczną inteligencję
Śledź najnowsze osiągnięcia sztucznej inteligencji i najświeższe informacje dotyczące sztucznej inteligencji w miarę wchodzenia do produkcji nowych architektur modeli.
Przeczytaj więcej aktualności o sztucznej inteligencji →