Cerebras dodał Qwen 3.8 27B do publicznych punktów końcowych swojej platformy Cerebras Inference, gdzie model z otwartymi wagami działa z szybkością około 1500 tokenów na sekundę, zgodnie z dokumentacją katalogu modeli firmy. Dzięki temu zestawieniu jedna z najpowszechniej używanych rodzin otwartych modeli Alibaba jest dostępna z prędkościami przewyższającymi typowe usługi hostowane na GPU.
Ogłoszenie natychmiast zwróciło uwagę programistów: historia zebrała w serwisie Hacker News ponad 600 punktów w ciągu jednego dnia, co stanowi poziom zainteresowania odzwierciedlający ogromne zapotrzebowanie na szybkie i tanie wnioskowanie. Aby uzyskać szerszą perspektywę na rynek wnioskowania, dział najświeższych wiadomości o sztucznej inteligencji śledzi każdą większą aktualizację platformy w momencie jej pojawienia się.
Specyfikacje w katalogu
Zgodnie z dokumentacją Cerebras, Qwen 3.8 27B zawiera 27 miliardów parametrów i obsługuje 64 tys. tokenów kontekstu w warstwie bezpłatnej i 128 tys. w warstwach płatnych, działając z szybkością około 1500 tokenów na sekundę. Znajduje się obok otwartego modelu GPT-OSS 120B OpenAI, który w tym samym katalogu wyświetla listę z szybkością około 3000 tokenów na sekundę z kontekstem 65 tys. na warstwie bezpłatnej i 131 tys. na warstwach płatnych.
Obydwa modele są dostępne w ramach bezpłatnego okresu próbnego Cerebras i płatnych zgodnie z rzeczywistym użyciem, z zastrzeżeniem ograniczeń stawek. Klienci potrzebujący zarezerwowanej pojemności, wyższej przepustowości lub produkcyjnych umów SLA są kierowani do oferty firmy dotyczącej dedykowanych punktów końcowych, którą w dokumentacji wymieniono również jako drogę do dodatkowych rodzin modeli poza tymi dwoma w publicznych punktach końcowych.
Oprócz wskaźników prędkości na uwagę zasługują okna kontekstowe. Sześćdziesiąt cztery tysiące tokenów w warstwie bezpłatnej — i 128 000 w warstwie płatnej — wystarczy, aby jednocześnie przechowywać w pamięci duże bazy kodów, długie dokumenty lub rozszerzone transkrypcje agentów, co ma znaczenie w przypadku dokładnie tych obciążeń, w których opłaca się szybkie dekodowanie. Dokumentacja Cerebras zawiera również przewodnik dotyczący zgodności z OpenAI, obniżający koszt zmiany w przypadku zespołów, których istniejący kod jest już przeznaczony dla pakietu SDK OpenAI: w zasadzie wskazanie istniejącego klienta na punkcie końcowym Cerebras oznacza zmianę konfiguracji, a nie przepisanie.
Nieprzycięte modele, przezroczysta kompresja
Jednym ze szczegółów wartych odnotowania w dokumentacji jest ujawnienie przez Cerebras sposobu, w jaki radzi sobie z kompresją modelu. Firma twierdzi, że wszystkie modele na jej publicznych punktach końcowych są oryginalnymi, nieobrobionymi wersjami i że w celu zachowania jakości wykorzystuje selektywną kwantyzację wyłącznie na podstawie masy podczas przechowywania. Wrażliwe warstwy zachowują pełną precyzję, aktywacje, uwaga i pamięć podręczna KV pozostają nieskwantowane, a dekwantyzacja odbywa się w locie.
Cerebras ujawnia również swoje badania nad technikami przycinania, takimi jak REAP (przycinanie eksperckie ważone przez router): przycięte warianty są udostępniane społeczności badawczej w serwisie Hugging Face, ale nie są udostępniane za pośrednictwem publicznego interfejsu API. Dla programistów decydujących o tym, gdzie uruchamiać otwarte modele, przejrzystość dotycząca tego, co dokładnie jest obsługiwane, jest niezwykle wyraźna.
Dlaczego szybkość tokena ma znaczenie
Takie liczby przepustowości mają największe znaczenie w przypadku obciążeń agentowych i kodowania. Aplikacje łączące setki wywołań modeli — agenci kodujący, autonomiczne przepływy pracy, asystenci w czasie rzeczywistym — zwielokrotniają opóźnienie przypadające na token na każdym kroku, więc różnica między 50 a 1500 tokenów na sekundę składa się na jakościowo odmienne doświadczenie. Najbardziej widoczne korzyści odnoszą interaktywne aplikacje, które przesyłają strumieniowo długie zakończenia.
Kompromisem jest zakres. Model zawierający 27 miliardów parametrów nie będzie odpowiadał systemom pionierskim w przypadku najtrudniejszych zadań wnioskowania, a dokumentacja Cerebras kieruje duże obciążenia produkcyjne w stronę wydajności dedykowanej. Jednak w przypadku dużych środkowych zadań, w których średniej wielkości otwarte modele są już wystarczająco dobre — podsumowywanie, klasyfikacja, użycie narzędzi, edycja kodu — wyróżnikiem staje się szybkość.
Istnieje również wymiar cenowy, który deweloperzy będą brać pod uwagę. Publicznych modeli punktów końcowych można używać w ramach bezpłatnego okresu próbnego przed podjęciem jakichkolwiek zobowiązań, co sprawia, że porównywanie wyników z własnym obciążeniem zespołu jest w zasadzie bezproblemowe — jest to celowe wprowadzenie, które kontrastuje z umowami korporacyjnymi, które wymagają rozmów handlowych przed udostępnieniem pierwszego tokenu. Udokumentowane limity szybkości są ograniczeniem, którego należy przestrzegać: dostęp na poziomie bezpłatnym istnieje w celu sprawdzenia szybkości, a nie w celu obsługi ruchu produkcyjnego.
Zajęty odcinek dla otwartych modeli
Dodatek pojawia się podczas zatłoczonego odcinka AI z otwartymi ciężarami. Laboratorium IFM z siedzibą w Zjednoczonych Emiratach Arabskich właśnie wprowadziło K2 Horizon, połączoną flotę sześciu w pełni otwartych modeli, a Meta w dalszym ciągu udoskonala rodzinę Muse pod kątem kodowania i zastosowań agentowych. Tymczasem ekosystemy modelu otwartego w Chinach utrzymują tempo dostaw, które skompresowało cykle wydawnicze w całej branży.
Dla programistów praktyczny wniosek jest taki, że stos modeli otwartych dojrzewa na dwóch frontach jednocześnie: możliwości, ponieważ modele średniej wielkości wypełniają luki w stosunku do flagowców w codziennych zadaniach, oraz służenie ekonomii, ponieważ wyspecjalizowani dostawcy wnioskowania konkurują na czystej prędkości. Qwen 3.8 27B na platformie Cerebras to punkt danych dla obu trendów — otwarty model obecnej generacji, obsługujący egzotyczne prędkości rok temu, na sprzęcie specjalnie zaprojektowanym do tego zadania.
Programiści oceniający platformę powinni porównywać własne obciążenia: opublikowane prędkości są danymi katalogowymi, rzeczywista przepustowość zależy od długości poleceń, współbieżności i konfiguracji, a limity szybkości warstwy bezpłatnej zaczną obowiązywać wcześniej niż jej prędkość.
Wyprzedź sztuczną inteligencję
Śledzone na bieżąco każde wydanie modelu, aktualizacja platformy wnioskowania i uruchomienie narzędzia dla programistów — przeczytaj więcej aktualności o sztucznej inteligencji →
