Europejska firma zajmująca się sztuczną inteligencją Multiverse Computing wprowadziła na rynek Quasar 438B, duży model rozumujący, który według firmy jest najinteligentniejszym modelem sztucznej inteligencji zbudowanym w Europie. Zgodnie z zapowiedzią firmy, Quasar 438B uzyskał 43 punkty w indeksie sztucznej inteligencji, co stanowi najwyższy wynik spośród wszystkich europejskich modeli mierzonych w tym teście.
Premiera stanowi znaczący krok dla hiszpańskiej firmy, która zbudowała swoją reputację na kompresji modeli AI, a nie na szkoleniu systemów o pionierskiej skali. Quasar 438B to pierwszy duży model wypuszczony przez Multiverse Computing, który pojawia się w odpowiedzi na naciski europejskich rządów i firm na rzecz możliwości sztucznej inteligencji, które nie zależą wyłącznie od laboratoriów amerykańskich i chińskich. Dla czytelników śledzących nasze wiadomości dotyczące sztucznej inteligencji ta publikacja sygnalizuje również, że wyścig o zmniejszenie luki w stosunku do pionierskich modeli nie jest już ograniczony do zwykłych konkurentów z USA.
Jakie właściwie wyniki osiąga Quasar 438B
Indeks sztucznej analizy inteligencji (wersja 4.1.1) łączy w sobie dziewięć ocen, w tym PKBval-AA v2, tau3-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience i AA-LCR. Łączny wynik Quasara 438B wynoszący 43 plasuje go przed Mistral Medium 3.5 z wynikiem 30, Nemotron 3 Ultra firmy NVIDIA z wynikiem 38 i Inkling z wynikiem 42, zgodnie z zapowiedzią firmy.
Szersze pole nadal należy do granicy amerykańskiej: Claude Opus 5 prowadzi w indeksie z wynikiem 63. Multiverse Computing nie twierdzi inaczej. Zamiast tego firma określa Quasara 438B jako najsilniejszą opcję europejską, przewyższającą porównywalne modele europejskie w siedmiu z ośmiu wybranych ocen sztucznej analizy, które podkreśliła.
Prędkość to drugi argument
Surowe wyniki testów porównawczych to tylko połowa możliwości Multiverse Computing. Firma twierdzi, że Quasar 438B zwraca 500 tokenów, włączając czas myślenia, w 15,3 sekundy. Spośród porównywanych modeli tylko Nemotron 3.5 Lightning (9,4 sekundy), Gemini 3.5 Flash-Lite (10,8 sekundy) i Gemini 3.7 Flash (11,5 sekundy) są szybsze, a tylko Gemini 3.7 Flash jest zarówno szybszy, jak i wydajniejszy w indeksie.
Porównanie z Mistral Medium 3.5 przebiega w jedną stronę w obu osiach: Quasar osiąga wyższe wyniki (43 w porównaniu z 30) i odpowiada szybciej (15,3 sekundy w porównaniu z 18,8 sekundy). Inkling, którego inteligencja jest prawie równa inteligencji Quasara wynoszącej 42 lata, potrzebuje 48,3 sekundy na tę samą odpowiedź zawierającą 500 żetonów, czyli ponad trzy razy dłużej.
Silne rozumowanie w długim kontekście
Z ogłoszenia wyróżnia się jeden wynik: w teście AA-LCR, który sprawdza zdolność wyodrębniania, łączenia i analizowania informacji rozproszonych w długich dokumentach, Quasar 438B uzyskuje wynik 75,0. To wynik na poziomie Groka 4,6 (wysoki), a Claude Opus 5 na poziomie 75,7 i wyprzedzający Qwen3.8 2.4T A95B na poziomie 75,3, według danych firmy.
Obsługa długich kontekstów ma znaczenie, ponieważ opierają się na nich badania korporacyjne, analiza dokumentów i agentyczne przepływy pracy. Jeśli model nie jest w stanie pomieścić i połączyć informacji w długim dokumencie, nie będzie w stanie zapewnić wieloetapowych narzędzi, które firmy faktycznie chcą wdrażać. To tutaj Kwazar jest najbliżej grupy granicznej.
Kodowanie agentowe wciąż ma potencjał
Najsłabszym wynikiem zapowiedzi jest Terminal-Bench v2.1, który umożliwia agentom kodującym pracę w rzeczywistych środowiskach terminalowych. Quasar 438B uzyskał 69,3 punktów, wyprzedzając Mistral Medium 3,5 o 18,7 punktu i Nemotron 3 Ultra o 15,4, ale wyprzedzając grupę pogranicza dowodzoną przez Claude Opus 5 z wynikiem 89,1. Firma Multiverse Computing przyznaje, że jest to ocena dająca największe możliwości i twierdzi, że na tym skupia się następna runda prac.
Stworzony dla agentów korporacyjnych
Quasar 438B jest pozycjonowany jako model dla organizacji prowadzących agentów rozwoju oprogramowania, drugich pilotów technicznych, systemy badawcze i automatyzację przepływu pracy. Należy do klasy obejmującej ponad 400 miliardów parametrów, obsługuje język angielski i hiszpański i jest przeznaczony do wieloetapowych zadań, które wymagają planowania, użycia narzędzi, wykonania kodu i dużego kontekstu bez opóźnień, jakie zwykle niesie ta klasa.
Dostęp odbywa się poprzez firmowy interfejs API CompactifAI, dzięki czemu zespoły mogą testować model bez konieczności instalowania własnej infrastruktury. Firma Multiverse Computing twierdzi, że nadchodzi więcej aktualizacji dla Quasar.
Co to oznacza dla europejskiego wyścigu AI
Wydanie następuje w szczególnym momencie dla europejskiej sztucznej inteligencji. Mistral, od dawna lider na kontynencie, stanął przed pytaniami dotyczącymi kierunku, w jakim zmierza, podczas gdy laboratoria amerykańskie umocniły swoją przewagę w zakresie złożonych wskaźników porównawczych. Model europejski, który zgodnie z prawem zajmuje pierwsze miejsce w Europie w niezależnym indeksie, zapewnia przedsiębiorstwom na kontynencie wiarygodną opcję regionalną, szczególnie w przypadku wdrożeń dwujęzycznych angielsko-hiszpańskich.
To, czy Quasar 438B utrzyma to stanowisko, to inna sprawa. Sama spółka zauważa, że tylko część liderów indeksu odpowiada szybciej, a różnica do Claude Opus 5 pozostaje dwudziestopunktowa. Jednak firma stawiająca na kompresję pokazała teraz, że może konkurować w klasie wagi ciężkiej, a europejskie przedsiębiorstwa w końcu mają model na rynku krajowym, który warto porównać z ich domyślnymi rozwiązaniami w USA.
Wyprzedź sztuczną inteligencję
Krajobraz sztucznej inteligencji zmienia się z godziny na godzinę, a wyniki testów porównawczych, które w styczniu wydawały się nie do podważenia, znikną latem. Przeczytaj więcej aktualności na temat sztucznej inteligencji w AI Buzz Wire, aby śledzić każdą premierę modelu, wyniki testów porównawczych i bieżące zmiany zasad.
Śledź tutaj najnowsze osiągnięcia AI.