Nowy startup AI założony przez byłego badacza OpenAI uruchomił tak zwaną zupełnie nową klasę modeli – taki, który nie może napisać eseju i twierdzi, że właśnie o to chodzi.

TypeSafe AI ogłosiło we wtorek wydanie swojego pierwszego „Modelu System One” o nazwie Jev, który będzie dostępny natychmiast we wczesnym dostępie. Firmę założył Diogo Almeida, który twierdzi, że badania stojące za przestrzeganiem instrukcji ChatGPT wyrosły z jego pracy w OpenAI. Po dwóch latach ukrywania się argumentuje, że skupienie branży na czacie przysłoniło obszary, w których automatyzacja tak naprawdę zawodzi. Więcej kontekstu na ten temat znajdziesz w naszych trendy AI.

„Modele od lat zachowują się nadludzko na czacie, więc gdzie jest cała automatyzacja?” Almeida napisała w poście startowym. „To było moje główne pytanie przez ostatnie cztery lata”.

Czym właściwie jest model „systemu pierwszego”.

Nazwa zapożyczona jest z psychologicznego rozróżnienia pomiędzy szybkim, instynktownym myśleniem i powolnym, przemyślanym rozumowaniem. Tam, gdzie duże modele językowe generują tekst token po tokenie — elastyczny, ogólny i podatny na sporadyczne pewne bzdury — Jev TypeSafe jest zbudowany do czegoś węższego: przyjmowania stanu nieustrukturyzowanego jako danych wejściowych i zwracania wpisywanych, ustrukturyzowanych decyzji z dołączonymi skalibrowanymi prawdopodobieństwami.

Firma opisuje Jeva jako „wywołanie funkcji wywiadu granicznego: nieustrukturyzowany stan wprowadzony, wpisane probabilistyczne decyzje”. Ponieważ możliwe wyniki są zdefiniowane z góry, a model nigdy nie generuje dowolnych ciągów znaków, TypeSafe twierdzi, że nie może generować błędów typu – właściwość, która według firmy jest gwarantowana matematycznie, a nie statystycznie prawdopodobna – i nie może wywoływać halucynacji w sposób, w jaki mogą to robić modele generujące tekst.

Jak podano w poście, architektura odbiega od głównego nurtu praktyki na trzy sposoby: nowa architektura modelu, równoległy próbnik generujący wszystkie wyniki w ramach jednego zapytania, a nie sekwencyjnie, oraz metoda szkoleniowa, którą firma nazywa Reinforcement Learning for Calibrated Decisions (RLCD), która optymalizuje pod kątem epistemicznie uczciwych prawdopodobieństw zamiast ludzkich preferencji lub programowo weryfikowalnych wyników.

Roszczenia: 100 razy szybciej, ułamek kosztów

Liczby publikowane przez TypeSafe są agresywne. Firma twierdzi, że Jev zapewnia inteligencję porównywalną z istniejącymi pionierskimi rozwiązaniami LLM w zakresie tak zwanych zadań „w kształcie Systemu One” – klasyfikacji, routingu, oceniania, ekstrakcji i decyzji o rozgałęzianiu – a jednocześnie odpowiada w czasie od 70 do 500 milisekund, w porównaniu z czasami reakcji od początku do końca wynoszącymi od 3 do 329 sekund w przypadku modeli pionierskich. To działa od 40 do 200 razy szybciej – twierdzi firma.

Ceny są podobnie niekonwencjonalne: 0,042 USD za milion tokenów wejściowych, przy czym tokeny wyjściowe są bezpłatne, ponieważ dane wyjściowe są obliczane równolegle, a nie generowane token po tokenie. Firma przyznała w swoim poście, że nie może jeszcze udowodnić, że ceny są zrównoważone na dużą skalę.

„Nadzwyczajne twierdzenia wymagają niezwykłych dowodów” – czytamy w poście, zanim zaprezentujemy, jakie dowody zawierają.

Paragony — i co mówią sceptycy

TypeSafe opublikowało demo porównujące Jeva z GPT-5.6 Terra, który opisuje jako najbardziej porównywalny model graniczny o podobnej inteligencji, i twierdzi, że jedyna różnica zdań w zarejestrowanym przebiegu dotyczyła naprawdę dwuznacznej oceny. Wprowadzono także nową metodologię „ewaluacji przepływu pracy”, która porównuje modele z konsensusem największych modeli zewnętrznych – Astry firmy OpenAI i Fable firmy OpenAI – w obrębie stałego wykresu obliczeniowego i twierdzi, że Jev „posiada granicę Pareto przez prawie 2 rzędy wielkości”.

Warto zauważyć, że firma opublikowała towarzyszący post zatytułowany „antibenchmaxxing”, wyjaśniając, dlaczego unika tradycyjnych testów porównawczych, argumentując, że model zaprojektowany na potrzeby ustrukturyzowanych decyzji w ramach przepływów pracy oprogramowania jest odporny na znaczące porównania globalne.

Reakcja w Hacker News, gdzie premiera w ciągu kilku godzin zebrała setki punktów, wahała się od prawdziwego entuzjazmu po ostry sceptycyzm. Kilku komentatorów zauważyło, że publiczne dowody składają się głównie z filmów demonstracyjnych – w tym jednego przedstawiającego model napędzający pętlę rozgrywki w Dooma – a nie z powtarzalnych ocen stron trzecich. Inni argumentowali, że podejście to najlepiej rozumieć jako niezwykle szybki klasyfikator o pionierskiej jakości, przydatny w przypadku wycinka obciążeń, a nie zamiennik LLM.

Nawet życzliwi obserwatorzy jasno określili ciężar dowodu. „Tak, wypowiadają się jako sceptycy, ale nie przedstawiają mnóstwa dowodów poza kilkoma filmami demonstracyjnymi” – napisał jeden z komentatorów. „Demo na żywo byłoby znacznie bardziej przekonujące”.

Dlaczego to i tak może mieć znaczenie

Boisko trafia w naprawdę bolesny punkt. Duża część produkcyjnych wywołań LLM w oprogramowaniu komercyjnym w ogóle nie ma charakteru generatywnego — są to binarne oceny, przypisania kategorii i decyzje dotyczące routingu ujęte w prozę. Jeśli model może wykonywać te wywołania ze skalibrowaną pewnością w 70 milisekundach i faktycznie zerowymi kosztami wyjściowymi, ekonomika oprogramowania opartego na sztucznej inteligencji znacznie się zmieni: interfejsy użytkownika działające w czasie rzeczywistym staną się praktyczne, a etapy potoku, które były zbyt drogie, aby zautomatyzować je za pomocą LLM, staną się wystarczająco tanie, aby można je było uruchomić wszędzie.

Sugerowane przypadki użycia TypeSafe obejmują klasyfikację i routing danych, weryfikację i ochronę wyników LLM, wykrywanie jailbreaków i analizę ograniczającą mapę na dużych zbiorach danych — obciążenia, w których otaczający kod może ograniczać swobodę modelu i wychwytywać błędy.

Firma szczerze odpowiada na otwarte pytania: opublikowane przez nią oceny przeprowadzono na laptopach na zachodnim wybrzeżu Stanów Zjednoczonych, a długoterminowa stabilność cen pozostaje niepotwierdzona. To, czy twierdzenia Jeva dotyczące wywiadu przetrwają kontakt z niezależnymi testami, zadecyduje, czy „Modele Systemu Pierwszego” staną się kategorią, czy ciekawostką.

Wczesny dostęp jest już dostępny za pośrednictwem strony internetowej firmy.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →