Nový startup založený na AI bývalým výzkumníkem OpenAI spustil to, co nazývá zcela novou třídou modelů – model, který vám nemůže napsat esej, a říká, že přesně o to jde.

TypeSafe AI v úterý oznámila vydání svého prvního modelu „System One Model“ s názvem Jev, který je okamžitě k dispozici v předběžném přístupu. Společnost založil Diogo Almeida, který říká, že výzkum, který stojí za následováním instrukcí ChatGPT, vyrostl z práce, ke které přispěl v OpenAI. Po dvou letech v utajení tvrdí, že fixace odvětví na chat zakryla, kde automatizace ve skutečnosti selhává. For more context on this story, see our ongoing more AI stories.

"Modelky byly na chatu už léta nadlidské, tak kde je všechna ta automatizace?" Almeida napsala v úvodním příspěvku. "To byla moje řidičská otázka za poslední čtyři roky."

Co model „System One“ vlastně je

Název si vypůjčil z psychologického rozlišení mezi rychlým, instinktivním myšlením a pomalým, záměrným uvažováním. Tam, kde velké jazykové modely generují textový token po tokenu – flexibilní, obecný a náchylný k občasným sebevědomým nesmyslům – je TypeSafe's Jev postaven tak, aby dělal něco užšího: brát nestrukturovaný stav jako vstupní a vracet typovaná, strukturovaná rozhodnutí s připojenými kalibrovanými pravděpodobnostmi.

Společnost popisuje Jev jako "volání funkce hraniční inteligence: nestrukturovaný stav dovnitř, typovaná pravděpodobnostní rozhodnutí ven." Vzhledem k tomu, že možné výstupy jsou definovány předem a model nikdy negeneruje volné řetězce, TypeSafe tvrdí, že nemůže produkovat typové chyby – vlastnost, o které společnost tvrdí, že je spíše matematicky zaručená než statisticky pravděpodobná – a nemůže halucinovat tak, jak to umí modely generující text.

Architektura se odchyluje od běžné praxe třemi způsoby, podle úvodního příspěvku: nová modelová architektura, paralelní vzorkovač, který produkuje všechny výstupy v jediném dotazu, nikoli postupně, a tréninková metoda, kterou společnost nazývá Reinforcement Learning for Calibrated Decisions (RLCD), která optimalizuje pro epistemicky poctivé pravděpodobnosti namísto lidských preferencí nebo programově ověřitelných výstupů.

Nároky: 100x rychlejší, zlomek nákladů

Čísla, která TypeSafe publikuje, jsou agresivní. Společnost říká, že Jev poskytuje inteligenci srovnatelnou se stávajícími hraničními LLM pro úkoly, které nazývá „System One shaped“ – klasifikaci, směrování, bodování, extrakci a rozhodnutí o větvení – a přitom reaguje za 70 až 500 milisekund, přičemž doba odezvy mezi koncovými body 3 až 329 sekund u hraničních modelů. To funguje 40x až 200x rychleji, říká společnost.

Ceny jsou podobně nekonvenční: 0,042 $ za milion vstupních tokenů, přičemž výstupní tokeny jsou zdarma, protože výstupy jsou počítány paralelně, nikoli generovány token po tokenu. Společnost ve svém příspěvku uznala, že zatím nemůže prokázat, že ceny jsou udržitelné v měřítku.

"Mimořádná tvrzení vyžadují mimořádné důkazy," stojí v příspěvku, než nabídne, jaké důkazy má.

Účtenky — a co říkají skeptici

TypeSafe zveřejnila vedle sebe demo porovnávající Jev s GPT-5.6 Terra, který popisuje jako nejsrovnatelnější hraniční model s podobnou inteligencí, a říká, že jediná neshoda v zaznamenaném běhu zahrnovala skutečně nejednoznačný úsudek. Představila také novou metodiku „workflow eval“, která měří modely proti konsenzu největších externích modelů – OpenAI's Astra a Anthropic's Fable – uvnitř pevného výpočetního grafu a tvrdí, že Jev „vlastní Paretovu hranici téměř na 2 řády“.

Společnost zejména zveřejnila doprovodný příspěvek nazvaný „antibenchmaxxing“, který vysvětluje, proč se vyhýbá tradičním benchmarkům, a tvrdí, že model navržený pro strukturovaná rozhodnutí v rámci softwarových pracovních postupů odolává smysluplnému globálnímu srovnání.

Reakce na Hacker News, kde spuštění přitáhlo stovky bodů během několika hodin, se pohybovalo od skutečného vzrušení po ostře skeptický. Několik komentátorů poznamenalo, že veřejné důkazy sestávají převážně z ukázkových videí – včetně jednoho, který ukazuje model pohánějící smyčku hry Doom – spíše než reprodukovatelná hodnocení třetích stran. Jiní tvrdili, že tento přístup lze nejlépe chápat jako extrémně rychlý klasifikátor hraniční kvality, který je užitečný spíše pro část pracovních zátěží než jako náhrada za LLM.

I soucitní pozorovatelé jasně postavili důkazní břemeno. "Ano, mluví jako skeptici, ale nenabízejí spoustu důkazů, kromě několika videí s ukázkami," napsal jeden z komentujících. "Živé demo by bylo mnohem přesvědčivější."

Proč na tom stejně záleží

Hřiště se dostává do bodu skutečné bolesti. Velká část produkčních LLM volání v komerčním softwaru není vůbec generativní – jsou to binární úsudky, přiřazení kategorií a směrovací rozhodnutí zabalená do prózy. Pokud model dokáže uskutečnit tato volání s kalibrovanou spolehlivostí 70 milisekund a efektivně s nulovými výstupními náklady, ekonomika softwaru poháněného umělou inteligencí se značně změní: uživatelská rozhraní v reálném čase se stanou praktickými a kroky zřetězení, které byly příliš drahé na automatizaci pomocí LLM, budou dostatečně levné, aby je bylo možné spustit všude.

Mezi doporučené případy použití TypeSafe patří klasifikace a směrování dat, ověřování a střežení výstupů LLM, detekce útěků z vězení a analýza redukující mapy nad velkými datovými sadami – pracovní zátěže, kdy okolní kód může omezit svobodu modelu a zachytit chyby.

Společnost je k otevřeným otázkám upřímná: její publikované výsledky byly spuštěny z notebooků na západním pobřeží USA a dlouhodobá cenová udržitelnost zůstává neprokázaná. Zda Jevova zpravodajská tvrzení přežijí kontakt s nezávislým testováním, určí, zda se „modely System One“ stanou kategorií nebo kuriozitou.

Předběžný přístup je nyní otevřen prostřednictvím webových stránek společnosti.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →