Een nieuwe AI-startup, opgericht door een voormalige OpenAI-onderzoeker, heeft wat zij noemt een geheel nieuwe modelklasse gelanceerd – eentje die je geen essay kan schrijven, en zegt dat dat precies het punt is.

TypeSafe AI heeft dinsdag de release aangekondigd van zijn eerste "System One Model", genaamd Jev, dat onmiddellijk beschikbaar is in vroege toegang. Het bedrijf is opgericht door Diogo Almeida, die zegt dat het onderzoek achter het volgen van ChatGPT-instructies voortkwam uit het werk waaraan hij bij OpenAI heeft bijgedragen. Na twee jaar in stealth stelt hij dat de fixatie van de industrie op chat heeft verdoezeld waar automatisering feitelijk faalt. Voor meer context over dit verhaal, zie ons laatste AI-ontwikkelingen.

"Modellen zijn al jaren bovenmenselijk in de chat, dus waar is al die automatisering?" Almeida schreef in de lanceerpost. "Dat is de afgelopen vier jaar mijn belangrijkste vraag geweest."

Wat een 'System One'-model eigenlijk is

De naam is ontleend aan het onderscheid in de psychologie tussen snel, instinctief denken en langzaam, weloverwogen redeneren. Waar grote taalmodellen tekst token voor token genereren - flexibel, algemeen en vatbaar voor af en toe zelfverzekerde onzin - is TypeSafe's Jev gebouwd om iets beperkters te doen: ongestructureerde toestanden als invoer nemen en getypte, gestructureerde beslissingen retourneren met gekalibreerde waarschijnlijkheden.

Het bedrijf beschrijft Jev als "een functieaanroep op het gebied van grensintelligentie: ongestructureerde status erin, getypte probabilistische beslissingen eruit." Omdat de mogelijke uitkomsten van tevoren zijn gedefinieerd en het model nooit tekenreeksen in vrije vorm genereert, beweert TypeSafe dat het geen typefouten kan veroorzaken – een eigenschap die volgens het bedrijf wiskundig gegarandeerd is in plaats van statistisch waarschijnlijk – en niet kan hallucineren op de manier waarop tekstgenererende modellen dat kunnen.

Volgens de lanceringspost wijkt de architectuur op drie manieren af ​​van de reguliere praktijk: een nieuwe modelarchitectuur, een parallelle sampler die alle outputs in één enkele query produceert in plaats van opeenvolgend, en een trainingsmethode die het bedrijf Reinforcement Learning for Calibrated Decisions (RLCD) noemt, die optimaliseert voor epistemisch eerlijke waarschijnlijkheden in plaats van menselijke voorkeur of programmatisch verifieerbare outputs.

De claims: 100x sneller, een fractie van de kosten

De cijfers die TypeSafe publiceert zijn agressief. Het bedrijf zegt dat Jev intelligentie levert die vergelijkbaar is met bestaande frontier LLM's over wat het 'System One-vormige' taken noemt (classificatie, routering, scoring, extractie en vertakkingsbeslissingen) terwijl het reageert in 70 tot 500 milliseconden, terwijl end-to-end responstijden van 3 tot 329 seconden voor frontier-modellen zijn. Dat komt neer op 40x tot 200x sneller, zegt het bedrijf.

De prijzen zijn eveneens onconventioneel: $ 0,042 per miljoen invoertokens, waarbij uitvoertokens gratis zijn, omdat de uitvoer parallel wordt berekend in plaats van token voor token te worden gegenereerd. Het bedrijf erkende in zijn post dat het nog niet kan bewijzen dat de prijsstelling op grote schaal duurzaam is.

“Buitengewone beweringen vereisen buitengewoon bewijs”, luidt het bericht, voordat het bewijsmateriaal wordt aangeboden.

De ontvangstbewijzen — en wat sceptici zeggen

TypeSafe publiceerde een side-by-side demo waarin Jev werd vergeleken met GPT-5.6 Terra, dat het beschrijft als het meest vergelijkbare grensmodel met vergelijkbare intelligentie, en zegt dat het enige meningsverschil in de geregistreerde run een werkelijk dubbelzinnig oordeel betrof. Het introduceerde ook een nieuwe ‘workflow eval’-methodologie die modellen meet aan de hand van de consensus van de grootste externe modellen – OpenAI’s Astra en Anthropic’s Fable – in een vaste rekengrafiek, en beweert dat Jev ‘de Pareto-grens bezit voor bijna twee ordes van grootte’.

Het bedrijf publiceerde met name een begeleidend bericht met de titel "antibenchmaxxing", waarin werd uitgelegd waarom het traditionele benchmarks vermijdt, met het argument dat een model dat is ontworpen voor gestructureerde beslissingen binnen softwareworkflows bestand is tegen zinvolle mondiale vergelijkingen.

De reacties op Hacker News, waar de lancering binnen enkele uren honderden punten opleverde, varieerden van oprechte opwinding tot scherpe scepsis. Verschillende commentatoren merkten op dat het publieke bewijsmateriaal grotendeels bestaat uit demovideo’s – waaronder een waarin het model wordt getoond dat een Doom-gameplay-loop aandrijft – in plaats van reproduceerbare evaluaties van derden. Anderen voerden aan dat de aanpak het best kan worden begrepen als een extreem snelle classificator van grensverleggende kwaliteit, die nuttig is voor een deel van de werklast in plaats van als vervanging voor LLM's.

Zelfs sympathieke waarnemers hebben de bewijslast duidelijk geformuleerd. "Ja, ze praten als sceptici, maar bieden niet veel bewijs, behalve een paar video's met demo's", schreef een commentator. "Een live demo zou veel overtuigender zijn."

Waarom het er toch toe doet

Het veld belandt op een echt pijnpunt. Een groot deel van de productie-LLM-oproepen in commerciële software zijn helemaal niet generatief: het zijn binaire oordelen, categorietoewijzingen en routeringsbeslissingen verpakt in proza. Als een model deze gesprekken kan voeren met een gekalibreerd vertrouwen in 70 milliseconden en feitelijk nul uitvoerkosten, verandert de economie van AI-aangedreven software aanzienlijk: realtime gebruikersinterfaces worden praktisch, en pijplijnstappen die te duur waren om te automatiseren met LLM's worden goedkoop genoeg om overal te gebruiken.

De voorgestelde gebruiksscenario's van TypeSafe omvatten het classificeren en routeren van gegevens, het verifiëren en bewaken van LLM-uitvoer, het detecteren van jailbreaks en het in kaart brengen van analyses over grote datasets - werklasten waarbij de omringende code de vrijheid van het model kan beperken en fouten kan opsporen.

Het bedrijf is openhartig over de open vragen: de gepubliceerde evaluaties zijn uitgevoerd vanaf laptops aan de westkust van de VS, en de duurzaamheid van de prijzen op de lange termijn is nog steeds niet bewezen. Of de inlichtingenclaims van Jev het contact met onafhankelijke tests overleven, zal bepalen of 'System One Models' een categorie of een curiosum wordt.

Vroege toegang is nu beschikbaar via de website van het bedrijf.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →