En ny AI-startup grundad av en före detta OpenAI-forskare har lanserat vad den kallar en helt ny modellklass – en som inte kan skriva en uppsats till dig och säger att det är precis poängen.

TypeSafe AI tillkännagav på tisdagen lanseringen av sin första "System One Model", som heter Jev, tillgänglig omedelbart i tidig tillgång. Företaget grundades av Diogo Almeida, som säger att forskningen bakom ChatGPT:s instruktionsföljande växte fram ur arbete han bidrog till på OpenAI. Efter två år i smyg hävdar han att branschens fixering vid chatt har skymt var automatiseringen faktiskt misslyckas. For more context on this story, see our ongoing artificial intelligence updates.

"Modeller har varit övermänskliga på chatt i flera år, så var är all automatisering?" skrev Almeida i lanseringsinlägget. "Det har varit min drivande fråga de senaste fyra åren."

Vad en "System One"-modell egentligen är

Namnet lånar från psykologins distinktion mellan snabbt, instinktivt tänkande och långsamt, medvetet resonemang. Där stora språkmodeller genererar text token för token - flexibel, allmän och benägen till enstaka självsäker nonsens - är TypeSafes Jev byggd för att göra något smalare: ta ostrukturerat tillstånd som input och returskrivna, strukturerade beslut med kalibrerade sannolikheter bifogade.

Företaget beskriver Jev som "ett gräns-intelligens funktionssamtal: ostrukturerat tillstånd in, maskinskrivna probabilistiska beslut ut." Eftersom de möjliga utdata är definierade i förväg och modellen aldrig genererar strängar i fritt format, hävdar TypeSafe att den inte kan producera typfel – en egenskap som företaget säger är matematiskt garanterad snarare än statistiskt trolig – och inte kan hallucinera på det sätt som textgenererande modeller kan.

Arkitekturen avviker från mainstream-praxis på tre sätt, enligt lanseringsinlägget: en ny modellarkitektur, en parallell sampler som producerar alla utdata i en enda fråga snarare än sekventiellt, och en träningsmetod som företaget kallar Reinforcement Learning for Calibrated Decisions (RLCD), som optimerar för epistemiskt ärliga preferenser eller utdata istället för mänskliga verifierbara sannolikheter.

Anspråken: 100 gånger snabbare, en bråkdel av kostnaden

Siffrorna som TypeSafe publicerar är aggressiva. Företaget säger att Jev levererar intelligens jämförbar med befintliga frontier LLMs på vad de kallar "System One-formade" uppgifter - klassificering, routing, poängsättning, extraktion och förgreningsbeslut - samtidigt som de svarar på 70 till 500 millisekunder, mot end-to-end-svarstider på 3 till 329 sekunder för frontier-modeller. Det fungerar 40x till 200x snabbare, säger företaget.

Prissättningen är likaledes okonventionell: 0,042 USD per miljon inmatade tokens, med output tokens gratis, eftersom utdata beräknas parallellt snarare än genereras token för token. Företaget erkände i sitt inlägg att det ännu inte kan bevisa att prissättningen är hållbar i skala.

"Extraordinära påståenden kräver extraordinära bevis", står det i inlägget, innan det ger vilka bevis det har.

Kvittona — och vad skeptiker säger

TypeSafe publicerade en sida vid sida-demo som jämförde Jev med GPT-5.6 Terra, som den beskriver som den mest jämförbara frontiermodellen vid liknande intelligens, och säger att den enda oenigheten i den inspelade körningen involverade ett genuint tvetydigt bedömningssamtal. Den introducerade också en ny metod för "workflow eval" som mäter modeller mot konsensus från de största externa modellerna - OpenAIs Astra och Anthropic's Fable - i en fast beräkningsgraf, och hävdar att Jev "äger Pareto-gränsen för nästan 2 storleksordningar."

Noterbart publicerade företaget ett medföljande inlägg med titeln "antibenchmaxxing" som förklarar varför det undviker traditionella riktmärken, med argumentet att en modell utformad för strukturerade beslut i mjukvaruarbetsflöden motstår meningsfull global jämförelse.

Reaktionen på Hacker News, där lanseringen drog hundratals poäng inom några timmar, varierade från genuin upphetsning till skarp skepsis. Flera kommentatorer noterade att de offentliga bevisen till stor del består av demovideor – inklusive en som visar modellen som driver en Doom-spelslinga – snarare än reproducerbara utvärderingar från tredje part. Andra hävdade att tillvägagångssättet bäst förstås som en extremt snabb klassificerare av gränskvalitet, användbar för en del arbetsbelastning snarare än en ersättning för LLM.

Även sympatiska iakttagare inramade bevisbördan tydligt. "Ja, de pratar som skeptiker men erbjuder inte massor av bevis, annat än ett par videor med demos", skrev en kommentator. "En livedemo skulle vara mycket mer övertygande."

Varför det kan spela någon roll

Planen landar på en riktig smärtpunkt. En stor del av produktionens LLM-anrop i kommersiell programvara är inte generativa alls – de är binära bedömningar, kategoritilldelningar och routingbeslut insvept i prosa. Om en modell kan ringa dessa samtal med kalibrerat förtroende vid 70 millisekunder och i praktiken noll utkostnad, förändras ekonomin med AI-driven programvara avsevärt: användargränssnitt i realtid blir praktiska och pipelinesteg som var för dyra att automatisera med LLM:er blir billiga nog att köras överallt.

TypSafes föreslagna användningsfall inkluderar klassificering och dirigering av data, verifiering och bevakning av LLM-utgångar, detektering av jailbreaks och kartreducerande analys över stora datamängder – arbetsbelastningar där den omgivande koden kan begränsa modellens frihet och fånga upp fel.

Företaget är uppriktigt om de öppna frågorna: dess publicerade utvärderingar kördes från bärbara datorer på USA:s västkust, och långsiktig prissättningshållbarhet är fortfarande obevisad. Huruvida Jevs intelligenskrav överlever kontakt med oberoende tester kommer att avgöra om "System One Models" blir en kategori eller en kuriosa.

Tidig tillgång är öppen nu via företagets hemsida.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →