전 OpenAI 연구원이 설립한 새로운 AI 스타트업은 완전히 새로운 클래스의 모델을 출시했습니다. 이 모델은 에세이를 작성할 수 없으며 이것이 바로 핵심이라고 말합니다.

TypeSafe AI는 화요일에 Jev라는 이름의 첫 번째 "System One 모델"을 출시했다고 발표했습니다. 이 모델은 초기 액세스에서 즉시 사용할 수 있습니다. 이 회사는 Diogo Almeida에 의해 설립되었습니다. 그는 ChatGPT의 지시 따르기에 대한 연구가 OpenAI에서 기여한 작업에서 비롯되었다고 말합니다. 2년 동안 비밀리에 지내던 그는 업계가 채팅에 집착하면서 자동화가 실제로 실패하는 부분이 모호해졌다고 주장합니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.

"모델은 수년 동안 채팅에서 초인적인 역할을 해왔는데 자동화는 모두 어디에 있습니까?" Almeida는 출시 게시물에 썼습니다. "그것은 지난 4년 동안 나의 운전 관련 질문이었습니다."

'시스템 원' 모델은 실제로 무엇인가

그 이름은 심리학에서 빠르고 본능적인 사고와 느리고 신중한 추론을 구별하는 데서 유래되었습니다. 대규모 언어 모델이 토큰별로 텍스트 토큰을 생성하는 경우(유연하고 일반적이며 가끔은 말도 안 되는 말도 안되는 경향이 있음) TypeSafe의 Jev는 더 좁은 작업을 수행하도록 설계되었습니다. 즉, 구조화되지 않은 상태를 입력으로 사용하고 보정된 확률이 첨부된 유형화된 구조화된 결정을 반환합니다.

회사는 Jev를 "프론티어 인텔리전스 기능 호출: 구조화되지 않은 상태 입력, 입력된 확률적 결정 출력"이라고 설명합니다. 가능한 출력이 미리 정의되어 있고 모델이 자유 형식 문자열을 생성하지 않기 때문에 TypeSafe는 유형 오류(회사에서 말하는 속성은 통계적으로 가능성이 아니라 수학적으로 보장됨)를 생성할 수 없으며 텍스트 생성 모델이 할 수 있는 방식으로 환각을 일으킬 수 없다고 주장합니다.

출시 게시물에 따르면 이 아키텍처는 세 가지 방식으로 주류 관행에서 출발합니다. 새로운 모델 아키텍처, 순차적이 아닌 단일 쿼리로 모든 출력을 생성하는 병렬 샘플러, 회사에서 RLCD(Reinforcement Learning for Calibrated Decisions)라고 부르는 훈련 방법은 인간 선호도나 프로그래밍 방식으로 검증 가능한 출력 대신 인식적으로 정직한 확률을 최적화합니다.

주장: 100배 더 빠르며 비용은 일부만

TypeSafe가 게시하는 숫자는 공격적입니다. 이 회사는 Jev가 분류, 라우팅, 채점, 추출 및 분기 결정과 같은 "System One 기반" 작업에 대해 기존 프론티어 LLM에 필적하는 인텔리전스를 제공하는 동시에 프론티어 모델의 경우 3~329초의 엔드투엔드 응답 시간에 비해 70~500밀리초 내에 응답한다고 밝혔습니다. 이는 40배에서 200배 더 빠르게 작동한다고 회사는 말합니다.

가격도 비슷하게 파격적입니다. 입력 토큰 백만 개당 0.042달러이며, 출력 토큰은 무료입니다. 출력은 토큰별로 생성되는 것이 아니라 병렬로 계산되기 때문입니다. 회사는 게시물에서 가격이 규모에 따라 지속 가능하다는 것을 아직 증명할 수 없다는 점을 인정했습니다.

게시물에는 어떤 증거가 있는지 제시하기 전에 "특별한 주장에는 특별한 증거가 필요합니다"라고 적혀 있습니다.

영수증 — 그리고 회의론자들의 말

TypeSafe는 Jev를 GPT-5.6 Terra와 비교한 병렬 데모를 발표했습니다. GPT-5.6 Terra는 유사한 지능에서 가장 유사한 프론티어 모델로 설명되며 기록된 실행에서 유일한 불일치는 실제로 모호한 판단 요구와 관련이 있다고 말합니다. 또한 고정 컴퓨팅 그래프 내에서 가장 큰 외부 모델인 OpenAI의 Astra 및 Anthropic's Fable의 합의에 대해 모델을 측정하는 새로운 "워크플로 평가" 방법론을 도입했으며 Jev가 "거의 2000배 규모의 파레토 프론티어를 소유하고 있다"고 주장합니다.

특히 이 회사는 "antibenchmaxxing"이라는 제목의 첨부 게시물을 게시하여 기존 벤치마크를 피하는 이유를 설명하고 소프트웨어 워크플로 내부의 구조화된 결정을 위해 설계된 모델은 의미 있는 글로벌 비교에 저항한다고 주장했습니다.

출시가 몇 시간 만에 수백 포인트를 기록한 Hacker News에 대한 반응은 진정한 흥분부터 날카로운 회의론까지 다양했습니다. 몇몇 논평자들은 공개 증거가 재현 가능한 제3자 평가보다는 주로 Doom 게임플레이 루프를 구동하는 모델을 보여주는 데모 비디오로 구성되어 있다고 지적했습니다. 다른 사람들은 이 접근 방식이 LLM을 대체하기보다는 일부 작업 부하에 유용한 매우 빠르고 뛰어난 품질의 분류자로 가장 잘 이해된다고 주장했습니다.

동정적인 관찰자조차도 입증 책임을 명확하게 규정했습니다. 한 댓글 작성자는 "그렇습니다. 그들은 회의론자처럼 말하지만 몇 개의 데모 동영상 외에는 많은 증거를 제공하지 않습니다"라고 썼습니다. "라이브 데모가 훨씬 더 설득력이 있을 것입니다."

어쨌든 중요한 이유

피치는 실제 문제점에 도달합니다. 상용 소프트웨어에서 프로덕션 LLM 호출의 상당 부분은 전혀 생성적이지 않습니다. 이는 이분법적 판단, 범주 할당 및 산문으로 둘러싸인 라우팅 결정입니다. 모델이 70밀리초에 보정된 신뢰도를 갖고 출력 비용을 사실상 0으로 호출할 수 있다면 AI 기반 소프트웨어의 경제성은 크게 변합니다. 즉, 실시간 사용자 인터페이스가 실용화되고 LLM으로 자동화하기에는 비용이 너무 많이 들었던 파이프라인 단계가 어디서나 실행될 수 있을 만큼 저렴해집니다.

TypeSafe가 제안하는 사용 사례에는 데이터 분류 및 라우팅, LLM 출력 확인 및 보호, 탈옥 감지, 대규모 데이터 세트에 대한 맵 축소 분석(주변 코드가 모델의 자유를 제한하고 오류를 포착할 수 있는 워크로드)이 포함됩니다.

회사는 공개 질문에 대해 솔직하게 밝혔습니다. 게시된 평가는 미국 서부 해안의 노트북에서 실행되었으며 장기적인 가격 지속 가능성은 아직 입증되지 않았습니다. Jev의 지능 주장이 독립적인 테스트를 통해 살아남는지 여부에 따라 "System One 모델"이 카테고리가 될지 호기심이 될지 여부가 결정됩니다.

현재 회사 웹사이트를 통해 얼리 액세스가 열려 있습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →