Uma nova startup de IA fundada por um ex-pesquisador da OpenAI lançou o que chama de uma classe de modelo inteiramente nova – uma que não pode escrever um ensaio e diz que esse é exatamente o ponto.
TypeSafe AI anunciou na terça-feira o lançamento de seu primeiro “Modelo System One”, chamado Jev, disponível imediatamente em acesso antecipado. A empresa foi fundada por Diogo Almeida, que afirma que a investigação por detrás do seguimento de instruções do ChatGPT surgiu do trabalho para o qual contribuiu na OpenAI. Depois de dois anos na clandestinidade, ele argumenta que a fixação da indústria no chat obscureceu onde a automação realmente falha. Para mais contexto sobre esta história, confira nossa últimos desenvolvimentos em IA.
“Os modelos têm sido sobre-humanos no chat há anos, então onde está toda a automação?” Almeida escreveu no post de lançamento. "Essa tem sido minha questão norteadora nos últimos quatro anos."
O que realmente é um modelo 'System One'
O nome vem da distinção da psicologia entre pensamento rápido e instintivo e raciocínio lento e deliberado. Onde grandes modelos de linguagem geram token de texto por token - flexível, geral e propenso a absurdos confiantes ocasionais - o Jev do TypeSafe é construído para fazer algo mais restrito: tomar o estado não estruturado como entrada e retornar decisões estruturadas digitadas com probabilidades calibradas anexadas.
A empresa descreve Jev como “uma chamada de função de inteligência de fronteira: entrada de estado não estruturado, saída de decisões probabilísticas digitadas”. Como os resultados possíveis são definidos antecipadamente e o modelo nunca gera strings de formato livre, o TypeSafe afirma que não pode produzir erros de tipo – uma propriedade que a empresa diz ser matematicamente garantida em vez de estatisticamente provável – e não pode ter alucinações da mesma forma que os modelos de geração de texto podem.
A arquitetura se afasta da prática convencional de três maneiras, de acordo com o post de lançamento: uma nova arquitetura de modelo, um amostrador paralelo que produz todos os resultados em uma única consulta, em vez de sequencialmente, e um método de treinamento que a empresa chama de Aprendizado por Reforço para Decisões Calibradas (RLCD), que otimiza para probabilidades epistemicamente honestas em vez de preferência humana ou resultados verificáveis programaticamente.
As reivindicações: 100x mais rápido, uma fração do custo
Os números que TypeSafe publica são agressivos. A empresa diz que Jev oferece inteligência comparável aos LLMs de fronteira existentes no que chama de tarefas "formatadas pelo System One" - classificação, roteamento, pontuação, extração e decisões de ramificação - enquanto responde em 70 a 500 milissegundos, contra tempos de resposta ponta a ponta de 3 a 329 segundos para modelos de fronteira. Isso funciona de 40 a 200 vezes mais rápido, diz a empresa.
O preço também não é convencional: US$ 0,042 por milhão de tokens de entrada, com tokens de saída gratuitos, uma vez que os resultados são calculados em paralelo, em vez de gerados token por token. A empresa reconheceu no seu post que ainda não pode provar que o preço é sustentável em escala.
“Alegações extraordinárias exigem evidências extraordinárias”, diz o post, antes de oferecer as evidências que possui.
As receitas – e o que dizem os céticos
TypeSafe publicou uma demonstração lado a lado comparando Jev com GPT-5.6 Terra, que descreve como o modelo de fronteira mais comparável com inteligência semelhante, e diz que a única discordância na execução registrada envolveu um julgamento genuinamente ambíguo. Ele também introduziu uma nova metodologia de "avaliação de fluxo de trabalho" que mede modelos em relação ao consenso dos maiores modelos externos - Astra da OpenAI e Fábula da Anthropic - dentro de um gráfico de computação fixo e afirma que Jev "é dono da fronteira de Pareto por quase 2 ordens de magnitude".
Notavelmente, a empresa publicou um post intitulado “antibenchmaxxing” explicando por que evita benchmarks tradicionais, argumentando que um modelo projetado para decisões estruturadas dentro de fluxos de trabalho de software resiste a comparações globais significativas.
A reação no Hacker News, onde o lançamento atraiu centenas de pontos em poucas horas, variou de entusiasmo genuíno a ceticismo acentuado. Vários comentaristas observaram que as evidências públicas consistem principalmente em vídeos de demonstração – incluindo um que mostra o modelo alimentando um ciclo de jogo Doom – em vez de avaliações reproduzíveis de terceiros. Outros argumentaram que a abordagem é melhor compreendida como um classificador extremamente rápido e de qualidade de fronteira, útil para uma fatia de cargas de trabalho, em vez de um substituto para LLMs.
Mesmo observadores solidários definiram claramente o ónus da prova. “Sim, eles falam como céticos, mas não oferecem muitas evidências, além de alguns vídeos de demonstrações”, escreveu um comentarista. "Uma demonstração ao vivo seria muito mais convincente."
Por que isso pode ser importante de qualquer maneira
O campo chega a um verdadeiro ponto problemático. Uma grande parte das chamadas de produção LLM em software comercial não são de forma alguma generativas – são julgamentos binários, atribuições de categorias e decisões de roteamento embrulhadas em prosa. Se um modelo puder fazer essas chamadas com confiança calibrada em 70 milissegundos e efetivamente zero custo de produção, a economia do software alimentado por IA mudará consideravelmente: as interfaces de usuário em tempo real tornar-se-ão práticas e as etapas do pipeline que eram muito caras para serem automatizadas com LLMs tornar-se-ão baratas o suficiente para serem executadas em qualquer lugar.
Os casos de uso sugeridos pelo TypeSafe incluem classificação e roteamento de dados, verificação e proteção de saídas LLM, detecção de jailbreaks e análise de redução de mapas em grandes conjuntos de dados – cargas de trabalho onde o código circundante pode restringir a liberdade do modelo e detectar erros.
A empresa é sincera sobre as questões em aberto: as suas avaliações publicadas foram executadas a partir de computadores portáteis na Costa Oeste dos EUA e a sustentabilidade dos preços a longo prazo continua por provar. Se as afirmações de inteligência de Jev sobreviverão ao contato com testes independentes determinará se os “Modelos do Sistema Um” se tornarão uma categoria ou uma curiosidade.
O acesso antecipado já está aberto no site da empresa.
---
Fique à Frente da IAAs últimas notícias, análises e avanços em inteligência artificial — tudo em um só lugar.
Ler mais notícias de IA →