Une nouvelle startup d'IA fondée par un ancien chercheur d'OpenAI a lancé ce qu'elle appelle une toute nouvelle classe de modèles – un modèle qui ne peut pas vous écrire un essai, et dit que c'est exactement le but.
TypeSafe AI a annoncé mardi la sortie de son premier « System One Model », nommé Jev, disponible immédiatement en accès anticipé. La société a été fondée par Diogo Almeida, qui affirme que la recherche derrière le suivi des instructions de ChatGPT est née du travail auquel il a contribué chez OpenAI. Après deux années d'activité discrète, il affirme que la fixation de l'industrie sur le chat a occulté les véritables échecs de l'automatisation. Pour plus de contexte sur cette histoire, consultez notre plus d'articles sur l'IA.
"Les modèles sont surhumains dans le chat depuis des années, alors où est toute l'automatisation ?" Almeida a écrit dans le message de lancement. "C'est ma question centrale depuis quatre ans."
Qu'est-ce qu'un modèle « System One » ?
Le nom emprunte à la distinction psychologique entre la pensée rapide et instinctive et le raisonnement lent et délibéré. Là où les grands modèles de langage génèrent du texte jeton par jeton - flexible, général et sujet à des absurdités occasionnelles confiantes - Jev de TypeSafe est conçu pour faire quelque chose de plus restreint : prendre un état non structuré comme entrée et renvoyer des décisions typées et structurées avec des probabilités calibrées attachées.
La société décrit Jev comme « un appel à une fonction de renseignement aux frontières : un état non structuré entré, des décisions probabilistes tapées sorties ». Étant donné que les résultats possibles sont définis à l'avance et que le modèle ne génère jamais de chaînes de forme libre, TypeSafe affirme qu'il ne peut pas produire d'erreurs de type - une propriété qui, selon l'entreprise, est mathématiquement garantie plutôt que statistiquement probable - et ne peut pas halluciner comme le peuvent les modèles générateurs de texte.
L'architecture s'écarte des pratiques traditionnelles de trois manières, selon le message de lancement : une nouvelle architecture de modèle, un échantillonneur parallèle qui produit tous les résultats dans une seule requête plutôt que séquentiellement, et une méthode de formation que l'entreprise appelle l'apprentissage par renforcement pour les décisions calibrées (RLCD), qui optimise les probabilités épistémiquement honnêtes au lieu des préférences humaines ou des résultats vérifiables par programme.
Les réclamations : 100 fois plus rapide, une fraction du coût
Les chiffres publiés par TypeSafe sont agressifs. La société affirme que Jev fournit des renseignements comparables aux LLM frontières existants sur ce qu'elle appelle les tâches « en forme de System One » – décisions de classification, de routage, de notation, d'extraction et de branchement – tout en répondant en 70 à 500 millisecondes, contre des temps de réponse de bout en bout de 3 à 329 secondes pour les modèles frontières. Cela équivaut à 40 à 200 fois plus rapide, affirme la société.
Le prix est également non conventionnel : 0,042 $ par million de jetons d'entrée, avec des jetons de sortie gratuits, puisque les sorties sont calculées en parallèle plutôt que générées jeton par jeton. La société a reconnu dans son message qu'elle ne pouvait pas encore prouver que les prix étaient durables à grande échelle.
"Des affirmations extraordinaires nécessitent des preuves extraordinaires", peut-on lire dans le message, avant de présenter les preuves dont il dispose.
Les reçus – et ce que disent les sceptiques
TypeSafe a publié une démo côte à côte comparant Jev à GPT-5.6 Terra, qu'il décrit comme le modèle frontière le plus comparable avec une intelligence similaire, et affirme que le seul désaccord dans l'exécution enregistrée impliquait un jugement véritablement ambigu. Il a également introduit une nouvelle méthodologie « d'évaluation du flux de travail » qui mesure les modèles par rapport au consensus des plus grands modèles externes – Astra d'OpenAI et Fable d'Anthropic – à l'intérieur d'un graphe de calcul fixe, et affirme que Jev « possède la frontière de Pareto pour près de 2 ordres de grandeur ».
La société a notamment publié un article intitulé « antibenchmaxxing » expliquant pourquoi elle évite les références traditionnelles, affirmant qu'un modèle conçu pour des décisions structurées au sein des flux de travail logiciels résiste à une comparaison mondiale significative.
Les réactions sur Hacker News, où le lancement a suscité des centaines de points en quelques heures, allaient d'un véritable enthousiasme à un scepticisme pointu. Plusieurs commentateurs ont noté que les preuves publiques consistent en grande partie en vidéos de démonstration – dont une montrant le modèle alimentant une boucle de jeu Doom – plutôt qu'en évaluations tierces reproductibles. D'autres ont fait valoir que l'approche est mieux comprise comme un classificateur extrêmement rapide et de qualité frontière, utile pour une tranche de charges de travail plutôt que comme un remplacement pour les LLM.
Même les observateurs sympathiques ont clairement défini la charge de la preuve. "Oui, ils parlent comme des sceptiques mais n'offrent pas beaucoup de preuves, à part quelques vidéos de démos", a écrit un intervenant. "Une démo live serait bien plus convaincante."
Pourquoi cela pourrait être important de toute façon
Le pitch atterrit sur un véritable point sensible. Une grande partie des appels LLM de production dans les logiciels commerciaux ne sont pas du tout génératifs : ce sont des jugements binaires, des attributions de catégories et des décisions de routage enveloppés dans de la prose. Si un modèle peut effectuer ces appels avec une confiance calibrée à 70 millisecondes et un coût de sortie effectivement nul, les aspects économiques des logiciels basés sur l'IA changent considérablement : les interfaces utilisateur en temps réel deviennent pratiques et les étapes de pipeline qui étaient trop coûteuses à automatiser avec des LLM deviennent suffisamment bon marché pour être exécutées partout.
Les cas d'utilisation suggérés par TypeSafe incluent la classification et le routage des données, la vérification et la protection des sorties LLM, la détection des jailbreaks et l'analyse de réduction de carte sur de grands ensembles de données – des charges de travail où le code environnant peut limiter la liberté du modèle et détecter les erreurs.
L'entreprise est franche sur les questions ouvertes : ses évaluations publiées ont été réalisées à partir d'ordinateurs portables sur la côte ouest des États-Unis, et la viabilité des prix à long terme n'a pas encore été prouvée. La question de savoir si les renseignements de Jev survivent au contact avec des tests indépendants déterminera si les « modèles System One » deviennent une catégorie ou une curiosité.
L'accès anticipé est désormais ouvert via le site Web de la société.
---
Restez à la Pointe de l'IALes dernières actualités, analyses et percées en IA — au même endroit.
Lire plus d'actualités IA →