Una nueva startup de IA fundada por un ex investigador de OpenAI ha lanzado lo que llama una clase de modelo completamente nueva, una que no puede escribir un ensayo y dice que ese es exactamente el punto.
TypeSafe AI anunció el martes el lanzamiento de su primer "System One Model", llamado Jev, disponible inmediatamente en acceso anticipado. La empresa fue fundada por Diogo Almeida, quien dice que la investigación detrás del seguimiento de instrucciones de ChatGPT surgió del trabajo en el que contribuyó en OpenAI. Después de dos años de sigilo, sostiene que la fijación de la industria por el chat ha oscurecido dónde falla realmente la automatización. Para más contexto sobre esta historia, consulta nuestra actualidad de inteligencia artificial.
"Las modelos han sido sobrehumanas en el chat durante años, entonces, ¿dónde está toda la automatización?" Almeida escribió en la publicación de lanzamiento. "Ésa ha sido mi pregunta principal durante los últimos cuatro años".
Qué es realmente un modelo 'System One'
El nombre proviene de la distinción que hace la psicología entre pensamiento rápido e instintivo y razonamiento lento y deliberado. Donde los grandes modelos de lenguaje generan texto token por token (flexible, general y propenso a tonterías ocasionales y seguras), Jev de TypeSafe está diseñado para hacer algo más limitado: tomar el estado no estructurado como entrada y devolver decisiones estructuradas escritas con probabilidades calibradas adjuntas.
La compañía describe a Jev como "una función de inteligencia de frontera: entrada de estado no estructurado, salida de decisiones probabilísticas escritas". Debido a que las posibles salidas se definen de antemano y el modelo nunca genera cadenas de forma libre, TypeSafe afirma que no puede producir errores de tipo (una propiedad que, según la compañía, está matemáticamente garantizada en lugar de estadísticamente probable) y no puede alucinar en la forma en que lo hacen los modelos que generan texto.
La arquitectura se aparta de la práctica convencional de tres maneras, según la publicación de lanzamiento: una nueva arquitectura de modelo, un muestreador paralelo que produce todos los resultados en una sola consulta en lugar de secuencialmente, y un método de capacitación que la compañía llama Aprendizaje por refuerzo para decisiones calibradas (RLCD), que optimiza probabilidades epistémicamente honestas en lugar de preferencias humanas o resultados programáticamente verificables.
Los reclamos: 100 veces más rápido, una fracción del costo
Las cifras que publica TypeSafe son agresivas. La compañía dice que Jev ofrece inteligencia comparable a los LLM de frontera existentes en lo que llama tareas "en forma de System One" (clasificación, enrutamiento, puntuación, extracción y decisiones de ramificación) mientras responde en 70 a 500 milisegundos, frente a tiempos de respuesta de extremo a extremo de 3 a 329 segundos para los modelos de frontera. Esto equivale a entre 40 y 200 veces más rápido, afirma la compañía.
El precio es igualmente poco convencional: 0,042 dólares por millón de tokens de entrada, con tokens de salida gratuitos, ya que las salidas se calculan en paralelo en lugar de generarse token por token. La compañía reconoció en su publicación que aún no puede demostrar que los precios sean sostenibles a escala.
"Las afirmaciones extraordinarias requieren pruebas extraordinarias", se lee en la publicación, antes de ofrecer las pruebas que tiene.
Los recibos y lo que dicen los escépticos
TypeSafe publicó una demostración comparativa de Jev con GPT-5.6 Terra, que describe como el modelo de frontera más comparable con inteligencia similar, y dice que el único desacuerdo en la ejecución grabada involucró una decisión de juicio genuinamente ambigua. También introdujo una nueva metodología de "evaluación del flujo de trabajo" que mide los modelos frente al consenso de los modelos externos más grandes (Astra de OpenAI y Fable de Anthropic) dentro de un gráfico de cálculo fijo, y afirma que Jev "posee la frontera de Pareto en casi 2 órdenes de magnitud".
En particular, la compañía publicó una publicación adjunta titulada "antibenchmaxxing" que explica por qué evita los puntos de referencia tradicionales, argumentando que un modelo diseñado para decisiones estructuradas dentro de los flujos de trabajo de software se resiste a una comparación global significativa.
La reacción en Hacker News, donde el lanzamiento obtuvo cientos de puntos en cuestión de horas, varió desde el entusiasmo genuino hasta el escepticismo declarado. Varios comentaristas señalaron que la evidencia pública consiste en gran medida en videos de demostración, incluido uno que muestra el modelo que impulsa un bucle de juego de Doom, en lugar de evaluaciones reproducibles de terceros. Otros argumentaron que el enfoque se entiende mejor como un clasificador extremadamente rápido y de calidad de frontera, útil para una porción de cargas de trabajo en lugar de un reemplazo para los LLM.
Incluso los observadores comprensivos formularon claramente la carga de la prueba. "Sí, hablan como escépticos pero no ofrecen mucha evidencia, aparte de un par de videos de demostraciones", escribió un comentarista. "Una demostración en vivo sería mucho más convincente."
Why It Might Matter Anyway
The pitch lands on a real pain point. A large share of production LLM calls in commercial software are not generative at all — they are binary judgments, category assignments, and routing decisions wrapped in prose. If a model can make those calls with calibrated confidence at 70 milliseconds and effectively zero output cost, the economics of AI-powered software change considerably: real-time user interfaces become practical, and pipeline steps that were too expensive to automate with LLMs become cheap enough to run everywhere.
TypeSafe's suggested use cases include classifying and routing data, verifying and guarding LLM outputs, detecting jailbreaks, and map-reducing analysis over large datasets — workloads where the surrounding code can constrain the model's freedom and catch errors.
The company is candid about the open questions: its published evals were run from laptops on the US West Coast, and long-term pricing sustainability remains unproven. Whether Jev's intelligence claims survive contact with independent testing will determine whether "System One Models" becomes a category or a curiosity.
Early access is open now through the company's website.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →