Microsoft lanzó el viernes Microsoft-Decision-1, un modelo especializado para la toma de decisiones rápida y estructurada, en su plataforma Foundry, y lo construyó sobre el Qwen3.5-9B de peso abierto de Alibaba en lugar de cualquier modelo de su socio cercano OpenAI, informó The New Stack.
El lanzamiento se produce tres días después de que OpenAI abriera su API Decisions a todos los desarrolladores en versión beta pública, y el mismo día TypeSafe, la startup que encendió la categoría de modelo de decisión con Jev hace aproximadamente tres semanas y media, anunció una Serie A de 870 millones de dólares con una valoración de 7.500 millones de dólares liderada por a16z. Microsoft fijó el precio de Decision-1 exactamente al tipo de Jev: 0,042 dólares por millón de tokens de entrada con salida gratuita. Para obtener más información sobre la carrera acelerada para hacer que la IA sea más barata y rápida, consulte nuestra [cobertura de la industria de la IA] en curso (https://aibuzzwire.news).
Con un precio que iguala a Jev, construido sobre los pesos abiertos de un rival
Decision-1 es un modelo post-entrenado: Microsoft partió del Qwen3.5-9B de Alibaba y lo ajustó para tareas de decisión estructuradas en lugar de generación abierta. La compañía dice que planea rebasar el modelo en sus propios modelos MAI, así como en los de OpenAI, pero la elección inicial de una base china de peso abierto es notable para una compañía que invierte miles de millones en OpenAI.
Microsoft también está lejos de ser el primero en actuar. En las tres semanas y media desde el lanzamiento de Jev, OpenAI, Upstage, Perplexity, Cloudflare y AWS han enviado sus propios modelos de decisión, según The New Stack. La base Qwen3.5 que eligió Microsoft se ha convertido en una especie de estándar de la industria: el vicepresidente de ingeniería de Cognition, Jared Palmer, gastó alrededor de $95 en computación Modal H100 para trasladar sus modelos Kev de código abierto a Qwen3.5, y Cloudflare construyó su modelo Clef-flash en la misma base Qwen3.5-9B.
El precio también está convergiendo. Palmer cotiza Kev-4B en OpenRouter a 0,042 dólares por millón de tokens de entrada, Perplexity cobra 0,02 dólares y OpenAI cobra más del doble de la tarifa de Jev. A esos precios, los ingresos por llamadas de decisión individuales son mínimos, lo que sugiere que la mayor oportunidad de Microsoft es mantener el tráfico de agentes, incluidas las llamadas generativas en torno a cada decisión, a través de Foundry.
Microsoft es su primer cliente
El presidente y director ejecutivo de Microsoft, Satya Nadella, anunció el modelo en X el viernes y escribió que Decision-1 "ofrece un rendimiento superior en tareas de decisión estructuradas, superando tanto a los LLM como a otros modelos de decisión en latencia y calidad", y agregó: "Ya lo estamos probando en todo Microsoft".
Cuatro equipos internos respaldaron esto, según The New Stack. Xbox Research utilizó Decisión-1 para clasificar más de 10.000 comentarios de los jugadores. El equipo de Copilot calificó el chat y las respuestas de los agentes con él. Los ingenieros de guardia lo usaron para obtener contexto durante incidentes en vivo, y Microsoft Discovery lo usó para calificar experimentos antes de que un agente vuelva a planificar.
Los números internos de Microsoft, como se informó, afirman que el modelo es más de 14 veces más rápido que GPT-6 Sol a una fracción del costo para la carga de trabajo de Xbox, y 46 veces más consistente en Discovery. Achint Srivastava, vicepresidente de ingeniería de software en la Oficina del CTO de Microsoft, presentó Decision-1 como una forma de agregar la toma de decisiones a las aplicaciones, agentes y flujos de trabajo existentes "en un entorno seguro y confiable".
Lo que la Decisión 1 no puede hacer
El lanzamiento también muestra dónde Microsoft está detrás de sus rivales. La lista de Foundry de Decision-1 dice que acepta hasta 32,768 tokens de texto y devuelve JSON, pero no admite imágenes, a diferencia de Decisions API de OpenAI y Clef de Cloudflare, que utiliza un codificador de visión. Y aunque Cloudflare lanzó Clef bajo la permisiva licencia Apache 2.0, Microsoft no ha anunciado pesos abiertos para Decision-1.
También hay una cuestión de compatibilidad. AWS, Upstage y Ollama han adoptado la API System One de TypeSafe, ahora una interfaz común en toda la categoría, pero Microsoft no ha dicho si Decision-1 es totalmente compatible, aunque su código de muestra Foundry llama a un punto final /systemone.
Las afirmaciones sobre la calibración también merecen un escrutinio. Microsoft dice que las probabilidades de Decision-1 están calibradas, lo que significa que una predicción del 90% debería ser correcta aproximadamente nueve de cada diez veces en casos representativos, y la propia documentación de la compañía aconseja a los clientes validar la calibración de sus datos. Esa precaución se hace eco de la preimpresión de JevOut, en la que el investigador de ciencias informáticas de la USC Zixiang Xu y sus coautores encontraron que adiciones breves y que suenan naturales al contexto cambiaron 312 de las 508 decisiones inicialmente correctas de Jev, y en 229 casos Jev asignó al menos un 70% de probabilidad a la respuesta incorrecta. Otros tres sistemas de puntuación mostraron tasas de cambio entre 64,9% y 73,2% bajo el mismo enfoque de prueba. Microsoft dice que probó la Decisión-1 con ocho tipos de perturbaciones, incluidas opciones reordenadas y descripciones parafraseadas.
Decisiones de enrutamiento entre Copilot, GitHub y Xbox
El modelo puede tener un trabajo mayor por delante. El miércoles, Microsoft dijo que GitHub Copilot pronto decidirá cuándo ejecutar una tarea en el dispositivo y cuándo enviarla a modelos a escala de nube, aunque no ha revelado qué envía Copilot a la nube. El enrutamiento de modelos se encuentra entre los casos de uso que Microsoft enumera para la Decisión-1, pero la compañía no ha confirmado que el modelo realizará esas llamadas. Al tomar decisiones de enrutamiento en Copilot, GitHub y Xbox, Microsoft tiene un incentivo para manejarlas internamente.
Lo que está en juego en la competencia es visible en la tracción de TypeSafe. El CEO de TypeSafe, Diogo Almeida, publicó en X que "el 29,4% de Fortune 500 apareció" en las tres semanas desde el lanzamiento de Jev, que el modelo "accidentalmente sirvió billones de tokens por día" y, con un ojo puesto en la carga de trabajo de su equipo, que "han pasado 3 semanas y ahora nos gustaría dormir". Esas son las mismas empresas a las que Microsoft vende Azure, lo que hace que la llegada de Decision-1 sea menos una apuesta a un nuevo mercado que una defensa de uno existente.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →

