Un diseño de mezcla de expertos
Según TestingCatalog AI News, Inkling-Small es un transformador de mezcla de expertos (MoE) que contiene 276 mil millones de parámetros totales, con 12 mil millones activos durante cualquier inferencia determinada. Esa arquitectura, donde sólo una pequeña porción del modelo "se despierta" para cada token, es el mismo truco de eficiencia que ha hecho que los modelos chinos de peso abierto como DeepSeek sean tan baratos de ejecutar. Thinking Machines confirmó que se publicarán todos los pesos en Hugging Face.
El modelo también viene con una ventana de contexto de hasta un millón de tokens y lo que el laboratorio llama "esfuerzo de pensamiento variable", que va desde mínimo hasta "xalto", lo que permite a los desarrolladores intercambiar computación por rendimiento dependiendo de la tarea. El ajuste está disponible a través de la plataforma Tinker de la compañía, y se puede acceder al chat de texto, imágenes y audio en Tinker Playground.
Capacitado en sistemas NVIDIA GB300
Thinking Machines dijo que Inkling-Small fue entrenado en sistemas NVIDIA GB300 NVL72 y utiliza "sustancialmente menos computación" que el modelo Inkling original, que se lanzó el 15 de julio de 2026. Ese primer modelo, cubierto por WIRED y TechCrunch como el lanzamiento debut de Thinking Machines, estableció al laboratorio como un competidor serio casi de la noche a la mañana.
El camino hacia Inkling-Small revela una estrategia de eficiencia deliberada. El laboratorio comenzó a trabajar en el modelo más pequeño solo después de entrenar a Inkling, utilizando el respiro para revisar su combinación de datos previa al entrenamiento y su receta de aprendizaje automático. Un punto de control de vista previa anterior se capacitó posteriormente en parte mediante destilación de políticas, con Inkling como maestro, seguido de aproximadamente dos semanas de aprendizaje reforzado con codificación agente a escala.
Dónde gana y dónde no
Los resultados de esa receta son notables. Thinking Machines afirma que Inkling-Small supera al Inkling original en puntos de referencia de razonamiento y codificación agente, mientras que Inkling sigue siendo más fuerte en cobertura de conocimiento y factualidad. En el Último examen de la humanidad de solo texto, una evaluación notoriamente difícil, el modelo más pequeño obtuvo un 31,6%, en comparación con el 29,7% de Inkling: una mejora real a pesar de la dramática reducción de los parámetros activos.
La compensación es clara: Inkling-Small es el codificador y razonador más inteligente, mientras que su hermano mayor conserva la base de conocimientos más amplia. Para los desarrolladores, esto es una característica, no un error: significa elegir la herramienta adecuada para el trabajo en lugar de pagar por un único modelo gigante en cada tarea.
Un jugador estadounidense en un campo de peso abierto liderado por China
Quizás la mayor implicación sea geopolítica. Como han señalado CNBC y otros, los modelos de frontera de peso abierto se han convertido en un punto de tensión entre Estados Unidos y China, con laboratorios chinos como DeepSeek y Qwen de Alibaba regalando modelos potentes y subcotizando los precios occidentales. Forkast formuló el comunicado de Inkling-Small sin rodeos: "La competencia de pesos abiertos ahora tiene un participante estadounidense".
Hasta ahora, los principales modelos de peso abierto provienen casi exclusivamente de China, lo que genera preocupaciones en Washington de que los laboratorios estadounidenses estén cediendo una categoría completa del mercado. Thinking Machines, una startup estadounidense bien financiada y dirigida por una de las figuras más destacadas de la IA, cambia ese cálculo. Al lanzar pesos completos en Hugging Face y admitir ajustes abiertos, el laboratorio está haciendo un juego directo para la comunidad de desarrolladores que los modelos chinos de peso abierto han cultivado.
Creado para desarrolladores, no solo para puntos de referencia
Thinking Machines ha combinado el lanzamiento con herramientas dirigidas directamente a los desarrolladores. Más allá de los pesos abiertos de Hugging Face, Databricks confirmó que la familia Inkling está disponible en su plataforma y que Tinker Playground admite texto multimodal, imágenes y chat de audio listo para usar. La configuración variable de "esfuerzo de pensamiento", desde mínimo hasta "xalto", está diseñada para compensaciones reales de ingeniería: ejecutar barato cuando una tarea es simple, gastar más computación cuando un problema exige un razonamiento más profundo. Esa flexibilidad es importante para las nuevas empresas que vigilan sus facturas de inferencia, muchas de las cuales ya han migrado a alternativas abiertas más baratas en lugar de pagar tarifas API superiores.
La tendencia de eficiencia en toda la industria
Inkling-Small también se ajusta a un patrón más amplio. En toda la industria, la vanguardia está pasando de modelos monolíticos cada vez más grandes a sistemas más pequeños e inteligentes que superan su peso. Desde los modelos de guerra de precios de DeepSeek hasta las arquitecturas comprimidas, el mensaje es consistente: el recuento de parámetros sin procesar importa menos que la eficiencia con la que un modelo utiliza su capacidad.
Para Thinking Machines, la apuesta por la eficiencia sobre el tamaño abarca ahora dos modelos, y los primeros puntos de referencia sugieren que la estrategia está funcionando. Con Inkling-Small disponible para descargar y ajustar hoy, los desarrolladores pueden probar esa afirmación por sí mismos.
Manténgase por delante de la IA
Cada semana llegan nuevos modelos de peso abierto y la competencia no hace más que intensificarse. Manténgase al día con cada lanzamiento a través de nuestra [cobertura de la industria de la IA] (https://aibuzzwire.news).
Leer más noticias sobre IA →