Um design de mistura de especialistas
De acordo com TestingCatalog AI News, Inkling-Small é um transformador de mistura de especialistas (MoE) contendo 276 bilhões de parâmetros totais, com 12 bilhões ativos durante qualquer inferência. Essa arquitetura – onde apenas uma pequena fatia do modelo “acorda” para cada token – é o mesmo truque de eficiência que tornou os modelos chineses abertos como o DeepSeek tão baratos de operar. Thinking Machines confirmou que os pesos completos serão lançados em Hugging Face.
O modelo também vem com uma janela de contexto de até um milhão de tokens e o que o laboratório chama de “esforço de pensamento variável”, variando de mínimo a “xalto”, permitindo que os desenvolvedores troquem computação por desempenho dependendo da tarefa. O ajuste fino está disponível por meio da plataforma Tinker da empresa, e bate-papo de texto, imagem e áudio estão acessíveis no Tinker Playground.
Treinado em sistemas NVIDIA GB300
A Thinking Machines disse que o Inkling-Small foi treinado em sistemas NVIDIA GB300 NVL72 e usa "substancialmente menos computação" do que o modelo Inkling original, lançado em 15 de julho de 2026. Esse primeiro modelo - coberto por WIRED e TechCrunch como lançamento de estreia da Thinking Machines - estabeleceu o laboratório como um concorrente sério quase da noite para o dia.
O caminho para o Inkling-Small revela uma estratégia de eficiência deliberada. O laboratório começou a trabalhar no modelo menor somente após treinar o Inkling, usando o espaço de respiração para revisar seu mix de dados pré-treinamento e receita de aprendizado de máquina. Um ponto de verificação de visualização anterior foi pós-treinado, em parte, por meio de destilação de acordo com a política, com Inkling atuando como professor, seguido por cerca de duas semanas de aprendizado de reforço de codificação de agentes em escala.
Onde ganha — e onde não ganha
Os resultados dessa receita são notáveis. A Thinking Machines afirma que o Inkling-Small ultrapassa o Inkling original em benchmarks de raciocínio e codificação de agente, enquanto o Inkling permanece mais forte em cobertura de conhecimento e factualidade. No Último Exame da Humanidade apenas em texto, uma avaliação notoriamente difícil, o modelo menor obteve pontuação de 31,6%, em comparação com 29,7% do Inkling — uma melhoria real apesar da redução dramática nos parâmetros ativos.
A compensação é clara: Inkling-Small é o codificador e raciocinador mais perspicaz, enquanto seu irmão maior mantém uma base de conhecimento mais ampla. Para os desenvolvedores, isso é um recurso, não um bug – significa escolher a ferramenta certa para o trabalho, em vez de pagar por um único modelo gigante para cada tarefa.
Um jogador dos EUA em um campo de peso aberto liderado pela China
Talvez a maior implicação seja geopolítica. Como a CNBC e outros observaram, os modelos de fronteira de peso aberto tornaram-se um ponto crítico entre os EUA e a China, com laboratórios chineses como o DeepSeek e o Qwen da Alibaba a oferecer modelos poderosos e a reduzir os preços ocidentais. Forkast enquadrou o lançamento do Inkling-Small sem rodeios: "A competição Open-Weights agora tem um participante nos EUA."
Até agora, os principais modelos de peso aberto vieram quase exclusivamente da China, levantando preocupações em Washington de que os laboratórios americanos estivessem cedendo uma categoria inteira do mercado. A Thinking Machines – uma startup norte-americana bem financiada, liderada por uma das figuras mais proeminentes da IA – muda esse cálculo. Ao liberar pesos completos no Hugging Face e apoiar o ajuste fino aberto, o laboratório está fazendo um jogo direto para a comunidade de desenvolvedores que os modelos chineses de peso aberto cultivaram.
Criado para desenvolvedores, não apenas para benchmarks
A Thinking Machines combinou o lançamento com ferramentas voltadas diretamente para desenvolvedores. Além dos pesos abertos do Hugging Face, Databricks confirmou que a família Inkling está disponível em sua plataforma, e o Tinker Playground oferece suporte para bate-papo multimodal de texto, imagem e áudio pronto para uso. A configuração variável de "esforço de raciocínio" - de mínimo a "xalto" - foi projetada para compensações reais de engenharia: executar barato quando uma tarefa é simples, gastar mais computação quando um problema exigir um raciocínio mais profundo. Essa flexibilidade é importante para as startups que acompanham suas contas de inferência, muitas das quais já migraram para alternativas mais baratas e abertas, em vez de pagar taxas API premium.
A tendência de eficiência em toda a indústria
Inkling-Small também se enquadra em um padrão mais amplo. Em toda a indústria, a vanguarda está mudando de modelos monolíticos cada vez maiores para sistemas menores e mais inteligentes que superam seu peso. Dos modelos de guerra de preços do DeepSeek às arquiteturas compactadas, a mensagem é consistente: a contagem bruta de parâmetros importa menos do que a eficiência com que um modelo usa sua capacidade.
Para as Thinking Machines, a aposta na eficiência em detrimento do tamanho abrange agora dois modelos – e os primeiros benchmarks sugerem que a estratégia está a funcionar. Com o Inkling-Small disponível para download e ajuste hoje, os desenvolvedores podem testar essa afirmação por si próprios.
Fique à frente da IA
Novos modelos de peso aberto chegam a cada semana e a competição só está se intensificando. Acompanhe cada lançamento através da nossa cobertura da indústria de IA.
Leia mais notícias sobre IA →