Un design misto di esperti
Secondo TestingCatalog AI News, Inkling-Small è un trasformatore di miscela di esperti (MoE) contenente 276 miliardi di parametri totali, di cui 12 miliardi attivi durante una determinata inferenza. Quell’architettura – in cui solo una piccola parte del modello “si risveglia” per ciascun token – è lo stesso trucco di efficienza che ha reso i modelli cinesi a peso aperto come DeepSeek così economici da gestire. Thinking Machines ha confermato che tutti i pesi saranno rilasciati su Hugging Face.
Il modello viene inoltre fornito con una finestra di contesto fino a un milione di token e quello che il laboratorio chiama "sforzo di pensiero variabile", che va da minimo a "xhigh", consentendo agli sviluppatori di scambiare elaborazione con prestazioni a seconda dell'attività. La messa a punto è disponibile tramite la piattaforma Tinker dell'azienda e la chat di testo, immagini e audio è accessibile nel Tinker Playground.
Formazione sui sistemi NVIDIA GB300
Thinking Machines ha affermato che Inkling-Small è stato addestrato sui sistemi NVIDIA GB300 NVL72 e utilizza "sostanzialmente meno risorse di elaborazione" rispetto al modello Inkling originale, lanciato il 15 luglio 2026. Quel primo modello, coperto da WIRED e TechCrunch come versione di debutto di Thinking Machines, ha reso il laboratorio un serio concorrente quasi da un giorno all'altro.
Il percorso verso Inkling-Small rivela una deliberata strategia di efficienza. Il laboratorio ha iniziato a lavorare sul modello più piccolo solo dopo aver addestrato Inkling, utilizzando la stanza di respirazione per rivedere il mix di dati pre-addestramento e la ricetta di apprendimento automatico. Un precedente punto di controllo di anteprima è stato post-addestrato in parte attraverso una distillazione in linea con le policy, con Inkling in qualità di insegnante, seguito da circa due settimane di apprendimento di rinforzo su scala scalare della codifica degli agenti.
Dove vince e dove no
I risultati di quella ricetta sono notevoli. Thinking Machines afferma che Inkling-Small supera l'originale Inkling in termini di ragionamento e benchmark di codifica degli agenti, mentre Inkling rimane più forte in termini di copertura della conoscenza e fattualità. Nel test di solo testo L'ultimo esame dell'umanità, una valutazione notoriamente difficile, il modello più piccolo ha ottenuto un punteggio del 31,6%, rispetto al 29,7% di Inkling: un miglioramento reale nonostante la drastica riduzione dei parametri attivi.
Il compromesso è chiaro: Inkling-Small è il programmatore e il ragionatore più acuto, mentre il fratello maggiore conserva una base di conoscenza più ampia. Per gli sviluppatori, questa è una caratteristica, non un bug: significa scegliere lo strumento giusto per il lavoro piuttosto che pagare per un unico modello gigante per ogni attività.
Un giocatore statunitense in un campo a peso aperto guidato dalla Cina
Forse la più grande implicazione è geopolitica. Come hanno notato CNBC e altri, i modelli di frontiera a peso aperto sono diventati un punto critico tra Stati Uniti e Cina, con laboratori cinesi come DeepSeek e Qwen di Alibaba che regalano modelli potenti e riducono i prezzi occidentali. Forkast ha definito senza mezzi termini il comunicato degli Inkling-Small: "La competizione a pesi aperti ora ha un concorrente statunitense."
Fino ad ora, i principali modelli a peso aperto provenivano quasi esclusivamente dalla Cina, sollevando preoccupazioni a Washington sul fatto che i laboratori americani stessero cedendo un’intera categoria di mercato. Thinking Machines, una startup statunitense ben finanziata guidata da una delle figure più importanti nel campo dell’intelligenza artificiale, cambia questo calcolo. Rilasciando tutti i pesi su Hugging Face e supportando la messa a punto aperta, il laboratorio sta facendo un gioco diretto per la comunità di sviluppatori che i modelli cinesi a peso aperto hanno coltivato.
Costruito per gli sviluppatori, non solo per i benchmark
Thinking Machines ha abbinato il rilascio a strumenti rivolti direttamente agli sviluppatori. Oltre ai pesi aperti Hugging Face, Databricks ha confermato che la famiglia Inkling è disponibile sulla sua piattaforma e Tinker Playground supporta immediatamente la chat multimodale di testo, immagini e audio. L'impostazione variabile dello "sforzo di pensiero", da minimo a "xhigh", è progettata per veri compromessi ingegneristici: esegui a basso costo quando un'attività è semplice, spendi più risorse di elaborazione quando un problema richiede un ragionamento più profondo. Questa flessibilità è importante per le startup che tengono d’occhio i loro conti di inferenza, molti dei quali sono già migrati verso alternative più economiche a peso aperto piuttosto che pagare tariffe API premium.
La tendenza all'efficienza nel settore
Inkling-Small si adatta anche a uno schema più ampio. In tutto il settore, l’avanguardia si sta spostando da modelli monolitici sempre più grandi verso sistemi più piccoli e intelligenti che superano il loro peso. Dai modelli di guerra dei prezzi di DeepSeek alle architetture compresse, il messaggio è coerente: il conteggio dei parametri grezzi conta meno dell'efficienza con cui un modello utilizza la sua capacità.
Per Thinking Machines, la scommessa sull’efficienza rispetto alle dimensioni è ora profonda due modelli e i primi benchmark suggeriscono che la strategia sta funzionando. Con Inkling-Small disponibile per il download e la messa a punto oggi, gli sviluppatori possono testare personalmente tale affermazione.
Stai al passo con l'intelligenza artificiale
Ogni settimana arrivano nuovi modelli a peso aperto e la concorrenza si sta solo intensificando. Tieniti aggiornato su ogni pubblicazione tramite la nostra copertura del settore dell'intelligenza artificiale.
Leggi altre notizie sull'AI →