Reflection AI, la startup americana sostenuta da Nvidia, ha introdotto il suo primo modello open-weight il 5 ottobre, un sistema misto di esperti chiamato Beam che l'azienda posiziona come la sfida occidentale più forte finora alla frontiera open-weight attualmente dominata dai laboratori cinesi. L'annuncio, pubblicato sul blog di Reflection e subito ripreso da Reuters, TechCrunch, Fortune e Semafor, arriva con una svolta: il modello non è ancora scaricabile.

Beam si sta sottoponendo a ciò che l'azienda descrive come red-teaming e valutazioni finali. L'accesso anticipato è aperto tramite un processo di registrazione e Reflection afferma che rilascerà i pesi, un rapporto tecnico, una scheda modello e gli artefatti degli sviluppatori entro la fine del mese. Quando ciò accadrà, Beam diventerà uno dei più grandi rilasci open-weight mai pubblicati da un laboratorio statunitense, e il test più chiaro finora per verificare se un’azienda americana può eguagliare la cadenza di rilascio e l’apertura che ha reso i modelli cinesi la scelta predefinita per gran parte della comunità open source. Per una copertura continua della gara a peso aperto e di tutto ciò che muove il campo, aggiungi ai preferiti la nostra home page delle notizie sull'intelligenza artificiale.

I numeri dietro Beam

Beam è un modello misto di esperti con 501 miliardi di parametri totali, di cui circa 23 miliardi attivi per token. Reflection afferma di aver pre-addestrato il modello su 23,8 trilioni di token estratti dal web e da set di dati con licenza proprietaria, sostenendo che il modello base corrisponde o supera modelli base aperti di dimensioni simili.

L’affermazione più distintiva riguarda l’apprendimento per rinforzo. Reflection ha creato gli algoritmi, gli ambienti di formazione e l'infrastruttura per sostenere RL di elaborazione elevata su larga scala e l'azienda riferisce che la sua esecuzione di RL ha generato più di 100 milioni di implementazioni su 10.500 GPU NVIDIA GB300 in quattro settimane di formazione. Si tratta di un investimento RL insolitamente elevato per una versione open-weight, e Reflection gli attribuisce le prestazioni competitive di Beam con quella che chiama efficienza di calcolo dell'inferenza di frontiera.

Benchmark: competitivo, non ancora leader

La tabella dei benchmark pubblicata da Reflection colloca Beam saldamente nel gruppo dei pesi aperti, dietro i modelli cinesi più grandi ma davanti o al livello di diversi nomi affermati.

Su SWE-Bench Pro v2-Hard, Beam segna 77,2, dietro GLM 5,3 a 88,2 e Kimi K3 a 88,2 sulla stessa riga, ma ben davanti a Inkling a 56,9. Su SWE-Bench Pro v1, Beam ottiene un punteggio di 65,5, davanti a Inkling (54,3), Nemotron 3 Ultra (46,4) e GLM 5.2 (62,1), mentre Qwen 3.8-Max ottiene 67,7. Nel benchmark di codifica agentic DeepSWE v1.1, Beam registra 44,4, al livello del 44,0 di GLM 5.2 e dietro a GLM 5.3 (61,0), Qwen 3.8-Max (51,0) e DeepSeek V4.1 Flash (74,2).

L'inquadramento dell'azienda è sincero riguardo alla posizione di Beam. Nel post sul blog, Reflection scrive che Beam "fa avanzare la frontiera occidentale del peso aperto" ed è "competitivo con modelli aperti più grandi come GLM 5.2 e si avvicina a Qwen 3.8-Max su attività di codifica e agenti". Ammette inoltre che i modelli aperti di frontiera come Kimi K3 "rimangono all'avanguardia in termini di capacità grezze".

Due avvertenze meritano di essere sottolineate. Innanzitutto, ogni numero qui viene auto-segnalato da Reflection prima del rilascio del peso, e la verifica indipendente diventerà possibile solo una volta che il rapporto tecnico e i punti di controllo saranno pubblici. In secondo luogo, diverse celle nella tabella dell'azienda sono contrassegnate come non riportate, il che rende per ora impossibili confronti completi tra mele.

L'argomento dell'efficienza

Ciò che Reflection presenta come il vero vantaggio di Beam non è la posizione in classifica, ma il costo al momento dell'inferenza. Poiché solo 23 miliardi dei suoi 501 miliardi di parametri si attivano per token, la società sostiene che Beam può fornire prestazioni di codifica e agenti quasi all'avanguardia a una frazione del costo di calcolo di modelli densi più grandi. Questo posizionamento rispecchia la strategia che ha reso le famiglie cinesi open-weight così popolari tra le startup: capacità sufficientemente forti a prezzi che rendano gli agenti sempre disponibili economicamente sostenibili.

Se l’affermazione di efficienza sopravvive al benchmarking indipendente, potrebbe avere più importanza dei delta della classifica. I team che gestiscono migliaia di agenti di codifica paralleli si preoccupano più del costo per attività completata che dei punti di riferimento a una cifra.

Una corrente sotterranea geopolitica

La copertura del lancio è stata sorprendentemente geopolitica per un modello di rilascio open source. Reuters ha descritto Beam come il "primo modello di intelligenza artificiale" di Reflection ad "affrontare i modelli aperti cinesi". Fortune ha chiesto se Beam potesse essere "la migliore possibilità per l'America di competere con la Cina" e Semafor ha definito l'azienda come "una risposta occidentale open source ai laboratori cinesi".

Questo quadro riflette lo stato dell’ecosistema open-weight alla fine del 2026: i modelli scaricabili più capaci provengono in stragrande maggioranza da laboratori cinesi, tra cui la famiglia GLM di Z.ai, la linea Kimi di Moonshot, Qwen e DeepSeek di Alibaba. I laboratori americani hanno in gran parte mantenuto chiusi i loro pesi migliori, scommettendo invece sulle entrate dell’API. Reflection scommette sul contrario: che un modello di frontiera occidentale aperta può attrarre l'ecosistema degli sviluppatori e che il sostegno di Nvidia gli fornisce la pista informatica per tenere il passo.

Cosa succede dopo

Il rilascio dei pesi alla fine di questo mese risponderà alle domande che contano: come si comporta Beam al di fuori delle valutazioni di Reflection, quale licenza accompagna i pesi e se l'efficienza regge sotto carico indipendente. Fino ad allora, Beam rimane una tabella di riferimento promettente, un modulo di iscrizione e la promessa di peso aperto più importante fatta quest’anno da un laboratorio americano.

Per gli sviluppatori che decidono se standardizzarsi su GLM, Kimi, Qwen o attendere Beam, il consiglio pratico è di mantenere le decisioni finali fino all'arrivo del rapporto tecnico e delle valutazioni di terze parti. La corsa a peso aperto ha un nuovo concorrente americano e, per la prima volta da molto tempo, non parte dal fondo del gruppo.

Stai al passo con l'intelligenza artificiale

La frontiera del peso aperto si sposta settimanalmente e i laboratori rilasciano più velocemente di quanto chiunque possa monitorare. Leggi ulteriori notizie sull'intelligenza artificiale su AI Buzz Wire per il lancio di modelli, analisi dei benchmark e storie di business dietro di essi.

Esplora gli ultimi sviluppi dell'intelligenza artificiale qui.