Reflection AI, das von Nvidia unterstützte amerikanische Startup, stellte am 5. Oktober sein erstes Open-Weight-Modell vor, ein spärliches Expertenmix-System namens Beam, das das Unternehmen als bisher stärkste westliche Herausforderung für die Open-Weight-Grenze ansieht, die derzeit von chinesischen Labors dominiert wird. Die Ankündigung, die auf dem eigenen Blog von Reflection veröffentlicht und von Reuters, TechCrunch, Fortune und Semafor schnell aufgegriffen wurde, hat eine Besonderheit: Das Modell ist noch nicht herunterladbar.

Beam durchläuft derzeit das, was das Unternehmen als abschließendes Red-Teaming und Evaluierung bezeichnet. Der Frühzugang ist über einen Anmeldeprozess möglich, und Reflection gibt bekannt, dass die Gewichte, ein technischer Bericht, eine Modellkarte und Entwicklerartefakte später in diesem Monat veröffentlicht werden. Wenn das geschieht, wird Beam eine der größten Open-Weight-Veröffentlichungen sein, die jemals von einem US-Labor veröffentlicht wurde, und der bislang eindeutigste Test dafür, ob ein amerikanisches Unternehmen mit der Veröffentlichungsfrequenz und Offenheit mithalten kann, die chinesische Modelle zur Standardwahl für einen Großteil der Open-Source-Community gemacht hat. Für eine kontinuierliche Berichterstattung über das Open-Weight-Rennen und alles andere, was das Feld bewegt, setzen Sie ein Lesezeichen auf unsere AI-News-Homepage.

Die Zahlen hinter Beam

Beam ist ein spärliches Expertenmischungsmodell mit insgesamt 501 Milliarden Parametern, von denen etwa 23 Milliarden pro Token aktiv sind. Reflection gibt an, das Modell anhand von 23,8 Billionen Token aus dem Internet und proprietären lizenzierten Datensätzen vorab trainiert zu haben, und behauptet, dass das Basismodell mit offenen Basismodellen ähnlicher Größe übereinstimmt oder diese übertrifft.

Der deutlichere Anspruch betrifft das verstärkende Lernen. Reflection hat die Algorithmen, Trainingsumgebungen und Infrastruktur entwickelt, um High-Computing-RL in großem Maßstab aufrechtzuerhalten, und das Unternehmen berichtet, dass sein RL-Lauf innerhalb von vier Trainingswochen mehr als 100 Millionen Rollouts auf 10.500 NVIDIA GB300-GPUs generiert hat. Das ist eine ungewöhnlich große RL-Investition für ein Open-Weight-Release, und Reflection würdigt die Wettbewerbsleistung von Beam mit der sogenannten Frontier-Inference-Recheneffizienz.

Benchmarks: Wettbewerbsfähig, noch nicht führend

Die von Reflection veröffentlichte Benchmark-Tabelle platziert Beam fest im Feld der offenen Gewichte, hinter den allergrößten chinesischen Modellen, aber vor oder auf gleicher Höhe mit mehreren etablierten Namen.

Beim SWE-Bench Pro v2-Hard erreicht Beam einen Wert von 77,2, hinter GLM 5,3 mit 88,2 und Kimi K3 mit 88,2 in derselben Reihe, aber deutlich vor Inkling mit 56,9. Auf SWE-Bench Pro v1 erreicht Beam 65,5 Punkte, vor Inkling (54,3), Nemotron 3 Ultra (46,4) und GLM 5,2 (62,1), während Qwen 3.8-Max 67,7 erreicht. Beim DeepSWE v1.1 Agentic Coding Benchmark erreicht Beam einen Wert von 44,4, gleichauf mit den 44,0 von GLM 5.2 und hinter GLM 5.3 (61,0), Qwen 3.8-Max (51,0) und DeepSeek V4.1 Flash (74,2).

Die eigene Darstellung des Unternehmens ist offen darüber, wo Beam sitzt. In dem Blogbeitrag schreibt Reflection, dass Beam „die westliche Open-Weight-Grenze vorantreibt“ und „mit größeren offenen Modellen wie GLM 5.2 konkurriert und sich Qwen 3.8-Max bei Codierungs- und Agentenaufgaben annähert“. Es wird auch eingeräumt, dass bahnbrechende offene Modelle wie der Kimi K3 „in puncto Leistungsfähigkeit weiterhin die Nase vorn haben“.

Zwei Vorbehalte verdienen Hervorhebung. Erstens wird jede Zahl hier von Reflection vor der Gewichtsfreigabe selbst gemeldet, und eine unabhängige Überprüfung wird erst möglich, wenn der technische Bericht und die Kontrollpunkte öffentlich sind. Zweitens sind mehrere Zellen in der unternehmenseigenen Tabelle als nicht gemeldet markiert, was vollständige Vergleiche von Äpfeln zu Äpfeln vorerst unmöglich macht.

Das Effizienzargument

Was Reflection als den wahren Vorteil von Beam bezeichnet, ist nicht die bloße Position in der Bestenliste, sondern die Kosten zum Zeitpunkt der Schlussfolgerung. Da nur 23 Milliarden seiner 501 Milliarden Parameter pro Token aktiviert werden, argumentiert das Unternehmen, dass Beam eine nahezu grenzenlose Agenten- und Codierungsleistung zu einem Bruchteil der Rechenkosten größerer dichter Modelle liefern kann. Diese Positionierung spiegelt die Strategie wider, die chinesische Open-Weight-Familien bei Start-ups so beliebt gemacht hat: ausreichend starke Kapazität zu Preisen, die Always-On-Agenten wirtschaftlich rentabel machen.

Wenn der Effizienzanspruch das unabhängige Benchmarking übersteht, könnte er wichtiger sein als die Deltas der Bestenliste. Teams, die Tausende paralleler Codierungsagenten betreiben, legen mehr Wert auf die Kosten pro abgeschlossener Aufgabe als auf einstellige Benchmark-Punkte.

Eine geopolitische Unterströmung

Die Berichterstattung über den Start war für eine Open-Source-Modellveröffentlichung auffallend geopolitisch. Reuters beschrieb Beam als das „erste KI-Modell“ von Reflection, das „mit chinesischen offenen Modellen konkurriert“. Fortune fragte, ob Beam „Amerikas beste Chance sein könnte, mit China zu konkurrieren“, und Semafor bezeichnete das Unternehmen als „eine westliche Open-Source-Antwort auf chinesische Labore“.

Dieser Rahmen spiegelt den Zustand des Open-Weight-Ökosystems Ende 2026 wider: Die leistungsfähigsten herunterladbaren Modelle stammen überwiegend aus chinesischen Labors, darunter die GLM-Familie von Z.ai, die Kimi-Linie von Moonshot, Qwen und DeepSeek von Alibaba. Amerikanische Labore haben ihre besten Gewichtungen weitgehend geschlossen gehalten und stattdessen auf API-Einnahmen gesetzt. Reflection setzt auf das Gegenteil: dass ein offenes Western-Frontier-Modell das Entwickler-Ökosystem anziehen kann und dass die Unterstützung von Nvidia dem Unternehmen die nötige Rechenleistung gibt, um mithalten zu können.

Was als nächstes passiert

Die Veröffentlichung der Gewichte später in diesem Monat wird die wichtigen Fragen beantworten: Wie schlägt sich Beam außerhalb der eigenen Bewertungen von Reflection, welche Lizenz liegt den Gewichten bei und ob die Effizienz unter unabhängiger Last standhält. Bis dahin bleibt Beam ein vielversprechender Benchmark-Tisch, ein Anmeldeformular und das folgenreichste Open-Weight-Versprechen, das ein amerikanisches Labor in diesem Jahr gemacht hat.

Für Entwickler, die entscheiden, ob sie auf GLM, Kimi, Qwen standardisieren oder auf Beam warten wollen, ist der praktische Ratschlag, endgültige Entscheidungen aufzuschieben, bis der technische Bericht und die Bewertungen Dritter vorliegen. Das Open-Weight-Rennen hat einen neuen amerikanischen Teilnehmer, und zum ersten Mal seit langem startet es nicht mehr ganz hinten im Feld.

Bleiben Sie der KI immer einen Schritt voraus

Die Grenze des offenen Gewichts verschiebt sich wöchentlich und die Labore veröffentlichen schneller, als irgendjemand verfolgen kann. Lesen Sie weitere KI-Neuigkeiten auf AI Buzz Wire für Modelleinführungen, Benchmark-Aufschlüsselungen und die Geschäftsgeschichten dahinter.

Entdecken Sie hier die neuesten KI-Entwicklungen.