Reflection AI, den Nvidia-stödda amerikanska startupen, introducerade sin första öppenviktsmodell den 5 oktober, ett gles blandning av expertsystem kallat Beam som företaget positionerar som den starkaste västerländska utmaningen hittills till den öppna viktgränsen som för närvarande domineras av kinesiska labb. Tillkännagivandet, publicerat på Reflections egen blogg och snabbt plockat upp av Reuters, TechCrunch, Fortune och Semafor, kommer med en twist: modellen är inte nedladdningsbar ännu.
Beam genomgår vad företaget beskriver som slutlig red-teaming och utvärderingar. Tidig tillgång är öppen genom en registreringsprocess, och Reflection säger att det kommer att släppa vikterna, en teknisk rapport, ett modellkort och utvecklarartefakter senare denna månad. När det händer kommer Beam att bli en av de största friviktsutgåvorna som någonsin publicerats av ett amerikanskt labb, och det tydligaste testet hittills av huruvida ett amerikanskt företag kan matcha releasekadensen och öppenheten som har gjort kinesiska modeller till standardvalet för stora delar av open source-gemenskapen. För kontinuerlig bevakning av öppenviktsloppet och allt annat som rör fältet, bokmärk vår AI-nyhetshemsida.
Siffrorna bakom Beam
Beam är en gles blandning av experter modell med 501 miljarder totala parametrar, varav ungefär 23 miljarder är aktiva per token. Reflection säger att den förtränade modellen på 23,8 biljoner tokens från webben och egenutvecklade licensierade datauppsättningar, och hävdade att basmodellen matchar eller överträffar öppna basmodeller av liknande storlek.
Det mer distinkta påståendet gäller förstärkningsinlärning. Reflection byggde algoritmerna, träningsmiljöerna och infrastrukturen för att upprätthålla högkvalificerad RL i skala, och företaget rapporterar att dess RL-körning genererade mer än 100 miljoner utrullningar över 10 500 NVIDIA GB300 GPU:er under fyra veckors utbildning. Det är en ovanligt stor RL-investering för en release med öppen vikt, och Reflection tillskriver den för Beams konkurrenskraftiga prestanda med vad den kallar frontier inferens beräkningseffektivitet.
Riktmärken: Konkurrenskraftig, ännu inte ledande
Reflections publicerade benchmark-tabell placerar Beam stabilt i den öppna vikten, bakom de allra största kinesiska modellerna men före eller i nivå med flera etablerade namn.
På SWE-Bench Pro v2-Hard får Beam 77,2, bakom GLM 5,3 på 88,2 och Kimi K3 på 88,2 på samma rad, men långt före Inkling på 56,9. På SWE-Bench Pro v1 får Beam 65,5, före Inkling (54,3), Nemotron 3 Ultra (46,4) och GLM 5,2 (62,1), medan Qwen 3,8-Max får 67,7. På DeepSWE v1.1 agentiska kodningsbenchmark registrerar Beam 44,4, nivå med GLM 5.2:s 44.0 och bakom GLM 5.3 (61.0), Qwen 3.8-Max (51.0) och DeepSeek V4.1 Flash (74.2).
Företagets egen inramning är uppriktig om var Beam sitter. I blogginlägget skriver Reflection att Beam "avancerar den västerländska öppna viktgränsen" och är "konkurrenskraftig med större öppna modeller som GLM 5.2 och närmar sig Qwen 3.8-Max på kodnings- och agentuppgifter." Det medger också att gränsöverskridande öppna modeller som Kimi K3 "förblir före på rå kapacitet."
Två varningar förtjänar att betonas. För det första, varje siffra här är självrapporterad av Reflection före viktsläppet, och oberoende verifiering kommer bara att bli möjlig när den tekniska rapporten och kontrollpunkterna är offentliga. För det andra är flera celler i företagets egen tabell markerade som ej rapporterade, vilket gör fullständiga jämförelser mellan äpplen och äpplen omöjliga för närvarande.
Effektivitetsargumentet
Det som Reflection anger som Beams verkliga fördel är inte den råa leaderboard-positionen utan kostnaden vid slutledningstidpunkten. Eftersom endast 23 miljarder av dess 501 miljarder parametrar aktiveras per token, hävdar företaget att Beam kan leverera agent- och kodningsprestanda nära gränsen till en bråkdel av beräkningskostnaden för större täta modeller. Den positioneringen speglar strategin som gjorde kinesiska familjer med öppen vikt så populära bland nystartade företag: tillräckligt stark kapacitet till priser som gör alltid-på-agenter ekonomiskt lönsamma.
Om effektivitetspåståendet överlever oberoende benchmarking kan det ha större betydelse än ledartavlans delta. Team som driver tusentals parallellkodningsagenter bryr sig mer om kostnaden per genomförd uppgift än om ensiffriga benchmarkpoäng.
En geopolitisk underström
Täckningen av lanseringen har varit slående geopolitisk för en modell med öppen källkod. Reuters beskrev Beam som den "första AI-modellen" från Reflection för att "ta på kinesiska öppna modeller." Fortune frågade om Beam kunde vara "Amerikas bästa chans att konkurrera med Kina", och Semafor inramade företaget som "ett västerländskt svar med öppen källkod till kinesiska labb."
Den inramningen återspeglar tillståndet för det öppna ekosystemet i slutet av 2026: de mest kapabla nedladdningsbara modellerna har kommit överväldigande från kinesiska laboratorier inklusive Z.ais GLM-familj, Moonshots Kimi-linje, Alibabas Qwen och DeepSeek. Amerikanska laboratorier har i stort sett hållit sina bästa vikter stängda och satsat på API-intäkter istället. Reflektion satsar på motsatsen: att en öppen västerländsk gränsmodell kan attrahera utvecklarens ekosystem, och att Nvidias stöd ger det beräkningsbanan att hänga med.
Vad händer härnäst
Viktsläppet senare denna månad kommer att svara på frågorna som är viktiga: hur Beam presterar utanför Reflections egna utvärderingar, vilken licens som följer med vikterna och om effektiviteten håller i sig under oberoende belastning. Fram till dess förblir Beam en lovande benchmark-tabell, ett registreringsformulär och det mest följdriktiga löfte om öppen vikt som ett amerikanskt labb har gett i år.
För utvecklare som bestämmer om de ska standardisera på GLM, Kimi, Qwen eller vänta på Beam, är det praktiska rådet att hålla slutgiltiga beslut tills den tekniska rapporten och tredje parts utvärderingar landar. Öppenviktsloppet har en ny amerikansk deltagare, och för första gången på ett tag börjar det inte bakifrån.
Ligg före AI
Den öppna viktgränsen flyttas varje vecka, och labben släpper snabbare än någon kan spåra. Läs fler AI-nyheter på AI Buzz Wire för modelllanseringar, benchmark-uppdelningar och affärshistorierna bakom dem.
Utforska den senaste AI-utvecklingen här.