Nvidia가 지원하는 미국 스타트업인 Reflection AI는 10월 5일에 첫 번째 개방형 모델인 Beam이라는 전문가 혼합 시스템을 출시했습니다. Beam은 현재 중국 연구소가 지배하고 있는 개방형 개척자에 대한 서구의 가장 강력한 도전으로 자리매김했습니다. Reflection의 자체 블로그에 게시되고 Reuters, TechCrunch, Fortune 및 Semafor에서 빠르게 확인된 이 발표에는 반전이 있었습니다. 해당 모델은 아직 다운로드할 수 없습니다.
Beam은 회사에서 설명하는 최종 레드팀 구성 및 평가를 진행하고 있습니다. 가입 절차를 통해 조기 액세스가 가능하며, Reflection은 이번 달 말에 가중치, 기술 보고서, 모델 카드 및 개발자 아티팩트를 출시할 것이라고 밝혔습니다. 그런 일이 발생하면 Beam은 미국 연구소에서 발표한 가장 큰 공개 릴리스 중 하나가 될 것이며, 미국 회사가 중국 모델을 대부분의 오픈 소스 커뮤니티에서 기본 선택으로 만든 릴리스 속도 및 개방성과 일치시킬 수 있는지 여부에 대한 가장 명확한 테스트가 될 것입니다. 오픈 체급 경주와 그 외 현장을 움직이는 모든 내용을 지속적으로 보도하려면 AI 뉴스 홈페이지를 북마크에 추가하세요.
빔 뒤의 숫자
Beam은 총 5,010억 개의 매개변수를 가진 희박한 전문가 혼합 모델이며, 그 중 약 230억 개가 토큰당 활성 상태입니다. Reflection은 웹과 독점 라이선스 데이터 세트에서 가져온 23조 8천억 개의 토큰을 기반으로 모델을 사전 훈련했으며 기본 모델이 비슷한 크기의 개방형 기본 모델과 일치하거나 그보다 뛰어나다고 주장합니다.
보다 독특한 주장은 강화 학습에 관한 것입니다. Reflection은 대용량 컴퓨팅 RL을 대규모로 유지하기 위해 알고리즘, 훈련 환경 및 인프라를 구축했으며 회사는 자사의 RL 실행이 4주간의 훈련 동안 10,500개의 NVIDIA GB300 GPU에 걸쳐 1억 개 이상의 롤아웃을 생성했다고 보고했습니다. 이는 개방형 릴리스에 대한 비정상적으로 큰 RL 투자이며 Reflection은 이를 프론티어 추론 컴퓨팅 효율성이라고 부르는 Beam의 경쟁력 있는 성능으로 평가합니다.
벤치마크: 경쟁적이지만 아직 선도적이지는 않음
Reflection이 게시한 벤치마크 테이블에 따르면 Beam은 매우 큰 중국 모델 뒤에 있지만 여러 기존 이름보다 앞서거나 같은 수준인 개방형 팩에 견고하게 포함되어 있습니다.
SWE-Bench Pro v2-Hard에서 Beam은 77.2점으로 같은 행에서 GLM 5.3(88.2점), Kimi K3(88.2점)에 뒤처졌지만 Inkling(56.9점)보다 훨씬 앞서 있습니다. SWE-Bench Pro v1에서 Beam은 Inkling(54.3), Nemotron 3 Ultra(46.4) 및 GLM 5.2(62.1)보다 높은 65.5점을 얻었고 Qwen 3.8-Max는 67.7점을 기록했습니다. DeepSWE v1.1 에이전트 코딩 벤치마크에서 Beam은 GLM 5.2의 44.0 수준이고 GLM 5.3(61.0), Qwen 3.8-Max(51.0) 및 DeepSeek V4.1 Flash(74.2)보다 뒤처지는 44.4를 기록합니다.
회사 자체의 프레임은 Beam의 위치에 대해 솔직합니다. 블로그 게시물에서 Reflection은 Beam이 "서구의 개방형 중량 개척지를 발전시키고" "GLM 5.2와 같은 더 큰 개방형 모델과 경쟁하고 코딩 및 에이전트 작업에서 Qwen 3.8-Max에 접근하고 있다"고 썼습니다. 또한 Kimi K3와 같은 프론티어 개방형 모델이 "기본 성능에서 여전히 앞서 있다"는 점을 인정합니다.
두 가지 주의 사항을 강조할 가치가 있습니다. 첫째, 여기에 있는 모든 수치는 가중치 공개를 앞두고 Reflection이 자체 보고한 것이며, 독립적인 검증은 기술 보고서와 체크포인트가 공개되어야 가능합니다. 둘째, 회사 자체 테이블의 여러 셀이 보고되지 않은 것으로 표시되어 현재로서는 완전한 사과 대 사과 비교가 불가능합니다.
효율성 논쟁
Reflection이 Beam의 진정한 이점으로 제시하는 것은 원시 순위표 위치가 아니라 추론 시 비용입니다. 5,010억 개의 매개변수 중 230억 개만이 토큰당 활성화되기 때문에 Beam은 대규모 밀도 모델의 컴퓨팅 비용보다 훨씬 적은 비용으로 경계에 가까운 에이전트 및 코딩 성능을 제공할 수 있다고 주장합니다. 이러한 포지셔닝은 중국의 개방형 제품군을 스타트업에서 인기 있게 만든 전략, 즉 상시 에이전트를 경제적으로 실행 가능하게 만드는 가격에 충분히 강력한 기능을 반영합니다.
효율성 주장이 독립적인 벤치마킹에서도 살아남는다면 이는 리더보드 델타보다 더 중요할 수 있습니다. 수천 개의 병렬 코딩 에이전트를 실행하는 팀은 한 자릿수 벤치마크 포인트보다 완료된 작업당 비용에 더 관심을 갖습니다.
지정학적 저류
출시에 대한 보도는 오픈 소스 모델 출시에 있어 매우 지정학적이었습니다. Reuters는 Beam을 Reflection의 '최초의 AI 모델'로 설명하여 '중국 개방형 모델을 채택'했습니다. Fortune은 Beam이 "미국이 중국과 경쟁할 수 있는 최고의 기회"가 될 수 있는지 물었고 Semafor는 이 회사를 "중국 연구소에 대한 오픈 소스 서구의 답변"이라고 표현했습니다.
이러한 프레임은 2026년 후반의 개방형 중량 생태계의 상태를 반영합니다. 가장 유능한 다운로드 가능한 모델은 Z.ai의 GLM 제품군, Moonshot의 Kimi 라인, Alibaba의 Qwen 및 DeepSeek를 포함한 중국 연구소에서 압도적으로 나왔습니다. 미국 연구소는 API 수익에 베팅하면서 대부분 최선의 가중치를 유지해 왔습니다. Reflection은 그 반대에 베팅하고 있습니다. 개방형 서부 개척 모델이 개발자 생태계를 끌어들일 수 있고 Nvidia의 지원이 이를 따라잡을 수 있는 컴퓨팅 활주로를 제공한다는 것입니다.
다음에 무슨 일이 일어날까요?
이번 달 말의 가중치 릴리스에서는 Beam이 Reflection의 자체 평가 외부에서 어떻게 수행되는지, 가중치에 수반되는 라이선스는 무엇인지, 독립적인 부하에서도 효율성이 유지되는지 여부 등 중요한 질문에 답할 것입니다. 그때까지 Beam은 유망한 벤치마크 테이블, 가입 양식, 그리고 올해 미국 연구소가 내놓은 가장 중요한 공개 중량 약속으로 남아 있습니다.
GLM, Kimi, Qwen으로 표준화할지 아니면 Beam을 기다릴지 결정하는 개발자의 경우 기술 보고서와 제3자 평가가 나올 때까지 최종 결정을 내리는 것이 실용적인 조언입니다. 오픈 웨이트 경주에는 새로운 미국인 참가자가 생겼고, 오랜만에 처음으로 무리의 뒤에서 시작하지 않습니다.
AI보다 앞서 나가세요
오픈 웨이트 프론티어는 매주 움직이며 실험실은 누구보다 빠르게 출시됩니다. AI Buzz Wire에서 더 많은 AI 뉴스를 읽어보세요에서 모델 출시, 벤치마크 분석 및 그 뒤에 숨은 비즈니스 스토리를 확인하세요.
여기에서 최신 AI 개발을 살펴보세요.