Reflection AI, công ty khởi nghiệp Mỹ được Nvidia hậu thuẫn, đã giới thiệu mô hình trọng lượng mở đầu tiên của mình vào ngày 5 tháng 10, một hệ thống gồm nhiều chuyên gia thưa thớt có tên Beam mà công ty coi là thách thức mạnh nhất của phương Tây đối với biên giới trọng lượng mở hiện do các phòng thí nghiệm Trung Quốc thống trị. Thông báo, được đăng trên blog riêng của Reflection và nhanh chóng được Reuters, TechCrunch, Fortune và Semafor săn đón, đi kèm với một điểm bất ngờ: mô hình này chưa thể tải xuống được.

Beam đang trải qua những gì công ty mô tả là đánh giá và đánh giá nhóm đỏ cuối cùng. Quyền truy cập sớm được mở thông qua quá trình đăng ký và Reflection cho biết họ sẽ phát hành trọng số, báo cáo kỹ thuật, thẻ mô hình và các tạo phẩm dành cho nhà phát triển vào cuối tháng này. Khi điều đó xảy ra, Beam sẽ trở thành một trong những bản phát hành phiên bản mở lớn nhất từng được một phòng thí nghiệm Hoa Kỳ xuất bản và là thử nghiệm rõ ràng nhất về việc liệu một công ty Mỹ có thể phù hợp với nhịp độ phát hành và tính cởi mở đã khiến các mô hình Trung Quốc trở thành lựa chọn mặc định cho phần lớn cộng đồng nguồn mở hay không. Để liên tục đưa tin về cuộc đua hạng cân mở và mọi thứ khác diễn ra trên sân, hãy đánh dấu trang chủ tin tức AI của chúng tôi.

Những con số đằng sau chùm tia

Beam là một mô hình gồm nhiều chuyên gia thưa thớt với tổng số 501 tỷ tham số, trong đó có khoảng 23 tỷ tham số đang hoạt động trên mỗi mã thông báo. Reflection cho biết họ đã đào tạo trước mô hình trên 23,8 nghìn tỷ mã thông báo được lấy từ web và các bộ dữ liệu được cấp phép độc quyền, đồng thời tuyên bố rằng mô hình cơ sở phù hợp hoặc vượt trội hơn các mô hình cơ sở mở có quy mô tương tự.

Tuyên bố đặc biệt hơn liên quan đến việc học tăng cường. Reflection đã xây dựng các thuật toán, môi trường đào tạo và cơ sở hạ tầng để duy trì RL tính toán cao trên quy mô lớn và công ty báo cáo rằng hoạt động RL của họ đã tạo ra hơn 100 triệu lượt triển khai trên 10.500 GPU NVIDIA GB300 trong bốn tuần đào tạo. Đó là khoản đầu tư RL lớn bất thường cho một bản phát hành trọng lượng mở và Reflection ghi nhận điều đó nhờ hiệu suất cạnh tranh của Beam với cái mà họ gọi là hiệu quả tính toán suy luận biên giới.

Tiêu chuẩn: Cạnh tranh, Chưa dẫn đầu

Bảng điểm chuẩn được công bố của Reflection xếp Beam vững chắc vào nhóm trọng lượng mở, xếp sau các mẫu xe lớn nhất của Trung Quốc nhưng vượt lên trên hoặc ngang bằng với một số tên tuổi đã có tên tuổi.

Trên SWE-Bench Pro v2-Hard, Beam đạt điểm 77,2, xếp sau GLM 5,3 với 88,2 và Kimi K3 với 88,2 trên cùng một hàng, nhưng vượt xa Inkling ở 56,9. Trên SWE-Bench Pro v1, Beam đạt điểm 65,5, trước Inkling (54,3), Nemotron 3 Ultra (46,4) và GLM 5,2 (62,1), trong khi Qwen 3,8-Max đạt 67,7. Trên điểm chuẩn mã hóa tác nhân DeepSWE v1.1, Beam ghi 44,4, ngang bằng với 44,0 của GLM 5.2 và xếp sau GLM 5.3 (61.0), Qwen 3.8-Max (51.0) và DeepSeek V4.1 Flash (74.2).

Cơ cấu riêng của công ty rất thẳng thắn về vị trí của Beam. Trong bài đăng trên blog, Reflection viết rằng Beam "nâng cao biên giới trọng lượng mở của phương Tây" và "cạnh tranh với các mô hình mở lớn hơn như GLM 5.2 và tiếp cận Qwen 3.8-Max về các nhiệm vụ mã hóa và tác nhân." Nó cũng thừa nhận rằng các mẫu xe mở biên giới như Kimi K3 "vẫn dẫn đầu về năng lực thô".

Hai lưu ý đáng được nhấn mạnh. Đầu tiên, mọi con số ở đây đều do Reflection tự báo cáo trước khi công bố trọng lượng và việc xác minh độc lập sẽ chỉ có thể thực hiện được sau khi báo cáo kỹ thuật và điểm kiểm tra được công khai. Thứ hai, một số ô trong bảng riêng của công ty được đánh dấu là không được báo cáo, điều này khiến cho việc so sánh hoàn toàn giữa các quả táo hiện không thể thực hiện được.

Đối số hiệu quả

Điều mà Reflection cho là lợi thế thực sự của Beam không phải là vị trí trên bảng xếp hạng thô mà là chi phí ở thời điểm suy luận. Bởi vì chỉ có 23 tỷ trong số 501 tỷ tham số được kích hoạt trên mỗi mã thông báo, công ty lập luận rằng Beam có thể mang lại hiệu suất mã hóa và tác nhân gần biên giới với chi phí tính toán chỉ bằng một phần nhỏ so với chi phí tính toán của các mô hình dày đặc lớn hơn. Định vị đó phản ánh chiến lược đã khiến các gia đình có trọng lượng mở của Trung Quốc trở nên phổ biến với các công ty khởi nghiệp: năng lực đủ mạnh với mức giá giúp các đại lý luôn hoạt động có hiệu quả về mặt kinh tế.

Nếu tuyên bố về tính hiệu quả vượt qua được tiêu chuẩn độc lập thì nó có thể quan trọng hơn các đồng bằng trên bảng xếp hạng. Các nhóm điều hành hàng nghìn tác nhân mã hóa song song quan tâm đến chi phí cho mỗi nhiệm vụ đã hoàn thành hơn là về điểm chuẩn một chữ số.

Dòng chảy ngầm địa chính trị

Tin tức về buổi ra mắt mang tính chất địa chính trị nổi bật đối với một bản phát hành mô hình nguồn mở. Reuters mô tả Beam là "mô hình AI đầu tiên" từ Reflection "tiếp nhận các mô hình mở của Trung Quốc". Fortune hỏi liệu Beam có thể là "cơ hội tốt nhất để Mỹ cạnh tranh với Trung Quốc" hay không và Semafor đã mô tả công ty này là "câu trả lời nguồn mở của phương Tây cho các phòng thí nghiệm Trung Quốc".

Khung đó phản ánh trạng thái của hệ sinh thái trọng lượng mở vào cuối năm 2026: các mô hình có khả năng tải xuống cao nhất phần lớn đến từ các phòng thí nghiệm Trung Quốc, bao gồm dòng GLM của Z.ai, dòng Kimi của Moonshot, Qwen và DeepSeek của Alibaba. Các phòng thí nghiệm của Mỹ phần lớn đã đóng cửa các trọng số tốt nhất của họ, thay vào đó đặt cược vào doanh thu API. Sự phản ánh đang đặt cược điều ngược lại: rằng một mô hình biên giới mở của phương Tây có thể thu hút hệ sinh thái nhà phát triển và sự hỗ trợ của Nvidia mang lại cho nó đường băng điện toán để theo kịp.

Điều gì xảy ra tiếp theo

Việc phát hành trọng lượng vào cuối tháng này sẽ trả lời các câu hỏi quan trọng: Beam thực hiện như thế nào ngoài các đánh giá của chính Reflection, giấy phép nào đi kèm với trọng lượng và liệu hiệu quả có duy trì được dưới tải độc lập hay không. Cho đến thời điểm đó, Beam vẫn là một bảng điểm chuẩn đầy hứa hẹn, một hình thức đăng ký và lời hứa có tính chất mở có hệ quả nhất mà một phòng thí nghiệm của Mỹ đã đưa ra trong năm nay.

Đối với các nhà phát triển đang quyết định nên chuẩn hóa GLM, Kimi, Qwen hay chờ Beam, lời khuyên thiết thực là hãy giữ quyết định cuối cùng cho đến khi có báo cáo kỹ thuật và đánh giá của bên thứ ba. Cuộc đua hạng cân mở có một người Mỹ mới tham gia và lần đầu tiên sau một thời gian, nó không bắt đầu từ phía sau.

Đi trước AI

Biên giới trọng lượng mở di chuyển hàng tuần và các phòng thí nghiệm phát hành nhanh hơn bất kỳ ai có thể theo dõi. Đọc thêm tin tức AI trên AI Buzz Wire để biết thông tin ra mắt mô hình, phân tích điểm chuẩn và câu chuyện kinh doanh đằng sau chúng.

Khám phá những phát triển AI mới nhất tại đây.