रिफ्लेक्शन AI, Nvidia-समर्थित अमेरिकन स्टार्टअपने 5 ऑक्टोबर रोजी आपले पहिले ओपन-वेट मॉडेल सादर केले, बीम नावाची एक विरळ मिश्रण-ऑफ-एक्सपर्ट सिस्टम जी कंपनी सध्या चिनी लॅब्सचे वर्चस्व असलेल्या ओपन-वेट फ्रंटियरसाठी सर्वात मजबूत पाश्चात्य आव्हान आहे. रिफ्लेक्शनच्या स्वतःच्या ब्लॉगवर प्रकाशित केलेली आणि रॉयटर्स, टेकक्रंच, फॉर्च्यून आणि सेमाफोरने पटकन उचललेली घोषणा, एका ट्विस्टसह आली: मॉडेल अद्याप डाउनलोड करण्यायोग्य नाही.

बीममध्ये अंतिम रेड-टीमिंग आणि मूल्यांकन म्हणून कंपनीचे वर्णन केले जाते. साइनअप प्रक्रियेद्वारे लवकर प्रवेश खुला आहे आणि रिफ्लेक्शन म्हणतो की ते वजन, एक तांत्रिक अहवाल, एक मॉडेल कार्ड आणि विकसक कलाकृती या महिन्याच्या शेवटी प्रकाशित करेल. जेव्हा असे होईल तेव्हा, यूएस लॅबद्वारे प्रकाशित केलेल्या सर्वात मोठ्या ओपन-वेट रिलीझपैकी बीम एक बनेल आणि अमेरिकन कंपनी रिलीझ कॅडेन्स आणि मोकळेपणाशी जुळू शकते की नाही याची सर्वात स्पष्ट चाचणी असेल ज्यामुळे चिनी मॉडेल्स बहुतेक ओपन-सोर्स समुदायासाठी डीफॉल्ट निवड बनले आहेत. खुल्या वजनाच्या शर्यतीच्या सतत कव्हरेजसाठी आणि इतर सर्व गोष्टींसाठी, आमचे AI बातम्या मुख्यपृष्ठ बुकमार्क करा.

बीमच्या मागे संख्या

बीम हे 501 अब्ज एकूण पॅरामीटर्ससह तज्ञांचे विरळ मिश्रण आहे, ज्यापैकी अंदाजे 23 अब्ज प्रति टोकन सक्रिय आहेत. रिफ्लेक्शन म्हणते की त्याने मॉडेलला वेबवरून काढलेल्या 23.8 ट्रिलियन टोकन्सवर आणि मालकीच्या परवानाधारक डेटासेटवर प्रीट्रेन केले आहे, असा दावा केला आहे की बेस मॉडेल समान आकाराच्या ओपन बेस मॉडेलशी जुळते किंवा त्यापेक्षा जास्त कामगिरी करते.

अधिक विशिष्ट दावा मजबुतीकरण शिक्षणाशी संबंधित आहे. रिफ्लेक्शनने उच्च-संगणक RL स्केलवर टिकवून ठेवण्यासाठी अल्गोरिदम, प्रशिक्षण वातावरण आणि पायाभूत सुविधा तयार केल्या आणि कंपनीने अहवाल दिला की त्याच्या RL रनने चार आठवड्यांच्या प्रशिक्षणात 10,500 NVIDIA GB300 GPU मध्ये 100 दशलक्ष रोलआउट्स व्युत्पन्न केले. ओपन-वेट रिलीझसाठी ही एक असामान्यपणे मोठी आरएल गुंतवणूक आहे आणि रिफ्लेक्शन बीमच्या स्पर्धात्मक कामगिरीचे श्रेय देते ज्याला ते फ्रंटियर इन्फरन्स कंप्युट कार्यक्षमता म्हणतात.

बेंचमार्क: स्पर्धात्मक, अद्याप आघाडीवर नाही

रिफ्लेक्शनचे प्रकाशित बेंचमार्क सारणी बीमला ओपन-वेट पॅकमध्ये अगदी सर्वात मोठ्या चिनी मॉडेल्सच्या मागे ठेवते परंतु अनेक स्थापित नावांसह किंवा त्यापेक्षा पुढे आहे.

SWE-Bench Pro v2-Hard वर, बीमने 77.2 स्कोअर केला, GLM 5.3 च्या मागे 88.2 वर आणि Kimi K3 ने 88.2 वर त्याच पंक्तीवर, परंतु 56.9 वर Inkling च्या खूप पुढे. SWE-Bench Pro v1 वर, Inkling (54.3), Nemotron 3 Ultra (46.4) आणि GLM 5.2 (62.1), तर Qwen 3.8-Max 67.7 च्या पुढे, Beam स्कोअर 65.5. DeepSWE v1.1 एजंटिक कोडिंग बेंचमार्कवर, बीमने 44.4, GLM 5.2 च्या 44.0 सह पातळी आणि GLM 5.3 (61.0), Qwen 3.8-Max (51.0) आणि DeepSeek V4.1 Flash (74.2) च्या मागे रेकॉर्ड केले.

बीम कुठे बसते याबद्दल कंपनीचे स्वतःचे फ्रेमिंग स्पष्ट आहे. ब्लॉग पोस्टमध्ये, रिफ्लेक्शन लिहिते की बीम "वेस्टर्न ओपन-वेट फ्रंटियरला पुढे नेत आहे" आणि "जीएलएम 5.2 सारख्या मोठ्या ओपन मॉडेल्ससह आणि कोडिंग आणि एजंटिक कार्यांवर क्वेन 3.8-मॅक्सच्या जवळ येण्यासाठी स्पर्धात्मक आहे." हे देखील कबूल करते की किमी K3 सारखे फ्रंटियर ओपन मॉडेल "कच्च्या क्षमतेवर पुढे आहेत."

दोन चेतावणी वर जोर देण्यास पात्र आहेत. प्रथम, येथील प्रत्येक क्रमांकाचा वेट रिलीझच्या अगोदर रिफ्लेक्शनद्वारे स्व-रिपोर्ट केला जातो आणि तांत्रिक अहवाल आणि चेकपॉईंट सार्वजनिक झाल्यावरच स्वतंत्र पडताळणी शक्य होईल. दुसरे, कंपनीच्या स्वतःच्या टेबलमधील अनेक सेल नोंदवलेले नाहीत म्हणून चिन्हांकित केले आहेत, ज्यामुळे संपूर्ण सफरचंद-ते-सफरचंद तुलना सध्या अशक्य होते.

कार्यक्षमता युक्तिवाद

बीमचा खरा फायदा म्हणून रिफ्लेक्शन पिच करतो तो लीडरबोर्डची कच्ची स्थिती नसून अनुमानाच्या वेळी त्याची किंमत आहे. 501 बिलियन पॅरामीटर्सपैकी केवळ 23 अब्ज प्रति टोकन सक्रिय झाल्यामुळे, कंपनीचा तर्क आहे की बीम मोठ्या दाट मॉडेल्सच्या मोजणीच्या खर्चाच्या एका अंशाने जवळ-सीमावर्ती एजंटिक आणि कोडिंग कार्यप्रदर्शन देऊ शकते. ते पोझिशनिंग त्या धोरणाला प्रतिबिंबित करते ज्यामुळे स्टार्टअप्समध्ये चिनी ओपन-वेट कुटुंबे इतकी लोकप्रिय झाली: किमतींमध्ये मजबूत-पुरेशी क्षमता जी नेहमी चालू असलेल्या एजंटना आर्थिकदृष्ट्या व्यवहार्य बनवते.

कार्यक्षमतेचा दावा स्वतंत्र बेंचमार्किंगमध्ये टिकून राहिल्यास, तो लीडरबोर्ड डेल्टा पेक्षा जास्त महत्त्वाचा असू शकतो. हजारो समांतर कोडिंग एजंट चालवणारे संघ एकल-अंकी बेंचमार्क पॉइंट्सपेक्षा प्रति पूर्ण कार्याच्या खर्चाची अधिक काळजी घेतात.

भू-राजकीय अंडरकरंट

ओपन-सोर्स मॉडेल रिलीझसाठी लॉन्चचे कव्हरेज अत्यंत भू-राजकीय आहे. रॉयटर्सने बीमचे वर्णन रिफ्लेक्शनपासून "चायनीज ओपन मॉडेल्स घेण्याकरिता" पहिले एआय मॉडेल म्हणून केले. फॉर्च्युनने विचारले की बीम "चीनशी स्पर्धा करण्याची अमेरिकेची सर्वोत्तम संधी" असू शकते आणि सेमाफोरने कंपनीला "चीनी प्रयोगशाळांना मुक्त-स्रोत पाश्चात्य उत्तर" म्हणून तयार केले.

ते फ्रेमिंग 2026 च्या उत्तरार्धात ओपन-वेट इकोसिस्टमची स्थिती प्रतिबिंबित करते: Z.ai चे GLM फॅमिली, Moonshot's Kimi line, Alibaba's Qwen आणि DeepSeek यासह सर्वात सक्षम डाउनलोड करण्यायोग्य मॉडेल्स चीनी लॅबमधून मोठ्या प्रमाणावर आले आहेत. अमेरिकन प्रयोगशाळांनी त्यांचे सर्वोत्तम वजन मोठ्या प्रमाणात बंद ठेवले आहे, त्याऐवजी API महसूलावर सट्टा लावला आहे. रिफ्लेक्शन याच्या उलट पैज लावत आहे: ओपन वेस्टर्न फ्रंटियर मॉडेल डेव्हलपर इकोसिस्टमला आकर्षित करू शकते आणि Nvidia च्या पाठिंब्यामुळे ते चालू ठेवण्यासाठी संगणकीय धावपट्टी मिळते.

पुढे काय होईल

या महिन्याच्या अखेरीस वजन प्रकाशन महत्त्वाचे असलेल्या प्रश्नांची उत्तरे देईल: बीम रिफ्लेक्शनच्या स्वतःच्या मूल्यमापनांच्या बाहेर कसे कार्य करते, वजनासोबत कोणता परवाना आहे आणि कार्यक्षमता स्वतंत्र भाराखाली आहे का. तोपर्यंत, बीम हे एक आशादायक बेंचमार्क सारणी, साइनअप फॉर्म आणि अमेरिकन लॅबने या वर्षी दिलेले सर्वात परिणामकारक ओपन-वेट वचन आहे.

GLM, Kimi, Qwen चे मानकीकरण करायचे किंवा Beam ची प्रतीक्षा करायची हे ठरवणाऱ्या विकासकांसाठी, तांत्रिक अहवाल आणि तृतीय-पक्षाचे मूल्यमापन येईपर्यंत अंतिम निर्णय घेणे हा व्यावहारिक सल्ला आहे. ओपन-वेट शर्यतीत एक नवीन अमेरिकन प्रवेशिका आहे आणि काही काळानंतर प्रथमच, ती पॅकच्या मागील बाजूने सुरू होत नाही.

AI च्या पुढे रहा

ओपन-वेट फ्रंटियर साप्ताहिक हलते, आणि लॅब कोणीही ट्रॅक करू शकतील त्यापेक्षा अधिक वेगाने सोडतात. AI Buzz Wire वर अधिक AI बातम्या वाचा मॉडेल लॉन्च, बेंचमार्क ब्रेकडाउन आणि त्यामागील व्यवसाय कथांसाठी.

येथे नवीनतम AI घडामोडी एक्सप्लोर करा.