Reflection AI، استارتآپ آمریکایی تحت حمایت انویدیا، اولین مدل وزن باز خود را در 5 اکتبر معرفی کرد، یک سیستم ترکیبی از متخصصان پراکنده به نام Beam که این شرکت به عنوان قویترین چالش غربی تاکنون برای مرزهای وزن باز که در حال حاضر تحت سلطه آزمایشگاههای چینی است، قرار میگیرد. این اطلاعیه که در وبلاگ خود Reflection منتشر شد و به سرعت توسط رویترز، TechCrunch، Fortune و Semafor دریافت شد، با تغییری به دست آمد: این مدل هنوز قابل دانلود نیست.
Beam در حال گذراندن چیزی است که شرکت به عنوان تیم نهایی قرمز و ارزیابی ها توصیف می کند. دسترسی زودهنگام از طریق فرآیند ثبتنام باز است و Reflection میگوید وزنها، گزارش فنی، کارت مدل و مصنوعات توسعهدهنده را در اواخر این ماه منتشر خواهد کرد. هنگامی که این اتفاق بیفتد، Beam به یکی از بزرگترین نسخههای آزاد منتشر شده توسط یک آزمایشگاه ایالات متحده تبدیل میشود و واضحترین آزمایشی است که نشان میدهد آیا یک شرکت آمریکایی میتواند با سرعت انتشار و باز بودن که مدلهای چینی را به انتخاب پیشفرض برای بسیاری از جامعه متنباز تبدیل کرده است، مطابقت داشته باشد. برای پوشش مستمر مسابقه وزن باز و هر چیز دیگری که در میدان حرکت می کند، صفحه اصلی اخبار هوش مصنوعی ما را علامت گذاری کنید.
اعداد پشت پرتو
Beam یک مدل ترکیبی از متخصصان پراکنده با 501 میلیارد پارامتر کل است که تقریباً 23 میلیارد آن در هر توکن فعال است. Reflection می گوید که این مدل را بر روی 23.8 تریلیون توکن برگرفته از وب و مجموعه داده های دارای مجوز اختصاصی از قبل آموزش داده است و ادعا می کند که مدل پایه با مدل های پایه باز با اندازه مشابه مطابقت دارد یا عملکرد بهتری دارد.
ادعای متمایزتر مربوط به یادگیری تقویتی است. Reflection الگوریتمها، محیطهای آموزشی و زیرساختها را برای حفظ RL با محاسبات بالا در مقیاس ایجاد کرد، و این شرکت گزارش میدهد که اجرای RL آن بیش از 100 میلیون نسخه در 10500 پردازنده گرافیکی NVIDIA GB300 طی چهار هفته آموزش ایجاد کرده است. این یک سرمایهگذاری غیرمعمول بزرگ RL برای انتشار با وزن باز است، و Reflection آن را به خاطر عملکرد رقابتی Beam با آنچه راندمان محاسبه استنتاج مرزی مینامد، اعتبار میدهد.
معیارها: رقابتی، هنوز پیشرو
جدول معیار منتشر شده توسط Reflection، Beam را به طور محکم در بسته وزن باز، پشت سر بزرگترین مدل های چینی، اما جلوتر از چندین نام معتبر قرار می دهد.
در SWE-Bench Pro v2-Hard، Beam امتیاز 77.2 را به دست آورده است، پس از GLM 5.3 با 88.2 و Kimi K3 با 88.2 در همان ردیف، اما بسیار جلوتر از Inkling با 56.9 است. در SWE-Bench Pro v1، Beam امتیاز 65.5 را کسب کرده است، بالاتر از Inkling (54.3)، Nemotron 3 Ultra (46.4) و GLM 5.2 (62.1)، در حالی که Qwen 3.8-Max امتیاز 67.7 را کسب کرده است. در بنچمارک کدنویسی نمایندگی DeepSWE v1.1، Beam 44.4 را ثبت می کند، در سطح 44.0 GLM 5.2 و پشت سر GLM 5.3 (61.0)، Qwen 3.8-Max (51.0) و DeepSeek V4.1 Flash (74.2).
قاببندی خود شرکت در مورد جایی که Beam مینشیند صریح است. در پست وبلاگ، Reflection می نویسد که Beam "مرزهای وزن باز غربی را پیش می برد" و "با مدل های باز بزرگتر مانند GLM 5.2 و نزدیک شدن به Qwen 3.8-Max در کدنویسی و وظایف نمایندگی رقابت می کند." همچنین میپذیرد که مدلهای مرزی باز مانند Kimi K3 "از نظر قابلیت خام پیشتاز هستند."
دو اخطار شایسته تاکید است. اولاً، هر عددی در اینجا توسط Reflection قبل از انتشار وزن گزارش میشود، و تأیید مستقل تنها زمانی امکانپذیر میشود که گزارش فنی و پستهای بازرسی عمومی شوند. دوم، چندین سلول در جدول خود شرکت بهعنوان گزارش نشده علامتگذاری شدهاند، که مقایسه کامل سیب به سیب را در حال حاضر غیرممکن میکند.
استدلال کارایی
آنچه که Reflection به عنوان مزیت واقعی Beam مطرح میکند، موقعیت خام رتبهبندی نیست، بلکه هزینه در زمان استنتاج است. از آنجایی که تنها 23 میلیارد از 501 میلیارد پارامتر آن در هر توکن فعال می شود، این شرکت استدلال می کند که Beam می تواند عملکرد عاملی و کدگذاری نزدیک به مرز را با کسری از هزینه محاسباتی مدل های متراکم بزرگتر ارائه دهد. این موقعیتیابی منعکسکننده استراتژی است که خانوادههای با وزن باز چینی را در بین استارتآپها بسیار محبوب کرده است: توانایی کافی با قیمتهایی که نمایندگان همیشه فعال را از نظر اقتصادی مقرونبهصرفه میسازد.
اگر ادعای کارایی از معیارهای مستقل جان سالم به در ببرد، می تواند مهمتر از دلتاهای تابلوی امتیاز باشد. تیم هایی که هزاران عامل برنامه نویسی موازی را اداره می کنند، بیشتر به هزینه هر کار تکمیل شده اهمیت می دهند تا امتیازات معیار تک رقمی.
جریان زیرزمینی ژئوپلیتیک
پوشش راه اندازی به طور قابل توجهی ژئوپلیتیکی برای انتشار مدل منبع باز بوده است. رویترز Beam را به عنوان "نخستین مدل هوش مصنوعی" از Reflection توصیف کرد که "مدل های باز چینی را پذیرفته است." فورچون پرسید که آیا Beam میتواند «بهترین شانس آمریکا برای رقابت با چین» باشد و سمافور این شرکت را بهعنوان «یک پاسخ منبع باز غربی به آزمایشگاههای چینی» معرفی کرد.
این قاببندی وضعیت اکوسیستم وزن باز را در اواخر سال 2026 منعکس میکند: توانمندترین مدلهای قابل دانلود عمدتاً از آزمایشگاههای چینی از جمله خانواده GLM Z.ai، خط کیمی Moonshot، Qwen از Alibaba و DeepSeek تهیه شدهاند. آزمایشگاه های آمریکایی تا حد زیادی بهترین وزن های خود را بسته نگه داشته اند و در عوض روی درآمد API شرط بندی کرده اند. Reflection برعکس شرط بندی می کند: اینکه یک مدل مرز باز غربی می تواند اکوسیستم توسعه دهندگان را جذب کند، و اینکه حمایت انویدیا به آن باند محاسباتی برای ادامه دادن می دهد.
بعد چه اتفاقی می افتد
انتشار وزن در اواخر این ماه به سوالات مهم پاسخ خواهد داد: چگونه Beam خارج از ارزیابی های خود Reflection عمل می کند، چه مجوزی وزنه ها را همراهی می کند، و اینکه آیا راندمان تحت بار مستقل باقی می ماند یا خیر. تا آن زمان، Beam یک جدول معیار امیدوارکننده، یک فرم ثبت نام و مهمترین وعده وزن باز که یک آزمایشگاه آمریکایی امسال داده است، باقی میماند.
برای توسعه دهندگانی که تصمیم می گیرند روی GLM، Kimi، Qwen استانداردسازی کنند یا منتظر Beam باشند، توصیه عملی این است که تصمیمات نهایی را تا زمانی که گزارش فنی و ارزیابی های شخص ثالث منتشر شود، نگه دارند. مسابقه وزن آزاد یک شرکت کننده جدید آمریکایی دارد و برای اولین بار پس از مدتی، از پشت بسته شروع نمی شود.
از هوش مصنوعی جلوتر بمانید
مرز با وزن باز هر هفته حرکت می کند و آزمایشگاه ها سریعتر از آن چیزی که هر کسی بتواند ردیابی کند آزاد می شود. [اخبار هوش مصنوعی را در AI Buzz Wire بخوانید] (https://aibuzzwire.news) برای راه اندازی مدل، خرابی معیارها و داستان های تجاری پشت آنها.
[آخرین پیشرفتهای هوش مصنوعی را در اینجا کاوش کنید] (https://aibuzzwire.news).
