Reflection AI، استارت‌آپ آمریکایی تحت حمایت انویدیا، اولین مدل وزن باز خود را در 5 اکتبر معرفی کرد، یک سیستم ترکیبی از متخصصان پراکنده به نام Beam که این شرکت به عنوان قوی‌ترین چالش غربی تاکنون برای مرزهای وزن باز که در حال حاضر تحت سلطه آزمایشگاه‌های چینی است، قرار می‌گیرد. این اطلاعیه که در وبلاگ خود Reflection منتشر شد و به سرعت توسط رویترز، TechCrunch، Fortune و Semafor دریافت شد، با تغییری به دست آمد: این مدل هنوز قابل دانلود نیست.

Beam در حال گذراندن چیزی است که شرکت به عنوان تیم نهایی قرمز و ارزیابی ها توصیف می کند. دسترسی زودهنگام از طریق فرآیند ثبت‌نام باز است و Reflection می‌گوید وزن‌ها، گزارش فنی، کارت مدل و مصنوعات توسعه‌دهنده را در اواخر این ماه منتشر خواهد کرد. هنگامی که این اتفاق بیفتد، Beam به یکی از بزرگترین نسخه‌های آزاد منتشر شده توسط یک آزمایشگاه ایالات متحده تبدیل می‌شود و واضح‌ترین آزمایشی است که نشان می‌دهد آیا یک شرکت آمریکایی می‌تواند با سرعت انتشار و باز بودن که مدل‌های چینی را به انتخاب پیش‌فرض برای بسیاری از جامعه متن‌باز تبدیل کرده است، مطابقت داشته باشد. برای پوشش مستمر مسابقه وزن باز و هر چیز دیگری که در میدان حرکت می کند، صفحه اصلی اخبار هوش مصنوعی ما را علامت گذاری کنید.

اعداد پشت پرتو

Beam یک مدل ترکیبی از متخصصان پراکنده با 501 میلیارد پارامتر کل است که تقریباً 23 میلیارد آن در هر توکن فعال است. Reflection می گوید که این مدل را بر روی 23.8 تریلیون توکن برگرفته از وب و مجموعه داده های دارای مجوز اختصاصی از قبل آموزش داده است و ادعا می کند که مدل پایه با مدل های پایه باز با اندازه مشابه مطابقت دارد یا عملکرد بهتری دارد.

ادعای متمایزتر مربوط به یادگیری تقویتی است. Reflection الگوریتم‌ها، محیط‌های آموزشی و زیرساخت‌ها را برای حفظ RL با محاسبات بالا در مقیاس ایجاد کرد، و این شرکت گزارش می‌دهد که اجرای RL آن بیش از 100 میلیون نسخه در 10500 پردازنده گرافیکی NVIDIA GB300 طی چهار هفته آموزش ایجاد کرده است. این یک سرمایه‌گذاری غیرمعمول بزرگ RL برای انتشار با وزن باز است، و Reflection آن را به خاطر عملکرد رقابتی Beam با آنچه راندمان محاسبه استنتاج مرزی می‌نامد، اعتبار می‌دهد.

معیارها: رقابتی، هنوز پیشرو

جدول معیار منتشر شده توسط Reflection، Beam را به طور محکم در بسته وزن باز، پشت سر بزرگترین مدل های چینی، اما جلوتر از چندین نام معتبر قرار می دهد.

در SWE-Bench Pro v2-Hard، Beam امتیاز 77.2 را به دست آورده است، پس از GLM 5.3 با 88.2 و Kimi K3 با 88.2 در همان ردیف، اما بسیار جلوتر از Inkling با 56.9 است. در SWE-Bench Pro v1، Beam امتیاز 65.5 را کسب کرده است، بالاتر از Inkling (54.3)، Nemotron 3 Ultra (46.4) و GLM 5.2 (62.1)، در حالی که Qwen 3.8-Max امتیاز 67.7 را کسب کرده است. در بنچمارک کدنویسی نمایندگی DeepSWE v1.1، Beam 44.4 را ثبت می کند، در سطح 44.0 GLM 5.2 و پشت سر GLM 5.3 (61.0)، Qwen 3.8-Max (51.0) و DeepSeek V4.1 Flash (74.2).

قاب‌بندی خود شرکت در مورد جایی که Beam می‌نشیند صریح است. در پست وبلاگ، Reflection می نویسد که Beam "مرزهای وزن باز غربی را پیش می برد" و "با مدل های باز بزرگتر مانند GLM 5.2 و نزدیک شدن به Qwen 3.8-Max در کدنویسی و وظایف نمایندگی رقابت می کند." همچنین می‌پذیرد که مدل‌های مرزی باز مانند Kimi K3 "از نظر قابلیت خام پیشتاز هستند."

دو اخطار شایسته تاکید است. اولاً، هر عددی در اینجا توسط Reflection قبل از انتشار وزن گزارش می‌شود، و تأیید مستقل تنها زمانی امکان‌پذیر می‌شود که گزارش فنی و پست‌های بازرسی عمومی شوند. دوم، چندین سلول در جدول خود شرکت به‌عنوان گزارش نشده علامت‌گذاری شده‌اند، که مقایسه کامل سیب به سیب را در حال حاضر غیرممکن می‌کند.

استدلال کارایی

آنچه که Reflection به عنوان مزیت واقعی Beam مطرح می‌کند، موقعیت خام رتبه‌بندی نیست، بلکه هزینه در زمان استنتاج است. از آنجایی که تنها 23 میلیارد از 501 میلیارد پارامتر آن در هر توکن فعال می شود، این شرکت استدلال می کند که Beam می تواند عملکرد عاملی و کدگذاری نزدیک به مرز را با کسری از هزینه محاسباتی مدل های متراکم بزرگتر ارائه دهد. این موقعیت‌یابی منعکس‌کننده استراتژی است که خانواده‌های با وزن باز چینی را در بین استارت‌آپ‌ها بسیار محبوب کرده است: توانایی کافی با قیمت‌هایی که نمایندگان همیشه فعال را از نظر اقتصادی مقرون‌به‌صرفه می‌سازد.

اگر ادعای کارایی از معیارهای مستقل جان سالم به در ببرد، می تواند مهمتر از دلتاهای تابلوی امتیاز باشد. تیم هایی که هزاران عامل برنامه نویسی موازی را اداره می کنند، بیشتر به هزینه هر کار تکمیل شده اهمیت می دهند تا امتیازات معیار تک رقمی.

جریان زیرزمینی ژئوپلیتیک

پوشش راه اندازی به طور قابل توجهی ژئوپلیتیکی برای انتشار مدل منبع باز بوده است. رویترز Beam را به عنوان "نخستین مدل هوش مصنوعی" از Reflection توصیف کرد که "مدل های باز چینی را پذیرفته است." فورچون پرسید که آیا Beam می‌تواند «بهترین شانس آمریکا برای رقابت با چین» باشد و سمافور این شرکت را به‌عنوان «یک پاسخ منبع باز غربی به آزمایشگاه‌های چینی» معرفی کرد.

این قاب‌بندی وضعیت اکوسیستم وزن باز را در اواخر سال 2026 منعکس می‌کند: توانمندترین مدل‌های قابل دانلود عمدتاً از آزمایشگاه‌های چینی از جمله خانواده GLM Z.ai، خط کیمی Moonshot، Qwen از Alibaba و DeepSeek تهیه شده‌اند. آزمایشگاه های آمریکایی تا حد زیادی بهترین وزن های خود را بسته نگه داشته اند و در عوض روی درآمد API شرط بندی کرده اند. Reflection برعکس شرط بندی می کند: اینکه یک مدل مرز باز غربی می تواند اکوسیستم توسعه دهندگان را جذب کند، و اینکه حمایت انویدیا به آن باند محاسباتی برای ادامه دادن می دهد.

بعد چه اتفاقی می افتد

انتشار وزن در اواخر این ماه به سوالات مهم پاسخ خواهد داد: چگونه Beam خارج از ارزیابی های خود Reflection عمل می کند، چه مجوزی وزنه ها را همراهی می کند، و اینکه آیا راندمان تحت بار مستقل باقی می ماند یا خیر. تا آن زمان، Beam یک جدول معیار امیدوارکننده، یک فرم ثبت نام و مهم‌ترین وعده وزن باز که یک آزمایشگاه آمریکایی امسال داده است، باقی می‌ماند.

برای توسعه دهندگانی که تصمیم می گیرند روی GLM، Kimi، Qwen استانداردسازی کنند یا منتظر Beam باشند، توصیه عملی این است که تصمیمات نهایی را تا زمانی که گزارش فنی و ارزیابی های شخص ثالث منتشر شود، نگه دارند. مسابقه وزن آزاد یک شرکت کننده جدید آمریکایی دارد و برای اولین بار پس از مدتی، از پشت بسته شروع نمی شود.

از هوش مصنوعی جلوتر بمانید

مرز با وزن باز هر هفته حرکت می کند و آزمایشگاه ها سریعتر از آن چیزی که هر کسی بتواند ردیابی کند آزاد می شود. [اخبار هوش مصنوعی را در AI Buzz Wire بخوانید] (https://aibuzzwire.news) برای راه اندازی مدل، خرابی معیارها و داستان های تجاری پشت آنها.

[آخرین پیشرفت‌های هوش مصنوعی را در اینجا کاوش کنید] (https://aibuzzwire.news).