سربراس Qwen 3.8 27B را به نقاط پایانی عمومی پلتفرم استنتاج Cerebras خود اضافه کرده است، جایی که طبق مستندات کاتالوگ مدل شرکت، مدل وزن باز تقریباً 1500 توکن در ثانیه اجرا می شود. این فهرست یکی از پرمصرف‌ترین خانواده‌های مدل باز علی‌بابا را با سرعت‌هایی در دسترس قرار می‌دهد که کمتر از سرویس‌های میزبانی GPU معمولی است.

این اعلامیه بلافاصله توجه توسعه دهندگان را به خود جلب کرد: این داستان در یک روز بیش از 600 امتیاز را در اخبار هکر جمع آوری کرد، سطحی از کشش که نشان می دهد تقاضا برای استنتاج سریع و ارزان چقدر داغ شده است. برای دید وسیع‌تری از بازار استنباط، میز [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) هر به‌روزرسانی اصلی پلتفرم را به محض فرود دنبال می‌کند.

مشخصات کاتالوگ

براساس مستندات Cerebras، Qwen 3.8 27B دارای 27 میلیارد پارامتر است و از 64 هزار توکن متن در سطح رایگان و 128 هزار در سطوح پولی پشتیبانی می‌کند که تقریباً 1500 توکن در ثانیه اجرا می‌شود. این در کنار مدل وزن باز OpenAI GPT-OSS 120B قرار دارد که همان کاتالوگ آن را با تقریباً 3000 توکن در ثانیه با زمینه 65K در سطح رایگان و 131K در سطوح پولی فهرست می کند.

هر دو مدل در ردیف‌های آزمایشی رایگان و پرداختی Cerebras، مشروط به محدودیت‌های نرخ، در دسترس هستند. مشتریانی که به ظرفیت رزرو شده، توان عملیاتی بالاتر یا SLA های تولیدی نیاز دارند، به پیشنهاد نقاط پایانی اختصاصی شرکت هدایت می شوند، که اسناد همچنین به عنوان مسیری برای خانواده های مدل اضافی فراتر از این دو در نقاط پایانی عمومی فهرست می کند.

پنجره های زمینه در کنار ارقام سرعت شایسته توجه هستند. شصت و چهار هزار توکن در ردیف رایگان - و 128000 در پولی - برای نگهداری همزمان پایگاه های کد قابل توجه، اسناد طولانی یا رونوشت های عامل توسعه یافته در حافظه کافی است، که برای حجم کاری دقیق که در آن رمزگشایی سریع جواب می دهد، اهمیت دارد. اسناد Cerebras همچنین شامل راهنمای سازگاری OpenAI است که هزینه تعویض را برای تیم‌هایی که کد موجود آنها قبلاً OpenAI SDK را هدف قرار می‌دهد کاهش می‌دهد: در اصل، نشان دادن مشتری موجود در نقطه پایانی Cerebras یک تغییر پیکربندی است تا بازنویسی.

مدل های هرس نشده، فشرده سازی شفاف

یکی از جزئیاتی که در اسناد قابل ذکر است، افشای Cerebras در مورد نحوه مدیریت فشرده سازی مدل است. این شرکت بیان می‌کند که تمام مدل‌های موجود در نقاط پایانی عمومی، نسخه‌های اصلی و بدون هرس هستند و برای حفظ کیفیت، تنها در حین ذخیره‌سازی از کمیت‌سازی انتخابی با وزن استفاده می‌کند. لایه‌های حساس با دقت کامل باقی می‌مانند، فعال‌سازی‌ها، توجه و حافظه پنهان KV unquantized باقی می‌مانند، و dequantization در پرواز اتفاق می‌افتد.

Cerebras همچنین تحقیقات خود را در مورد تکنیک های هرس مانند REAP (هس فعال سازی تخصصی با وزن روتر) فاش می کند: انواع هرس شده با جامعه تحقیقاتی در Hugging Face به اشتراک گذاشته می شوند اما از طریق API عمومی ارائه نمی شوند. برای توسعه‌دهندگانی که انتخاب می‌کنند کجا مدل‌های باز را اجرا کنند، این شفافیت در مورد آنچه دقیقاً ارائه می‌شود به‌طور غیرعادی واضح است.

چرا سرعت توکن مهم است

اعداد خروجی مانند اینها برای بارهای کاری عاملی و کدگذاری بیشترین اهمیت را دارند. برنامه‌هایی که صدها تماس مدل را زنجیره‌ای می‌کنند - عامل‌های کدنویسی، گردش‌های کاری مستقل، دستیاران بلادرنگ - تأخیر هر توکن را در هر مرحله چند برابر می‌کنند، بنابراین تفاوت بین 50 و 1500 توکن در ثانیه به یک تجربه کیفی متفاوت تبدیل می‌شود. برنامه‌های تعاملی که تکمیل‌های طولانی را پخش می‌کنند بیشترین سود را دارند.

مبادله دامنه است. یک مدل 27 میلیارد پارامتری با سیستم‌های مرزی در سخت‌ترین وظایف استدلالی مطابقت نخواهد داشت، و اسناد خود Cerebras بارهای کاری سنگین تولید را به سمت ظرفیت اختصاصی هدایت می‌کنند. اما برای کارهای میانی بزرگ که در آن مدل‌های باز با اندازه متوسط ​​از قبل به اندازه کافی خوب هستند - خلاصه، طبقه‌بندی، استفاده از ابزار، ویرایش کد - سرعت به عامل تمایز تبدیل می‌شود.

همچنین یک بعد قیمت توسعه دهندگان وزن وجود دارد. مدل‌های نقطه پایانی عمومی در یک آزمایش رایگان قبل از هر تعهدی قابل استفاده هستند، که باعث می‌شود محک زدن در برابر حجم کاری خود تیم اساساً بدون اصطکاک باشد - یک رمپ عمدی که با قراردادهای سازمانی که نیاز به گفتگوهای فروش قبل از ارائه اولین نشانه دارند، در تضاد است. محدودیت‌های نرخ مستند محدودیت برای تماشا هستند: دسترسی لایه آزاد برای اثبات سرعت وجود دارد، نه برای اجرای ترافیک تولید.

کشش شلوغ برای مدل های باز

اضافه شده در طول یک کشش شلوغ برای هوش مصنوعی وزنه باز فرود می آید. آزمایشگاه IFM مستقر در امارات به تازگی K2 Horizon را معرفی کرده است، ناوگان متصل از شش مدل کاملاً باز، و متا همچنان به تکرار خانواده Muse خود برای کدنویسی و استفاده عاملی ادامه می دهد. در همین حال، اکوسیستم‌های مدل باز در چین با سرعتی حمل می‌شوند که چرخه‌های انتشار را در سراسر صنعت فشرده کرده است.

برای توسعه دهندگان، نکته مهم این است که پشته مدل باز در دو جنبه به طور همزمان رشد می کند: توانایی، زیرا مدل های متوسط ​​فاصله را با پرچمداران در کارهای روزمره می بندند، و خدمات اقتصادی، زیرا ارائه دهندگان استنتاج تخصصی با سرعت خام رقابت می کنند. Qwen 3.8 27B در Cerebras یک نقطه داده برای هر دو روند است - یک مدل باز نسل فعلی که با سرعت‌هایی عجیب و غریب یک سال پیش، روی سخت‌افزاری که برای این کار ساخته شده بود، استفاده می‌شود.

توسعه دهندگانی که پلتفرم را ارزیابی می کنند باید بار کاری خود را محک بزنند: سرعت های منتشر شده ارقام کاتالوگ هستند، توان عملیاتی در دنیای واقعی به طول سریع، همزمانی و پیکربندی بستگی دارد، و محدودیت های نرخ لایه رایگان قبل از سرعت آن محدود می شود.

از هوش مصنوعی جلوتر بمانید

هر نسخه از مدل، به‌روزرسانی پلتفرم استنتاج و راه‌اندازی ابزار توسعه‌دهنده، در صورت وقوع ردیابی می‌شود — اخبار هوش مصنوعی بیشتر بخوانید →