سربراس Qwen 3.8 27B را به نقاط پایانی عمومی پلتفرم استنتاج Cerebras خود اضافه کرده است، جایی که طبق مستندات کاتالوگ مدل شرکت، مدل وزن باز تقریباً 1500 توکن در ثانیه اجرا می شود. این فهرست یکی از پرمصرفترین خانوادههای مدل باز علیبابا را با سرعتهایی در دسترس قرار میدهد که کمتر از سرویسهای میزبانی GPU معمولی است.
این اعلامیه بلافاصله توجه توسعه دهندگان را به خود جلب کرد: این داستان در یک روز بیش از 600 امتیاز را در اخبار هکر جمع آوری کرد، سطحی از کشش که نشان می دهد تقاضا برای استنتاج سریع و ارزان چقدر داغ شده است. برای دید وسیعتری از بازار استنباط، میز [اخبار جدید هوش مصنوعی] (https://aibuzzwire.news) هر بهروزرسانی اصلی پلتفرم را به محض فرود دنبال میکند.
مشخصات کاتالوگ
براساس مستندات Cerebras، Qwen 3.8 27B دارای 27 میلیارد پارامتر است و از 64 هزار توکن متن در سطح رایگان و 128 هزار در سطوح پولی پشتیبانی میکند که تقریباً 1500 توکن در ثانیه اجرا میشود. این در کنار مدل وزن باز OpenAI GPT-OSS 120B قرار دارد که همان کاتالوگ آن را با تقریباً 3000 توکن در ثانیه با زمینه 65K در سطح رایگان و 131K در سطوح پولی فهرست می کند.
هر دو مدل در ردیفهای آزمایشی رایگان و پرداختی Cerebras، مشروط به محدودیتهای نرخ، در دسترس هستند. مشتریانی که به ظرفیت رزرو شده، توان عملیاتی بالاتر یا SLA های تولیدی نیاز دارند، به پیشنهاد نقاط پایانی اختصاصی شرکت هدایت می شوند، که اسناد همچنین به عنوان مسیری برای خانواده های مدل اضافی فراتر از این دو در نقاط پایانی عمومی فهرست می کند.
پنجره های زمینه در کنار ارقام سرعت شایسته توجه هستند. شصت و چهار هزار توکن در ردیف رایگان - و 128000 در پولی - برای نگهداری همزمان پایگاه های کد قابل توجه، اسناد طولانی یا رونوشت های عامل توسعه یافته در حافظه کافی است، که برای حجم کاری دقیق که در آن رمزگشایی سریع جواب می دهد، اهمیت دارد. اسناد Cerebras همچنین شامل راهنمای سازگاری OpenAI است که هزینه تعویض را برای تیمهایی که کد موجود آنها قبلاً OpenAI SDK را هدف قرار میدهد کاهش میدهد: در اصل، نشان دادن مشتری موجود در نقطه پایانی Cerebras یک تغییر پیکربندی است تا بازنویسی.
مدل های هرس نشده، فشرده سازی شفاف
یکی از جزئیاتی که در اسناد قابل ذکر است، افشای Cerebras در مورد نحوه مدیریت فشرده سازی مدل است. این شرکت بیان میکند که تمام مدلهای موجود در نقاط پایانی عمومی، نسخههای اصلی و بدون هرس هستند و برای حفظ کیفیت، تنها در حین ذخیرهسازی از کمیتسازی انتخابی با وزن استفاده میکند. لایههای حساس با دقت کامل باقی میمانند، فعالسازیها، توجه و حافظه پنهان KV unquantized باقی میمانند، و dequantization در پرواز اتفاق میافتد.
Cerebras همچنین تحقیقات خود را در مورد تکنیک های هرس مانند REAP (هس فعال سازی تخصصی با وزن روتر) فاش می کند: انواع هرس شده با جامعه تحقیقاتی در Hugging Face به اشتراک گذاشته می شوند اما از طریق API عمومی ارائه نمی شوند. برای توسعهدهندگانی که انتخاب میکنند کجا مدلهای باز را اجرا کنند، این شفافیت در مورد آنچه دقیقاً ارائه میشود بهطور غیرعادی واضح است.
چرا سرعت توکن مهم است
اعداد خروجی مانند اینها برای بارهای کاری عاملی و کدگذاری بیشترین اهمیت را دارند. برنامههایی که صدها تماس مدل را زنجیرهای میکنند - عاملهای کدنویسی، گردشهای کاری مستقل، دستیاران بلادرنگ - تأخیر هر توکن را در هر مرحله چند برابر میکنند، بنابراین تفاوت بین 50 و 1500 توکن در ثانیه به یک تجربه کیفی متفاوت تبدیل میشود. برنامههای تعاملی که تکمیلهای طولانی را پخش میکنند بیشترین سود را دارند.
مبادله دامنه است. یک مدل 27 میلیارد پارامتری با سیستمهای مرزی در سختترین وظایف استدلالی مطابقت نخواهد داشت، و اسناد خود Cerebras بارهای کاری سنگین تولید را به سمت ظرفیت اختصاصی هدایت میکنند. اما برای کارهای میانی بزرگ که در آن مدلهای باز با اندازه متوسط از قبل به اندازه کافی خوب هستند - خلاصه، طبقهبندی، استفاده از ابزار، ویرایش کد - سرعت به عامل تمایز تبدیل میشود.
همچنین یک بعد قیمت توسعه دهندگان وزن وجود دارد. مدلهای نقطه پایانی عمومی در یک آزمایش رایگان قبل از هر تعهدی قابل استفاده هستند، که باعث میشود محک زدن در برابر حجم کاری خود تیم اساساً بدون اصطکاک باشد - یک رمپ عمدی که با قراردادهای سازمانی که نیاز به گفتگوهای فروش قبل از ارائه اولین نشانه دارند، در تضاد است. محدودیتهای نرخ مستند محدودیت برای تماشا هستند: دسترسی لایه آزاد برای اثبات سرعت وجود دارد، نه برای اجرای ترافیک تولید.
کشش شلوغ برای مدل های باز
اضافه شده در طول یک کشش شلوغ برای هوش مصنوعی وزنه باز فرود می آید. آزمایشگاه IFM مستقر در امارات به تازگی K2 Horizon را معرفی کرده است، ناوگان متصل از شش مدل کاملاً باز، و متا همچنان به تکرار خانواده Muse خود برای کدنویسی و استفاده عاملی ادامه می دهد. در همین حال، اکوسیستمهای مدل باز در چین با سرعتی حمل میشوند که چرخههای انتشار را در سراسر صنعت فشرده کرده است.
برای توسعه دهندگان، نکته مهم این است که پشته مدل باز در دو جنبه به طور همزمان رشد می کند: توانایی، زیرا مدل های متوسط فاصله را با پرچمداران در کارهای روزمره می بندند، و خدمات اقتصادی، زیرا ارائه دهندگان استنتاج تخصصی با سرعت خام رقابت می کنند. Qwen 3.8 27B در Cerebras یک نقطه داده برای هر دو روند است - یک مدل باز نسل فعلی که با سرعتهایی عجیب و غریب یک سال پیش، روی سختافزاری که برای این کار ساخته شده بود، استفاده میشود.
توسعه دهندگانی که پلتفرم را ارزیابی می کنند باید بار کاری خود را محک بزنند: سرعت های منتشر شده ارقام کاتالوگ هستند، توان عملیاتی در دنیای واقعی به طول سریع، همزمانی و پیکربندی بستگی دارد، و محدودیت های نرخ لایه رایگان قبل از سرعت آن محدود می شود.
از هوش مصنوعی جلوتر بمانید
هر نسخه از مدل، بهروزرسانی پلتفرم استنتاج و راهاندازی ابزار توسعهدهنده، در صورت وقوع ردیابی میشود — اخبار هوش مصنوعی بیشتر بخوانید →
