أضافت Cerebras Qwen 3.8 27B إلى نقاط النهاية العامة لمنصة Cerebras Inference الخاصة بها، حيث يعمل نموذج الأوزان المفتوحة بحوالي 1500 رمز في الثانية، وفقًا لوثائق كتالوج نموذج الشركة. تجعل القائمة واحدة من عائلات النماذج المفتوحة الأكثر استخدامًا على بابا متاحة بسرعات تتضاءل أمام الخدمة النموذجية التي تستضيفها وحدة معالجة الرسومات.
وقد لفت هذا الإعلان انتباه المطورين على الفور: فقد جمعت القصة أكثر من 600 نقطة على Hacker News خلال يوم واحد، وهو مستوى من الاهتمام يعكس مدى تزايد الطلب على الاستدلال السريع والرخيص. للحصول على رؤية أوسع لسوق الاستدلال، يتابع مكتب أخبار الذكاء الاصطناعي العاجلة كل تحديث رئيسي للمنصة فور وصوله.
المواصفات الموجودة في الكتالوج
وفقًا لوثائق Cerebras، يحمل Qwen 3.8 27B 27 مليار معلمة ويدعم 64 ألف رمز مميز للسياق على الطبقة المجانية و128 ألف رمز مميز على المستويات المدفوعة، ويعمل بحوالي 1500 رمز مميز في الثانية. إنه يقع جنبًا إلى جنب مع نموذج GPT-OSS 120B مفتوح الوزن من OpenAI، والذي يسرده نفس الكتالوج بحوالي 3000 رمز في الثانية مع سياق 65 ألفًا على الطبقة المجانية و131 ألفًا على المستويات المدفوعة.
يتوفر كلا الطرازين في الإصدار التجريبي المجاني من Cerebras وطبقات الدفع أولاً بأول، مع مراعاة حدود الأسعار. يتم توجيه العملاء الذين يحتاجون إلى سعة محجوزة أو إنتاجية أعلى أو اتفاقيات مستوى الخدمة للإنتاج إلى عرض نقاط النهاية المخصصة للشركة، والتي تدرجها الوثائق أيضًا كطريق إلى عائلات نموذجية إضافية تتجاوز الاثنتين على نقاط النهاية العامة.
تستحق نوافذ السياق الاهتمام إلى جانب أرقام السرعة. يكفي أربعة وستون ألف رمز مميز على الطبقة المجانية - و128000 رمزًا مدفوعًا - للاحتفاظ بقواعد تعليمات برمجية كبيرة أو مستندات طويلة أو نصوص الوكيل الموسعة في الذاكرة مرة واحدة، وهو أمر مهم بالنسبة لأحمال العمل الدقيقة حيث يؤتي فك التشفير السريع ثماره. تتضمن وثائق Cerebras أيضًا دليل توافق OpenAI، مما يخفض تكلفة التبديل للفرق التي تستهدف كودها الحالي بالفعل OpenAI SDK: من حيث المبدأ، فإن توجيه عميل حالي إلى نقطة نهاية Cerebras هو تغيير في التكوين وليس إعادة كتابة.
نماذج غير منقحة، ضغط شفاف
إحدى التفاصيل الجديرة بالملاحظة في الوثائق هي كشف Cerebras عن كيفية تعاملها مع ضغط النموذج. تذكر الشركة أن جميع النماذج الموجودة على نقاط النهاية العامة الخاصة بها هي إصدارات أصلية وغير مكررة، وأنها تستخدم تكميمًا انتقائيًا للوزن فقط أثناء التخزين فقط للحفاظ على الجودة. تظل الطبقات الحساسة بدقة كاملة، وتظل عمليات التنشيط والانتباه وذاكرة التخزين المؤقت KV غير كمية، وتحدث عملية الاستخلاص بسرعة.
تكشف Cerebras أيضًا عن أبحاثها في تقنيات التقليم مثل REAP (التقليم التنشيطي المعتمد على جهاز التوجيه): تتم مشاركة المتغيرات المشذبة مع مجتمع البحث على Hugging Face ولكن لا يتم تقديمها من خلال واجهة برمجة التطبيقات العامة. بالنسبة للمطورين الذين يختارون مكان تشغيل النماذج المفتوحة، فإن الشفافية حول ما يتم تقديمه بالضبط تكون واضحة بشكل غير عادي.
ما أهمية سرعة الرمز المميز؟
تعتبر أرقام الإنتاجية مثل هذه ذات أهمية كبيرة بالنسبة لأحمال عمل الوكلاء والتشفير. التطبيقات التي تربط مئات من مكالمات النماذج - وكلاء الترميز، وسير العمل المستقل، والمساعدين في الوقت الفعلي - تضاعف زمن الاستجابة لكل رمز مميز عبر كل خطوة، وبالتالي فإن الفرق بين 50 و1500 رمزًا مميزًا في الثانية يتراكم في تجربة مختلفة نوعيًا. تستفيد التطبيقات التفاعلية التي تقوم ببث عمليات الإكمال الطويلة بشكل واضح.
المقايضة هي النطاق. لن يتطابق نموذج مكون من 27 مليار معلمة مع الأنظمة الحدودية في أصعب مهام الاستدلال، وتقوم مستندات Cerebras الخاصة بتوجيه أعباء العمل الإنتاجية الثقيلة نحو السعة المخصصة. ولكن بالنسبة للمهام المتوسطة الكبيرة التي تكون فيها النماذج المفتوحة متوسطة الحجم جيدة بالفعل بما فيه الكفاية - التلخيص، والتصنيف، واستخدام الأدوات، وتحرير التعليمات البرمجية - تصبح السرعة هي ما يميزك.
هناك أيضًا أبعاد سعرية سوف يزنها المطورون. يمكن استخدام نماذج نقاط النهاية العامة في نسخة تجريبية مجانية قبل أي التزام، مما يجعل قياس الأداء مقابل عبء العمل الخاص بالفريق خاليًا من الاحتكاك بشكل أساسي - وهو منحدر متعمد يتناقض مع عقود المؤسسات التي تتطلب محادثات المبيعات قبل تقديم الرمز المميز الأول. حدود المعدل الموثقة هي القيد الذي يجب مراقبته: الوصول إلى الطبقة الحرة موجود لإثبات السرعة، وليس لتشغيل حركة الإنتاج.
امتداد مزدحم للنماذج المفتوحة
تهبط الإضافة خلال منطقة مزدحمة للأوزان المفتوحة للذكاء الاصطناعي. قدم مختبر IFM الذي يقع مقره في الإمارات العربية المتحدة للتو K2 Horizon، وهو أسطول متصل مكون من ستة نماذج مفتوحة بالكامل، وتواصل Meta تكرار عائلة Muse الخاصة بها للبرمجة والاستخدام الوكيل. وفي الوقت نفسه، تحافظ الأنظمة البيئية ذات النموذج المفتوح في الصين على الشحن بوتيرة أدت إلى ضغط دورات الإصدار عبر الصناعة.
بالنسبة للمطورين، فإن الفكرة العملية هي أن حزمة النماذج المفتوحة تنضج على جبهتين في وقت واحد: القدرة، حيث تعمل النماذج متوسطة الحجم على سد الفجوات مع العلامات الرئيسية في المهام اليومية، وخدمة الاقتصاد، حيث يتنافس مقدمو الاستدلال المتخصصون على السرعة الخام. يعد Qwen 3.8 27B الموجود على Cerebras بمثابة نقطة بيانات لكلا الاتجاهين - وهو نموذج مفتوح من الجيل الحالي تم تقديمه بسرعات كانت غريبة قبل عام، على أجهزة مصممة خصيصًا لهذه المهمة.
يجب على المطورين الذين يقومون بتقييم النظام الأساسي قياس أعباء العمل الخاصة بهم: السرعات المنشورة هي أرقام كتالوج، ويعتمد معدل النقل في العالم الحقيقي على أطوال الموجه والتزامن والتكوين، وسيتم ربط حدود معدل الطبقة المجانية قبل أن يتم ربط سرعتها.
البقاء في صدارة الذكاء الاصطناعي
يتم تتبع كل إصدار للنموذج، وتحديث النظام الأساسي للاستدلال، وإطلاق أداة المطور فور حدوثه — اقرأ المزيد من أخبار الذكاء الاصطناعي →
