أضافت Amazon Web Services GLM 5.3 من Z.ai، مطور النماذج المعروف أيضًا باسم Zhipu AI، إلى Amazon Bedrock، مما يمنح عملاء المؤسسات وصولاً مُدارًا بالكامل لواجهة برمجة التطبيقات (API) إلى أحد أكبر النماذج ذات الوزن المفتوح التي تم إصدارها هذا العام. إن الإطلاق، الذي تم الإعلان عنه على مدونة AWS Machine Learning في 5 أكتوبر، يجعل نموذج خليط الخبراء ذو ​​المعلمة 753B متاحًا من خلال البنية التحتية المدارة لـ Bedrock بدلاً من مطالبة الشركات باستضافة الأوزان ذاتيًا.

وفقًا لـ AWS، تم تحسين GLM 5.3 - كما هو منشور على Hugging Face Hub - للبرمجة والمهام طويلة المدى، مع تقرير Z.ai عن قدرات ملحوظة في مجال الأمن السيبراني. وترتبط نقاط القوة هذه مباشرة بما قام المشترون من المؤسسات بسحبه من واجهات برمجة التطبيقات الحدودية هذا العام: التفكير متعدد الخطوات، وسير العمل المعزز بالأدوات، والسياق المستدام عبر قواعد الأكواد الكبيرة. لمزيد من السياق حول هذه القصة، راجع أخبار الذكاء الاصطناعي.

ما يحصل عليه عملاء Bedrock بالفعل

يتبع التكامل دليل الوصول المُدار القياسي الخاص بـ Bedrock، مع بعض الإضافات على مستوى المؤسسات:

  • وصول مرن لواجهة برمجة التطبيقات. يمكن استدعاء GLM 5.3 من خلال واجهات برمجة التطبيقات للاستجابات وإكمال الدردشة المتوافقة مع OpenAI - والتي توصي بها AWS للتطبيقات الجديدة - وكذلك من خلال واجهات برمجة تطبيقات Bedrock Invoc وConverse الأصلية. يمكن للفرق التي تقوم بترحيل خطوط الأنابيب القائمة على OpenAI إعادة توجيه النموذج مع الحد الأدنى من تغييرات التعليمات البرمجية.
  • الاستدلال عبر المناطق. يأتي النموذج خلف ملفي تعريف للاستدلال، us.zai.glm-5.3 لحركة المرور عبر المناطق في الولايات المتحدة وglobal.zai.glm-5.3 للتوجيه العالمي. تنتقل الطلبات إلى منطقة المصدر التي يختارها العميل ويتولى Bedrock التعامل مع التوجيه الآمن.
  • التخزين المؤقت السريع. يتم تشغيل التخزين المؤقت التلقائي الضمني بشكل افتراضي، مع توفر عناصر تحكم صريحة في ذاكرة التخزين المؤقت على واجهات برمجة التطبيقات المتوافقة مع OpenAI. بالنسبة لأحمال عمل الوكلاء التي تعيد إرسال مطالبات النظام الكبيرة أو سياق المستودع عند كل منعطف، تقول AWS أن التخزين المؤقت يقلل من زمن الوصول وتكلفة الإدخال.
  • مستويات الخدمة. يمكن للعملاء اختيار Flex لأحمال العمل المحسنة من حيث التكلفة والأقل حساسية للوقت، أو الأولوية لحركة المرور الحرجة لزمن الوصول بسعر مميز، أو Standard للرصيد الافتراضي.

هناك تحذير واحد يبرز: تنص AWS على أن الوصول إلى GLM 5.3 على Bedrock متاح لعملاء المؤسسات المؤهلين، مما يقترح عملية تأهيل مسورة بدلاً من الخدمة الذاتية المفتوحة لجميع الحسابات.

أول مشاركة في الإيرادات لمختبر صيني

إلى جانب التكامل الفني، تصف التغطية الصحفية للإطلاق ترتيبًا لتقاسم الإيرادات على أساس الاستخدام بين AWS وZ.ai والذي بموجبه يحصل موفر النموذج على جزء من استهلاك Bedrock - القالب التجاري القياسي الذي يستخدمه Bedrock مع الشركاء الغربيين، والذي يتم تطبيقه الآن على النموذج الرئيسي لمختبر صيني حدودي. وذكرت التقارير الصحفية المالية في أسواق هونج كونج أن الأسهم المرتبطة بـ Zhipu ارتفعت بأكثر من 7٪ في التعاملات المبكرة بسبب الأخبار.

الصفقة مهمة لما تشير إليه حول استراتيجية المنصة. لقد أمضى أصحاب المقاييس الفائقة العامين الماضيين في عقد تحالفات حصرية مع المختبرات الغربية؛ يؤدي فتح Bedrock لعائلة صينية ذات وزن مفتوح إلى توسيع نطاق وصول المنصة إلى الشركات الحساسة من حيث التكلفة وإلى الأسواق التي تواجه فيها العارضات الأمريكيات ضغوطًا على الأسعار. كما أنه يمنح توزيع Z.ai لا يمكن لإصدار الأوزان المفتوحة أن يطابقه: يمكن لآلاف المؤسسات التي لن تقوم مطلقًا بتنزيل نقطة تفتيش بمعلمة 753B أن تستدعيها الآن خلف اتفاقية مستوى الخدمة.

من الأوزان المفتوحة إلى واجهة برمجة التطبيقات المُدارة

كان مسار GLM 5.3 إلى Bedrock يمر عبر مجتمع الوزن المفتوح. تم نشر النموذج على Hugging Face Hub، حيث لفتت أوزانه ومعاييره وشروط ترخيصه انتباه المطورين قبل عرض أي استضافة مُدارة - وهو دليل قواعد اللعبة Z.ai الذي استخدمته عبر سلسلة GLM، بما في ذلك إصدار GLM-5.3-Flash المرخص من معهد ماساتشوستس للتكنولوجيا والذي تم تشغيله على رقائق صينية الصنع.

بالنسبة للمؤسسات، فإن حساب التفاضل والتكامل بين تنزيل الأوزان واستدعاء واجهة برمجة التطبيقات (API) يعود دائمًا إلى العمليات: تتطلب الاستضافة الذاتية لنموذج مزيج من الخبراء ذو ​​معلمة 753B سعة كبيرة لوحدة معالجة الرسومات (GPU) ونضج MLOps الذي لا تستطيع معظم المؤسسات تبريره لحمل عمل واحد. يعمل الوصول المُدار لـ Bedrock على إزالة هذا الحاجز مع إبقاء خيار النشر المختلط مفتوحًا للشركات التي لديها قيود على إقامة البيانات.

البدء بشكل ملموس

تمر وثائق AWS عبر الاستدعاء من وحدة تحكم Bedrock — حيث يظهر النموذج في ساحة اللعب القياسية للاختبار السريع دون الحاجة إلى تعليمات برمجية — وبرمجيًا من خلال نقطة نهاية وقت التشغيل الأساسي. المتطلبات الأساسية هي أذونات IAM المعتادة لاستدعاء النموذج، بما في ذلك الأساس: InvocModel والأساس: InvocModelWithResponseStream، بالإضافة إلى أذونات ملف تعريف الاستدلال عبر المناطق المختار. تم إدراج إصدار Python 3.10 أو الأحدث في أمثلة التعليمات البرمجية.

والجدير بالذكر أن منشور AWS يتضمن عرضًا توضيحيًا اختياريًا لاختبار الأمان تم إنشاؤه باستخدام Docker وأداة Strix مفتوحة المصدر، التي تعمل على تشغيل GLM 5.3 من خلال Bedrock لسير عمل الأمن الهجومي - وهو إدراج غير عادي يسلط الضوء على موقع الأمن السيبراني الذي طالبت به Z.ai للنموذج. بالنسبة لمنصة حساسة للامتثال مثل AWS، فإن عرض نموذج صيني في سياق عرض القرصنة يعد إشارة واضحة حول مزيج عبء العمل الذي تسعى Z.ai إلى تحقيقه.

خليط الخبراء في الاقتصاد

إن رقم المعلمة 753B أقل أهمية بالنسبة لحجمه مقارنة بهندسته المعمارية. تعمل نماذج خليط الخبراء على تنشيط جزء صغير فقط من المعلمات الخاصة بها لكل رمز مميز، وهذه هي الطريقة التي يمكن بها لـ GLM 5.3 تقديم قدرة على المستوى الحدودي دون تكاليف الاستدلال على المستوى الحدودي في كل طلب. إلى جانب التخزين المؤقت السريع - حيث يتم تقديم مطالبات النظام المتكررة وسياق المستودع من ذاكرة التخزين المؤقت بتكلفة منخفضة - تستهدف الاقتصاديات بشكل مباشر أعباء العمل الوكيل كبيرة الحجم التي تهيمن على ميزانيات الذكاء الاصطناعي للمؤسسات هذا العام: مساعدو الترميز، والعمليات الأمنية، وخطوط أنابيب الأتمتة طويلة المدى.

تسمح طبقات خدمة Bedrock بعد ذلك لفرق العمليات بتداول التكلفة مقابل زمن الوصول لكل حمل عمل. يمكن تشغيل مهمة تحليل الأكواد المجمعة ليلاً على أساس التسعير المرن، بينما يركب مساعد الطيار الأمني ​​التفاعلي طبقة الأولوية - نفس النموذج، ولكن يتم قياسه بشكل مختلف.

ما يجب مشاهدته

يؤدي الإطلاق إلى إجراء ثلاثة اختبارات على المدى القريب. أولاً، التبني: ما إذا كانت قاعدة مؤسسة Bedrock تتعامل مع GLM 5.3 كخيار إنتاج أو فضول قياس الأداء. ثانيًا، التسعير: تعمل الطبقة المرنة على إضعاف مستويات الخدمة المُحسّنة لزمن الاستجابة، كما أن تسعير سلسلة GLM ضغط تاريخيًا على المنافسين الغربيين فيما يتعلق بالتكلفة. ثالثًا، الرد: تواجه الشركات الأخرى ذات التوسع الكبير نفس الاختيار المتمثل في استضافة أو التنازل عن قطاع المؤسسات ذات النموذج الصيني.

بالنسبة لفرق الذكاء الاصطناعي التي تتتبع توفر النماذج، فإن الفكرة العملية بسيطة - أحد النماذج ذات الوزن المفتوح الأكثر مراقبة في عام 2026 أصبح الآن على بعد استدعاء واحد لواجهة برمجة التطبيقات (API) لعملاء AWS، ويزداد مشهد نماذج الذكاء الاصطناعي بشكل أكثر تنافسية مع كل منصة توقع مع مختبر صيني.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →