يمر مشروع مفتوح المصدر غير معروف يسمى Strata بلحظة. المحرك المرخص من معهد ماساتشوستس للتكنولوجيا، والذي يدير Qwen3.8-Flash-Next التابع لشركة Alibaba - وهو نموذج مكون من 125 مليار معلمة من الخبراء - على أجهزة الكمبيوتر الشخصية المخصصة للألعاب، ظهر على الصفحة الأولى من Hacker News في 4 أكتوبر بأكثر من 640 نقطة، وجمع مستودع GitHub الخاص به أكثر من 11000 نجمة منذ إنشائه في 24 سبتمبر.

الفكرة بسيطة: يمكن لنموذج مكون من 125 مليار معلمة، والذي يعيش عادةً على الخادم، الدردشة وكتابة التعليمات البرمجية وقراءة الصور وتشغيل وكلاء التشفير بالكامل على بطاقة رسومات المستهلك، دون ترك أي شيء من الجهاز.

ما الذي تفعله ستراتا فعليًا؟

يعد Strata محركًا استدلاليًا ومثبتًا بنقرة واحدة لنظامي التشغيل Windows وLinux. وفقًا لوثائقها، فإن المتطلبات متواضعة وفقًا لمعايير الطراز الحدودي: وحدة معالجة رسومات تحتوي على ما لا يقل عن 12 جيجابايت من VRAM من سلسلة RTX 20 أو 30 أو 40 أو 50 من NVIDIA أو سلسلة Radeon RX 6000 أو 7000 أو 9000 من AMD، وما لا يقل عن 32 جيجابايت من ذاكرة الوصول العشوائي للنظام، وحوالي 80 جيجابايت من مساحة SSD المجانية.

يشحن المحرك إصدارات كمية من Qwen3.8-Flash-Next بمستويات ضغط متعددة، من Q2_0 إلى IQ3_S، بالإضافة إلى متغير متخصص في التعليمات البرمجية. فهو يكشف عن واجهات برمجة التطبيقات المتوافقة مع OpenAI وAnthropic على المضيف المحلي، مما يعني أن الأدوات المصممة لـ ChatGPT أو Claude - بما في ذلك وكلاء البرمجة مثل Claude Code وCursor وCodex - يمكن توجيهها إلى الخادم المحلي بأقل قدر من التغييرات. يتم تضمين إدخال الصور الاختياري ودعم وحدات معالجة الرسومات المتعددة، كما يوفر برنامج التثبيت وضع إعداد بمساعدة الذكاء الاصطناعي يتيح لمساعد الترميز تكوين الجهاز من مطالبة واحدة تم لصقها.

أرقام السرعة

إن المعايير المنشورة للمشروع، والتي تم قياسها على جهازي كمبيوتر سطح مكتب للمستهلكين، هي سبب انتشار الإصدار. على NVIDIA RTX 5070 مع 12 جيجابايت من VRAM مقترنًا بـ Ryzen 5 7600 و64 جيجابايت من ذاكرة الوصول العشوائي، ذكرت Strata:

  • تكميم Q2_0: 94 رمزًا مميزًا في الثانية للإنشاء و2,650 رمزًا مميزًا في الثانية للمعالجة السريعة على مستند مكون من 32 ألف رمز مميز
  • IQ3_S: 53 رمزًا مميزًا في الجيل الثاني، و1,620 رمزًا مميزًا في الثانية للمعالجة الفورية
  • متغير المبرمج: 55 رمزًا مميزًا لكل جيل ثانٍ

من ناحية AMD، تمكنت بطاقة RX 9070 XT المزودة بذاكرة VRAM سعة 16 جيجابايت من إدارة 60 رمزًا مميزًا في الثانية في Q2_0. تقدر الوثائق أن بطاقة RTX 3090 المزودة بذاكرة VRAM سعة 24 جيجابايت يجب أن تصل إلى 100 إلى 140 رمزًا في الثانية – وهو أسرع مما يستطيع معظم الناس قراءته.

للمقارنة، قبل ستة أشهر، كان تشغيل نموذج كثيف يحتوي على 70 مليار معلمة محليًا بسرعات قابلة للاستخدام يتطلب محطة عمل بمئات الجيجابايت من الذاكرة الموحدة أو حيل فك تشفير تخمينية قوية.

لماذا يتناسب طراز 125B مع بطاقة الألعاب

قطعتان من التكنولوجيا تجعل هذا ممكنا. الأول هو النموذج نفسه. وكما أوضحت AI Buzz Wire عند إصدارها، فإن Qwen3.8-Flash-Next عبارة عن بنية مزيج من الخبراء مع ما يقرب من 125 مليار معلمة إجمالية ولكن فقط حوالي 6 مليار نشطة لكل رمز مميز - بحيث تمس كل كلمة يتم إنشاؤها شريحة صغيرة من الشبكة، مما يقلل بشكل كبير من الحوسبة لكل رمز مميز.

والثاني هو التكميم. تقوم أسرع إعدادات Strata المسبقة بضغط أوزان النموذج إلى بتتين أو ثلاث بتات لكل معلمة، مما يؤدي إلى استبدال بعض الدقة بمساحة تناسب وحدة معالجة الرسومات (GPU) سعة 12 جيجابايت وذاكرة الوصول العشوائي (RAM) للنظام. هذه المقايضة هي التحذير الرئيسي: إن التحليل الكمي من فئتي Q2 وIQ2 يؤدي إلى تدهور الجودة بشكل ملموس في المهام التي تتطلب تفكيرًا كثيفًا، ويجب على المشترين التعامل مع أرقام السرعة الرئيسية كنقطة بداية بدلاً من ضمان لكل عبء عمل. تقوم صفحات قياس أداء المجتمع في المستودع بتتبع نتائج الجودة عبر الأحجام.

جزء من موجة الذكاء الاصطناعي المحلية الأكبر

تصل ستراتا وسط زخم متسارع للاستدلال المحلي. أصبحت عائلة Qwen التابعة لـ Alibaba هي خط النماذج ذات الوزن المفتوح الأكثر تنزيلًا، ولدى Meta وGoogle نماذج تنافسية مفتوحة المصدر خاصة بهما، وتتيح موجة من الأدوات الآن للمستهلكين تشغيل مساعدين قادرين دون الحاجة إلى اشتراكات أو مغادرة بيانات لأجهزتهم.

يعكس المشروع أيضًا كيفية تحول تعريف "الأجهزة الاستهلاكية". أصبحت الآن بطاقة الرسومات 2026 متوسطة المدى المزودة بذاكرة VRAM سعة 12 جيجابايت، والتي تم شحنها بشكل أساسي للألعاب، بمثابة مُسرِّع استدلال قابل للتطبيق لنموذج في فئة الحجم التي حددت الأنظمة الحدودية قبل عامين فقط.

يظل Strata برنامجًا مبكرًا - حيث يوثق متتبع مشكلات المستودع الحواف الخشنة على وحدات معالجة الرسومات القديمة والمعالجات غير AVX2 - لكن المشروع مرخص من معهد ماساتشوستس للتكنولوجيا، وهو مجاني، وتم تطويره بشكل مفتوح، مع دعم تجريبي لـ Intel Arc، وبطاقات Tesla وRadeon الأقدم، وأجهزة معالجة رسومات متعددة موثقة من قبل أعضاء المجتمع.

بالنسبة للمطورين، قد تكون الوجبات الجاهزة الأكثر عملية هي توافق واجهة برمجة تطبيقات المضيف المحلي: يمكن إعادة توجيه أي برنامج نصي أو وكيل مكتوب ضد OpenAI أو Anthropic SDK إلى نشر Qwen محلي عن طريق تغيير عنوان URL الأساسي، مما يجعل Strata خيارًا منخفض الاحتكاك للنماذج الأولية الحساسة للخصوصية، أو الاستخدام دون اتصال بالإنترنت، أو ببساطة تحديد سقف لإنفاق واجهة برمجة التطبيقات.

كيفية تجربتها

لا يتطلب البدء جلسة نهائية مع دليل. يوفر برنامج التثبيت برامج التشغيل وأوزان النماذج والخادم المحلي في مسار واحد، ويتضمن المستودع ملف إعداد مصمم ليتم لصقه مباشرة في مساعد ترميز الذكاء الاصطناعي، والذي يقوم بعد ذلك بتكوين الجهاز بشكل مستقل. تكون عمليات الإطلاق الأولى أبطأ أثناء تحميل الأوزان من القرص؛ توصي الوثائق باستخدام SSD وتحذر من أن المحادثات الطويلة تنقل المزيد من العمل إلى ذاكرة الوصول العشوائي للنظام.

البقاء في صدارة الذكاء الاصطناعي

تابع AI Buzz Wire للحصول على أحدث النماذج مفتوحة المصدر وأدوات الذكاء الاصطناعي المحلية وأجهزة الاستدلال.

اقرأ المزيد من أخبار الذكاء الاصطناعي →