یک پروژه منبع باز کمتر شناخته شده به نام Strata در حال گذراندن لحظات است. موتور دارای مجوز MIT، که Qwen3.8-Flash-Next Alibaba را اجرا می کند - یک مدل ترکیبی از متخصصان با 125 میلیارد پارامتر - در رایانه های شخصی بازی معمولی، در 4 اکتبر با بیش از 640 امتیاز به صفحه اول Hacker News نمایش داده شد و مخزن GitHub آن از 4 سپتامبر 2000 جمع آوری شده است.
موضوع ساده است: یک مدل 125 میلیارد پارامتری که معمولاً روی یک سرور زندگی میکند، میتواند چت کند، کد بنویسد، تصاویر را بخواند و عوامل برنامهنویسی را به طور کامل روی کارت گرافیک مصرفکننده هدایت کند، بدون اینکه چیزی از دستگاه خارج نشود.
آنچه استراتا در واقع انجام می دهد
Strata هم یک موتور استنتاج و هم یک نصب کننده با یک کلیک برای ویندوز و لینوکس است. طبق مستندات آن، الزامات استانداردهای مدل مرزی بسیار ساده است: یک GPU با حداقل 12 گیگابایت VRAM از سری RTX 20، 30، 40 یا 50 NVIDIA یا سری Radeon RX 6000، 7000 یا 9000 AMD، حداقل 32 گیگابایت فضای RAM، SD تقریباً رایگان.
این موتور نسخههای کوانتیزهشده Qwen3.8-Flash-Next را در چندین سطح فشردهسازی، از Q2_0 تا IQ3_S، بهعلاوه یک نوع کد تخصصی ارسال میکند. این برنامه APIهای سازگار با OpenAI و Anthropic را در میزبان محلی نشان می دهد، به این معنی که ابزارهای ساخته شده برای ChatGPT یا Claude - از جمله عوامل برنامه نویسی مانند Claude Code، Cursor و Codex - می توانند با حداقل تغییرات به سمت سرور محلی هدایت شوند. ورودی تصویر اختیاری و پشتیبانی از چند GPU گنجانده شده است، و نصبکننده حتی یک حالت راهاندازی با کمک هوش مصنوعی را ارائه میدهد که به دستیار کدنویسی اجازه میدهد دستگاه را از طریق یک پیام چسبانده شده پیکربندی کند.
اعداد سرعت
معیارهای منتشر شده این پروژه، که بر روی دو دسکتاپ مصرفکننده اندازهگیری میشوند، دلیل گسترش انتشار هستند. Strata گزارش می دهد که در NVIDIA RTX 5070 با 12 گیگابایت VRAM همراه با Ryzen 5 7600 و 64 گیگابایت رم:
- Q2_0 Quantization: 94 توکن در ثانیه برای تولید و 2650 توکن در ثانیه برای پردازش سریع در یک سند 32K توکن
- IQ3_S: 53 توکن در نسل دوم، 1620 توکن در ثانیه پردازش سریع
- نوع کدگذار: 55 توکن در هر نسل دوم
در سمت AMD، یک RX 9070 XT با 16 گیگابایت VRAM، 60 توکن در ثانیه را در Q2_0 مدیریت کرد. این اسناد تخمین میزند که یک RTX 3090 با 24 گیگابایت VRAM باید به 100 تا 140 توکن در ثانیه برسد - سریعتر از آن چیزی که اکثر مردم میتوانند بخوانند.
برای مقایسه، شش ماه پیش، اجرای حتی یک مدل متراکم 70 میلیارد پارامتری به صورت محلی با سرعت قابل استفاده نیاز به یک ایستگاه کاری با صدها گیگابایت حافظه یکپارچه یا ترفندهای رمزگشایی تهاجمی حدس و گمان داشت.
چرا مدل 125B روی کارت بازی قرار می گیرد
دو فناوری این امکان را فراهم می کند. اولین مورد خود مدل است. همانطور که AI Buzz Wire در زمان انتشار خود پوشش داد، Qwen3.8-Flash-Next یک معماری ترکیبی از متخصصان با تقریباً 125 میلیارد پارامتر کل است اما تنها حدود 6 میلیارد پارامتر فعال در هر توکن - بنابراین هر کلمه تولید شده برش کوچکی از شبکه را لمس می کند و محاسبات در هر توکن را به طرز چشمگیری کاهش می دهد.
دوم کوانتیزاسیون است. سریعترین پیشتنظیمهای Strata وزن مدل را به دو یا سه بیت در هر پارامتر فشرده میکند، و مقداری دقت را برای ردپایی که در یک پردازنده گرافیکی 12 گیگابایتی و رم سیستم قرار میگیرد، مبادله میکند. این معاوضه اخطار اصلی است: کمیتهای کلاس Q2 و کلاس IQ2 به طور قابلتوجهی کیفیت را در کارهای سنگین استدلالی پایین میآورند و خریداران باید اعداد سرعت سرفصل را بهعنوان نقطه شروع بهجای تضمین برای هر حجم کاری در نظر بگیرند. صفحات معیار انجمن در مخزن نتایج کیفیت را در اندازهها دنبال میکنند.
بخشی از یک موج محلی-AI بزرگتر
استراتا در میان شتاب شتاب برای استنتاج محلی وارد می شود. خانواده Qwen علیبابا به پربارگیریترین خط مدل وزن باز تبدیل شده است، متا و گوگل مدلهای رقابتی منبع باز خود را دارند و موجی از ابزارها اکنون به مصرفکنندگان اجازه میدهد دستیارهای توانا را بدون اشتراک یا خروج داده از دستگاه خود اجرا کنند.
این پروژه همچنین نشان می دهد که چگونه تعریف "سخت افزار مصرف کننده" در حال تغییر است. یک کارت گرافیک میان رده 2026 با 12 گیگابایت VRAM، که عمدتاً برای بازی عرضه می شد، اکنون یک شتاب دهنده استنتاج مناسب برای مدلی در کلاس اندازه است که فقط دو سال پیش سیستم های مرزی را تعریف کرد.
Strata نرمافزار اولیه باقی مانده است - ردیاب مخزن لبههای ناهموار را روی GPUهای قدیمیتر و پردازندههای غیر AVX2 مستند میکند - اما این پروژه دارای مجوز MIT، رایگان و در فضای باز است و با پشتیبانی آزمایشی از Intel Arc، کارتهای قدیمیتر Tesla و Radeon و ریگهای چند GPU مستند شده توسط اعضای انجمن است.
برای توسعهدهندگان، عملیترین راهکار ممکن است سازگاری Localhost API باشد: هر اسکریپت یا عاملی که بر خلاف OpenAI یا Anthropic SDK نوشته شده است را میتوان با تغییر URL پایه به یک استقرار محلی Qwen هدایت کرد، و Strata را به گزینهای کم اصطکاک برای نمونهسازی حساس به حریم خصوصی، استفاده آفلاین یا صرفاً محدود کردن هزینه API تبدیل کرد.
چگونه آن را امتحان کنیم
برای شروع نیازی به جلسه ترمینال با دفترچه راهنما ندارد. نصبکننده درایورها، وزنهای مدل و سرور محلی را در یک پاس فراهم میکند، و مخزن شامل یک فایل راهاندازی طراحی شده است که مستقیماً در یک دستیار کدنویسی هوش مصنوعی قرار میگیرد، که سپس دستگاه را بهطور مستقل پیکربندی میکند. در حالی که وزنه ها از دیسک بارگیری می شوند، اولین پرتاب ها کندتر هستند. این مستندات یک SSD را توصیه میکند و هشدار میدهد که مکالمات طولانی کار بیشتری را روی رم سیستم تغییر میدهد.
از هوش مصنوعی جلوتر بمانید[AI Buzz Wire] (https://aibuzzwire.news) را برای آخرین مدلهای منبع باز، ابزارهای محلی هوش مصنوعی و سختافزار استنتاج دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →