یک پروژه منبع باز کمتر شناخته شده به نام Strata در حال گذراندن لحظات است. موتور دارای مجوز MIT، که Qwen3.8-Flash-Next Alibaba را اجرا می کند - یک مدل ترکیبی از متخصصان با 125 میلیارد پارامتر - در رایانه های شخصی بازی معمولی، در 4 اکتبر با بیش از 640 امتیاز به صفحه اول Hacker News نمایش داده شد و مخزن GitHub آن از 4 سپتامبر 2000 جمع آوری شده است.

موضوع ساده است: یک مدل 125 میلیارد پارامتری که معمولاً روی یک سرور زندگی می‌کند، می‌تواند چت کند، کد بنویسد، تصاویر را بخواند و عوامل برنامه‌نویسی را به طور کامل روی کارت گرافیک مصرف‌کننده هدایت کند، بدون اینکه چیزی از دستگاه خارج نشود.

آنچه استراتا در واقع انجام می دهد

Strata هم یک موتور استنتاج و هم یک نصب کننده با یک کلیک برای ویندوز و لینوکس است. طبق مستندات آن، الزامات استانداردهای مدل مرزی بسیار ساده است: یک GPU با حداقل 12 گیگابایت VRAM از سری RTX 20، 30، 40 یا 50 NVIDIA یا سری Radeon RX 6000، 7000 یا 9000 AMD، حداقل 32 گیگابایت فضای RAM، SD تقریباً رایگان.

این موتور نسخه‌های کوانتیزه‌شده Qwen3.8-Flash-Next را در چندین سطح فشرده‌سازی، از Q2_0 تا IQ3_S، به‌علاوه یک نوع کد تخصصی ارسال می‌کند. این برنامه APIهای سازگار با OpenAI و Anthropic را در میزبان محلی نشان می دهد، به این معنی که ابزارهای ساخته شده برای ChatGPT یا Claude - از جمله عوامل برنامه نویسی مانند Claude Code، Cursor و Codex - می توانند با حداقل تغییرات به سمت سرور محلی هدایت شوند. ورودی تصویر اختیاری و پشتیبانی از چند GPU گنجانده شده است، و نصب‌کننده حتی یک حالت راه‌اندازی با کمک هوش مصنوعی را ارائه می‌دهد که به دستیار کدنویسی اجازه می‌دهد دستگاه را از طریق یک پیام چسبانده شده پیکربندی کند.

اعداد سرعت

معیارهای منتشر شده این پروژه، که بر روی دو دسکتاپ مصرف‌کننده اندازه‌گیری می‌شوند، دلیل گسترش انتشار هستند. Strata گزارش می دهد که در NVIDIA RTX 5070 با 12 گیگابایت VRAM همراه با Ryzen 5 7600 و 64 گیگابایت رم:

  • Q2_0 Quantization: 94 توکن در ثانیه برای تولید و 2650 توکن در ثانیه برای پردازش سریع در یک سند 32K توکن
  • IQ3_S: 53 توکن در نسل دوم، 1620 توکن در ثانیه پردازش سریع
  • نوع کدگذار: 55 توکن در هر نسل دوم

در سمت AMD، یک RX 9070 XT با 16 گیگابایت VRAM، 60 توکن در ثانیه را در Q2_0 مدیریت کرد. این اسناد تخمین می‌زند که یک RTX 3090 با 24 گیگابایت VRAM باید به 100 تا 140 توکن در ثانیه برسد - سریع‌تر از آن چیزی که اکثر مردم می‌توانند بخوانند.

برای مقایسه، شش ماه پیش، اجرای حتی یک مدل متراکم 70 میلیارد پارامتری به صورت محلی با سرعت قابل استفاده نیاز به یک ایستگاه کاری با صدها گیگابایت حافظه یکپارچه یا ترفندهای رمزگشایی تهاجمی حدس و گمان داشت.

چرا مدل 125B روی کارت بازی قرار می گیرد

دو فناوری این امکان را فراهم می کند. اولین مورد خود مدل است. همانطور که AI Buzz Wire در زمان انتشار خود پوشش داد، Qwen3.8-Flash-Next یک معماری ترکیبی از متخصصان با تقریباً 125 میلیارد پارامتر کل است اما تنها حدود 6 میلیارد پارامتر فعال در هر توکن - بنابراین هر کلمه تولید شده برش کوچکی از شبکه را لمس می کند و محاسبات در هر توکن را به طرز چشمگیری کاهش می دهد.

دوم کوانتیزاسیون است. سریع‌ترین پیش‌تنظیم‌های Strata وزن مدل را به دو یا سه بیت در هر پارامتر فشرده می‌کند، و مقداری دقت را برای ردپایی که در یک پردازنده گرافیکی 12 گیگابایتی و رم سیستم قرار می‌گیرد، مبادله می‌کند. این معاوضه اخطار اصلی است: کمیت‌های کلاس Q2 و کلاس IQ2 به طور قابل‌توجهی کیفیت را در کارهای سنگین استدلالی پایین می‌آورند و خریداران باید اعداد سرعت سرفصل را به‌عنوان نقطه شروع به‌جای تضمین برای هر حجم کاری در نظر بگیرند. صفحات معیار انجمن در مخزن نتایج کیفیت را در اندازه‌ها دنبال می‌کنند.

بخشی از یک موج محلی-AI بزرگتر

استراتا در میان شتاب شتاب برای استنتاج محلی وارد می شود. خانواده Qwen علی‌بابا به پربارگیری‌ترین خط مدل وزن باز تبدیل شده است، متا و گوگل مدل‌های رقابتی منبع باز خود را دارند و موجی از ابزارها اکنون به مصرف‌کنندگان اجازه می‌دهد دستیارهای توانا را بدون اشتراک یا خروج داده از دستگاه خود اجرا کنند.

این پروژه همچنین نشان می دهد که چگونه تعریف "سخت افزار مصرف کننده" در حال تغییر است. یک کارت گرافیک میان رده 2026 با 12 گیگابایت VRAM، که عمدتاً برای بازی عرضه می شد، اکنون یک شتاب دهنده استنتاج مناسب برای مدلی در کلاس اندازه است که فقط دو سال پیش سیستم های مرزی را تعریف کرد.

Strata نرم‌افزار اولیه باقی مانده است - ردیاب مخزن لبه‌های ناهموار را روی GPUهای قدیمی‌تر و پردازنده‌های غیر AVX2 مستند می‌کند - اما این پروژه دارای مجوز MIT، رایگان و در فضای باز است و با پشتیبانی آزمایشی از Intel Arc، کارت‌های قدیمی‌تر Tesla و Radeon و ریگ‌های چند GPU مستند شده توسط اعضای انجمن است.

برای توسعه‌دهندگان، عملی‌ترین راهکار ممکن است سازگاری Localhost API باشد: هر اسکریپت یا عاملی که بر خلاف OpenAI یا Anthropic SDK نوشته شده است را می‌توان با تغییر URL پایه به یک استقرار محلی Qwen هدایت کرد، و Strata را به گزینه‌ای کم اصطکاک برای نمونه‌سازی حساس به حریم خصوصی، استفاده آفلاین یا صرفاً محدود کردن هزینه API تبدیل کرد.

چگونه آن را امتحان کنیم

برای شروع نیازی به جلسه ترمینال با دفترچه راهنما ندارد. نصب‌کننده درایورها، وزن‌های مدل و سرور محلی را در یک پاس فراهم می‌کند، و مخزن شامل یک فایل راه‌اندازی طراحی شده است که مستقیماً در یک دستیار کدنویسی هوش مصنوعی قرار می‌گیرد، که سپس دستگاه را به‌طور مستقل پیکربندی می‌کند. در حالی که وزنه ها از دیسک بارگیری می شوند، اولین پرتاب ها کندتر هستند. این مستندات یک SSD را توصیه می‌کند و هشدار می‌دهد که مکالمات طولانی کار بیشتری را روی رم سیستم تغییر می‌دهد.

از هوش مصنوعی جلوتر بمانید

[AI Buzz Wire] (https://aibuzzwire.news) را برای آخرین مدل‌های منبع باز، ابزارهای محلی هوش مصنوعی و سخت‌افزار استنتاج دنبال کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →