一个鲜为人知的开源项目 Strata 正在风靡一时。这款获得麻省理工学院许可的引擎在普通游戏 PC 上运行阿里巴巴的 Qwen3.8-Flash-Next(一个 1250 亿参数的专家混合模型),于 10 月 4 日以超过 640 个点登上了《黑客新闻》的头版,自 9 月 24 日创建以来,其 GitHub 存储库已获得超过 11,000 颗星。
其宣传很简单:通常存在于服务器上的 1250 亿个参数模型可以完全在消费类显卡上聊天、编写代码、读取图像并驱动编码代理,而无需离开机器。
Strata 实际上是做什么的
Strata 既是一个推理引擎,也是一个适用于 Windows 和 Linux 的一键安装程序。根据其文档,按照前沿模型标准,这些要求是适度的:GPU 具有至少 12GB VRAM(来自 NVIDIA 的 RTX 20、30、40 或 50 系列或 AMD 的 Radeon RX 6000、7000 或 9000 系列)、至少 32GB 的系统 RAM 和大约 80GB 的可用 SSD 空间。
该引擎提供 Qwen3.8-Flash-Next 的量化版本,具有多个压缩级别(从 Q2_0 到 IQ3_S),以及代码专用变体。它在本地主机上公开 OpenAI 和 Anthropic 兼容的 API,这意味着为 ChatGPT 或 Claude 构建的工具(包括 Claude Code、Cursor 和 Codex 等编码代理)可以通过最小的更改指向本地服务器。包括可选的图像输入和多 GPU 支持,安装程序甚至提供人工智能辅助设置模式,让编码助手通过单个粘贴的提示配置机器。
速度数字
该项目发布的基准测试是在两台消费者台式机上进行测量的,这是该版本广泛传播的原因。 Strata 报告称,在配备 12GB VRAM 的 NVIDIA RTX 5070 搭配 Ryzen 5 7600 和 64GB RAM 的情况下:
- Q2_0 量化: 每秒生成 94 个令牌,每秒 2,650 个令牌用于快速处理 32K 令牌文档
- IQ3_S: 第二代 53 个令牌,每秒提示处理 1,620 个令牌
- 编码器变体: 每第二代 55 个代币
在 AMD 方面,具有 16GB VRAM 的 RX 9070 XT 在 Q2_0 每秒管理 60 个令牌。该文档估计,具有 24GB VRAM 的 RTX 3090 应该达到每秒 100 到 140 个令牌——比大多数人的阅读速度还要快。
相比之下,六个月前,即使以可用速度在本地运行 700 亿个参数的密集模型,也需要一个具有数百 GB 统一内存或激进的推测解码技巧的工作站。
为什么 125B 型号适合游戏卡
两项技术使这成为可能。首先是模型本身。正如 AI Buzz Wire 在其发布时所介绍的那样,Qwen3.8-Flash-Next 是一个专家混合架构,总参数大约为 1250 亿个,但每个代币只有大约 60 亿个活跃值,因此每个生成的单词都会触及网络的一小部分,从而大大减少了每个代币的计算量。
第二是量化。 Strata 最快的预设将模型的权重压缩到每个参数两位或三位,以一定的精度换取适合 12GB GPU 和系统 RAM 的占用空间。这种权衡是主要的警告:Q2 级和 IQ2 级定量分析人员在推理繁重的任务上会显着降低质量,购买者应该将总体速度数据视为起点,而不是每个工作负载的保证。存储库中的社区基准页面跟踪不同规模的质量结果。
更大的本地人工智能浪潮的一部分
Strata 在本地推理加速发展的势头中应运而生。阿里巴巴的 Qwen 系列已成为下载次数最多的开放重量模型系列,Meta 和 Google 也开源了自己的竞争模型,现在一系列工具让消费者无需订阅或数据离开设备即可运行功能强大的助手。
该项目还反映了“消费硬件”定义的转变。具有 12GB VRAM 的中档 2026 显卡主要用于游戏,现在对于两年前定义前沿系统的尺寸级别模型来说是可行的推理加速器。
Strata 仍然是早期软件——存储库的问题跟踪器记录了旧版 GPU 和非 AVX2 处理器上的粗糙边缘——但该项目是 MIT 许可的、免费的,并且是开放开发的,并为 Intel Arc、旧版 Tesla 和 Radeon 卡以及社区成员记录的多 GPU 设备提供实验支持。
对于开发人员来说,最实际的收获可能是本地主机 API 兼容性:任何针对 OpenAI 或 Anthropic SDK 编写的脚本或代理都可以通过更改基本 URL 重定向到本地 Qwen 部署,从而使 Strata 成为隐私敏感原型设计、离线使用或简单限制 API 支出的低摩擦选项。
如何尝试
入门不需要终端会话和手册。安装程序一次性配置驱动程序、模型权重和本地服务器,存储库包含一个设置文件,旨在直接粘贴到 AI 编码助手中,然后由 AI 编码助手自主配置机器。当权重从磁盘加载时,首次启动速度较慢;该文档建议使用 SSD,并警告长时间对话会将更多工作转移到系统 RAM 上。
保持人工智能领先关注 AI Buzz Wire,了解有关开源模型、本地 AI 工具和推理硬件的最新信息。
阅读更多人工智能新闻 →