本周黑客新闻上流传着一个小而引人注目的项目:openTPU,一个开源人工智能加速器,其硬件设计本身是由人工智能代理生产的。该存储库在 GitHub 上根据 Apache 2.0 许可证发布,描述了其作者所称的“由 AI 开发的开源 AI 加速器”——与该类型的大多数演示不同,它在物理卡上运行真实的生产模型,并在物理卡上运行真实的权重,爱好者可以端到端地研究。

用其自述文件的话说,该项目提出了两个问题:人工智能代理在硬件设计方面能走多远,以及它们能否构建运行自己推理的芯片?第二个问题颇具挑衅性。设计芯片(或者在本例中为 FPGA 比特流)的人工智能系统会生成自己的代币,这是一个循环,可以准确捕捉行业想象力的发展方向。 更多相关背景,请参阅我们的人工智能资讯。

卡上实际运行的内容

按照数据中心标准,硬件目标并不引人注目:围绕 Xilinx Kintex-7 xc7k480t FPGA 构建的浪潮 YPCB-00338 卡,具有两个 DDR3 通道和 17.1 GB/s 峰值内存带宽。这与 HBM 堆叠加速器相去甚远,后者使结果更加有趣,而不是更少。

根据该项目公布的测量结果,该设计运行了十个现代开放模型及其真实重量。 LFM2.5-230M 在 int8 中每秒解码 59 个令牌,在 4 位中每秒解码 85.8 个令牌。 Qwen3-0.6B 每秒管理 21.6 个令牌,而较大的模型按预期缩小:SmolLM3-3B 每秒 5 个令牌 int8,Phi-4-mini (3.8B) 每秒 4 个令牌,Qwen3.5-4B 每秒 5.9 个令牌(4 位)。 Gemma 4 E2B 和 E4B 也会运行,将它们的每层嵌入表保留在卡上。

该团队进一步采用了超过该卡 4 GiB DRAM 的专家混合模型。 LFM2.5-8B-A1B — 85 亿个参数,其中 17 亿个活动参数 — 由来自主机存储的流专家每秒解码 10.6 个令牌,其中 98.5% 的专家使用命中卡插槽,每个令牌仅传输 5.2 MB。 Qwen3.5-35B-A3B 的运行速度为每秒 3.95 个令牌,同时通过 PCIe 传输每个令牌 153 MB 的数据。自述文件指出,每个配置都与项目的模拟器令牌相匹配——硬件黑客将认为这是工作中最困难的部分。

像真正的硅项目一样构建

openTPU 与典型业余爱好 FPGA 演示的区别在于堆栈的完整性。 monorepo 包含 SystemVerilog 硬件设计、自定义指令集、位精确模拟器、带有自己的编译器的内核语言以及驱动 PCIe 卡的主机软件,包括遵循 nvidia-smi 精神的 otpu-smi 监控实用程序和 otpu-chat 演示。

生产映像运行一个四列脉动矩阵单元和一个 133.33 MHz 的流引擎,并由内存核心内的小型 CPU 校准 LiteDRAM 内存控制器 - 该卡可在 12 秒内校准两个 DDR3 通道,无需主机参与。目前的版本自 10 月 1 日起部署,对多个模型的解码速度比之前的图像快 8% 到 10%,同时将 DRAM 利用率提高到峰值的 91%-94%。

该项目还记录了基于 FP4 值构建的 4 位权重格式,具有每个权重 4.25 位的两级块尺度,将语言模型头保持在 int8 中以确保准确性。在某些型号上,该格式将每个令牌的字节数减少了大约三分之一,并将解码速度提高了 40% 到 45%。

自述文件将该项目的方法归功于早期存储库 auto-arch-tournament 的经验教训,该存储库探索了人工智能驱动的硬件架构搜索。 openTPU 将该方法应用于完整的加速器,在接触硬件之前,代理的设计会针对模拟器进行验证。

为什么它很重要

这里的性能不会给Nvidia带来麻烦。采用 DDR3 的 Kintex-7 是具有十年历史的硬件,它运行的模型很小。但这就是该项目隐含的要点:整个加速器——RTL、指令集、模拟器、编译器和主机堆栈——在一个存储库中对一个人来说是清晰的,并且它至少部分是由人工智能代理而不是硬件团队设计的。

这个想法汇聚了三种潮流。首先,开源人工智能硬件长期以来一直因所需专业知识的广泛性而受到阻碍;代理驱动的设计流程降低了这一障碍。其次,推理需求正在推动研究人员转向奇异的专用硬件,而自动化设计搜索非常适合探索该领域。第三,自托管的角度——人工智能构建其运行的机器——已经成为社区密切关注的一个信号,从该项目在 Hacker News 上的迅速崛起来看,该项目在几个小时内就获得了超过 150 个点。

该存储库于 9 月 24 日创建,并于 10 月 2 日收到最新推送,测量结果最早可追溯到 10 月 1 日——这一发展速度本身就值得关注。对于任何想要了解 AI 加速器如何从 Python 中的矩阵乘法一直到线路工作的人来说,该项目自己的框架是准确的:整个内容都存在于一个小型 monorepo 中,您可以从头到尾阅读。

无论代理设计的硬件成为一个重要的利基市场还是仍然是一个研究好奇心,openTPU 都展示了一些具体的东西:让人工智能模型编写软件的工具现在已经产生了一个运行这些相同模型的有效的、经过验证的硬件系统。至少在 FPGA 规模上,该循环是闭合的。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →