一个开源项目将 2890 万个参数的语言模型压缩到成本约为 8 美元的微控制器上,完全在芯片上以每秒约 9 个令牌的速度生成文本,而根本没有网络连接。该演示发布在 GitHub 上,并迅速登上了黑客新闻的头版,展示了小型本地人工智能的前沿在短时间内取得了多大进展。

这项工作以 ESP32-S3 为中心,这是一种深受爱好者和硬件制造商欢迎的廉价嵌入式芯片。不久前,在如此小的一块硅片上运行 2890 万个参数的模型似乎难以置信,而该项目生动地说明了我们在每日 AI 行业报道 中跟踪的设备上 AI 的更广泛推动。曾经认为云对于任何真正的语言模型都是必需的,而功能日益强大的系统正在边缘寻找家园。

构建背后的数字

该项目清楚地列出了其规格。该模型存储 2890 万个参数,其中约 2500 万个参数存储在闪存查找表中。它在 ESP32-S3 芯片上运行,具有 512KB 快速 SRAM、8MB PSRAM 和 16MB 闪存。实际上,它达到每秒大约 9.5 个令牌端到端,或每秒 9.7 个纯计算令牌,并且当以 4 位精度存储时,整个模型仅占用 14.9 兆字节。

最引人注目的是作者与先前作品的比较。已知在此类芯片上运行的最后一个语言模型仅包含 260,000 个参数。新版本的容量增加了大约一百倍,这种飞跃不是来自更大的芯片,而是来自重新思考模型数据的实际存储位置。

从 Gemma 借来的记忆技巧

核心问题是微控制器几乎没有快速存储器。 ESP32-S3 仅提供 512KB 的 SRAM,按照惯例,整个模型都需要从那里访问,这就是为什么之前的尝试停留在几十万个参数上。

解决方法基于简单的观察。大多数语言模型的参数都位于嵌入表中,模型从中读取而不是计算。因此,该项目并没有将巨大的 2500 万行表强行放入稀缺的快速内存中,而是将其保留在慢速闪存中,只提取每个令牌实际需要的少数行,一次大约 450 字节。执行实际计算的模型的一小部分保留在快速内存中,而大部分权重只是在闪存中等待,一次采样一点。

该技术被称为每层嵌入,它起源于 Google 的 Gemma 模型,特别是 Gemma 3n 和 Gemma 4,它是为手机和 GPU 设计的。据该项目的作者称,之前没有人在这么小的芯片上尝试过这种方法。

它能做什么,不能做什么

该模型是在 TinyStories(一个简单儿童故事数据集)上进行训练的,因此其能力被刻意缩小。它写的故事简短、基本连贯,但不会回答事实问题、遵循复杂的指令、编写代码或推理世界。作者坦率地说,这种限制源于模型的推理部分太小,而记忆技巧并不能改变它。

因此,该项目的有趣之处不是其输出质量,而是其架构。这一成就是将这么大的模型安装到这么小的芯片上,证明在手机和服务器上支持高效模型的相同技术可以一直推广到成本低于三明治的硬件。

为什么设备上的人工智能很重要

其影响远远超出了一个简洁的技术演示。由于该模型完全在芯片上运行,因此不会将任何内容发送到服务器。这意味着完全的隐私保护,没有数据离开设备,并且无需支付云费用。对于偏远地区、低功耗设备或连接不可靠的环境中的应用,这种组合确实非常有用。

它还指出了一个未来,小型的专业模型分布在数十亿廉价的嵌入式设备中,而不是集中在少数巨型数据中心中。同样的压力推动了人们对笔记本电脑和手机上的本地人工智能的兴趣,即更低的延迟、更低的成本和更强的隐私,在微控制器规模上的应用更加有力。

公开邀请进行修补

该项目是在 MIT 许可下发布的,作者在 GitHub 上分享了完整的代码以及详细的文档和基准测试结果。这种开放性意味着其他硬件开发人员可以研究该方法,将其应用于其他芯片,或者将参数数量推得更高。

该作品以 slvDev 名义发布,在开发者社区中引起了强烈反响,在 Hacker News 上获得了数百个点赞,并引发了关于该技术下一步可能走向何方的讨论。如果这种趋势持续下去,“语言模型”和普通嵌入式软件之间的界限将变得更加模糊。

保持人工智能领先地位

从 8 美元的芯片到价值数十亿美元的数据中心,人工智能在哪里运行的问题正变得与人工智能能做什么一样重要。硬件层的发展速度比大多数人意识到的要快,今天看起来很奇怪的项目往往定义了明天的主流。 在 AI Buzz Wire 上阅读更多人工智能新闻,关注边缘计算、模型效率和设备智能方面的每一次突破。

跟上人工智能硬件革命——访问 AI Buzz Wire