一个新的开源项目因解决机器学习的一个顽固局限性而引起人们的关注:构建一种永不停止学习的语言模型。该项目被称为 mini-AGI,将自己描述为一个持续学习的字节级语言模型,它组装了自己的架构,在具有 8GB VRAM 的单个 GPU 上从头开始训练,并不断从它读取的所有内容中学习。

该项目周末出现在《黑客新闻》上,得分攀升至一百多分,其 GitHub 上的存储库是在 MIT 许可下发布的。根据该项目的自述文件,其目标是证明即使在普通的消费级硬件上,也可以从单个数据流中持续学习,而不会发生灾难性的遗忘。 更多相关背景,请参阅我们的AI行业报道

权重在磁盘上,而不是在 VRAM 中

迷你 AGI 背后的核心技巧是非常规的内存管理方案。系统不是将所有模型参数保存在 GPU 内存中,而是将其权重作为普通文件存储在磁盘上,并根据需要将其分页到显卡上。

该设计选择具有重要意义:模型的参数计数受可用磁盘空间而不是 VRAM 的限制。自述文件指出,该模型可以在训练时在容量不足时增加新容量,并修剪不需要的容量。训练和推理通过完全相同的代码路径运行,因此没有单独的微调机制,也没有冻结的基础模型——用该项目的话说,阅读和接受训练是同一事件。

该系统针对的是至少配备 8GB VRAM GPU 的 PC 或笔记本电脑,这是许多开发人员已经拥有的硬件。

为什么持续学习很难

目前可用的大多数语言模型都遵循相同的生命周期:实验室训练模型、冻结模型并发布模型。用户可以围绕边缘进行微调,但基本权重永远不会再改变。该项目的动机部分认为,这使得每个个人拥有的模型都是“别人的模型,上面只有一层薄薄的你”——一个在发布之日就停止学习的模型。

这个障碍是机器学习研究中众所周知的一个障碍:灾难性遗忘,神经网络在接受新数据训练时倾向于覆盖以前学到的知识。从日常信息流中不断学习的模型通常会降低它之前知道的所有内容。

自述文件概述了影响设计的约束。该模型必须适合 8GB 的​​ VRAM,而不是量化,因为训练需要梯度和优化器状态,​​这会增加大约三倍于权重本身的内存。它必须不要忘记,坚持已经学到的东西,同时从无休止的文本流中吸收新材料。

自行构建的字节级模型

mini-AGI 在字节级别而不是令牌上运行,一次读取一个块的字符流,并对每个块采取梯度步骤。该项目还表示,该模型“组装了自己的架构”,这与传统模型不同,传统模型的结构是在训练开始之前由创建者固定的。

该方法是有意进行实验的。这是训练制度的小规模示范,而不是对前沿系统的挑战。

重要注意事项

该项目的作者明确说明了系统的当前状态。用 README 自己的话来说,迷你 AGI 是“一个小型玩具级模型”,读者不应该期待前沿级的功能。这个练习的目的是表明,从单个数据流中持续学习而不发生灾难性遗忘是完全可能的——而且在几乎任何人都可以访问的硬件上也是可能的。

该模型的权重尚未公布。训练运行仍在完成对正在学习的语料库的第一次传递,作者表示,一旦完成,权重将被释放,按照目前的速度,还需要几周的时间。在此之前,观察者可以在项目页面上检查训练运行历史记录中的样本,以了解模型在阅读过程中如何改进。

为什么这很重要

如果随着模型扩展到更强大的尺寸,这种方法仍然有效,那么它就指向了一种不同类型的人工智能所有权:生活在你自己的机器上的个人模型,不断从你提供给它们的文档和数据中学习,并且永远不会因为供应商的发布时间表而冻结它们的权重。

该项目还提醒我们,人工智能领域并非所有有趣的工作都发生在前沿。凭借单个消费级 GPU、普通磁盘空间和 MIT 许可证,迷你 AGI 正试图回答大型实验室在很大程度上回避的一个问题——是否可以构建一个模型来学习人们的行为方式:从接下来遇到的任何事情中持续不断地学习。

代码和文档可在 GitHub 上获取,任何拥有兼容硬件、想要跟进、分叉项目或继续训练模型的人都可以在他们认为合适的情况下使用。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →