一组研究人员展示了一种直接在物理芯片上训练光子集成电路的通用方法,这一步骤可以将光学处理器从固定的、预先设计的加速器转变为在构建后可以学习的硬件。这项发表在《自然计算科学》上的研究成果在题为“光子电路成为可训练的人工智能硬件”的配套简报中进行了总结。

这种方法被称为 INSPIRE(片上原位物理梯度下降的缩写),解决了人工智能光子计算的核心瓶颈之一:尽管光子处理器承诺在速度和能源效率方面取得重大进展,但它们的训练仍然主要局限于数字模拟,需要昂贵的物理建模并遭受制造引起的错误。 更多相关背景,请参阅我们的人工智能资讯。

为什么光子 AI 芯片难以训练

如今,大多数神经网络都是在数字硬件上进行训练的,可以精确计算梯度。光子电路则不同:光以难以完美建模的方式发生干涉、散射和耦合,而微小的制造差异意味着实验室中的芯片很少表现得与其数字孪生完全相同。离线训练网络,然后将参数传输到芯片上意味着接受会降低准确性的不匹配。

之前的研究已经解决了这个问题。研究已经证明了光子神经网络中的原位反向传播和梯度测量,并且在 2024 年,研究人员为光学神经网络引入了完全前向模式训练,以减少对数字模型仿真的依赖。这项新工作扩展了这一路线,声称一种跨电路架构通用的方法,而不是针对一种设计定制的方法。

INSPIRE 的工作原理

根据该论文,INSPIRE 使用片上合成时间反转全息术来测量双向光子模式的完整复杂场。该测量允许电路本身计算梯度并更新其自身参数,而不需要芯片的完整数字模型。

实际效果是显着的。由于梯度计算发生在物理系统内部,因此可以在制造后训练不同的电路拓扑,并且硬件可以处理矩阵设计、多波长计算和快速元学习,而无需忠实的数字复制品。在传统的工作流程中,每一个步骤都取决于现实芯片无法保证的模拟精度。

该框架被描述为与拓扑无关,这意味着它适用于多种光电路设计,而不是单一的定制布局。由于梯度是物理测量的,因此网络可以在制造后进行训练,吸收原本会被视为噪声的制造缺陷。

结果

报告的数字是具体的。在实验中,该方法产生的训练矩阵的相对误差为0.26%。该团队还演示了通过对大于电路中本地可调谐元件数量的矩阵进行散射介质进行原位训练——用比问题名义上需要的更少的物理控制来有效地学习。

也许最引人注目的是,研究人员表明元光子电路可以执行原位元学习,实现他们所描述的具有 251 倍模型压缩和 136 倍特定任务训练加速的单次光子学习。随附的简介补充说,该硬件无需完整的电路数字模型即可实现矩阵设计、多波长计算和快速元学习。

为什么它很重要

人工智能的能源需求是该行业最紧迫的限制之一,长期以来,光学计算一直被认为是一种运行矩阵乘法(神经网络的核心运算)的方法,其功耗远低于电子处理器。来自初创公司和学术团体的光学芯片已经展示了令人印象深刻的推理吞吐量。然而,训练仍然是数字化的:芯片运行网络,但学习发生在模拟它的 GPU 上。

实用的原位训练方法将缩小这一差距,让光子系统适应硬件本身的新任务。它还可以降低部署光子加速器的成本,因为芯片在使用前不再需要进行完美的表征和补偿。作者将这项工作定义为“一条通往自适应和高效智能光子系统的实用途径”。

注意事项

结果来自受控实验室演示,论文摘要并未声称已做好生产准备。将片上训练从演示的矩阵大小扩展到前沿神经网络的规模仍然是一个开放的工程挑战,将测量设备(合成时间反转全息术)集成到紧凑、可大规模制造的封装中也是如此。现实世界的部署还需要证明在温度波动和组件老化(已知光子系统会漂移的条件)下的可靠性。

尽管如此,该出版物仍然标志着该领域重点的显着转变:从设计更好的光子电路到让光子电路自行设计,至少在狭义上调整自身参数。如果后续工作能够在更大范围内重现结果,光学人工智能硬件的能源需求就会变得更加强劲。

基础研究“通过广义原位物理梯度下降进行光子神经形态学习”由周天匡、赵云、李尚龙、邵国成、黄如琪和方璐发表,发表在《自然计算科学》上。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →