Группа исследователей продемонстрировала общий метод обучения фотонных интегральных схем непосредственно на физическом чипе — шаг, который может превратить оптические процессоры из фиксированных заранее спроектированных ускорителей в аппаратное обеспечение, которое обучается после того, как оно создано. Работа, опубликованная в журнале Nature Computational Science, резюмируется в сопутствующем обзоре под названием «Фотонные схемы становятся обучаемым оборудованием ИИ».
Метод, получивший название INSPIRE (сокращение от «на кристалле, физический градиентный спуск на месте»), устраняет одно из центральных узких мест в фотонных вычислениях для искусственного интеллекта: хотя фотонные процессоры обещают значительный прирост в скорости и энергоэффективности, их обучение по-прежнему ограничивается цифровым моделированием, которое требует дорогостоящего физического моделирования и страдает от ошибок, вызванных изготовлением. Подробнее об этой истории — в нашем новости об ИИ.
Почему фотонные чипы искусственного интеллекта трудно обучать
Большинство нейронных сетей сегодня обучаются на цифровом оборудовании, где градиенты могут быть точно вычислены. Фотонные схемы устроены по-другому: свет интерферирует, рассеивается и образует пары таким образом, что его трудно идеально смоделировать, а небольшие производственные различия означают, что чип в лаборатории редко ведет себя точно так же, как его цифровой двойник. Обучение сети в автономном режиме и последующая передача параметров на чип означает принятие несоответствия, которое снижает точность.
Предыдущие исследования помогли решить эту проблему. Исследования продемонстрировали обратное распространение ошибки in situ и измерение градиента в фотонных нейронных сетях, а в 2024 году исследователи внедрили обучение в прямом режиме для оптических нейронных сетей, чтобы уменьшить зависимость от эмуляции цифровой модели. Новая работа расширяет эту линию, утверждая, что метод является общим для всех схемных архитектур, а не адаптирован к одной конструкции.
Как работает INSPIRE
Согласно документу, INSPIRE использует встроенную в кристалл синтетическую голографию обращения времени для измерения полных сложных полей двунаправленных фотонных мод. Это измерение позволяет самой схеме рассчитывать градиенты и обновлять свои собственные параметры, не требуя полной цифровой модели чипа.
Практические последствия значительны. Поскольку вычисление градиента происходит внутри физической системы, различные топологии схем могут быть обучены после изготовления, а аппаратное обеспечение может выполнять матричное проектирование, многоволновые вычисления и быстрое метаобучение без точной цифровой копии. В традиционных рабочих процессах каждый из этих шагов будет зависеть от точности моделирования, которую не могут гарантировать реальные чипы.
Платформа описывается как независимая от топологии, что означает, что она работает с различными конструкциями оптических схем, а не с одной индивидуальной компоновкой. Поскольку градиенты измеряются физически, сеть можно обучать после изготовления, поглощая те самые производственные несовершенства, которые в противном случае считались бы шумом.
Результаты
Сообщаемые цифры являются конкретными. В экспериментах метод давал обученные матрицы с относительной погрешностью 0,26%. Команда также продемонстрировала обучение на месте с помощью рассеивающей среды для матриц, превышающих количество собственных настраиваемых элементов в схеме — эффективное обучение с меньшим количеством физических элементов управления, чем номинально требует задача.
Пожалуй, самое поразительное то, что исследователи показали, что метафотонные схемы могут выполнять метаобучение на месте, реализуя то, что они называют однократным фотонным обучением, с 251-кратным сжатием модели и 136-кратным ускорением обучения для конкретных задач. В сопутствующем описании добавляется, что аппаратное обеспечение обеспечивает матричную конструкцию, многоволновые вычисления и быстрое метаобучение без полной цифровой модели схемы.
Почему это важно
Энергетический аппетит ИИ является одним из наиболее острых ограничений отрасли, и оптические вычисления уже давно предлагаются как способ выполнения матричного умножения — основной операции нейронных сетей — с гораздо меньшим энергопотреблением, чем у электронных процессоров. Оптические чипы от стартапов и академических групп уже продемонстрировали впечатляющую производительность вывода. Однако обучение остается цифровым: чип управляет сетью, но обучение происходит на графических процессорах, имитирующих ее.
Практический метод обучения на месте закроет этот пробел, позволяя фотонным системам адаптироваться к новым задачам на самом оборудовании. Это также может снизить стоимость развертывания фотонных ускорителей, поскольку чипам больше не нужно будет точно определять характеристики и компенсировать их перед использованием. Авторы формулируют свою работу как предложение «практического пути к адаптивным и эффективным интеллектуальным фотонным системам».
Предостережения
Результаты получены в результате контролируемых лабораторных демонстраций, и краткое изложение статьи не претендует на готовность к производству. Масштабирование обучения на кристалле от продемонстрированных размеров матриц до масштабов передовых нейронных сетей остается открытой инженерной задачей, как и интеграция измерительного аппарата — синтетической голографии с обращением времени — в компактные, массово производимые корпуса. Реальные развертывания также должны будут доказать надежность при перепадах температуры и старении компонентов, условиях, когда фотонные системы, как известно, дрейфуют.
Тем не менее, публикация знаменует собой заметный сдвиг в акцентах в этой области: от разработки более совершенных фотонных схем к предоставлению фотонным схемам возможности проектировать себя самостоятельно, по крайней мере, в узком смысле настройки своих собственных параметров. Если последующая работа воспроизведет результаты в большем масштабе, энергетическая аргументация в пользу оптического оборудования искусственного интеллекта станет существенно сильнее.
Базовое исследование «Фотонное нейроморфное обучение посредством обобщенного физического градиентного спуска in situ», проведенное Тянькуан Чжоу, Юн Чжао, Шанлун Ли, Гочэн Шао, Руки Хуангом и Лу Фаном, опубликовано в журнале Nature Computational Science.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →