Команда дослідників продемонструвала загальний метод навчання фотонних інтегральних схем безпосередньо на фізичному чіпі, крок, який може перетворити оптичні процесори з фіксованих, попередньо розроблених прискорювачів на апаратне забезпечення, яке навчається після того, як воно буде створено. Робота, опублікована в Nature Computational Science, підсумована в супровідному короткому описі під назвою «Фотонні схеми стають апаратним забезпеченням ШІ, яке можна навчити».
Метод під назвою INSPIRE — скорочення від on-chip, in situ physical gradient descent — усуває одне з центральних вузьких місць у фотонних обчисленнях для штучного інтелекту: хоча фотонні процесори обіцяють значні переваги у швидкості та енергоефективності, їх навчання в основному обмежується цифровим моделюванням, яке потребує дорогого фізичного моделювання та страждає від помилок, спричинених виготовленням. For more context on this story, see our ongoing AI news.
Чому фотонні мікросхеми ШІ важко навчити
Більшість нейронних мереж сьогодні навчаються на цифровому обладнанні, де можна точно обчислити градієнти. Фотонні схеми відрізняються: світло заважає, розсіюється та поєднується таким чином, що його важко ідеально змоделювати, а невеликі варіації виробництва означають, що чіп у лабораторії рідко поводиться так само, як його цифровий двійник. Навчання мережі в автономному режимі, а потім передача параметрів на чіп означає прийняття невідповідності, що погіршує точність.
Попередні дослідження дозволили вирішити цю проблему. Дослідження продемонстрували зворотне поширення на місці та вимірювання градієнта у фотонних нейронних мережах, а в 2024 році дослідники запровадили повне навчання прямого режиму для оптичних нейронних мереж, щоб зменшити залежність від емуляції цифрової моделі. Нова робота розширює цю лінію, заявляючи про метод, який є загальним для схемних архітектур, а не пристосований до однієї конструкції.
Як працює INSPIRE
Згідно з документом, INSPIRE використовує вбудовану в чіп синтетичну голографію зі зворотним часом для вимірювання повного комплексу полів двонаправлених фотонних мод. Це вимірювання дозволяє схемі самій обчислювати градієнти та оновлювати власні параметри, не вимагаючи повної цифрової моделі чіпа.
Практичні наслідки значні. Оскільки градієнтне обчислення відбувається всередині фізичної системи, різноманітні топології схем можна навчити після виготовлення, а апаратне забезпечення може обробляти матричне проектування, багатохвильове обчислення та швидке метанавчання без точної цифрової копії. У звичайних робочих процесах кожен із цих кроків залежатиме від точності моделювання, яку реальні чіпи не можуть гарантувати.
Фреймворк описується як незалежний від топології, що означає, що він працює з різноманітними конструкціями оптичних схем, а не з одним індивідуальним макетом. Оскільки градієнти вимірюються фізично, мережу можна навчити після виготовлення, поглинаючи самі виробничі недоліки, які інакше вважалися б шумом.
Результати
Наведені цифри є конкретними. В експериментах метод дав навчені матриці з відносною похибкою 0,26%. Команда також продемонструвала навчання на місці за допомогою середовища розсіювання для матриць, які перевищують кількість власних регульованих елементів у схемі — ефективне навчання з меншою кількістю фізичних елементів керування, ніж номінально вимагає проблема.
Можливо, найбільш вражаючим є те, що дослідники показали, що мета-фотонні схеми можуть виконувати мета-навчання на місці, реалізуючи те, що вони описують як одномоментне фотонне навчання з 251-кратним стисненням моделі та 136-кратним прискоренням навчання для конкретного завдання. У супровідному описі додається, що апаратне забезпечення забезпечує матричний дизайн, багатохвильове обчислення та швидке метанавчання без повної цифрової моделі схеми.
Чому це важливо
Енергоапетит штучного інтелекту є одним із найгостріших обмежень галузі, і оптичні обчислення давно пропонувалися як спосіб запуску множення матриць — основної роботи нейронних мереж — з набагато меншою потужністю, ніж електронні процесори. Оптичні чіпи від стартапів і академічних груп вже продемонстрували вражаючу пропускну здатність висновків. Навчання, однак, залишилося цифровим: чіп керує мережею, але навчання відбувається на графічних процесорах, які її імітують.
Практичний метод навчання на місці міг би усунути цю прогалину, дозволивши фотонним системам адаптуватися до нових завдань на самому обладнанні. Це також може знизити вартість розгортання фотонних прискорювачів, оскільки чіпи більше не потребуватимуть ідеальної характеристики та компенсації перед використанням. Автори описують роботу як пропозицію «практичний шлях до адаптивних та ефективних інтелектуальних фотонних систем».
Застереження
Результати отримані в результаті контрольованих лабораторних демонстрацій, і в короткому звіті газети не стверджується про готовність до виробництва. Масштабування навчання на чіпі від продемонстрованих розмірів матриці до масштабу граничних нейронних мереж залишається відкритою інженерною проблемою, так само як і інтеграція вимірювального апарату — синтетичної голографії з реверсом часу — у компактні пакети, які можна масово виготовляти. Розгортання в реальному світі також потребує доведення надійності в умовах перепадів температури та старіння компонентів, умов, коли, як відомо, фотонні системи дрейфують.
Тим не менш, публікація відзначає значне зміщення акцентів у галузі: від розробки кращих фотонних схем до дозволу фотонним схемам проектувати себе, принаймні у вузькому сенсі налаштування власних параметрів. Якщо подальша робота відтворює результати у більшому масштабі, енергетичний аргумент для апаратного забезпечення оптичного штучного інтелекту стає значно сильнішим.
Дослідження, що лежить в основі, «Фотонічне нейроморфне навчання за допомогою узагальненого фізичного градієнтного спуску in situ» Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang і Lu Fang, опубліковано в Nature Computational Science.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →