Zespół badaczy zademonstrował ogólną metodę uczenia fotonicznych układów scalonych bezpośrednio na fizycznym chipie, co może przekształcić procesory optyczne ze stałych, wstępnie zaprojektowanych akceleratorów w sprzęt, który uczy się po zbudowaniu. Wyniki pracy, opublikowane w czasopiśmie Nature Computational Science, podsumowano w towarzyszącym skrócie zatytułowanym „Obwody fotoniczne stają się możliwym do wyszkolenia sprzętem AI”.
Metoda o nazwie INSPIRE — skrót od fizycznego gradientu na chipie, in situ — usuwa jedno z głównych wąskich gardeł w obliczeniach fotonicznych na potrzeby sztucznej inteligencji: chociaż procesory fotoniczne obiecują znaczny wzrost szybkości i efektywności energetycznej, ich szkolenie w dużej mierze ogranicza się do symulacji cyfrowych, które wymagają kosztownego modelowania fizycznego i charakteryzują się błędami wynikającymi z produkcji. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.
Dlaczego fotoniczne chipy AI są trudne do wytrenowania
Większość dzisiejszych sieci neuronowych jest trenowana na sprzęcie cyfrowym, na którym można dokładnie obliczyć gradienty. Obwody fotoniczne są różne: światło zakłóca, rozprasza i łączy w sposób trudny do idealnego modelowania, a drobne różnice produkcyjne oznaczają, że chip w laboratorium rzadko zachowuje się dokładnie tak, jak jego cyfrowy bliźniak. Uczenie sieci w trybie offline, a następnie przesyłanie parametrów do chipa oznacza zaakceptowanie niedopasowania, które pogarsza dokładność.
Poprzednie badania rozwiązały problem. Badania wykazały propagację wsteczną i pomiar gradientu in situ w fotonicznych sieciach neuronowych, a w 2024 r. badacze wprowadzili szkolenie w trybie pełnego przesyłania do przodu dla optycznych sieci neuronowych, aby zmniejszyć zależność od emulacji modelu cyfrowego. Nowa praca rozszerza tę linię, twierdząc, że jest to metoda ogólna dla różnych architektur obwodów, a nie dostosowana do jednego projektu.
Jak działa INSPIRE
Według artykułu INSPIRE wykorzystuje syntetyczną holografię z odwróceniem czasu na chipie do pomiaru pełnych zespolonych pól dwukierunkowych modów fotonicznych. Pomiar ten pozwala samemu obwodowi obliczać gradienty i aktualizować własne parametry, bez konieczności tworzenia w pełni cyfrowego modelu chipa.
Konsekwencja praktyczna jest znacząca. Ponieważ obliczenia gradientu odbywają się w systemie fizycznym, po wyprodukowaniu można trenować różnorodne topologie obwodów, a sprzęt radzi sobie z projektowaniem macierzy, obliczeniami na wielu długościach fal i szybkim metauczeniem bez wiernej repliki cyfrowej. W konwencjonalnych procesach każdy z tych etapów zależałby od dokładności symulacji, której nie mogą zagwarantować rzeczywiste chipy.
Struktura jest opisana jako niezależna od topologii, co oznacza, że współpracuje z różnymi projektami obwodów optycznych, a nie z pojedynczym, dostosowanym do indywidualnych potrzeb układem. Ponieważ gradienty są mierzone fizycznie, sieć można trenować po wyprodukowaniu, absorbując niedoskonałości produkcyjne, które w przeciwnym razie byłyby uznawane za szum.
Wyniki
Podane liczby są konkretne. W eksperymentach metoda dała wytrenowane macierze z błędem względnym wynoszącym 0,26%. Zespół zademonstrował także szkolenie in situ za pomocą mediów rozpraszających dla macierzy większych niż liczba natywnych przestrajalnych elementów w obwodzie — efektywne uczenie się przy mniejszej liczbie fizycznych elementów sterujących, niż nominalnie wymaga tego problem.
Być może najbardziej uderzające jest to, że badacze wykazali, że obwody meta-fotoniczne mogą przeprowadzać metauczenie się in situ, realizując to, co określają jako jednorazowe uczenie się fotoniczne z 251-krotną kompresją modelu i 136-krotnym przyspieszeniem treningu specyficznego dla zadania. W dokumencie towarzyszącym dodano, że sprzęt umożliwia projektowanie matryc, obliczenia na wielu długościach fali i szybkie metauczenie się bez w pełni cyfrowego modelu obwodu.
Dlaczego to ma znaczenie
Apetyt na energię sztucznej inteligencji jest jednym z najpilniejszych ograniczeń w branży, a obliczenia optyczne od dawna są proponowane jako sposób wykonywania mnożenia macierzy – podstawowego działania sieci neuronowych – przy znacznie niższym poborze mocy niż procesory elektroniczne. Chipy optyczne start-upów i grup akademickich wykazały już imponującą przepustowość wnioskowania. Szkolenie pozostało jednak cyfrowe: chip obsługuje sieć, ale nauka odbywa się na symulujących ją procesorach graficznych.
Praktyczna metoda szkolenia in situ wypełniłaby tę lukę, umożliwiając systemom fotonicznym dostosowanie się do nowych zadań na samym sprzęcie. Mogłoby to również obniżyć koszty wdrażania akceleratorów fotonicznych, ponieważ chipy nie musiałyby już być doskonale charakteryzowane i kompensowane przed użyciem. Autorzy określają tę pracę jako oferującą „praktyczną drogę do adaptacyjnych i wydajnych inteligentnych systemów fotonicznych”.
Zastrzeżenia
Wyniki pochodzą z kontrolowanych demonstracji laboratoryjnych, a podsumowanie artykułu nie zawiera informacji o gotowości do produkcji. Skalowanie uczenia na chipie z zademonstrowanych rozmiarów matryc do skali pionierskich sieci neuronowych pozostaje otwartym wyzwaniem inżynieryjnym, podobnie jak integracja aparatu pomiarowego — syntetycznej holografii z odwróceniem czasu — w kompaktowe, nadające się do masowej produkcji obudowy. Wdrożenia w świecie rzeczywistym musiałyby również wykazać niezawodność w przypadku wahań temperatury i starzenia się komponentów, czyli warunków, w których systemy fotoniczne dryfują.
Mimo to publikacja ta oznacza zauważalną zmianę akcentu w tej dziedzinie: od projektowania lepszych obwodów fotonicznych do umożliwienia obwodom fotonicznym samodzielnego projektowania, przynajmniej w wąskim znaczeniu dostrajania własnych parametrów. Jeśli dalsze prace odtworzą wyniki na większą skalę, argumenty energetyczne dotyczące sprzętu optycznego AI staną się znacznie silniejsze.
Podstawowe badanie pt. „Fotoniczne uczenie się neuromorficzne poprzez uogólnione opadanie gradientu fizycznego in situ” przeprowadzone przez Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang i Lu Fang zostało opublikowane w czasopiśmie Nature Computational Science.
---
Bądź na Bieżąco z AINajnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.
Czytaj więcej wiadomości AI →