Ett team av forskare har demonstrerat en generell metod för att träna fotoniska integrerade kretsar direkt på det fysiska chippet, ett steg som kan förvandla optiska processorer från fasta, fördesignade acceleratorer till hårdvara som lär sig efter att den byggts. Arbetet, publicerat i Nature Computational Science, sammanfattas i en följeslagare med titeln "Photonic circuits become trainable AI hardware."

Metoden, kallad INSPIRE – kort för on-chip, in situ fysisk gradientnedstigning – adresserar en av de centrala flaskhalsarna inom fotonisk beräkning för artificiell intelligens: även om fotoniska processorer lovar stora vinster i hastighet och energieffektivitet, har deras träning i stort sett förblivit begränsad till digitala simuleringar som kräver kostsam fysisk modellering och lider av feltillverkning. For more context on this story, see our ongoing artificial intelligence updates.

Varför Photonic AI-chips är svåra att träna

De flesta neurala nätverk är idag tränade på digital hårdvara, där gradienter kan beräknas exakt. Fotoniska kretsar är olika: ljus stör, sprider och kopplar ihop sig på sätt som är svåra att modellera perfekt, och små tillverkningsvariationer gör att ett chip i labbet sällan beter sig exakt som sin digitala tvilling. Att träna nätverket offline och sedan överföra parametrarna till chippet innebär att man accepterar en missmatchning som försämrar noggrannheten.

Tidigare forskning har identifierat problemet. Studier har visat in situ backpropagation och gradientmätning i fotoniska neurala nätverk, och 2024 introducerade forskare helt framåtriktad träning för optiska neurala nätverk för att minska beroendet av digital modellemulering. Det nya arbetet utökar denna linje genom att hävda en metod som är allmän över kretsarkitekturer snarare än skräddarsydd för en design.

Hur INSPIRE fungerar

Enligt tidningen använder INSPIRE syntetisk tidsomvänd holografi på chip för att mäta de fullständiga komplexa fälten av dubbelriktade fotoniska lägen. Den mätningen gör att kretsen själv kan beräkna gradienter och uppdatera sina egna parametrar, utan att kräva en fullständig digital modell av chippet.

Den praktiska konsekvensen är betydande. Eftersom gradientberäkningen sker inuti det fysiska systemet, kan olika kretstopologier tränas efter tillverkning, och hårdvaran kan hantera matrisdesign, multivåglängdsberäkning och snabb meta-inlärning utan en trogen digital replika. I konventionella arbetsflöden skulle vart och ett av dessa steg bero på simuleringsnoggrannhet som verkliga chips inte kan garantera.

Ramverket beskrivs som topologiagnostiskt, vilket betyder att det fungerar med olika optiska kretsdesigner snarare än en enda skräddarsydd layout. Eftersom gradienter mäts fysiskt kan nätverket tränas efter tillverkning och absorbera själva tillverkningsfel som annars skulle räknas som brus.

Resultaten

De rapporterade siffrorna är specifika. I experiment gav metoden tränade matriser med ett relativt fel på 0,26 %. Teamet demonstrerade också in situ-träning genom spridningsmedia för matriser större än antalet inbyggda avstämbara element i kretsen - effektivt lärande med färre fysiska kontroller än vad problemet nominellt kräver.

Det kanske mest slående är att forskarna visade att meta-fotoniska kretsar kan utföra in situ meta-inlärning, och inser vad de beskriver som single-shot fotonisk inlärning med 251-faldig modellkompression och 136-faldig uppgiftsspecifik träningsacceleration. Den kompletterande briefen tillägger att hårdvaran uppnår matrisdesign, multivåglängdsberäkning och snabb meta-inlärning utan en fullständig digital modell av kretsen.

Varför det är viktigt

AI:s energiaptit är en av branschens mest pressande begränsningar, och optisk datoranvändning har länge föreslagits som ett sätt att köra matrismultiplikationer - kärnverksamheten i neurala nätverk - med mycket lägre effekt än elektroniska processorer. Optiska chips från startups och akademiska grupper har redan visat imponerande slutledningskapacitet. Träning har dock förblivit digital: chippet driver nätverket, men inlärningen sker på GPU:er som simulerar det.

En praktisk träningsmetod på plats skulle täppa till det gapet och låta fotoniska system anpassa sig till nya uppgifter på själva hårdvaran. Det skulle också kunna minska kostnaderna för att installera fotoniska acceleratorer, eftersom chips inte längre skulle behöva karakteriseras och kompenseras perfekt före användning. Författarna framställer arbetet som att erbjuda "en praktisk väg mot adaptiva och effektiva intelligenta fotoniska system."

Varningar

Resultaten kommer från kontrollerade laboratoriedemonstrationer, och tidningens sammanfattning gör inte anspråk på produktionsberedskap. Att skala on-chip-träning från demonstrerade matrisstorlekar till skalan av frontier neurala nätverk förblir en öppen ingenjörsutmaning, liksom att integrera mätapparaten – syntetisk tidsomvänd holografi – i kompakta, masstillverkbara paket. Verkliga utbyggnader skulle också behöva bevisa tillförlitlighet över temperatursvängningar och komponentåldring, förhållanden där fotoniska system är kända för att driva.

Ändå markerar publikationen en anmärkningsvärd förändring i tyngdpunkten för fältet: från att designa bättre fotoniska kretsar till att låta fotoniska kretsar designa sig själva, åtminstone i den snäva meningen att justera sina egna parametrar. Om uppföljningsarbetet reproducerar resultaten i större skala, blir energifallet för optisk AI-hårdvara väsentligt starkare.

Den underliggande studien, "Photonic neuromorphic learning via generalized in situ physical gradient descent" av Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang och Lu Fang, publiceras i Nature Computational Science.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →