Ein Forscherteam hat eine allgemeine Methode zum Trainieren photonischer integrierter Schaltkreise direkt auf dem physischen Chip demonstriert, ein Schritt, der optische Prozessoren von festen, vorgefertigten Beschleunigern in Hardware verwandeln könnte, die nach dem Bau lernt. Die in Nature Computational Science veröffentlichte Arbeit wird in einem Begleitbrief mit dem Titel „Photonische Schaltkreise werden zu trainierbarer KI-Hardware“ zusammengefasst.

Die Methode mit dem Namen INSPIRE – kurz für „On-Chip, In-situ Physical Gradient Descent“ – behebt einen der zentralen Engpässe beim photonischen Computing für künstliche Intelligenz: Obwohl photonische Prozessoren große Geschwindigkeits- und Energieeffizienzgewinne versprechen, ist ihr Training weitgehend auf digitale Simulationen beschränkt, die eine kostspielige physikalische Modellierung erfordern und unter fertigungsbedingten Fehlern leiden. Weitere Informationen zu dieser Geschichte finden Sie in unserer aktuelle KI-Trends.

Warum photonische KI-Chips schwer zu trainieren sind

Die meisten neuronalen Netze werden heute auf digitaler Hardware trainiert, mit der sich Gradienten exakt berechnen lassen. Photonische Schaltkreise sind anders: Licht interferiert, streut und koppelt auf eine Weise, die sich nur schwer perfekt modellieren lässt, und winzige Herstellungsabweichungen führen dazu, dass sich ein Chip im Labor selten genau wie sein digitaler Zwilling verhält. Das Offline-Training des Netzwerks und die anschließende Übertragung der Parameter auf den Chip bedeutet, eine Nichtübereinstimmung in Kauf zu nehmen, die die Genauigkeit beeinträchtigt.

Frühere Untersuchungen haben das Problem gelöst. Studien haben In-situ-Backpropagation und Gradientenmessung in photonischen neuronalen Netzen gezeigt, und im Jahr 2024 führten Forscher ein vollständiges Vorwärtsmodustraining für optische neuronale Netze ein, um die Abhängigkeit von der Emulation digitaler Modelle zu verringern. Die neue Arbeit erweitert diese Linie, indem sie eine Methode beansprucht, die für alle Schaltungsarchitekturen allgemein gilt und nicht auf ein Design zugeschnitten ist.

So funktioniert INSPIRE

Dem Papier zufolge nutzt INSPIRE die synthetische Zeitumkehr-Holographie auf dem Chip, um die gesamten komplexen Felder bidirektionaler photonischer Modi zu messen. Diese Messung ermöglicht es der Schaltung selbst, Gradienten zu berechnen und ihre eigenen Parameter zu aktualisieren, ohne dass ein vollständiges digitales Modell des Chips erforderlich ist.

Die praktische Konsequenz ist erheblich. Da die Gradientenberechnung innerhalb des physischen Systems erfolgt, können verschiedene Schaltkreistopologien nach der Herstellung trainiert werden, und die Hardware kann Matrixdesign, Multiwellenlängenberechnung und schnelles Meta-Lernen ohne eine originalgetreue digitale Nachbildung bewältigen. In herkömmlichen Arbeitsabläufen würde jeder dieser Schritte von einer Simulationsgenauigkeit abhängen, die reale Chips nicht garantieren können.

Das Framework wird als topologieunabhängig beschrieben, was bedeutet, dass es mit verschiedenen optischen Schaltungsdesigns und nicht mit einem einzelnen maßgeschneiderten Layout funktioniert. Da Gradienten physikalisch gemessen werden, kann das Netzwerk nach der Herstellung trainiert werden und dabei genau die Herstellungsmängel absorbieren, die andernfalls als Rauschen gelten würden.

Die Ergebnisse

Die gemeldeten Zahlen sind konkret. In Experimenten lieferte die Methode trainierte Matrizen mit einem relativen Fehler von 0,26 %. Das Team demonstrierte auch ein In-situ-Training durch Streumedien für Matrizen, die größer sind als die Anzahl der nativen abstimmbaren Elemente in der Schaltung – und zwar effektiv mit weniger physischen Kontrollen, als das Problem nominell erfordert.

Am auffälligsten ist vielleicht, dass die Forscher zeigten, dass metaphotonische Schaltkreise In-situ-Meta-Lernen durchführen können und damit das realisieren, was sie als photonisches Single-Shot-Lernen mit 251-facher Modellkomprimierung und 136-facher aufgabenspezifischer Trainingsbeschleunigung bezeichnen. In der Begleitbeschreibung wird hinzugefügt, dass die Hardware Matrixdesign, Multiwellenlängenberechnung und schnelles Meta-Lernen ohne ein vollständig digitales Modell der Schaltung ermöglicht.

Warum es wichtig ist

Der Energiehunger der KI ist eines der drängendsten Hindernisse der Branche, und optische Datenverarbeitung wird seit langem als Möglichkeit vorgeschlagen, Matrixmultiplikationen – die Kernoperation neuronaler Netze – mit weitaus geringerem Stromverbrauch als elektronische Prozessoren auszuführen. Optische Chips von Startups und akademischen Gruppen haben bereits einen beeindruckenden Inferenzdurchsatz gezeigt. Das Training ist jedoch digital geblieben: Der Chip betreibt das Netzwerk, aber das Lernen findet auf GPUs statt, die es simulieren.

Eine praktische In-situ-Trainingsmethode würde diese Lücke schließen und es photonischen Systemen ermöglichen, sich auf der Hardware selbst an neue Aufgaben anzupassen. Es könnte auch die Kosten für den Einsatz photonischer Beschleuniger senken, da Chips vor der Verwendung nicht mehr perfekt charakterisiert und kompensiert werden müssten. Die Autoren beschreiben die Arbeit als „einen praktischen Weg zu adaptiven und effizienten intelligenten photonischen Systemen“.

Vorbehalte

Die Ergebnisse stammen aus kontrollierten Labordemonstrationen und die Zusammenfassung des Papiers erhebt keinen Anspruch auf Produktionsbereitschaft. Die Skalierung des On-Chip-Trainings von nachgewiesenen Matrixgrößen auf die Größenordnung neuronaler Grenznetze bleibt eine offene technische Herausforderung, ebenso wie die Integration des Messgeräts – der synthetischen Zeitumkehrholographie – in kompakte, in Massen herstellbare Pakete. Bei realen Einsätzen müsste die Zuverlässigkeit auch bei Temperaturschwankungen und Komponentenalterung nachgewiesen werden – Bedingungen, bei denen photonische Systeme bekanntermaßen driften.

Dennoch stellt die Veröffentlichung eine bemerkenswerte Schwerpunktverlagerung auf diesem Gebiet dar: vom Entwurf besserer photonischer Schaltkreise hin zur Selbstentwicklung photonischer Schaltkreise, zumindest im engeren Sinne der Abstimmung ihrer eigenen Parameter. Wenn Folgearbeiten die Ergebnisse in größerem Maßstab reproduzieren, wird das Energieargument für optische KI-Hardware wesentlich stärker.

Die zugrunde liegende Studie „Photonic neuromorphic learning via generalized in situ Physical Gradient Descent“ von Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang und Lu Fang ist in Nature Computational Science veröffentlicht.

---

Bleib vorne bei KI

Die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Mehr KI-Nachrichten lesen →