Tým výzkumníků demonstroval obecnou metodu pro trénování fotonických integrovaných obvodů přímo na fyzickém čipu, což je krok, který by mohl proměnit optické procesory z pevných, předem navržených akcelerátorů na hardware, který se po sestavení učí. Práce publikovaná v Nature Computational Science je shrnuta v doprovodném stručném textu s názvem „Fotonické obvody se stávají trénovatelným hardwarem AI“.
Metoda zvaná INSPIRE – zkratka pro on-chip, in situ Physical Gradient Descent – řeší jednu z hlavních překážek ve fotonickém počítání pro umělou inteligenci: ačkoli fotonické procesory slibují velké zisky v rychlosti a energetické účinnosti, jejich školení zůstalo z velké části omezeno na digitální simulace, které vyžadují nákladné fyzické modelování a trpí chybami způsobenými výrobou. For more context on this story, see our ongoing breaking AI news.
Proč je těžké trénovat fotonické AI čipy
Většina neuronových sítí je dnes trénována na digitálním hardwaru, kde lze gradienty přesně vypočítat. Fotonické obvody jsou různé: světlo interferuje, rozptyluje a spojuje se způsoby, které je obtížné dokonale modelovat, a malé výrobní odchylky znamenají, že čip v laboratoři se zřídka chová přesně jako jeho digitální dvojče. Trénovat síť offline a poté přenést parametry na čip znamená přijmout nesoulad, který snižuje přesnost.
Předchozí výzkum tento problém odstranil. Studie prokázaly zpětné šíření a gradientní měření in situ ve fotonických neuronových sítích a v roce 2024 výzkumníci zavedli plně dopředný režim školení pro optické neuronové sítě, aby se snížilo spoléhání na emulaci digitálního modelu. Nová práce rozšiřuje tuto linii tím, že požaduje metodu, která je obecná napříč architekturami obvodů spíše než přizpůsobená jednomu návrhu.
Jak INSPIRE funguje
Podle článku INSPIRE používá na čipu syntetickou časově reverzní holografii k měření úplných komplexních polí obousměrných fotonických módů. Toto měření umožňuje samotnému obvodu vypočítat gradienty a aktualizovat své vlastní parametry, aniž by vyžadoval úplný digitální model čipu.
Praktický důsledek je významný. Vzhledem k tomu, že výpočet gradientu probíhá uvnitř fyzického systému, lze po vyrobení trénovat různé topologie obvodů a hardware zvládne maticový návrh, výpočet více vlnových délek a rychlé meta-učení bez věrné digitální repliky. V konvenčních pracovních postupech by každý z těchto kroků závisel na přesnosti simulace, kterou reálné čipy nemohou zaručit.
Rámec je popsán jako topologicky agnostický, což znamená, že pracuje s různými návrhy optických obvodů spíše než s jediným zakázkovým uspořádáním. Vzhledem k tomu, že gradienty se měří fyzicky, lze síť po vyrobení trénovat a absorbovat právě ty výrobní nedokonalosti, které by se jinak počítaly jako šum.
Výsledky
Uvedená čísla jsou konkrétní. V experimentech metoda poskytla trénované matice s relativní chybou 0,26 %. Tým také demonstroval trénink in situ prostřednictvím rozptylových médií pro matice větší, než je počet nativních laditelných prvků v okruhu – efektivně se učí s menším počtem fyzických ovládacích prvků, než problém nominálně vyžaduje.
Možná nejpozoruhodnější je, že vědci ukázali, že metafotonické obvody mohou provádět meta-učení in situ, přičemž si uvědomili, co popisují jako jednozáběrové fotonické učení s 251násobnou kompresí modelu a 136násobným zrychlením specifického tréninku. Doprovodný brief dodává, že hardware dosahuje maticového designu, vícevlnových výpočtů a rychlého meta-učení bez plně digitálního modelu obvodu.
Proč na tom záleží
Energetický apetit umělé inteligence je jedním z nejnaléhavějších omezení v oboru a optické výpočty byly dlouho navrhovány jako způsob, jak provozovat maticové multiplikace – základní operace neuronových sítí – s mnohem nižším výkonem než elektronické procesory. Optické čipy od startupů a akademických skupin již prokázaly působivou propustnost odvození. Školení však zůstalo digitální: čip provozuje síť, ale učení probíhá na GPU, které ji simulují.
Praktická metoda školení in situ by tuto mezeru zaplnila a umožnila by fotonickým systémům přizpůsobit se novým úkolům na samotném hardwaru. Mohlo by to také snížit náklady na nasazení fotonických urychlovačů, protože čipy by již nemusely být před použitím dokonale charakterizovány a kompenzovány. Autoři koncipovali práci jako nabídku „praktické cesty k adaptivním a efektivním inteligentním fotonickým systémům“.
Upozornění
Výsledky pocházejí z řízených laboratorních demonstrací a shrnutí příspěvku netvrdí připravenost výroby. Škálování tréninku na čipu z demonstrovaných velikostí matic na měřítko hraničních neuronových sítí zůstává otevřenou inženýrskou výzvou, stejně jako integrace měřicího přístroje – syntetické holografie s reverzním časem – do kompaktních, hromadně vyrobitelných balíčků. Implementace v reálném světě by také potřebovala prokázat spolehlivost napříč teplotními výkyvy a stárnutím komponent, tedy podmínkami, kdy je známo, že fotonické systémy driftují.
Přesto tato publikace představuje významný posun v důrazu v této oblasti: od navrhování lepších fotonických obvodů k tomu, aby se fotonické obvody navrhovaly samy, alespoň v úzkém smyslu ladění jejich vlastních parametrů. Pokud následná práce reprodukuje výsledky ve větším měřítku, energetické pouzdro pro hardware optické umělé inteligence bude materiálně silnější.
Základní studie „Fotonické neuromorfní učení prostřednictvím zobecněného sestupu fyzického gradientu in situ“ od Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang a Lu Fang je publikována v Nature Computational Science.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →