Un team di ricercatori ha dimostrato un metodo generale per addestrare i circuiti integrati fotonici direttamente sul chip fisico, un passo che potrebbe trasformare i processori ottici da acceleratori fissi e pre-progettati in hardware che apprende dopo essere stato costruito. Il lavoro, pubblicato su Nature Computational Science, è riassunto in un brief intitolato "I circuiti fotonici diventano hardware AI addestrabile".
Il metodo, chiamato INSPIRE – abbreviazione di on-chip, in situ Physical Gradient Discesa – affronta uno dei colli di bottiglia centrali nel calcolo fotonico per l’intelligenza artificiale: sebbene i processori fotonici promettano importanti guadagni in termini di velocità ed efficienza energetica, la loro formazione è rimasta in gran parte limitata alle simulazioni digitali che richiedono una modellazione fisica costosa e soffrono di errori indotti dalla fabbricazione. Per maggiori informazioni su questa storia, consulta la nostra copertura dell'industria IA.
Perché i chip AI fotonici sono difficili da addestrare
La maggior parte delle reti neurali oggi sono addestrate su hardware digitale, dove i gradienti possono essere calcolati esattamente. I circuiti fotonici sono diversi: la luce interferisce, si disperde e si accoppia in modi difficili da modellare perfettamente, e piccole variazioni di produzione fanno sì che un chip in laboratorio raramente si comporti esattamente come il suo gemello digitale. Addestrare la rete offline e poi trasferire i parametri sul chip significa accettare una mancata corrispondenza che riduce la precisione.
La ricerca precedente ha risolto il problema. Gli studi hanno dimostrato la retropropagazione in situ e la misurazione del gradiente nelle reti neurali fotoniche e nel 2024 i ricercatori hanno introdotto l'addestramento in modalità completamente avanzata per le reti neurali ottiche per ridurre la dipendenza dall'emulazione del modello digitale. Il nuovo lavoro estende questa linea sostenendo un metodo generale per tutte le architetture dei circuiti piuttosto che adattato a un unico progetto.
Come funziona INSPIRE
Secondo lo studio, INSPIRE utilizza l’olografia sintetica a inversione temporale su chip per misurare tutti i campi complessi delle modalità fotoniche bidirezionali. Questa misurazione consente al circuito stesso di calcolare i gradienti e aggiornare i propri parametri, senza richiedere un modello digitale completo del chip.
La conseguenza pratica è significativa. Poiché il calcolo del gradiente avviene all'interno del sistema fisico, è possibile addestrare diverse topologie di circuiti dopo la fabbricazione e l'hardware è in grado di gestire la progettazione di matrici, il calcolo a lunghezze d'onda multiple e il metaapprendimento rapido senza una replica digitale fedele. Nei flussi di lavoro convenzionali, ognuno di questi passaggi dipenderebbe dall’accuratezza della simulazione che i chip del mondo reale non possono garantire.
Il framework è descritto come indipendente dalla topologia, il che significa che funziona con diversi progetti di circuiti ottici piuttosto che con un unico layout su misura. Poiché i gradienti vengono misurati fisicamente, la rete può essere addestrata dopo la fabbricazione, assorbendo proprio le imperfezioni di produzione che altrimenti conterebbero come rumore.
I risultati
I numeri riportati sono specifici. Negli esperimenti, il metodo ha prodotto matrici addestrate con un errore relativo dello 0,26%. Il team ha anche dimostrato l’addestramento in situ attraverso mezzi di dispersione per matrici più grandi del numero di elementi sintonizzabili nativi nel circuito, apprendendo in modo efficace con meno controlli fisici di quanto il problema richiede nominalmente.
Forse la cosa più sorprendente è che i ricercatori hanno dimostrato che i circuiti metafotonici possono eseguire meta-apprendimento in situ, realizzando quello che descrivono come apprendimento fotonico a colpo singolo con una compressione del modello di 251 volte e un'accelerazione dell'addestramento specifico per attività di 136 volte. Il brief di accompagnamento aggiunge che l'hardware raggiunge la progettazione a matrice, il calcolo multilunghezza d'onda e il metaapprendimento rapido senza un modello digitale completo del circuito.
Perché è importante
L’appetito energetico dell’intelligenza artificiale è uno dei vincoli più pressanti del settore, e il calcolo ottico è stato a lungo proposto come un modo per eseguire moltiplicazioni di matrici – il funzionamento principale delle reti neurali – con una potenza molto inferiore rispetto ai processori elettronici. I chip ottici di startup e gruppi accademici hanno già dimostrato un rendimento di inferenza impressionante. La formazione, tuttavia, è rimasta digitale: il chip gestisce la rete, ma l’apprendimento avviene su GPU che la simulano.
Un metodo pratico di formazione in situ colmerebbe questa lacuna, consentendo ai sistemi fotonici di adattarsi a nuovi compiti sull’hardware stesso. Potrebbe anche ridurre il costo di implementazione degli acceleratori fotonici, poiché i chip non avrebbero più bisogno di essere perfettamente caratterizzati e compensati prima dell’uso. Gli autori ritengono che il lavoro offra "un percorso pratico verso sistemi fotonici intelligenti, adattivi ed efficienti".
Avvertenze
I risultati provengono da dimostrazioni di laboratorio controllate e la sintesi del documento non afferma che sia pronta per la produzione. Scalare l’addestramento su chip dalle dimensioni delle matrici dimostrate alla scala delle reti neurali di frontiera rimane una sfida ingegneristica aperta, così come l’integrazione dell’apparato di misurazione – l’olografia sintetica a inversione temporale – in pacchetti compatti e producibili in serie. Le implementazioni nel mondo reale dovrebbero anche dimostrare l’affidabilità rispetto agli sbalzi di temperatura e all’invecchiamento dei componenti, condizioni in cui è noto che i sistemi fotonici vanno alla deriva.
Tuttavia, la pubblicazione segna un notevole cambiamento nell’enfasi del campo: dalla progettazione di circuiti fotonici migliori al lasciare che i circuiti fotonici si progettino da soli, almeno nel senso stretto della regolazione dei propri parametri. Se il lavoro di follow-up riproduce i risultati su scala più ampia, la questione energetica dell’hardware di intelligenza artificiale ottica diventa materialmente più forte.
Lo studio sottostante, "Apprendimento neuromorfico fotonico tramite discesa del gradiente fisico generalizzato in situ" di Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang e Lu Fang, è pubblicato su Nature Computational Science.
---
Rimani Aggiornato sull'IALe ultime notizie, analisi e scoperte sull'intelligenza artificiale — tutto in un posto.
Leggi altre notizie sull'IA →