Un equipo de investigadores ha demostrado un método general para entrenar circuitos integrados fotónicos directamente en el chip físico, un paso que podría convertir los procesadores ópticos de aceleradores fijos y prediseñados en hardware que aprende después de su construcción. El trabajo, publicado en Nature Computational Science, se resume en un informe complementario titulado "Los circuitos fotónicos se convierten en hardware de IA entrenable".
El método, llamado INSPIRE (abreviatura de descenso de gradiente físico in situ en un chip), aborda uno de los principales obstáculos en la computación fotónica para la inteligencia artificial: aunque los procesadores fotónicos prometen importantes ganancias en velocidad y eficiencia energética, su entrenamiento se ha limitado en gran medida a simulaciones digitales que requieren costosos modelos físicos y sufren errores inducidos por la fabricación. Para más contexto sobre esta historia, consulta nuestra últimos avances en IA.
Por qué los chips fotónicos de IA son difíciles de entrenar
La mayoría de las redes neuronales actuales están entrenadas en hardware digital, donde los gradientes se pueden calcular con exactitud. Los circuitos fotónicos son diferentes: la luz interfiere, se dispersa y se acopla de maneras que son difíciles de modelar perfectamente, y pequeñas variaciones de fabricación significan que un chip en el laboratorio rara vez se comporta exactamente como su gemelo digital. Entrenar la red fuera de línea y luego transferir los parámetros al chip significa aceptar una falta de coincidencia que degrada la precisión.
Investigaciones anteriores han socavado el problema. Los estudios han demostrado la retropropagación in situ y la medición de gradientes en redes neuronales fotónicas, y en 2024 los investigadores introdujeron el entrenamiento en modo totalmente directo para redes neuronales ópticas para reducir la dependencia de la emulación de modelos digitales. El nuevo trabajo amplía esta línea al afirmar un método que es general en todas las arquitecturas de circuitos en lugar de adaptarse a un diseño.
Cómo funciona INSPIRE
Según el artículo, INSPIRE utiliza holografía sintética de inversión de tiempo en un chip para medir los campos complejos completos de los modos fotónicos bidireccionales. Esa medición permite que el propio circuito calcule gradientes y actualice sus propios parámetros, sin requerir un modelo digital completo del chip.
La consecuencia práctica es significativa. Debido a que el cálculo del gradiente ocurre dentro del sistema físico, se pueden entrenar diversas topologías de circuitos después de la fabricación, y el hardware puede manejar el diseño matricial, el cálculo de múltiples longitudes de onda y el metaaprendizaje rápido sin una réplica digital fiel. En los flujos de trabajo convencionales, cada uno de esos pasos dependería de la precisión de la simulación que los chips del mundo real no pueden garantizar.
El marco se describe como independiente de la topología, lo que significa que funciona con diversos diseños de circuitos ópticos en lugar de un único diseño personalizado. Debido a que los gradientes se miden físicamente, la red se puede entrenar después de la fabricación, absorbiendo las mismas imperfecciones de fabricación que de otro modo contarían como ruido.
Los resultados
Las cifras reportadas son específicas. En los experimentos, el método produjo matrices entrenadas con un error relativo del 0,26%. El equipo también demostró entrenamiento in situ mediante medios de dispersión para matrices mayores que la cantidad de elementos sintonizables nativos en el circuito, aprendiendo efectivamente con menos controles físicos de los que nominalmente requiere el problema.
Quizás lo más sorprendente es que los investigadores demostraron que los circuitos metafotónicos pueden realizar metaaprendizaje in situ, realizando lo que describen como aprendizaje fotónico de un solo disparo con una compresión del modelo de 251 veces y una aceleración del entrenamiento de tareas específicas de 136 veces. El informe complementario agrega que el hardware logra un diseño matricial, cálculo de longitudes de onda múltiples y metaaprendizaje rápido sin un modelo digital completo del circuito.
Por qué es importante
El apetito energético de la IA es una de las limitaciones más apremiantes de la industria, y la computación óptica se ha propuesto desde hace mucho tiempo como una forma de ejecutar multiplicaciones de matrices (la operación central de las redes neuronales) con una potencia mucho menor que la de los procesadores electrónicos. Los chips ópticos de nuevas empresas y grupos académicos ya han demostrado un rendimiento de inferencia impresionante. Sin embargo, la capacitación sigue siendo digital: el chip ejecuta la red, pero el aprendizaje ocurre en GPU que la simulan.
Un método práctico de formación in situ cerraría esa brecha, permitiendo que los sistemas fotónicos se adapten a nuevas tareas en el propio hardware. También podría reducir el coste de implementación de aceleradores fotónicos, ya que ya no sería necesario caracterizar y compensar perfectamente los chips antes de su uso. Los autores enmarcan el trabajo como una oferta "una ruta práctica hacia sistemas fotónicos inteligentes adaptables y eficientes".
Advertencias
Los resultados provienen de demostraciones controladas de laboratorio y el resumen del artículo no afirma que esté listo para la producción. Escalar el entrenamiento en chip desde tamaños de matriz demostrados hasta la escala de redes neuronales de frontera sigue siendo un desafío de ingeniería abierto, al igual que la integración del aparato de medición (holografía sintética de inversión de tiempo) en paquetes compactos y fabricables en masa. Las implementaciones en el mundo real también necesitarían demostrar confiabilidad ante los cambios de temperatura y el envejecimiento de los componentes, condiciones en las que se sabe que los sistemas fotónicos se desvían.
Aún así, la publicación marca un cambio notable en el énfasis en este campo: de diseñar mejores circuitos fotónicos a dejar que los circuitos fotónicos se diseñen solos, al menos en el sentido estricto de ajustar sus propios parámetros. Si el trabajo de seguimiento reproduce los resultados a mayor escala, el argumento energético a favor del hardware de IA óptica se vuelve materialmente más sólido.
El estudio subyacente, "Aprendizaje neuromórfico fotónico mediante descenso de gradiente físico in situ generalizado" realizado por Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang y Lu Fang, se publica en Nature Computational Science.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →