한 연구팀이 물리적 칩에서 직접 광집적 회로를 훈련시키는 일반적인 방법을 시연했습니다. 이는 광학 프로세서를 미리 설계된 고정형 가속기에서 제작 후 학습하는 하드웨어로 전환할 수 있는 단계입니다. Nature Computational Science에 게재된 이 연구는 "광자 회로가 훈련 가능한 AI 하드웨어가 됩니다"라는 제목의 동반 요약에 요약되어 있습니다.

INSPIRE(온칩 물리적 경사 하강법의 약자)라고 불리는 이 방법은 인공 지능을 위한 광자 컴퓨팅의 주요 병목 현상 중 하나를 해결합니다. 광자 프로세서는 속도와 에너지 효율성의 큰 이점을 약속하지만 교육은 비용이 많이 드는 물리적 모델링이 필요하고 제조로 인한 오류로 인해 어려움을 겪는 디지털 시뮬레이션에 크게 국한되어 있습니다. 이 이야기에 대한 자세한 내용은 인공지능 뉴스를 참조하세요.

광자 AI 칩이 훈련하기 어려운 이유

오늘날 대부분의 신경망은 기울기를 정확하게 계산할 수 있는 디지털 하드웨어에서 훈련됩니다. 광자 회로는 다릅니다. 빛은 완벽하게 모델링하기 어려운 방식으로 간섭하고 산란하며 결합하며 작은 제조 변형으로 인해 실험실의 칩이 디지털 트윈과 정확히 동일하게 작동하는 경우가 거의 없습니다. 네트워크를 오프라인으로 훈련한 다음 매개변수를 칩으로 전송한다는 것은 정확도를 저하시키는 불일치를 허용한다는 것을 의미합니다.

이전 연구에서는 이 문제가 해결되었습니다. 연구에 따르면 광자 신경망의 현장 역전파 및 기울기 측정이 입증되었으며, 2024년에 연구자들은 디지털 모델 에뮬레이션에 대한 의존도를 줄이기 위해 광학 신경망에 대한 완전 순방향 모드 교육을 도입했습니다. 새로운 연구에서는 하나의 설계에 맞춰진 것이 아니라 회로 아키텍처 전체에 걸쳐 일반적인 방법을 주장함으로써 이 라인을 확장했습니다.

INSPIRE 작동 방식

논문에 따르면 INSPIRE는 온칩 합성 시간 반전 홀로그래피를 사용하여 양방향 광자 모드의 전체 복잡한 필드를 측정합니다. 이러한 측정을 통해 회로 자체는 칩의 전체 디지털 모델이 필요 없이 기울기를 계산하고 자체 매개변수를 업데이트할 수 있습니다.

실질적인 결과는 중요합니다. 기울기 계산은 물리적 시스템 내부에서 발생하기 때문에 제작 후 다양한 회로 토폴로지를 훈련할 수 있으며, 하드웨어는 충실한 디지털 복제본 없이도 매트릭스 설계, 다중 파장 계산 및 신속한 메타 학습을 처리할 수 있습니다. 기존 워크플로에서는 이러한 모든 단계가 실제 칩이 보장할 수 없는 시뮬레이션 정확도에 따라 달라집니다.

프레임워크는 토폴로지에 구애받지 않는 것으로 설명됩니다. 즉, 단일 맞춤형 레이아웃이 아닌 다양한 광학 회로 설계와 함께 작동한다는 의미입니다. 경사도는 물리적으로 측정되므로 제작 후 네트워크를 훈련하여 노이즈로 간주될 수 있는 제조상의 결함을 흡수할 수 있습니다.

결과

보고된 숫자는 구체적입니다. 실험에서 이 방법은 0.26%의 상대 오차로 훈련된 행렬을 생성했습니다. 또한 팀은 회로의 기본 조정 가능한 요소 수보다 큰 행렬에 대한 분산 미디어를 통해 현장 교육을 시연했습니다. 즉, 명목상 문제에 필요한 것보다 더 적은 물리적 제어로 효과적으로 학습할 수 있습니다.

아마도 가장 놀라운 점은 연구원들이 메타 광자 회로가 현장 메타 학습을 수행하여 251배의 모델 압축과 136배의 작업별 훈련 가속화를 통해 단일 샷 광자 학습으로 설명하는 것을 실현할 수 있음을 보여주었다는 것입니다. 동반 개요에서는 하드웨어가 회로의 전체 디지털 모델 없이도 매트릭스 설계, 다중 파장 계산 및 신속한 메타 학습을 달성한다고 덧붙입니다.

중요한 이유

AI의 에너지 수요는 업계에서 가장 시급한 제약 중 하나이며, 광학 컴퓨팅은 전자 프로세서보다 훨씬 낮은 전력으로 신경망의 핵심 작업인 행렬 곱셈을 실행하는 방법으로 오랫동안 제안되어 왔습니다. 스타트업 및 학계 그룹의 광학 칩은 이미 인상적인 추론 처리량을 보여주었습니다. 그러나 훈련은 디지털 방식으로 유지됩니다. 칩은 네트워크를 실행하지만 학습은 이를 시뮬레이션하는 GPU에서 발생합니다.

실용적인 현장 훈련 방법은 이러한 격차를 줄여 광자 시스템이 하드웨어 자체의 새로운 작업에 적응할 수 있게 해줍니다. 또한 칩을 사용하기 전에 더 이상 완벽하게 특성화하고 보상할 필요가 없기 때문에 광가속기 배포 비용을 줄일 수 있습니다. 저자는 "적응적이고 효율적인 지능형 광자 시스템을 향한 실용적인 경로"를 제공하는 것으로 작업의 틀을 잡았습니다.

주의사항

결과는 통제된 실험실 시연에서 나온 것이며, 논문 요약에서는 생산 준비 상태를 주장하지 않습니다. 입증된 매트릭스 크기에서 최전선 신경망의 규모까지 온칩 훈련을 확장하는 것은 측정 장치(합성 시간 반전 홀로그래피)를 소형의 대량 생산 가능한 패키지에 통합하는 것과 마찬가지로 개방형 엔지니어링 과제로 남아 있습니다. 또한 실제 배포에서는 온도 변화와 구성 요소 노후화, 즉 포토닉 시스템이 표류하는 것으로 알려진 조건 전반에 걸쳐 신뢰성을 입증해야 합니다.

그럼에도 불구하고 이 간행물은 더 나은 광자 회로를 설계하는 것에서 최소한 자체 매개변수를 조정한다는 좁은 의미에서 광자 회로가 스스로 설계하도록 허용하는 것까지 해당 분야의 중점이 눈에 띄게 바뀌었음을 나타냅니다. 후속 작업이 더 큰 규모로 결과를 재현하면 광학 AI 하드웨어의 에너지 사례가 실질적으로 더 강력해집니다.

Tiankuang Zhou, Yun Zhao, Shanglong Li, Guocheng Shao, Ruqi Huang 및 Lu Fang의 기본 연구인 "일반화된 현장 물리적 경사하강법을 통한 광자 신경모형 학습"이 Nature Computational Science에 게재되었습니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →