SOA.edu.pl Nauka Kwantowe emitery mogą rozwiązać jeden z największych problemów optycznej AI. Naukowcy pokazali sieć neuronową działającą przy nanowatowej intensywności światła

Kwantowe emitery mogą rozwiązać jeden z największych problemów optycznej AI. Naukowcy pokazali sieć neuronową działającą przy nanowatowej intensywności światła

Sztuczna inteligencja potrzebuje coraz większej mocy obliczeniowej, a wraz z nią rośnie zużycie energii przez centra danych. Jednym z pomysłów na przełamanie tego ograniczenia jest przeniesienie części obliczeń z elektroniki do fotoniki. Światło znakomicie radzi sobie z operacjami liniowymi, ale od lat blokuje je jeden problem: energooszczędna nieliniowość, bez której nie da się zbudować naprawdę głębokiej optycznej sieci neuronowej. Naukowcy z University of Wisconsin–Madison i Stanford University pokazali, że rozwiązaniem mogą być pojedyncze emitery kwantowe umieszczone w specjalnie zaprojektowanych nanostrukturach fotonicznych.

Rozwój współczesnych modeli sztucznej inteligencji opiera się w dużej mierze na zwiększaniu skali. Modele dostają coraz więcej parametrów, przetwarzają większe zbiory danych i wykonują gigantyczną liczbę operacji matematycznych. Takie podejście przyniosło imponujące rezultaty, ale ma bardzo konkretną cenę: rosną wymagania dotyczące procesorów, pamięci, przepustowości systemów, a przede wszystkim energii potrzebnej do wykonywania obliczeń.

Dlatego coraz większe zainteresowanie budzą technologie, które nie polegają wyłącznie na budowaniu szybszych wersji klasycznych procesorów elektronicznych. Jednym z najbardziej obiecujących kierunków jest wykorzystanie światła. Fotony mogą przechodzić przez falowody, interferometry i inne struktury optyczne, wykonując przy okazji część matematyki potrzebnej sieciom neuronowym. Problem zaczyna się jednak wtedy, gdy sieć przestaje wykonywać wyłącznie proste transformacje liniowe.

Światło świetnie radzi sobie z matematyką potrzebną sztucznej inteligencji

Znaczna część pracy współczesnych sieci neuronowych sprowadza się do mnożenia macierzy przez wektory. Procesory GPU są w takich obliczeniach wyjątkowo wydajne, ale przez cały czas muszą przesyłać ładunki elektryczne, pobierać dane z pamięci i przekazywać wyniki między kolejnymi częściami układu. Pojedyncza operacja zużywa niewiele energii, lecz kiedy wykonuje się ich miliardy albo biliony, całkowity koszt staje się ogromny.

Fotonika pozwala podejść do tego problemu inaczej. Informację można zapisać w amplitudzie, fazie albo intensywności światła, a następnie przepuścić sygnał przez odpowiednio zaprojektowaną strukturę. Interferencja i propagacja fal wykonują wtedy transformacje matematyczne w sposób wynikający bezpośrednio z praw fizyki. Zamiast symulować każdą operację krok po kroku w elektronice, część obliczeń może zachodzić podczas samego przechodzenia światła przez układ.

To jedna z przyczyn, dla których optyczne akceleratory AI od dawna są postrzegane jako potencjalnie bardzo szybkie i energooszczędne. Sama szybkość mnożenia macierzy nie wystarczy jednak do zbudowania skutecznej głębokiej sieci neuronowej.

Bez nieliniowości głęboka sieć przestaje być naprawdę głęboka

Jeżeli pierwsza warstwa sieci wykonuje transformację liniową, druga również jest liniowa, a kolejne zachowują się tak samo, cały ten zestaw operacji można matematycznie zastąpić jedną większą transformacją liniową. Można więc dodawać kolejne warstwy, ale nie da to sieci pełnej zdolności do tworzenia skomplikowanych reprezentacji danych.

Dlatego klasyczne sieci neuronowe wykorzystują funkcje aktywacji, takie jak ReLU, sigmoid czy GELU. Wprowadzają one nieliniowość pomiędzy warstwami, dzięki czemu sieć może stopniowo przekształcać dane w coraz bardziej złożony sposób. To właśnie nieliniowość pozwala głębokim modelom rozpoznawać skomplikowane obrazy, analizować język, sterować robotami czy uczyć się podejmowania decyzji.

W elektronice wykonanie funkcji aktywacji jest stosunkowo proste. W układzie fotonicznym sytuacja jest znacznie trudniejsza, ponieważ światło o małej intensywności zachowuje się w większości materiałów bardzo liniowo.

Paradoks fotonicznej AI: tania część obliczeń i droga funkcja aktywacji

Jeżeli dwukrotnie zwiększymy amplitudę słabego sygnału optycznego, odpowiedź typowego materiału zmieni się w przewidywalny, niemal proporcjonalny sposób. Silniejszą nieliniowość można uzyskać, sięgając między innymi po efekt Kerra czy absorpcję saturacyjną, ale mechanizmy te zwykle wymagają odpowiednio dużego natężenia pola elektromagnetycznego.

Powstaje wtedy niewygodny paradoks. Układ fotoniczny wykonuje liniową część obliczeń przy bardzo niskim zużyciu energii, ale pomiędzy kolejnymi warstwami trzeba dostarczyć znacznie większą moc tylko po to, aby uzyskać potrzebną funkcję aktywacji. W efekcie jedna z najważniejszych zalet obliczeń optycznych zostaje częściowo utracona.

Zespół z University of Wisconsin–Madison i Stanford University zaproponował rozwiązanie oparte na zupełnie innej skali oddziaływań. Zamiast polegać na nieliniowych właściwościach dużej objętości materiału, naukowcy sięgnęli po fizykę pojedynczego układu kwantowego.

Pojedynczy defekt w diamencie może działać jak funkcja aktywacji

W pracy opublikowanej w Nature Communications Qingyi Zhou, Jungmin Kim, Yutian Tao i współautorzy opisali architekturę wykorzystującą pojedyncze emitery kwantowe. Takim emiterem może być atom, kropka kwantowa albo odpowiedni defekt w strukturze krystalicznej. Układy tego rodzaju mają dyskretne poziomy energetyczne, dzięki czemu bardzo silnie oddziałują ze światłem o dobranej częstotliwości.

W analizowanym rozwiązaniu wykorzystano centrum barwne SiV, czyli defekt typu silicon-vacancy w diamencie. Przy bardzo słabym świetle taki emiter intensywnie oddziałuje z padającymi fotonami. Kiedy jednak natężenie promieniowania rośnie, przejście energetyczne zaczyna się nasycać i dalszy wzrost sygnału nie wywołuje już proporcjonalnej odpowiedzi.

Właśnie w tym momencie pojawia się nieliniowość potrzebna sieci neuronowej. Sygnał wyjściowy przestaje być prostą, proporcjonalną funkcją sygnału wejściowego, a pojedynczy układ kwantowy może pełnić rolę fizycznego odpowiednika funkcji aktywacji.

Do uzyskania efektu nie potrzeba potężnej wiązki laserowej

Najważniejszą zaletą emitera kwantowego jest to, że nasycenie następuje przy bardzo niewielkiej liczbie fotonów. Nie trzeba więc dostarczać ogromnej energii do dużej objętości materiału — wszystko rozgrywa się na poziomie jednego, bardzo silnie reagującego układu kwantowego.

Nie wystarczy jednak umieścić defekt w diamencie i przepuścić obok niego światło. Emiter jest niezwykle mały, więc bez odpowiedniej konstrukcji znaczna część promieniowania przeszłaby przez urządzenie praktycznie bez kontaktu z centrum kwantowym.

Badacze rozwiązali ten problem, projektując nanostrukturę fotoniczną, która kształtuje pole elektromagnetyczne i wzmacnia oddziaływanie światła z emiterem. W analizowanym układzie zastosowano fosforek galu umieszczony na diamencie, a centrum SiV znajdowało się w obszarze szczególnie silnego sprzężenia optycznego. Cały obszar projektowy miał około 1,5 × 0,7 mikrometra — mniej niż typowa komórka ludzka i tyle, co pojedyncza bakteria.

Nanostrukturę zaprojektował algorytm

Interesujący jest również sposób, w jaki powstała geometria urządzenia. Naukowcy wykorzystali metodę określaną jako inverse design, czyli projektowanie odwrotne. W tradycyjnym podejściu konstruktor najpierw wymyśla kształt elementu, a dopiero potem sprawdza w symulacji, jak zachowa się w nim światło.

W projektowaniu odwrotnym kolejność jest odwrócona. Badacz określa efekt, który chce uzyskać, a algorytm optymalizacyjny szuka geometrii najlepiej realizującej to zadanie. W rezultacie powstają struktury o kształtach dalekich od tego, co człowiek zaprojektowałby intuicyjnie, ale bardzo skutecznie kontrolujące propagację i koncentrację światła.

Tutaj celem było uzyskanie jak najsilniejszego sprzężenia między sygnałem optycznym a pojedynczym emiterem kwantowym. Dzięki temu niewielkie urządzenie mogło wykazywać silną odpowiedź nieliniową przy ekstremalnie małej intensywności promieniowania.

Nieliniowość pojawiała się już przy około 0,24 nW/µm²

To właśnie wymagane natężenie światła jest jednym z najciekawszych wyników całej pracy. Autorzy nie ograniczyli się przy tym do opisania samej zmiany właściwości optycznych. Zaproponowali sposób oceny ekspresyjności nieliniowości, czyli tego, na ile dany mechanizm rzeczywiście pomaga kolejnym warstwom sieci neuronowej tworzyć bardziej złożone reprezentacje danych.

Dla urządzenia z pojedynczym emiterem odpowiedni poziom nieliniowości pojawiał się przy intensywności około 0,24 nW/µm². Dla porównania, w konfiguracjach analizowanych przez autorów absorpcja saturacyjna grafenu wymagała około 0,02 W/µm², a efekt Kerra w 50-mikrometrowym falowodzie krzemowym — ponad 72 W/µm².

Tych wartości nie należy traktować jako uniwersalnego rankingu materiałów nieliniowych, bo wyniki zależą od geometrii urządzeń i przyjętych parametrów. Różnica skali pozostaje jednak ogromna i dobrze pokazuje podstawową zaletę rozwiązania z pojedynczym emiterem: silna odpowiedź nieliniowa może pojawiać się przy świetle o niezwykle małej intensywności.

Badacze sprawdzili, czy taki element rzeczywiście ma sens w sieci neuronowej

Sama demonstracja silnej nieliniowości nie oznacza jeszcze, że urządzenie przyda się w uczeniu maszynowym. Dlatego autorzy zbudowali model wielowarstwowej sieci neuronowej, w której każda warstwa składała się z liniowej transformacji fotonicznej i nieliniowej funkcji aktywacji realizowanej przez modelowany emiter kwantowy.

Podczas treningu zastosowano podejście określane jako physics-aware training. Algorytm nie korzystał więc z idealnej, abstrakcyjnej funkcji matematycznej, lecz uwzględniał rzeczywistą charakterystykę urządzenia wynikającą z symulacji elektromagnetycznych. Pozwoliło to ocenić nie tylko to, czy wymyślona funkcja aktywacji dobrze wygląda na papierze, ale też czy jej fizyczna realizacja zachowuje przydatne właściwości podczas uczenia sieci.

Od trzech spiral do rozpoznawania obrazów

Jednym z pierwszych testów był klasyczny problem trzech przeplatających się spiral. Punkty należące do różnych klas są w nim rozmieszczone tak, że nie da się ich rozdzielić prostą liniową granicą decyzyjną. To dobry przykład pokazujący, dlaczego sama transformacja liniowa nie wystarcza.

Sieć wyposażona w kwantową nieliniowość potrafiła stopniowo przekształcać przestrzeń danych i tworzyć bardziej skomplikowane granice między klasami. Autorzy przetestowali architekturę również na popularnych zbiorach MNIST i Fashion-MNIST oraz w zadaniach regresji nieliniowej.

Chcieli jednak sprawdzić coś więcej niż klasyczną klasyfikację. W kolejnych eksperymentach sięgnęli po uczenie ze wzmocnieniem, w którym sieć musi nauczyć się podejmować sekwencję decyzji na podstawie informacji ze środowiska.

Optyczna AI dostała zadanie grania w Ponga

Jednym z testów była klasyczna gra Atari Pong. Model otrzymywał informacje z kolejnych klatek obrazu i musiał nauczyć się sterować paletką tak, aby odbijać piłkę i zdobywać punkty. Sygnał na wyjściu sieci odpowiadał możliwym akcjom.

Autorzy porównali modele całkowicie liniowe z architekturami wykorzystującymi kwantową funkcję aktywacji. Łącznie przeanalizowali 104 modele: 52 liniowe i 52 nieliniowe. Różnica była wyraźna. Modele liniowe stosunkowo szybko osiągały ograniczony poziom skuteczności, a samo zwiększanie liczby parametrów niewiele poprawiało. Sieci nieliniowe korzystały natomiast ze wzrostu skali i uczyły się znacznie skuteczniejszej strategii.

Nie oznacza to oczywiście, że badacze zbudowali fizyczny procesor fotoniczny i podłączyli go do gry. Cała praca jest symulacją numeryczną. Pokazuje jednak, że charakterystyka proponowanego urządzenia wystarcza, by pełnić funkcję aktywacji także w zadaniach bardziej złożonych niż prosta klasyfikacja.

Drugi test: nauczyć symulowanego geparda biegać

Kolejnym środowiskiem był HalfCheetah — popularna symulacja w badaniach nad uczeniem ze wzmocnieniem, w której sztuczny organizm złożony z kilku segmentów i przegubów musi nauczyć się stabilnego ruchu do przodu.

Wejście sieci obejmowało 17 zmiennych opisujących między innymi pozycje i prędkości elementów modelu, a wyjście sterowało sześcioma elementami wykonawczymi. Sieć z kwantową nieliniowością nauczyła się stabilnej strategii ruchu, podczas gdy wersja liniowa nie osiągnęła porównywalnej skuteczności.

Wynik pokazuje, że nieliniowość proponowanego elementu przydaje się nie tylko w prostych demonstracjach matematycznych, lecz może zwiększać ekspresyjność modelu również w zadaniach wymagających dynamicznych decyzji.

Autorzy sprawdzili, co działoby się przy skali współczesnych transformerów

Po eksperymentach na mniejszych modelach badacze przeprowadzili teoretyczne skalowanie rozwiązania do architektur odpowiadających znacznie większym sieciom. Nie powstał optyczny odpowiednik GPT ani symulacja kompletnego wielkiego modelu językowego działającego na proponowanym sprzęcie. Autorzy oszacowali natomiast moc potrzebną do działania samych nieliniowych elementów aktywacyjnych.

Analiza obejmowała skale od GPT-2 aż po znacznie większe modele. Według obliczeń optyczna moc potrzebna do realizowania nieliniowości pozostawała poniżej około 1,2 wata we wszystkich rozpatrywanych przypadkach.

Co więcej, zapotrzebowanie na moc nie rosło wprost proporcjonalnie do liczby parametrów. W modelu autorów zależność można było w przybliżeniu opisać jako:

P ∝ Nparam0,66

To wzrost wolniejszy niż liniowy — cecha interesująca z punktu widzenia skalowania przyszłych systemów, ale wymagająca bardzo ostrożnej interpretacji.

1,2 wata to nie jest komputer wielkości GPT zużywający 1,2 wata

To prawdopodobnie najważniejsze zastrzeżenie dotyczące całego badania. Podana wartość odnosi się wyłącznie do optycznej mocy potrzebnej do działania analizowanych funkcji aktywacji. Nie jest to pobór energii kompletnego procesora ani całego systemu sztucznej inteligencji.

Rzeczywiste urządzenie musiałoby również generować światło laserowe, kodować dane, realizować transformacje liniowe, przechowywać parametry modelu, odczytywać wyniki i sterować poszczególnymi komponentami. Dochodzą do tego straty podczas transmisji oraz konwersja energii elektrycznej na światło i z powrotem.

Jeżeli zastosowane emitery wymagałyby pracy w bardzo niskich temperaturach, do rachunku trzeba byłoby doliczyć energię potrzebną do chłodzenia. Dlatego wyników nie należy zestawiać bezpośrednio z poborem mocy współczesnych układów GPU. Badanie odpowiada na znacznie węższe pytanie: czy nieliniowość potrzebną sieci neuronowej można uzyskać przy ekstremalnie małej mocy optycznej.

Niska energia może oznaczać mniejszą szybkość działania

Pojedynczy emiter kwantowy nie rozwiązuje wszystkich problemów optycznej AI. Jednym z najważniejszych ograniczeń jest szybkość. Tempo, w jakim emiter reaguje na kolejne sygnały, zależy między innymi od czasu życia jego stanów energetycznych. Dla parametrów centrum SiV przyjętych w modelu naturalne pasmo odpowiedzi pozostawało poniżej gigaherca.

Tymczasem nowoczesne układy fotoniczne mogą pracować przy częstotliwościach liczonych w dziesiątkach gigaherców. Oznacza to potencjalny kompromis między ekstremalnie małym zapotrzebowaniem na energię a szybkością przetwarzania informacji.

Sytuację może poprawić efekt Purcella, który pozwala wpływać na tempo emisji spontanicznej poprzez odpowiednie zaprojektowanie otoczenia fotonicznego emitera. To jednak kolejny obszar wymagający dalszych prac inżynieryjnych.

Znacznie trudniejszym problemem może być masowa produkcja

Pojedynczy emiter wykonany i dokładnie scharakteryzowany w laboratorium to zupełnie inna sytuacja niż procesor zawierający ogromną liczbę takich elementów. Emitery kwantowe tworzone w ciele stałym nie są idealnymi kopiami. Lokalne naprężenia, niewielkie różnice w strukturze krystalicznej i obecność innych defektów mogą przesuwać ich częstotliwości rezonansowe.

W proponowanej architekturze światło powinno tymczasem precyzyjnie oddziaływać z każdym emiterem. Takie centra można przestrajać elektrycznie, między innymi z wykorzystaniem efektu Starka, ale czym innym jest dostrojenie jednego eksperymentalnego elementu, a czym innym jednoczesna kontrola tysięcy czy milionów urządzeń.

Problematyczne może być także samo umieszczenie defektu. Nanostruktura działa najlepiej wtedy, gdy emiter znajduje się dokładnie w przewidzianym miejscu pola elektromagnetycznego, a niewielkie przesunięcie osłabia sprzężenie. Istnieją już metody tworzenia centrów barwnych za pomocą implantacji jonowej czy technik laserowych, lecz produkcja milionów niemal identycznych struktur nadal pozostaje ogromnym wyzwaniem technologicznym.

Kriogenika może odebrać część energetycznej przewagi

Kolejny problem wiąże się z temperaturą. Wiele emiterów kwantowych osiąga najlepsze właściwości optyczne w warunkach znacznie chłodniejszych niż temperatura pokojowa. Ograniczenie drgań sieci krystalicznej poprawia stabilność emitera i zmniejsza szerokość jego linii spektralnych.

Z punktu widzenia energooszczędnych procesorów nie jest to dobra wiadomość. Jeżeli przyszły układ wymagałby rozbudowanego systemu kriogenicznego, koszt energetyczny utrzymywania niskiej temperatury mógłby wielokrotnie przewyższyć samą moc optyczną wykorzystywaną przez emitery.

Dlatego przedstawionego rozwiązania nie można dziś traktować jako gotowej metody zmniejszenia rachunków za energię w centrach danych. Znaczenie tej pracy jest bardziej fundamentalne: pokazuje ona, że bardzo silna nieliniowość optyczna może być dostępna również przy ekstremalnie małej liczbie fotonów.

Najważniejsze jest to, że problem może nie być fundamentalny

Przez lata fotoniczne sieci neuronowe miały wyraźne ograniczenie. Światło znakomicie nadaje się do wykonywania transformacji liniowych, ale głębokie uczenie wymaga nieliniowości — a jeśli jej uzyskanie kosztuje dużo energii, część przewagi fotoniki zostaje utracona.

Nowa praca sugeruje, że nie ma fizycznej konieczności angażowania ogromnej liczby fotonów do stworzenia wystarczająco silnej funkcji aktywacji. Pojedynczy układ kwantowy nasyca się już przy bardzo słabym świetle i wprowadza dokładnie ten rodzaj zmiany charakterystyki, którego potrzebuje głęboka sieć neuronowa.

To ważna zmiana perspektywy. Problem nie znika, ale przestaje wyglądać na ograniczenie wynikające z fundamentalnych właściwości światła. Coraz bardziej przypomina niezwykle trudne zadanie inżynieryjne: jak wyprodukować ogromną liczbę odpowiednich emiterów, jak je kontrolować, jak zwiększyć ich szybkość i jak zintegrować je z resztą procesora.

„Kwantowa AI” nie oznacza tutaj komputera kwantowego

Warto wyjaśnić często pojawiające się nieporozumienie. Proponowana architektura nie jest komputerem kwantowym wykonującym obliczenia za pomocą kubitów, superpozycji czy splątania. Informacja przechodząca przez sieć pozostaje klasycznym sygnałem optycznym.

Kwantowy jest mechanizm fizyczny wykorzystany w niewielkim elemencie pełniącym funkcję aktywacji. Pojedynczy emiter ma dyskretne poziomy energetyczne i dzięki ich nasyceniu może bardzo silnie wpływać na klasyczne światło przy niewielkiej liczbie fotonów.

To więc przykład wykorzystania fizyki kwantowej do zbudowania komponentu klasycznego systemu obliczeniowego, a nie próba zastąpienia sieci neuronowej algorytmem działającym na komputerze kwantowym.

Przyszłe procesory AI mogą łączyć elektronikę, fotonikę i fizykę kwantową

Najbardziej realistycznym kierunkiem rozwoju nie wydaje się całkowite zastąpienie tradycyjnej elektroniki światłem. Znacznie bardziej prawdopodobne są systemy hybrydowe, w których każda technologia wykonuje tę część pracy, do której najlepiej pasuje.

Pamięć może pozostać elektroniczna. Układy cyfrowe mogą odpowiadać za sterowanie i część logiki. Mnożenia macierzy można przenieść do fotoniki, wykorzystując propagację i interferencję światła, natomiast emitery kwantowe mogłyby realizować energooszczędne operacje nieliniowe pomiędzy kolejnymi warstwami.

Nie trzeba więc zastępować tranzystora fotonem w każdym miejscu procesora. Wystarczy wykorzystać światło tam, gdzie daje realną przewagę, i zachować elektronikę wszędzie tam, gdzie nadal sprawdza się lepiej.

Od pojedynczego emitera do wielkich modeli AI droga pozostaje ogromna

Nowych wyników nie należy odczytywać jako zapowiedzi, że za kilka lat wielkie modele językowe przeniosą się do kwantowo-optycznych procesorów zużywających kilka watów. Taki komputer nie istnieje. Badanie ma przede wszystkim charakter teoretyczny i numeryczny, a przejście od pojedynczego elementu do układu z ogromną liczbą powtarzalnych emiterów wymagałoby rozwiązania wielu problemów technologicznych.

Mimo to autorzy pokazali coś istotnego. Mechanizm oparty na pojedynczym emiterze może — według symulacji — zapewniać nieliniowość użyteczną w głębokim uczeniu przy niezwykle małej intensywności światła. Co więcej, po zastosowaniu go w modelowanych sieciach pojawiają się zdolności, których brakuje architekturom całkowicie liniowym: od rozdzielania skomplikowanych zbiorów danych po rozwiązywanie zadań uczenia ze wzmocnieniem.

Mały defekt może rozwiązywać bardzo duży problem

Współczesne procesory liczą, kontrolując przepływ ogromnej liczby ładunków elektrycznych. Fotonika proponuje inne podejście: część matematyki wykonuje sama propagacja światła. Fale przechodzą przez odpowiednio zaprojektowaną strukturę, interferują ze sobą i w naturalny sposób realizują określone operacje.

Do tej pory jednym z największych problemów pozostawało znalezienie nieliniowego elementu, który nie zniszczy energetycznej przewagi takiego rozwiązania. Badania nad pojedynczymi emiterami kwantowymi pokazują, że odpowiedź może kryć się w urządzeniu wielkości bakterii — defekcie w diamencie otoczonym nanostrukturą fotoniczną zaprojektowaną tak, aby każda niewielka porcja światła oddziaływała z nim możliwie skutecznie.

Taki emiter sam nie rozpoznaje obrazów, nie rozumie języka i nie steruje robotem. Wykonuje jednak jedną niezwykle ważną rzecz: wprowadza silną nieliniowość przy ekstremalnie małym poziomie energii optycznej. Jeżeli naukowcom uda się w przyszłości produkować takie elementy na dużą skalę, precyzyjnie kontrolować ich parametry, zwiększyć szybkość działania i ograniczyć wymagania dotyczące temperatury, mogą stać się jednym z brakujących elementów potrzebnych do budowy praktycznych głębokich sieci fotonicznych.

Najważniejszy wynik tego badania nie polega więc na stworzeniu gotowego optycznego komputera AI. Naukowcy pokazali coś wcześniejszego, ale potencjalnie fundamentalnego: jedna z największych przeszkód stojących przed energooszczędną fotoniczną sztuczną inteligencją może nie być nieprzekraczalnym ograniczeniem fizyki. Być może jest problemem inżynieryjnym — niezwykle trudnym, ale możliwym do rozwiązania.

FAQ

Dlaczego fotoniczne sieci neuronowe potrzebują nieliniowości?

Same transformacje liniowe można matematycznie sprowadzić do jednej większej transformacji, dlatego dokładanie kolejnych liniowych warstw nie daje pełnych możliwości głębokiej sieci neuronowej. Nieliniowa funkcja aktywacji pozwala kolejnym warstwom tworzyć coraz bardziej złożone reprezentacje danych.

Jak pojedynczy emiter kwantowy może działać jako funkcja aktywacji w optycznej AI?

Pojedynczy emiter kwantowy ma dyskretne poziomy energetyczne i przy wzroście natężenia światła jego przejście zaczyna się nasycać. Dzięki temu odpowiedź przestaje być proporcjonalna do sygnału wejściowego i powstaje nieliniowość potrzebna głębokiej sieci neuronowej.

Jak mało światła potrzebował proponowany element do uzyskania użytecznej nieliniowości?

W analizowanym urządzeniu z pojedynczym emiterem odpowiedni poziom nieliniowości pojawiał się przy intensywności około 0,24 nW/µm². W konfiguracjach porównywanych przez autorów było to znacznie mniej niż dla analizowanej absorpcji saturacyjnej grafenu i efektu Kerra w falowodzie krzemowym.

Czy wynik poniżej 1,2 wata oznacza, że duży model AI mógłby działać przy mocy 1,2 W?

Nie. Wartość poniżej około 1,2 W dotyczyła wyłącznie oszacowanej mocy optycznej potrzebnej do działania nieliniowych elementów aktywacyjnych, a nie całego procesora lub kompletnego systemu AI. Do rzeczywistego zużycia energii trzeba byłoby doliczyć m.in. generowanie światła, pamięć, transformacje liniowe, sterowanie, odczyt wyników, straty i ewentualne chłodzenie.

Czy opisana „kwantowa AI” jest komputerem kwantowym?

Nie. Informacja w proponowanej architekturze pozostaje klasycznym sygnałem optycznym, a fizyka kwantowa jest wykorzystywana w pojedynczym emiterze pełniącym funkcję nieliniowego elementu. Nie jest to komputer wykorzystujący kubity, superpozycję i splątanie do wykonywania algorytmu AI.

Czy naukowcy zbudowali działający fotoniczny procesor AI z emiterami kwantowymi?

Nie. Badanie miało charakter teoretyczny i numeryczny, a właściwości proponowanego elementu wykorzystano w symulowanych sieciach neuronowych. Modele testowano między innymi na MNIST, Fashion-MNIST, grze Pong i środowisku HalfCheetah.

Jakie problemy trzeba rozwiązać, zanim emitery kwantowe trafią do praktycznych procesorów AI?

Do najważniejszych wyzwań należą szybkość działania emiterów, precyzyjne rozmieszczanie i dostrajanie ogromnej liczby elementów, różnice między wytwarzanymi emiterami oraz możliwość pracy bez energochłonnej kriogeniki. Przejście od pojedynczego elementu do procesora zawierającego tysiące lub miliony powtarzalnych urządzeń pozostaje dużym problemem inżynieryjnym.

Jak zaprojektowano nanostrukturę wzmacniającą oddziaływanie światła z emiterem kwantowym?

Naukowcy wykorzystali inverse design, czyli projektowanie odwrotne, w którym algorytm optymalizacyjny szuka geometrii najlepiej realizującej zadany efekt optyczny. Zaprojektowana struktura z fosforku galu na diamencie miała zwiększać sprzężenie światła z centrum SiV− i zajmowała obszar około 1,5 × 0,7 mikrometra.

KOMENTARZE

Michał

Najbardziej zaciekawiło mnie wyjaśnienie, dlaczego sama fotonika nie wystarcza do budowy głębokiej sieci neuronowej. Dopiero kwestia nieliniowości pokazuje, gdzie naprawdę leży problem z optycznymi procesorami AI.

Anna

Dobrze, że wyraźnie zaznaczono, iż te 1,2 wata nie oznacza poboru mocy całego odpowiednika dużego modelu językowego. Bez tego z takiego wyniku bardzo łatwo byłoby wyciągnąć zbyt daleko idące wnioski.

Krzysztof

Zaskoczyła mnie skala różnicy pomiędzy nieliniowością z pojedynczego emitera a rozwiązaniami opartymi na efekcie Kerra. Oczywiście warunków nie da się porównywać jeden do jednego, ale pokazuje to, dlaczego ten kierunek jest interesujący.

Joanna

Najbardziej pomocne było dla mnie wyjaśnienie, czym dokładnie jest centrum SiV w diamencie i dlaczego jego nasycenie może pełnić funkcję aktywacji. Bez tego określenie „kwantowa nieliniowość” brzmiałoby dość abstrakcyjnie.

Paweł

Ciekawy jest sam pomysł wykorzystania algorytmu inverse design do zaprojektowania nanostruktury. Wychodzi na to, że AI może tu nie tylko korzystać z nowego sprzętu, ale również pomagać projektować jego fizyczne elementy.

Monika

Doceniam fragment o ograniczeniach. Kriogenika, strojenie emiterów, dokładność ich rozmieszczenia i produkcja na dużą skalę pokazują, że od dobrej symulacji do praktycznego procesora droga jest jeszcze bardzo długa.

Rafał

Testy z Pongiem i HalfCheetah dobrze pokazują, po co ta nieliniowość jest potrzebna w praktyce. Samo stwierdzenie, że element ma odpowiednią charakterystykę optyczną, byłoby dużo mniej przekonujące bez sprawdzenia go w modelach sieci neuronowych.

Ewa

Ważne było dla mnie doprecyzowanie, że nie chodzi tutaj o komputer kwantowy. Mechanizm pojedynczego emitera jest kwantowy, ale przetwarzany sygnał nadal pozostaje klasycznym sygnałem optycznym.

Tomasz

Najciekawszy wydaje mi się wniosek końcowy: być może problem energooszczędnej nieliniowości w fotonicznym AI nie jest fundamentalnym ograniczeniem fizyki, tylko bardzo trudnym problemem inżynieryjnym. To spora różnica, jeśli myśli się o rozwoju tej technologii w dłuższej perspektywie.

Related Post

Asteroida Ryugu skrywa ślady chemii sprzed miliardów lat. Odkryto amon, azotany i związki ważne dla powstania życia

Asteroida Ryugu skrywa ślady chemii sprzed miliardów lat. Odkryto amon, azotany i związki ważne dla powstania życiaAsteroida Ryugu skrywa ślady chemii sprzed miliardów lat. Odkryto amon, azotany i związki ważne dla powstania życia

Kilka gramów czarnego pyłu przywiezionego na Ziemię z asteroidy Ryugu okazuje się jednym z najcenniejszych archiwów chemicznych w całym Układzie Słonecznym. Najnowsze badania próbek dostarczonych przez japońską misję Hayabusa2 pokazują,

Co naprawdę jedli ludzie tysiące lat temu? Archeologia zaczyna odzyskiwać smaki, zapachy i politykę dawnych kuchni

Co naprawdę jedli ludzie tysiące lat temu? Archeologia zaczyna odzyskiwać smaki, zapachy i politykę dawnych kuchniCo naprawdę jedli ludzie tysiące lat temu? Archeologia zaczyna odzyskiwać smaki, zapachy i politykę dawnych kuchni

Przez dużą część historii archeologii jedzenie pozostawało w cieniu bardziej spektakularnych znalezisk. Monumentalne budowle, broń, biżuteria czy wyposażenie grobów wydawały się znacznie bardziej atrakcyjnymi źródłami wiedzy o dawnych społeczeństwach niż