Naukowcy z Instytutu Naukowego Weizmanna w Rehovot w Izraelu zbudowali system sztucznej inteligencji, który może zrekonstruować to, na co patrzy dana osoba, wyłącznie na podstawie skanu mózgu fMRI, a także przewidzieć aktywność mózgu danej osoby na podstawie obrazu skierowanego w drugą stronę – donosi MIT Technology Review 1 października 2026 r.

Narzędzie opracowane przez informatyka Michal Irani i jej współpracowników odtwarza oglądane obrazy z precyzją, której nie dorównały wcześniejsze wysiłki dekodowania mózgu. W przypadku bezpośrednich porównań rekonstrukcje modelu zachowują nie tylko ogólny temat sceny, ale także jej strukturę, położenie i treść – utrzymującą się słabość poprzednich systemów, które mogły wygenerować wiarygodnego banana, ale rzadko banana, który dana osoba faktycznie widziała. Więcej kontekstu na ten temat znajdziesz w naszych trendy AI.

Jak działa dekoder mózgu

System jest dwugałęziowym „dekoderem mózgu”. Jedna gałąź przewiduje strukturę obrazu — gdzie w kadrze znajdują się kolory i kształty — druga zaś przewiduje jego zawartość, np. kiść bananów na talerzu. Te połączone przewidywania następnie sterują modelem dyfuzji, tą samą rodziną technik generatywnych sztucznej inteligencji, która stoi za nowoczesnymi generatorami obrazów i wideo, w celu uzyskania ostatecznej rekonstrukcji.

Zespół zaczął od publicznie dostępnych danych ze skanów mózgu: ochotnikom pokazano setki obrazów leżących w skanerach fMRI, które śledzą przepływ natlenionej krwi przez mózg jako wskaźnik aktywności neuronalnej. Grupa Iraniego wykorzystała nowsze zbiory danych przechwycone za pomocą skanerów o wyższej rozdzielczości, gdzie każdy woksel aktywności obejmuje w przybliżeniu jeden milimetr sześcienny tkanki, a nie około trzy milimetry sześcienne w przypadku standardowego skanera.

Szkolenie na pożyczonych danych

Główną przeszkodą był głód danych. Skany fMRI o wysokiej rozdzielczości od osoby oglądającej tysiące obrazów są rzadkością, a modele potrzebne były o wiele więcej, niż było. Rozwiązaniem badaczy było wytrenowanie drugiego modelu w odwrotnej kolejności – kodera, który przewiduje, jak wyglądałby skan mózgu, gdyby danej osobie pokazano dany obraz.

Dzięki wzajemnemu uruchamianiu kodera i dekodera zespół mógł skutecznie generować nieograniczoną liczbę par treningowych. Zacznij od zdjęcia lamparta, przewiduj aktywność fMRI, jaką wywoła, zrekonstruuj obraz na podstawie tej aktywności i udoskonal oba modele pod kątem niedopasowań. Według Irani około 70 procent danych szkoleniowych ostatecznie pochodziło ze zdjęć, które w rzeczywistości nigdy nie zostały pokazane zeskanowanemu ochotnikowi.

Dzięki temu podejściu zespół stworzył coś, co zespół nazwał uniwersalnym koderem mózgu, a jego wydajność jest głównym rezultatem. Poprzednie narzędzia dekodujące zazwyczaj wymagały około 40 godzin danych fMRI, aby skalibrować je pod kątem nowej osoby. Dekoder Irani potrzebuje około godziny — różnica ma znaczenie, ponieważ czas skanowania jest kosztowny. „Nikt z nas nie może sobie pozwolić na 40 godzin obrazowania nowego tematu” – powiedział Tommy Sprague, neurolog z Uniwersytetu Kalifornijskiego w Santa Barbara, który nie był zaangażowany w badania, zauważając, że obrazowanie może kosztować około 600–1000 dolarów za godzinę. Wyniki zaprezentowano we wrześniu na konferencji Cognitive Computational Neuroscience w Nowym Jorku.

Co jest dobre — a co złe

W testach porównawczych narzędzie uzyskało lepsze wyniki niż opisane wcześniej systemy dekodowania mózgu „ze znaczną przewagą” – powiedział Irani w rozmowie z MIT Technology Review. To nie jest nieomylne. Podczas rozmowy wideo wskazała na zdjęcie ciasta, które system zrekonstruował jako stos trzech kanapek, oraz psa w wannie, który wrócił jako koza o podobnym kolorze w tej samej wannie.

Łącząc dane z wielu badań, zespół zidentyfikował również obszary mózgu, które wydają się mieć wspólne funkcje u poszczególnych osób — jeden region reagował na obrazy jedzenia, inny na sport. Irani twierdzi, że obecnie współpracuje z neurologami, aby wykorzystać te narzędzia do bardziej systematycznego mapowania sposobu, w jaki mózg organizuje znaczenie.

Obietnice dla medycyny

Najbliższe nadzieje mają charakter kliniczny. Irani wierzy, że takie podejście może ostatecznie pomóc osobom z zespołem zamknięcia – całkowicie sparaliżowanym pacjentom, którzy nie mogą mówić ani się poruszać – komunikować się za pomocą samej aktywności mózgu. Chce także rozszerzyć tę technikę poza obrazy statyczne na wideo i dźwięk, a długoterminowym celem jest rekonstrukcja wyimaginowanych treści, w tym snów i treści sensorycznej retrospekcji związanych z zespołem stresu pourazowego (PTSD).

Judy Illes, neuroetyk i profesor neurologii na Uniwersytecie Kolumbii Brytyjskiej, która nie była zaangażowana w prace, określiła badania jako „wspaniałe”. „Pomysł [wykorzystania tego podejścia], aby pomóc osobom ze schorzeniami neurologicznymi... terapeutycznie jest niezwykle ekscytujący” – powiedziała MIT Technology Review.

Problem prywatności

Ta sama precyzja stwarza perspektywę, której ta dziedzina od dawna się obawiała: wydobycie obrazów mentalnych danej osoby bez znaczącej zgody. „Wyniki wydają się bardzo imponujące” – powiedział Sprague. „Ale jeśli istnieje sposób na potajemne wydobycie informacji o tym, o czym myślisz, to… 150 lat science fiction może się spełnić w każdej chwili, a to jest niepokojące pod wieloma względami”.

Obawy te pozostają na razie ograniczone przez fizykę. System wymaga godzinnego leżenia wewnątrz wielotonowego magnesu fMRI, a każdy poprzedni dekoder wymagał obszernej kalibracji przeprowadzanej przez każdą osobę. Jednak wymóg kalibracji jest dokładnie tym, co zespół Iraniego właśnie obniżył dziesiątkami, dlatego etycy zwracają uwagę na narzędzie, które okazuje się również przełomem w badaniach.

Kolejne cele grupy Weizmanna — ruchome obrazy i dźwięk, a następnie treści wyobrażone i wyśnione — sprawdzą, czy dokładność tej techniki przetrwa poza starannie kontrolowanymi warunkami laboratorium skanerowego. Jeśli tak się stanie, zarówno zastosowania medyczne, jak i debaty na temat prywatności będą się nasilać jednocześnie.

Szybko poruszające się pole

Dekodowanie mózgu przeszło od rozmytych, ledwo rozpoznawalnych przybliżeń do strukturalnie wiernych rekonstrukcji w ciągu niecałej dekady, dzięki lepszym skanerom, większym współdzielonym zbiorom danych i modelom generatywnym, które mogą wypełnić realistyczne szczegóły z grubych sygnałów. Wkład Weizmanna — wykorzystanie dwukierunkowej pętli koder-dekoder do przełamania wąskiego gardła w danych — polega na tym, że wiedza inżynierska szybko się rozprzestrzenia, ponieważ nie jest zależna od nowego sprzętu. Można się spodziewać, że inne laboratoria powtórzą schemat szkoleniowy i że kwestia tego, kto kontroluje i wyraża zgodę na dane neuronowe, przesunie się z marginesów polityki sztucznej inteligencji w stronę jej centrum.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →