Исследователи из Научного института Вейцмана в Реховоте, Израиль, создали систему искусственного интеллекта, которая может реконструировать то, на что смотрит человек, на основе только его фМРТ-сканирования мозга — и предсказывать активность мозга человека по изображению в другом направлении, — сообщил MIT Technology Review 1 октября 2026 года.
Инструмент, разработанный ученым-компьютерщиком Михал Ирани и ее коллегами, воссоздает наблюдаемые изображения с точностью, с которой не могли сравниться предыдущие попытки декодирования мозга. При параллельных сравнениях реконструкции модели сохраняют не только общий предмет сцены, но и ее структуру, положение и содержание — постоянный недостаток предыдущих систем, которые могли генерировать правдоподобный банан, но редко тот банан, который человек действительно видел. Подробнее об этой истории — в нашем последние разработки в ИИ.
Как работает мозговой декодер
Система представляет собой двухветвевой «декодер мозга». Одна ветвь предсказывает структуру изображения — расположение цветов и форм в кадре, а вторая — его содержимое, например связку бананов на тарелке. Эти объединенные прогнозы затем управляют диффузионной моделью — тем же семейством генеративных методов искусственного интеллекта, которые лежат в основе современных генераторов изображений и видео, — для создания окончательной реконструкции.
Команда начала с общедоступных данных сканирования мозга: добровольцам показывали сотни изображений, пока они лежали в сканерах фМРТ, которые отслеживают поток насыщенной кислородом крови через мозг как показатель активности нейронов. Группа Ирани использовала новые наборы данных, полученные на сканерах с более высоким разрешением, где каждый воксел активности покрывает примерно один кубический миллиметр ткани, а не примерно три кубических миллиметра стандартного сканера.
Обучение на заимствованных данных
Главным препятствием был недостаток данных. Сканирования фМРТ с высоким разрешением, сделанные человеком, просматривающим тысячи изображений, редки, а моделей требовалось гораздо больше, чем существовало. Обходной путь исследователей состоял в том, чтобы обучить вторую модель в обратном порядке — кодировщик, который предсказывает, как будет выглядеть сканирование мозга, если человеку покажут заданное изображение.
Запустив кодер и декодер друг против друга, команда могла генерировать практически неограниченное количество обучающих пар. Начните с фотографии леопарда, предскажите активность фМРТ, которую он будет производить, реконструируйте изображение по этой активности и уточните обе модели на предмет несоответствий. По словам Ирани, около 70 процентов данных обучения в конечном итоге были получены из изображений, которые никогда не показывали сканированному добровольцу.
Этот подход позволил создать то, что команда называет универсальным мозговым кодировщиком, и его эффективность является главным результатом. Предыдущим инструментам декодирования обычно требовалось около 40 часов данных фМРТ для калибровки под нового человека. Декодеру Ирани требуется примерно один час — разница имеет значение, поскольку время сканирования стоит дорого. «Никто из нас не может позволить себе 40 часов визуализации нового объекта», — сказал Томми Спрэг, нейробиолог из Калифорнийского университета в Санта-Барбаре, который не участвовал в исследовании, отметив, что визуализация может стоить примерно от 600 до 1000 долларов в час. Результаты были представлены на конференции по когнитивно-вычислительной нейробиологии в Нью-Йорке в сентябре.
Что правильно, а что неправильно
В сравнительных тестах инструмент «значительно» превзошел ранее описанные системы декодирования мозга, сообщил Ирани MIT Technology Review. Это не является непогрешимым. Во время видеозвонка она указала на изображение торта, который система реконструировала как стопку из трех сэндвичей, и собаки в ванне, которая вернулась в виде козы такого же цвета в той же ванне.
Объединив данные нескольких исследований, команда также определила области мозга, которые, по-видимому, имеют общие функции у разных людей: одна область реагировала на изображения еды, другая — на спорт. Ирани говорит, что сейчас она работает с нейробиологами, чтобы использовать инструменты для более систематического картирования того, как мозг организует смысл.
Обещания для медицины
Самые ближайшие надежды связаны с клиническими исследованиями. Ирани считает, что этот подход может в конечном итоге помочь людям с синдромом запертости — полностью парализованным пациентам, которые не могут говорить и двигаться, — общаться, используя только активность мозга. Она также хочет распространить эту технику за пределы статических изображений на видео и аудио, преследуя долгосрочную цель — реконструировать воображаемый контент, включая сны и сенсорное содержание воспоминаний о посттравматическом стрессе.
Джуди Иллес, нейроэтик и профессор неврологии Университета Британской Колумбии, не принимавшая участия в работе, назвала исследование «великолепным». «Идея [использования этого подхода] для помощи людям с неврологическими заболеваниями… с терапевтической точки зрения чрезвычайно интересна», — сказала она в интервью MIT Technology Review.
Проблема конфиденциальности
Та же самая точность открывает перспективу, которой давно боялись в этой области: извлечение мысленных образов человека без значимого согласия. «Результаты кажутся очень впечатляющими», — сказал Спрэг. «Но если есть способ тайно получить информацию о том, о чем вы думаете, тогда… 150 лет научной фантастики могут стать реальностью в любое время, и это во многих отношениях вызывает беспокойство».
Эти опасения пока остаются ограниченными физикой. Система требует, чтобы человек часами лежал внутри многотонного магнита для фМРТ, а каждый предыдущий декодер нуждался в тщательной индивидуальной калибровке. Но требование калибровки — это именно то, что команда Ирани только что сократила в десятки раз, поэтому специалисты по этике обращают внимание на инструмент, который также является исследовательским прорывом.
Следующие цели группы Вейцмана — движущиеся изображения и звук, а затем воображаемый и воображаемый контент — проверят, выживет ли точность метода за пределами тщательно контролируемых условий лаборатории сканирования. Если это произойдет, то и медицинские применения, и дебаты о конфиденциальности будут обостряться одновременно.
Быстро движущееся поле
Декодирование мозга менее чем за десять лет превратилось из размытых, едва распознаваемых приближений в структурно точные реконструкции благодаря более совершенным сканерам, более крупным общим наборам данных и генеративным моделям, которые могут воспроизводить реалистичные детали из грубых сигналов. Вклад Вейцмана — использование двунаправленного цикла кодирования-декодера для преодоления «узких мест» в данных — представляет собой своего рода инженерную идею, которая имеет тенденцию быстро распространяться, поскольку она не зависит от нового оборудования. Ожидайте, что другие лаборатории повторят схему обучения, и ожидайте, что вопрос о том, кто контролирует и дает согласие на использование нейронных данных, переместится с периферии политики ИИ в ее центр.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →