Дослідники з Інституту науки Вейцмана в Реховоті, Ізраїль, створили систему штучного інтелекту, яка може реконструювати те, на що дивиться людина, лише на основі сканування мозку фМРТ — і передбачити мозкову активність людини на основі зображення в іншому напрямку, — повідомляє MIT Technology Review 1 жовтня 2026 року.
Інструмент, розроблений комп’ютерним науковцем Міхал Ірані та її колегами, відтворює переглянуті зображення з точністю, якої не досягли попередні спроби декодування мозку. У паралельних порівняннях реконструкції моделі зберігають не лише загальний предмет сцени, але й її структуру, положення та зміст — постійний недолік попередніх систем, які могли створити правдоподібний банан, але рідко банан, який людина насправді бачила. For more context on this story, see our ongoing more AI stories.
Як працює декодер мозку
Система являє собою двогілковий "декодер мозку". Одна гілка передбачає структуру зображення — де кольори та форми сидять у кадрі — тоді як друга передбачає його вміст, наприклад, пучок бананів на тарілці. Ці комбіновані прогнози потім керують дифузійною моделлю, тим самим сімейством генеративних методів ШІ, що стоять за сучасними генераторами зображень і відео, для створення остаточної реконструкції.
Команда почала з загальнодоступних даних сканування мозку: добровольцям показали сотні зображень, які вони лежали, на фМРТ-сканерах, які відстежують кровотік кисню через мозок як проксі для нейронної активності. Група Ірані використовувала новіші набори даних, отримані сканерами з вищою роздільною здатністю, де кожен воксель активності охоплює приблизно один кубічний міліметр тканини, а не приблизно три кубічні міліметри стандартного сканера.
Навчання запозиченим даним
Головною перешкодою був брак даних. ФМРТ-сканування високої роздільної здатності людини, яка переглядає тисячі зображень, є дефіцитними, а моделей було потрібно набагато більше, ніж існувало. Обхідний шлях дослідників полягав у тому, щоб навчити другу модель у зворотному порядку — кодер, який передбачає, як би виглядало сканування мозку, якби людині показали певне зображення.
Запустивши кодер і декодер один проти одного, команда могла створити фактично необмежену кількість тренувальних пар. Почніть із фотографії леопарда, передбачте активність фМРТ, яку він викличе, реконструюйте зображення на основі цієї активності та уточніть обидві моделі на невідповідності. За словами Ірані, близько 70 відсотків тренувальних даних зрештою були отримані із зображень, які насправді ніколи не були показані відсканованому добровольцю.
Цей підхід створив те, що команда називає універсальним кодувальником мозку, і його ефективність є головним результатом. Попередні інструменти декодування зазвичай вимагали близько 40 годин даних фМРТ для калібрування для нової людини. Декодеру Irani потрібна приблизно одна година — різниця, яка має значення, оскільки час сканування дорогий. «Ніхто з нас не може дозволити собі 40 годин візуалізації для нового об’єкта», — сказав Томмі Спраг, нейробіолог з Каліфорнійського університету в Санта-Барбарі, який не брав участі в дослідженні, зазначивши, що візуалізація може коштувати приблизно від 600 до 1000 доларів США за годину. Висновки були представлені на конференції Cognitive Computational Neuroscience у Нью-Йорку у вересні.
Що стає правильним — і неправильним
У порівняльних тестах інструмент перевершив раніше описані системи декодування мозку «значним відривом», сказав Ірані в MIT Technology Review. Воно не безпомилкове. Під час відеодзвінка вона вказала на зображення торта, яке система реконструювала як купу з трьох бутербродів, і собаку у ванні, яка повернулася як коза такого ж кольору в тій же ванні.
Об’єднавши дані кількох досліджень, команда також визначила ділянки мозку, які, здається, мають спільні функції між людьми — одна область реагувала на зображення їжі, інша — на спорт. Ірані каже, що зараз вона працює з нейробіологами, щоб використати інструменти для картографування того, як мозок організовує значення більш систематично.
Обіцянки для медицини
Найбільш безпосередні надії клінічні. Ірані вважає, що цей підхід може зрештою допомогти людям із синдромом замкнутості — повністю паралізованим пацієнтам, які не можуть говорити чи рухатися — спілкуватися, використовуючи лише активність мозку. Вона також хоче поширити цю техніку за межі статичних зображень на відео та аудіо з довгостроковою метою реконструкції уявного вмісту, включаючи сни та сенсорний вміст спогадів посттравматичного стресу.
Джуді Іллс, нейроетик і професор неврології в Університеті Британської Колумбії, яка не брала участі в роботі, назвала дослідження «чудовим». «Ідея [використання цього підходу], щоб допомогти людям із неврологічними захворюваннями... терапевтично, є надзвичайно захоплюючою», — сказала вона MIT Technology Review.
Проблема конфіденційності
Така ж точність відкриває перспективу, якої поліція давно боялася: вилучення ментальних образів людини без осмисленої згоди. "Результати здаються дуже вражаючими", - сказав Спраг. «Але якщо є спосіб таємно витягти інформацію про те, про що ви думаєте, то... 150 років наукової фантастики можуть втілитися в життя в будь-який час, і це викликає занепокоєння в багатьох відношеннях».
Наразі ці побоювання залишаються пов’язаними з фізикою. Система вимагає, щоб людина годинами лежала всередині багатотонного магніту фМРТ, і кожен попередній декодер потребував ретельного калібрування для кожної людини. Але вимоги до калібрування — це саме те, що команда Ірані щойно скоротила в десятки разів, тому фахівці з етики звертають увагу на інструмент, який також став науковим проривом.
Наступні цілі групи Weizmann — рухомі зображення та звук, а потім уявний і мрійний вміст — перевірять, чи точність техніки виживає поза ретельно контрольованими умовами лабораторії сканера. Якщо це станеться, як медичні програми, так і дебати про конфіденційність разом загостряться.
Поле, що швидко рухається
Декодування мозку прогресувало від розмитих, ледь впізнаваних наближень до структурно достовірних реконструкцій менш ніж за десять років завдяки кращим сканерам, більшим загальним наборам даних і генеративним моделям, які можуть заповнювати реалістичні деталі з грубих сигналів. Внесок Вейцмана — використання двонаправленого циклу кодування-декодера для усунення вузьких місць у даних — це своєрідне інженерне розуміння, яке має тенденцію до швидкого поширення, оскільки воно не залежить від нового обладнання. Очікуйте, що інші лабораторії повторять схему навчання, і очікуйте, що питання про те, хто контролює нейронні дані та дає згоду на них, переміститься з узбіччя політики ШІ до її центру.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →