Các nhà nghiên cứu tại Viện Khoa học Weizmann ở Rehovot, Israel đã xây dựng một hệ thống trí tuệ nhân tạo có thể tái tạo lại những gì một người đang nhìn chỉ dựa trên kết quả quét não fMRI của họ - và dự đoán hoạt động não của một người từ một hình ảnh theo hướng khác - MIT Technology Review đưa tin vào ngày 1 tháng 10 năm 2026.

Công cụ này do nhà khoa học máy tính Michal Irani và các đồng nghiệp của cô phát triển, tái tạo các hình ảnh được xem với độ chính xác mà những nỗ lực giải mã não trước đó chưa thể sánh được. Trong các so sánh song song, việc tái tạo mô hình không chỉ bảo tồn chủ đề chung của một cảnh mà còn bảo tồn cấu trúc, vị trí và nội dung của nó - một điểm yếu dai dẳng của các hệ thống trước đó, có thể tạo ra một quả chuối hợp lý nhưng hiếm khi tạo ra quả chuối mà người đó thực sự nhìn thấy. For more context on this story, see our ongoing breaking AI news.

Bộ giải mã não hoạt động như thế nào

Hệ thống này là một "bộ giải mã não" hai nhánh. Một nhánh dự đoán cấu trúc của hình ảnh - nơi màu sắc và hình dạng nằm trong khung - trong khi nhánh thứ hai dự đoán nội dung của nó, chẳng hạn như một nải chuối trên đĩa. Những dự đoán kết hợp đó sau đó sẽ điều khiển một mô hình khuếch tán, cùng một nhóm kỹ thuật AI tổng hợp đằng sau các trình tạo hình ảnh và video hiện đại, để tạo ra bản tái tạo cuối cùng.

Nhóm nghiên cứu bắt đầu từ dữ liệu quét não có sẵn công khai: các tình nguyện viên đã được xem hàng trăm hình ảnh khi nằm trong máy quét fMRI, theo dõi lưu lượng máu được oxy hóa qua não như một đại diện cho hoạt động thần kinh. Nhóm của Irani đã sử dụng các bộ dữ liệu mới hơn được ghi lại trên các máy quét có độ phân giải cao hơn, trong đó mỗi voxel hoạt động bao phủ khoảng một milimét khối mô thay vì khoảng ba milimét khối của một máy quét tiêu chuẩn.

Đào tạo về dữ liệu mượn

Trở ngại chính là nạn đói dữ liệu. Quét fMRI độ phân giải cao từ một người xem hàng nghìn hình ảnh là rất khan hiếm và các mô hình cần nhiều hơn những gì hiện có. Cách giải quyết của các nhà nghiên cứu là đào tạo mô hình thứ hai theo chiều ngược lại - một bộ mã hóa dự đoán kết quả quét não sẽ như thế nào nếu một người được hiển thị một hình ảnh nhất định.

Bằng cách chạy bộ mã hóa và bộ giải mã với nhau, nhóm có thể tạo ra các cặp huấn luyện không giới hạn một cách hiệu quả. Bắt đầu với bức ảnh của một con báo, dự đoán hoạt động fMRI mà nó sẽ tạo ra, tái tạo lại hình ảnh từ hoạt động đó và tinh chỉnh cả hai mô hình về những điểm không khớp. Theo Irani, khoảng 70% dữ liệu đào tạo cuối cùng đến từ những hình ảnh chưa bao giờ được hiển thị thực sự cho một tình nguyện viên được quét.

Cách tiếp cận này đã tạo ra thứ mà nhóm nghiên cứu gọi là bộ mã hóa não phổ quát và hiệu quả của nó là kết quả nổi bật. Các công cụ giải mã trước đây thường yêu cầu khoảng 40 giờ dữ liệu fMRI để hiệu chỉnh cho một người mới. Bộ giải mã của Irani cần khoảng một giờ - một sự khác biệt quan trọng vì thời gian quét rất tốn kém. Tommy Sprague, nhà khoa học thần kinh tại Đại học California, Santa Barbara, người không tham gia vào nghiên cứu, cho biết: “Không ai trong chúng tôi có đủ khả năng chi trả 40 giờ để chụp ảnh cho một đối tượng mới”. Ông lưu ý rằng việc chụp ảnh có thể tốn khoảng 600 đến 1.000 USD mỗi giờ. Những phát hiện này đã được trình bày tại hội nghị Khoa học thần kinh tính toán nhận thức ở New York vào tháng 9.

Điều gì đúng — và điều gì sai

Trong các thử nghiệm so sánh, công cụ này vượt trội hơn các hệ thống giải mã não được mô tả trước đây “một cách đáng kể”, Irani nói với MIT Technology Review. Nó không phải là không thể sai lầm. Qua một cuộc gọi điện video, cô ấy chỉ vào hình ảnh một chiếc bánh mà hệ thống tái tạo lại thành một đống ba chiếc bánh sandwich và một con chó trong bồn tắm trở lại thành một con dê có màu tương tự trong cùng một bồn tắm.

Bằng cách tổng hợp dữ liệu từ nhiều nghiên cứu, nhóm nghiên cứu cũng xác định được các vùng não dường như có chung chức năng giữa các cá nhân - một vùng phản ứng với hình ảnh về đồ ăn, vùng khác phản ứng với thể thao. Irani cho biết cô hiện đang làm việc với các nhà khoa học thần kinh để sử dụng các công cụ nhằm lập bản đồ cách bộ não tổ chức ý nghĩa một cách có hệ thống hơn.

Lời hứa về y học

Hy vọng trước mắt nhất là lâm sàng. Irani tin rằng phương pháp này cuối cùng có thể giúp những người mắc hội chứng bị nhốt - những bệnh nhân bị liệt hoàn toàn, không thể nói hoặc cử động - giao tiếp chỉ bằng hoạt động của não. Cô cũng muốn mở rộng kỹ thuật này ngoài hình ảnh tĩnh sang video và âm thanh, với mục tiêu lâu dài là tái tạo lại nội dung tưởng tượng, bao gồm cả những giấc mơ và nội dung cảm giác của những đoạn hồi tưởng về PTSD.

Judy Illes, nhà thần kinh học và giáo sư thần kinh học tại Đại học British Columbia, người không tham gia vào nghiên cứu, đã mô tả nghiên cứu này là "tuyệt vời". Cô nói với MIT Technology Review: “Ý tưởng [sử dụng phương pháp này] để giúp đỡ những người mắc bệnh thần kinh… về mặt trị liệu là vô cùng thú vị”.

Vấn đề về quyền riêng tư

Độ chính xác tương tự làm tăng triển vọng mà lĩnh vực này đã lo sợ từ lâu: trích xuất hình ảnh tinh thần của một người mà không có sự đồng ý có ý nghĩa. Sprague nói: “Kết quả có vẻ rất ấn tượng”. “Nhưng nếu có cách nào đó để lén lút trích xuất thông tin về điều bạn đang nghĩ đến, thì… khoa học viễn tưởng 150 năm có thể trở thành hiện thực bất cứ lúc nào, và điều đó thật đáng lo ngại về nhiều mặt.”

Những mối quan tâm đó cho đến nay vẫn bị giới hạn bởi vật lý. Hệ thống này yêu cầu một người nằm bên trong một nam châm fMRI nặng hàng giờ và mọi bộ giải mã trước đó đều cần hiệu chỉnh rộng rãi cho mỗi người. Nhưng yêu cầu hiệu chỉnh chính xác là thứ mà nhóm của Irani vừa cắt giảm hàng chục lần, đó là lý do tại sao các nhà đạo đức học đang chú ý đến một công cụ cũng tình cờ là một bước đột phá trong nghiên cứu.

Mục tiêu tiếp theo của nhóm Weizmann – hình ảnh và âm thanh chuyển động, sau đó là nội dung tưởng tượng và mơ – sẽ kiểm tra xem độ chính xác của kỹ thuật có tồn tại bên ngoài các điều kiện được kiểm soát cẩn thận của phòng thí nghiệm máy quét hay không. Nếu đúng như vậy, cả ứng dụng y tế và các cuộc tranh luận về quyền riêng tư sẽ cùng nhau leo ​​thang.

Một lĩnh vực chuyển động nhanh

Việc giải mã não đã phát triển từ những giá trị gần đúng mờ, khó nhận biết đến việc tái tạo trung thực về mặt cấu trúc trong vòng chưa đầy một thập kỷ, được thúc đẩy bởi các máy quét tốt hơn, bộ dữ liệu được chia sẻ lớn hơn và các mô hình tổng hợp có thể điền chi tiết thực tế từ các tín hiệu thô. Đóng góp của Weizmann — sử dụng vòng lặp bộ mã hóa-giải mã hai chiều để phá vỡ nút thắt cổ chai dữ liệu — là loại hiểu biết sâu sắc về kỹ thuật có xu hướng lan truyền nhanh chóng vì nó không phụ thuộc vào phần cứng mới. Mong đợi các phòng thí nghiệm khác sẽ nhân rộng kế hoạch đào tạo và mong đợi câu hỏi ai kiểm soát và đồng ý với dữ liệu thần kinh sẽ chuyển từ bên lề của chính sách AI về trung tâm của nó.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →