Key points are not available for this paper at this time.
신경 디코딩 연구에서 가장 흥미로운 주제 중 하나는 fMRI 신호를 기반으로 인식된 자연 이미지를 재구성하는 것입니다. 이전 연구들은 저수준 속성(모양, 질감, 배치)이나 고수준 특징(객체의 범주, 장면의 기술적 의미)과 같은 시각적 요소의 다양한 측면을 재현하는 데 성공했지만, 일반적으로 복잡한 장면 이미지의 이러한 속성을 함께 재구성하는 데 실패했습니다. 최근 생성 AI는 고복잡도 이미지를 생성할 수 있는 잠재 확산 모델을 통해 비약적인 발전을 이루었습니다. 여기서 우리는 뇌 디코딩을 위한 이 혁신적인 기술을 어떻게 활용할 수 있는지를 조사합니다. 우리는 'Brain-Diffuser'라는 두 단계 장면 복원 프레임워크를 제시합니다. 첫 번째 단계에서는 fMRI 신호로부터 시작하여 VDVAE(Very Deep Variational Autoencoder) 모델을 사용해 저수준 속성과 전반적인 배치를 포착하는 이미지를 재구성합니다. 두 번째 단계에서는 예측된 다중 모달(텍스트 및 시각) 특징에 조건부인 잠재 확산 모델(다재다능 확산)의 이미지 간 프레임워크를 사용하여 최종 복원된 이미지를 생성합니다. 공개적으로 사용 가능한 Natural Scenes Dataset 벤치마크에서 우리의 방법은 이전 모델보다 정성적 및 정량적으로 모두 우수한 성능을 발휘합니다. 개인 ROI(관심 영역) 마스크에서 생성된 합성 fMRI 패턴에 적용했을 때, 우리의 훈련된 모델은 신경 과학 지식과 일치하는 매력적인 'ROI-최적' 장면을 생성합니다. 따라서 제안된 방법론은 응용(예: 뇌-컴퓨터 인터페이스) 및 기초 신경 과학 모두에 영향을 미칠 수 있습니다.
Özçelik et al. (수요일)이 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: