Key points are not available for this paper at this time.
解码非侵入性脑记录对推动我们对人类认知的理解至关重要,但面临个体差异和复杂神经信号表示的挑战。传统方法需要定制模型和大量试验,并且在视觉重建任务中缺乏可解释性。我们的框架通过3D视觉变换器将3D脑结构与视觉语义相结合。统一特征提取器高效地将fMRI特征与多个级别的视觉嵌入对齐,消除了对个体特定模型的需求,并允许从单次试验数据中提取。这种提取器将多级视觉特征整合为一个网络,简化了与大型语言模型(LLMs)的集成。此外,我们还通过各种与fMRI图像相关的文本数据增强了fMRI数据集,以支持多模态大型模型的发展。与LLM的集成增强了解码能力,使得脑部描述、问答、详细描述、复杂推理和视觉重建等任务成为可能。我们的方法不仅在这些任务中表现优越,而且准确识别和操控脑信号中的基于语言的概念,提高了可解释性,并提供对神经过程的更深入见解。这些进展显著拓宽了非侵入性脑解码在神经科学和人机交互中的适用性,为先进的脑计算机接口和认知模型奠定了基础。
Shen等人(周二)研究了这个问题。