摘要 空间编码器(如CNN和视觉变换器ViTs)与时间调节器(如LSTMs)之间的协作是混合模型的基础,但这种相互作用的动态仍然不太清楚。本研究引入了一个跨领域框架,利用信息理论和马尔可夫信息瓶颈(MIB)原则的指标,来量化这些架构的内部信息流。我们分析了两种不同的模型——用于监控视频的CNN-LSTM和用于医学fMRI序列的ViT-LSTM——在其原始和外部领域的表现。我们的分析揭示了两种根本不同的编码策略。CNN采用了一个严格、与数据无关的“渐进压缩”流程。相比之下,ViT展示了一种“自适应压缩”策略,其中有效信息瓶颈的成功形成取决于数据域。我们展示了这种适应性得到了ViT内部复杂的三阶段功能层次结构的支持。此外,我们发现LSTM调节器的角色会适应其合作伙伴:与CNN配对时,它作为常规压缩器,但与ViT配对时,它切换为“解压缩器”角色,以处理接收到的高度压缩表示。我们提出这种复杂的相互作用体现了一种“动态劳动分工”原则,其中功能角色并非固定,而是从系统与数据的互动中出现。这一见解挑战了对神经网络组件的静态看法,并为更强大、上下文感知的人工智能开启了一条路径。
Zvereva等(Mon,)研究了这个问题。