Key points are not available for this paper at this time.
视觉媒介(图像和视频)自然包含大量信息冗余,从而提供了提高处理效率的绝佳机会。尽管基于视觉变换器(ViT)的模型在处理大规模数据时表现有效,但它们未能利用这种固有的冗余,导致计算成本较高。专家混合(MoE)网络展示了可扩展性,同时保持相同的推理时间成本,但它们的参数开销较大。我们提出了嵌套专家混合(MoNE),这种方法利用嵌套结构为专家,其中每个专家都处于一个逐渐增加的计算-准确率曲线下。在给定计算预算的情况下,MoNE学习动态选择优先顺序的标记,因此冗余标记通过更便宜的嵌套专家进行处理。使用该框架,我们在性能上达到了与基线模型相当的水平,同时将推理时间的计算减少了超过两倍。我们在标准图像和视频数据集(ImageNet-21K、Kinetics400 和 Something-Something-v2)上验证了我们的方法。我们进一步强调了MoNE的适应性,通过展示它在不同推理时间计算预算下在视频中保持强大性能的能力,只使用一个训练好的模型。
Jain et al. (Mon,) 研究了这个问题。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: