Key points are not available for this paper at this time.
深層畳み込みニューラルネットワーク(CNN)の精度は、一般的に高解像度画像を用いることで向上します。しかし、これはしばしば高い計算コストと大きなメモリ使用量を伴います。画像のすべての領域がタスク関連であるわけではないという事実に触発され、元の画像から戦略的に選択された比較的小さな入力のシーケンスを処理することによって効率的な画像分類を行う新しいフレームワークを提案します。このような動的な意思決定プロセスは、テスト時の適応推論を自然に促進し、モデルが予測に対して十分な自信を持った時点で終了することができ、さらなる冗長な計算を回避します。特に、我々のフレームワークは汎用性があり、ほとんどの最新の軽量CNN(MobileNets、EfficientNets、RegNetsなど)に対応しているため、バックボーンの特徴抽出器として便利に展開できます。ImageNetにおける実験では、我々の手法が多様な深層モデルの計算効率を一貫して向上させることを示しています。例えば、iPhone XS Max上の非常に効率的なMobileNet-V3の平均遅延を20%削減しながら、精度を犠牲にすることはありません。コードと事前学習モデルはhttps://github.com/blackfeather-wang/GFNet-Pytorchで入手可能です。
Wang et al. (Sun)はこの問題を研究しました。