Key points are not available for this paper at this time.
シングルステージ検出器は、高い検出精度とリアルタイムスピードにより大きな注目を集めています。マルチスケールオブジェクトを検出するために、シングルステージ検出器は複数のピラミッド層に基づいてスケールを意識した予測を行います。しかし、浅いピラミッド層における不十分なコンテキスト探索は、小さなオブジェクトの検出精度を満足のいかないものにしています。この問題を解決するために、アテンション適応型の重みを用いてマルチスケールコンテキストを選択的に抽出するスキームを提案します。具体的には、正確な物体検出のための効率的選択的コンテキストネットワークを提案します。このネットワークは、強化されたコンテキストモジュールと三重アテンションモジュールを組み込んでいます。強化されたコンテキストモジュールは、元のスケール、小さなスケール、および大きなスケールのコンテキスト情報を抽出するための複数のブランチで構成されています。このコンテキストを最大限に活用し、ノイズ情報をフィルタリングするために、グローバルレベル、チャネルレベル、および空間レベルのアテンションを含む三重アテンションモジュールを導入し、選択的なコンテキスト融合を実施します。この2つのモジュールは実装が容易で、物体検出の精度を効率的に向上させることができます。私たちの方法の性能は、2つのベンチマークで検証されています:PASCAL VOCとMS COCO。512×512の入力の場合、VGG16を搭載した私たちの検出器は競争力のある結果を達成します(MS COCOの事前学習なしでシングルスケール推論の場合、Pascal VOC 2012テストセットで80.9)。MS COCOテスト開発セットでは、ResNet101を搭載した私たちの検出器が全体の性能においてRetinaNet500を2.5% AP上回り、その速度はTitan XP GPU上で48ミリ秒です。その結果、ESCNetは精度と速度の間でより良いトレードオフを実現します。
Nie et al. (2020) はこの問題を研究しました。
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: