Key points are not available for this paper at this time.
視覚セグメンテーションは、画像、ビデオフレーム、またはポイントクラウドを複数のセグメントまたはグループに分割することを目的としています。この技術は、自律運転、画像編集、ロボットセンシング、医療分析など、数多くの実世界のアプリケーションがあります。この10年間、深層学習ベースの方法はこの分野で目覚ましい進展を遂げました。最近では、自然言語処理のために元々設計された自己注意に基づく神経ネットワークの一種であるトランスフォーマーが、さまざまな視覚処理タスクにおいて従来の畳み込みまたは再帰的アプローチを大幅に上回っています。特に、視覚トランスフォーマーは、さまざまなセグメンテーションタスクに対して堅牢で統一された、さらにはより簡単なソリューションを提供します。この調査は、トランスフォーマーベースの視覚セグメンテーションの徹底的な概要を提供し、最近の進展を要約します。まず、問題定義、データセット、および以前の畳み込み法を含む背景をレビューします。次に、最近のすべてのトランスフォーマーベースのアプローチを統一するメタアーキテクチャを要約します。このメタアーキテクチャに基づいて、メタアーキテクチャの修正や関連するアプリケーションを含むさまざまな方法設計を検討します。また、3Dポイントクラウドセグメンテーション、ファウンデーションモデルのチューニング、ドメイン意識セグメンテーション、効率的なセグメンテーション、医療セグメンテーションなど、いくつかの特定のサブフィールドを紹介します。さらに、レビューした方法をいくつかの確立されたデータセットでまとめて再評価します。最後に、この分野のオープンチャレンジを特定し、今後の研究の方向性を提案します。プロジェクトページはhttps://github.com/lxtGH/Awesome-Segmentation-With-Transformerで見つけることができます。
Li et al. (Mon,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: