Key points are not available for this paper at this time.
本論文では、グラフヘッドアテンション(GHA)に基づく新しいタイプの視覚トランスフォーマー(ViT)を提案します。純粋なViTのマルチヘッドアテンション(MHA)は複数のパラメータを必要とし、画像の局所性を失いやすいため、トランスフォーマーの注意ヘッドにグラフを適用することでMHAをGHAに置き換えました。その結果、提案されたGHAは入力パッチの局所性とグローバリティの両方を維持し、注意の多様性を保証します。提案されたGHA-ViTは、CIFAR-10/100、MNIST、およびMNIST-Fデータセットと、中規模のImageNet-1Kデータセットでのスクラッチトレーニングにおいて、純粋なViTベースのモデルよりも一般的に優れた性能を発揮します。約2900万パラメータを持つベースモデルGHA-Bを使用したImageNet-1Kでは、Top-1精度81.7%を達成しました。さらに、CIFAR-10/100では、既存のViTとパラメータが17倍削減され、性能がそれぞれ0.4/4.3%向上しました。提案されたGHA-ViTは、他の最新のViT軽量モデルと比較して、パラメータ数と操作数、精度のレベルにおいて有望な結果を示しています。
Kim et al.(木曜日)はこの質問を研究しました。
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: