Key points are not available for this paper at this time.
私たちは、畳み込み層の上に新しいエンコーディングレイヤーを統合したディープテクスチャエンコーディングネットワーク(Deep-TEN)を提案します。このネットワークは、辞書学習とエンコーディングパイプライン全体を単一のモデルに統合します。現在の手法は、それぞれの独立したコンポーネントから構築されており、SIFTディスクリプタや事前学習されたCNN機能などのオフ・ザ・シェルフ機能を使用して材料認識のための標準エンコーダを持っています。私たちの新しいアプローチは、固有の視覚用語が損失関数から直接学習されるエンドツーエンドの学習フレームワークを提供します。特徴、辞書、そして分類器のエンコーディング表現はすべて同時に学習されます。この表現は順序を持たないため、特に材料およびテクスチャ認識に有用です。エンコーディングレイヤーは、VLADやフィッシャーベクトルのような堅牢な残差エンコーダを一般化し、学習された畳み込み特徴を転送しやすくするドメイン特有の情報を破棄する特性を持ちます。さらに、様々なサイズとクラスラベルを持つ複数のデータセットを使用した共同訓練がサポートされ、認識性能が向上します。実験結果は、MINC-2500、Flickr Material Database、KTH-TIPS-2b、および最近のデータベースである4D-Light-Field-MaterialやGTOSなどのゴールドスタンダードデータベースを使用した最先端の手法と比較して優れた性能を示しています。システム全体のソースコードは公開されています。
Zhang et al. (木曜日) はこの質問を研究しました。