Key points are not available for this paper at this time.
我々は、画像のコレクションを使用して人間の監視なしにローカル特徴パイプラインをゼロから学習するための新しい深層アーキテクチャとトレーニング戦略を提案します。そのために、深度および相対カメラポーズの手がかりを利用して、ネットワークが他の画像の出力に基づいて1つの画像で達成すべき仮想的なターゲットを作成します。このプロセスは本質的に微分不可能ですが、我々はそれを1つのブランチに制限し、もう1つのブランチで微分可能性を保持することで、二重ブランチの設定でネットワークを最適化できることを示します。我々の手法は、屋内および屋外のデータセットで訓練されており、前者には3Dセンサーからの深度データを、後者には市販の構造からのモーションソリューションからの深度推定を使用しています。我々のモデルは、両方のデータセットにおけるスパース特徴マッチングにおいて最新の技術を上回り、QVGA画像で60fps以上で動作します。
大野ら(木曜日)はこの問題を研究しました。