Key points are not available for this paper at this time.
You Only Look Once(YOLO)シリーズの検出器は、効率的で実用的なツールとして確立されています。しかし、事前定義されたトレーニング済みのオブジェクトカテゴリへの依存が、オープンなシナリオでの適用性を制限しています。この制限に対処するために、YOLO-Worldを紹介します。これは、視覚と言語のモデリングを通じてYOLOにオープンボキャブラリー検出機能を強化する革新的なアプローチです。具体的には、新しい再パラメータ化可能な視覚-言語パス集約ネットワーク(RepVL-PAN)と領域-テキスト対比損失を提案し、視覚情報と言語情報の相互作用を促進します。我々の方法は、高い効率でゼロショットの方式で広範なオブジェクトを検出するのに優れています。挑戦的なLVISデータセットにおいて、YOLO-WorldはV100で35.4 APと52.0 FPSを達成し、精度と速度の両面で多くの最先端手法を上回ります。さらに、微調整されたYOLO-Worldは物体検出やオープンボキャブラリーインスタンスセグメンテーションを含むいくつかの下流タスクで顕著なパフォーマンスを発揮します。コードとモデルは以下から入手できます:https://github.com/AILab-eve/YOLO-World。
Cheng et al.(2024)はこの問題を研究しました。