Key points are not available for this paper at this time.
大規模ビジョン-ランゲージモデル(LVLM)は最近、オープンワールドの視覚理解において強力な能力を示し、重要な進展を遂げました。しかし、LVLMが現実の人口統計的偏見、特に性別、肌の色、年齢などの属性における格差にどのように対処しているかはまだ明らかではありません。本論文では、いくつかの主流のLVLMにおける視覚的公平性を実証的に調査し、公共の公平性ベンチマークデータセット(例:FACET)に基づいて敏感な人口統計属性におけるパフォーマンスの格差を監査します。LVLMにおける視覚的バイアスを明らかにするために、視覚的質疑応答/分類タスクに対する直接的な質問と単一選択質問の指示付きプロンプトを使った公平性評価フレームワークを設計しました。ゼロショットプロンプティングの結果は、視覚理解の向上にもかかわらず、オープンソースおよびクローズドソースのLVLMが異なる指示プロンプトや人口統計属性にわたって広範な公平性の問題を示していることを示しています。”},{
Wu et al. (2024) studied this question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: