Key points are not available for this paper at this time.
自閉症スペクトラム障害 (ASD) と診断された子供は、社会的慣習を理解し、他者の感情を迅速に認識するのに苦労することが多い。感情認識に対する深層学習 (DL) の応用における最近の進歩は、自閉症の子供を支援するためのAI駆動の支援技術の役割を固めている。しかし、大規模な高品質な人間の感情データを収集し、注釈を付けるコストと、データの異なるモダリティ上での不均衡なパフォーマンスの現象は、DLベースの感情認識にとって課題である。これらの課題に応えるため、本論文では、Contrastive Language-Image Pre-training (CLIP) や wav2vec 2.0 のような大規模な事前学習済みモデルをファインチューニングして、テキストに基づいたガイダンスを用いて音声および映像ベースの感情認識を改善する転送学習を探求する。これに基づき、視覚融合モジュールとCLIPの感情プロンプトファインチューニングを含むEmoAsstフレームワークを提案し、さらにCLIPのテキストエンコーダーと、wav2vec 2.0モデル上での音声ベースの感情認識のための教師あり対照学習を活用する。加えて、共同の少数ショット感情分類器が精度を向上させ、実世界のアプリケーションへの大きな適応性を提供する。MELDデータセットに対する評価結果は、我々の手法の優れた性能を示しており、既存のほとんどの映像および音声ベースのアプローチを超えている。特に、我々の研究は、映像および音声ベースの感情認識と分類 (ERC) を改善するための提案されたテキストベースのガイダンス技術の有望な潜在能力を示している。
Wang et al. (Tue,) studied this question.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: