最近のマンバベースのモデルは、長距離の時間的依存関係を効率的にモデル化することにより、スピーチ強化において期待が持たれています。しかし、スピーチ強化マンバ (SEMamba) のようなモデルは、単一スピーカーのシナリオに制限され、カクテルパーティー問題のような複雑なマルチスピーカー環境では苦労しています。これを克服するために、AVSEMambaを導入し、フルフェイスの視覚的手がかりをマンバベースの時間的バックボーンと統合したオーディオビジュアルスピーチ強化モデルです。AVSEMambaは、空間的および時間的な視覚情報を活用することで、困難な条件でのターゲットスピーチのより正確な抽出を可能にします。AVSEC-4チャレンジの開発および盲目的テストセットで評価されたAVSEMambaは、スピーチの可懂性 (STOI)、知覚品質 (PESQ)、および非侵入型品質 (UTMOS) で他のモノラルベースラインを上回り、モノラルリーダーボードで1位を達成しました。
Chao et al. (Tue,) はこの問題を研究しました。
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: