Key points are not available for this paper at this time.
لقد حظيت تمثيلات الكلام المنفصلة باهتمام حديث بسبب فعاليتها في تدريب النماذج المعتمدة على المحولات لمهام متعددة تتعلق بالكلام مثل التعرف التلقائي على الكلام، والترجمة، والتحقق من الهوية للمتحدث، والنماذج الأساسية المشتركة للكلام والنص. في هذا العمل، نقدم تحليلًا شاملاً لبناء نظم التعرف التلقائي على الكلام باستخدام الرموز المنفصلة. نستكشف طرقًا مختلفة لتدريب الرموز مثل مخططات التكميم والترميز في مجال الزمن مقابل ترميز الميزات الطيفية. كما نستعرض تقنيات تدريب ASR التي تهدف إلى تحسين الأداء وكفاءة التدريب وقوة التحمل ضد الضوضاء. استنادًا إلى نتائجنا، نقدم خط أنابيب ASR باستخدام الرموز الذي يتفوق على Encodec عند معدل بت مماثل. من المثير للإعجاب أنه يتجاوز أيضًا نتائج الحالة الحالية التي حققتها نماذج قوية ذات إشراف ذاتي على معيار ML-SUPERB لـ 143 لغة على الرغم من كونه أصغر حجمًا وتم تدريبه على كمية بيانات أقل بكثير.
درس داوان وآخرون (الأربعاء) هذا السؤال.