تدرس هذه العمل تحسين الكلام (SE) من منظور نماذج اللغة (LMs). نقترح طريقة جديدة تستفيد من تحسين التفضيل المباشر (DPO) لتحسين الجودة الإدراكية للكلام المحسن. باستخدام UTMOS، وهو نموذج توقع MOS عصبي، كنموذج بديل للتقييمات البشرية، توجه مقاربتنا تحسين النتائج نحو المخرجات المفضلة إدراكياً. وهذا يختلف عن طرق SE المستندة إلى نماذج اللغة الحالية التي تركز على تعظيم احتمالية رموز الكلام النظيف، مما قد يؤدي إلى عدم توافق مع الإدراك البشري وتدهور الجودة على الرغم من انخفاض خطأ التوقع. تظهر التجارب على مجموعات اختبار تحدي كبح الضوضاء العميقة لعام 2020 أن تطبيق DPO على نموذج SE المستند إلى نموذج لغة مدرب مسبقًا يؤدي إلى تحسينات متسقة عبر مقاييس جودة الكلام المختلفة، مع مكاسب نسبية تصل إلى 56%. ولعلمنا، هذه هي المرة الأولى التي يتم فيها تطبيق DPO على SE والأولى التي تتضمن التغذية الراجعة الإدراكية البديلة في تدريب SE المستند إلى نموذج لغة، مما يشير إلى اتجاه واعد نحو SE المتوائم إدراكياً.
درس لي وآخرون (مون،) هذا السؤال.