Key points are not available for this paper at this time.
في هذا العمل، نطور تقنية لتدريب الميزات مباشرة من شكل موجة الكلام أحادي القناة من أجل تحسين أداء اكتشاف كلمات التنبيه (WW). عادةً ما تستخرج أنظمة التعرف على الكلام التقليدية تمثيل ميزات مضغوط بناءً على المعرفة السابقة مثل طاقة بنك الفلاتر اللوغاريتمي (LFBE). تُستخدم هذه الميزة بعد ذلك لتدريب نموذج صوتي (AM) لشبكة عصبية عميقة (DNN). على النقيض من ذلك، نقوم بتدريب نموذج WW DNN AM مباشرةً من بيانات الصوت أحادي القناة بطريقة تدريجية. أولاً، نبني شبكة DNN لاستخراج المميزات مع طبقة عنق زجاجة مخفية صغيرة، وندرب هذا التمثيل المميز باستخدام نفس دالة الهدف عبر المهام المتعددة كنا نستخدمها لتدريب WW DNNs. ثم، يتم تدريب شبكة DNN لتصنيف WW باستخدام ميزات عنق الزجاجة المدخلة، مع الحفاظ على طبقات استخراج الميزات ثابتة. أخيرًا، يتم دمج شبكات DNN لاستخراج الميزات والتصنيف ثم تحسينها بشكل مشترك. نظهر فعالية هذه التقنية التدريبية التدريجية من خلال مجموعة من التجارب على بيانات حقيقية تم تشكيلها بشعاع في بيئة بعيدة. تُظهر نتائج التجارب أن شبكة DNN المدخلة للصوت توفر معدلات غياب أقل بكثير لنطاق من معدلات الإنذار كاذبة مقارنةً بـ LFBE عندما تتوفر كمية كافية من بيانات التدريب، مما يؤدي إلى تحسين نسبي يقارب 12% في المساحة تحت المنحنى (AUC).
قام Kumatani وزملاؤه (الجمعة) بدراسة هذا السؤال.