Key points are not available for this paper at this time.
استرجاع عواطف الكلام هو تقنية مهمة لجمع البيانات على نطاق واسع وبجودة عالية. النهج التقليدي الذي يستخدم مجموعة من نماذج التصنيف قد يحد من تنوع العواطف المسترجعة و/أو يؤدي إلى أداء ضعيف في ظروف الصوت خارج المجال. اللغة الطبيعية متنوعة وغير مرتبطة بمفاهيم صوتية محددة، مما يعكس إمكانات هائلة لتطوير نظام استرجاع عواطف الكلام القائم على اللغة. في هذه الورقة نقدم CLAP4Emo، إطارًا جديدًا لاسترجاع الكلام العاطفي عبر مطالبات اللغة الطبيعية استنادًا إلى تدريب مسبق متباين بين اللغة والصوت. لتعويض غياب التوضيحات التدريبية في مجموعات البيانات العامة الحالية، نقترح إطارًا نظاميًا يطبق ChatGPT لتوليد توضيحات عاطفية. تظهر النتائج التجريبية أن طريقتنا يمكن أن تحسن بشكل فعال تنوع العينات المسترجعة مع الحفاظ على دقة عالية عبر خمس مجموعات بيانات مرجعية. من خلال الاستفادة من نماذج اللغة الكبيرة، نؤسس ارتباطًا بين الصوت واللغة لوصف العواطف، مما يؤدي إلى نظام استرجاع بديهي وتفاعلي. نحن نطلق التوضيحات العاطفية المولدة على: https://github.com/boschresearch/soundsee-emo-caps
درس Lin وآخرون (Mon,) هذا السؤال.