Key points are not available for this paper at this time.
ध्वनि-भाषा मॉडल (ALMs) ध्वनियों को संसाधित करते हैं ताकि ध्वनि-उत्पादक घटनाओं और दृश्यों का भाषाई विवरण प्रदान किया जा सके। कम्प्यूटिंग शक्ति और डेटा सेट बनाने में हालिया उन्नतियों ने इस क्षेत्र में महत्वपूर्ण प्रगति की है। यह पेपर उन मौजूदा डेटा सेट्स का सर्वेक्षण करता है जो ऑडियो-भाषा मॉडल को प्रशिक्षित करने के लिए उपयोग किए जाते हैं, मॉडल के प्रदर्शन को बढ़ाने के लिए बड़े, विविध डेटा सेट्स के उपयोग की हाल की प्रवृत्ति पर जोर देते हुए। इन डेटा सेट्स के प्रमुख स्रोतों में Freesound प्लेटफॉर्म और AudioSet शामिल हैं, जिन्होंने इस क्षेत्र की तेजी से वृद्धि में योगदान दिया है। हालांकि पूर्व सर्वेक्षण मुख्य रूप से तकनीकों और प्रशिक्षण विवरणों को संबोधित करते हैं, यह सर्वेक्षण विभिन्न डेटा सेट्स को श्रेणीबद्ध और मूल्यांकित करता है, उनके उत्पत्ति, विशेषताओं और उपयोग के मामलों को संबोधित करता है। यह डेटा लीक विश्लेषण भी करता है ताकि डेटा सेट की अखंडता सुनिश्चित की जा सके और डेटा सेट्स के बीच पूर्वाग्रह को कम किया जा सके। यह सर्वेक्षण दिसंबर 2023 तक के शोध पत्रों का विश्लेषण करके किया गया था, और इसमें उस अवधि के बाद के किसी भी पत्र शामिल नहीं हैं।
Wijngaard et al. (मंगलवार,) ने इस प्रश्न का अध्ययन किया।