Key points are not available for this paper at this time.
생성 모델은 오디오 생성 작업에서 상당한 성과를 보여주었습니다. 그러나 기존 모델은 복잡하고 상세한 프롬프트에 어려움을 겪으며, 이로 인해 성능 저하가 발생할 수 있습니다. 우리는 이 문제가 훈련 데이터의 낮은 질과 상대적으로 적은 양에서 비롯된다고 가정합니다. 본 연구에서는 오디오 생성 모델 개선을 위한 풍부한 캡션을 가진 대규모 오디오 데이터셋을 만드는 것을 목표로 합니다. 우리는 예측된 비주얼 캡션, 오디오 캡션 및 태그 레이블을 종합적인 설명으로 변환하기 위해 대형 언어 모델(LLM)을 활용하여 오디오-비주얼 데이터셋의 세부 캡션을 생성하는 자동화된 파이프라인을 개발합니다. 우리는 오디오 이벤트 순서, 발생 장소 및 환경 정보를 포함한 세부 정보가 풍부한 1.66M 고품질 오디오-캡션 쌍으로 구성된 Sound-VECaps 데이터셋을 소개합니다. Sound-VECaps로 훈련하면 복잡한 입력 프롬프트에서 오디오를 이해하고 생성하는 텍스트-오디오 생성 모델의 능력이 크게 향상되어 전체 시스템 성능이 개선됨을 보여줍니다. 또한, 우리는 여러 오디오-언어 작업에서 Sound-VECaps의 절단 연구를 수행하여 오디오-텍스트 표현 학습의 발전 가능성을 제시합니다. 우리의 데이터셋과 모델은 온라인에서 이용 가능합니다.
Yuan et al. (금요일,)이 이 질문을 연구했습니다.