오디오의 텍스트 표현이 대형 언어 모델(LLM)의 오디오 세계 학습과 어떻게 관련이 있을까요? 본 연구는 LLM이 텍스트 데이터로 주로 훈련되었음에도 불구하고 오디오 생성을 위한 프롬프트를 받을 수 있는 정도를 조사합니다. 우리는 오디오 생성의 복잡성을 점진적으로 증가시키는 삼단계 접근 방식을 사용합니다: 1) 음악 노트, 2) 환경 소리, 3) 인간의 말. 텍스트와 오디오 간의 간극을 메우기 위해 코드를 매개체로 활용하여 LLM이 실행할 경우 원하는 오디오 출력을 생성하는 코드를 작성하도록 유도합니다. 생성된 오디오의 품질과 정확성을 평가하기 위해 FAD 및 CLAP 점수를 사용합니다. 우리의 연구 결과는 LLM이 기본적인 오디오 특징은 생성할 수 있지만, 오디오의 복잡성이 증가함에 따라 성능이 저하된다는 것을 보여줍니다. 이는 LLM이 청각 세계에 대한 잠재적 이해를 가지고 있지만, 이 이해를 실질적인 오디오 출력으로 변환하는 능력이 여전히 미비하다는 것을 시사합니다. LLM이 생성하는 오디오의 품질과 다양성을 향상시킬 수 있는 기술에 대한 추가 연구는 텍스트 기반 LLM의 오디오 생성 성능 개선으로 이어질 수 있습니다.
Anbazhagan et al. (Sun,)이 이 질문을 연구했습니다.