Los puntos clave no están disponibles para este artículo en este momento.
Los Modelos de Lenguaje Grande (LLMs) han demostrado capacidades supremas en la comprensión y generación de texto, pero no pueden aplicarse directamente a tareas cross-modal sin ajuste fino. Este documento propone un enfoque de aprendizaje in-context cross-modal, habilitando a los LLMs congelados para lograr múltiples tareas de audio en un estilo de pocos ejemplos sin ninguna actualización de parámetros. Específicamente, proponemos un modelo de codec de audio impulsado por LLMs, LLM-Codec, para transferir la modalidad de audio al espacio textual, es decir, representando los tokens de audio con palabras o sub-palabras en el vocabulario de los LLMs, mientras se mantiene una alta calidad de reconstrucción de audio. La idea clave es reducir la heterogeneidad de modalidad entre texto y audio comprimiendo la modalidad de audio en un espacio de tokens de LLMs bien entrenado. Así, la representación de audio puede verse como un nuevo idioma extranjero, y los LLMs pueden aprender el nuevo idioma extranjero con varias demostraciones. En experimentos, investigamos el rendimiento del enfoque propuesto en múltiples tareas de comprensión y generación de audio, por ejemplo, clasificación de emoción en el habla, clasificación de audio, generación de texto a voz, mejora del habla, etc. Los resultados experimentales demuestran que los LLMs equipados con el LLM-Codec propuesto, denominado UniAudio 1.5, impulsados solo por unos pocos ejemplos, pueden lograr las funciones esperadas en escenarios simples. Valida la viabilidad y efectividad del enfoque de aprendizaje in-context cross-modal propuesto. Para facilitar la investigación en el aprendizaje de tareas de audio de pocos ejemplos y LLMs multi-modales, hemos liberado el modelo LLM-Codec como código abierto.
Yang et al. (Fri,) estudiaron esta cuestión.