Key points are not available for this paper at this time.
Métodos recentes para síntese de cabeças falantes dirigidas por áudio frequentemente otimizam campos de radiação neural (NeRF) em um vídeo monocular de retrato falante, aproveitando sua capacidade de renderizar quadros novos de alta fidelidade e consistentes em 3D. No entanto, eles frequentemente têm dificuldade em reconstruir a geometria facial completa devido à ausência de informações 3D abrangentes nos vídeos monoculares de entrada. Neste artigo, introduzimos uma nova estrutura de síntese de cabeças falantes direcionada por áudio, chamada Talk3D, que pode reconstruir fielmente suas geometrias faciais plausíveis ao adotar efetivamente o princípio generativo 3D pré-treinado. Dado o modelo generativo 3D personalizado, apresentamos uma nova arquitetura U-Net com atenção guiada por áudio que prevê as variações dinâmicas da face no espaço NeRF impulsionadas por áudio. Além disso, nosso modelo é ainda modulado por tokens de condicionamento não relacionados ao áudio que efetivamente desacoplam variações não relacionadas a características de áudio. Comparado aos métodos existentes, nosso método se destaca na geração de geometrias faciais realistas mesmo sob poses extremas da cabeça. Também conduzimos experimentos extensivos mostrando que nossa abordagem supera os benchmarks de estado da arte em termos de avaliações quantitativas e qualitativas.
Ko et al. (Sex,) estudaram essa questão.