Key points are not available for this paper at this time.
토킹 헤드 합성은 비디오 제작 산업을 위한 유망한 접근 방식입니다. 최근, 이 연구 분야에서는 생성 품질을 개선하거나 모델 일반화를 향상시키기 위한 많은 노력이 기울어졌습니다. 그러나 두 가지 문제를 동시에 해결할 수 있는 작업은 거의 없으며, 이는 실용적인 응용을 위해 필수적입니다. 이를 위해 본 논문에서는 새롭게 떠오르는 강력한 잠재 확산 모델에 주목하고, 토킹 헤드 생성을 오디오 기반의 시간적으로 일관된 노이즈 제거 과정(DiffTalk)으로 모델링합니다. 보다 구체적으로, 오디오 신호를 단일 주요 요소로 사용하는 대신, 토킹 페이스의 제어 메커니즘을 조사하고, 성격 인식 일반화 합성을 위한 조건으로 참고 얼굴 이미지와 랜드마크를 통합합니다. 이러한 방식으로 제안된 DiffTalk는 출처 오디오와 동기화된 고품질 토킹 헤드 비디오를 생성할 수 있으며, 더 중요하게는 추가적인 미세 조정 없이 다양한 정체성에 자연스럽게 일반화될 수 있습니다. 또한, 우리의 DiffTalk는 미미한 추가 계산 비용으로 고해상도 합성을 우아하게 조정할 수 있습니다. 광범위한 실험 결과, 제안된 DiffTalk는 일반화된 새로운 정체성을 위한 고충실도의 오디오 기반 토킹 헤드 비디오를 효율적으로 합성함을 보여줍니다. 더 많은 비디오 결과는 https://sstzal.github.io/DiffTalk/를 참고하시기 바랍니다.
Shen et al. (Thu,)는 이 질문을 연구했습니다.