Key points are not available for this paper at this time.
강력한 생성 모델과 대규모 인터넷 데이터를 사용하여 텍스트-비디오 생성에서 상당한 발전이 이루어졌습니다. 그러나 생성된 비디오 내에서 특정 캐릭터의 움직임과 외형, 시점 이동 등 개별 개념을 정확하게 제어하는 데 여전히 상당한 도전 과제가 남아 있습니다. 본 연구에서는 각 개념을 3D 표현으로 별도로 생성한 후, 이를 대형 언어 모델(LLM)과 2D 확산 모델의 사전 정보와 조합하는 새로운 패러다임을 제안합니다. 구체적으로, 입력 텍스트 프롬프트가 주어지면, 우리의 계획은 세 가지 단계로 구성됩니다: 1) LLM을 디렉터로 활용하여 복잡한 쿼리를 비디오 내의 개별 개념을 나타내는 여러 서브 프롬프트로 분해한 후, LLM이 사전 훈련된 전문가 모델을 호출하여 해당 개념의 3D 표현을 얻도록 합니다. 2) 이러한 표현들을 구성하기 위해, 다중 모드 LLM에게 물체의 경로의 비율과 좌표에 대한 조잡한 가이드를 생성하도록 프롬프트합니다. 3) 생성된 프레임이 자연 이미지 분포에 부합하도록 하여, 2D 확산 사전 정보를 추가로 활용하고 점수 증류 샘플링을 사용하여 구성을 정제합니다. 광범위한 실험을 통해 우리 방법이 텍스트에서 다양한 움직임과 각 개념에 대한 유연한 제어를 가진 고충실도 비디오를 생성할 수 있음을 보여줍니다. 프로젝트 페이지: https://aka.ms/c3v.
Zhu et al. (Sat,)은 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: