Key points are not available for this paper at this time.
최근 텍스트-이미지 생성 모델은 목표 텍스트 프롬프트에 의해 안내되는 다양하고 창의적인 이미지를 생성하는 비할 데 없는 능력을 보여주었습니다. 혁신적이지만, 현재의 최첨단 확산 모델은 주어진 텍스트 프롬프트의 의미를 완전히 전달하는 이미지를 생성하는 데 실패할 수 있습니다. 우리는 공개적으로 사용 가능한 Stable Diffusion 모델을 분석하고, 모델이 입력 프롬프트에서 하나 이상의 주제를 생성하지 못하는 치명적 무시의 존재를 평가합니다. 또한, 일부 경우 모델이 여러 주제에 해당하는 속성(예: 색상)을 올바르게 바인딩하지 못하는 것도 발견하였습니다. 이러한 실패 사례를 완화하기 위해, 우리는 생성 과정 중 실시간으로 개입하여 생성된 이미지의 신뢰성을 향상시키고자 하는 생성적 의미 간호(GSN)의 개념을 소개합니다. Attend-and-Excite라는 이름의 GSN의 주의 기반 형식을 사용하여, 우리는 모델이 텍스트 프롬프트에서 모든 주제 토큰에 주의를 기울이고 그들의 활성화를 강화하거나 흥미롭게 만들도록 교정하도록 안내합니다. 이를 통해 모델이 텍스트 프롬프트에 설명된 모든 주제를 생성하도록 유도합니다. 우리는 우리의 접근 방식을 대안적 접근 방식과 비교하고, 그것이 다양한 텍스트 프롬프트에서 원하는 개념을 더 신뢰성 있게 전달함을 입증합니다.
Chefer et al. (Tue,)은 이 질문을 연구하였습니다.