Stable Diffusion은 텍스트 프롬프트에 명시된 객체 수량을 정확히 재현하지 못해 지속적인 객체 개수 불일치(object count mismatch) 문제가 발생하는 경우가 많다. 본 연구는 모델을 수정하지 않고 프롬프트 엔지니어링만으로 이러한 오류를 완화할 수 있는지를 분석하였다. 이를 위해 기본적인 수량 명시 프롬프트, 사람이 직접 설계한 구조화 프롬프트, 그리고 LLM 기반 자기 정제(self-refine) 프롬프트의 세 가지 유형을 비교하였다. Text-to-Image 생성은 Stable Diffusion 1.5를 사용하여 수행되었으며, 생성된 이미지는 YOLOv8을 활용해 평가하였다. 수량 재현 성능은 수량정확도(count accuracy), 평균절대오차(MAE), 과소 생성률(under-rate), 과대 생성률(over-rate) 지표를 통해 측정하였다. 분석 결과, 수량 명시 프롬프트에 비해 구조화 프롬프트는 일부 개선 효과를 보인 반면, 자기 정제 프롬프트는 수량 정확도를 크게 향상시키는 성과를 나타냈다. 이는 LLM을 활용한 프롬프트 정제가 모델이 객체 수량 정보를 보다 명확하게 반영하도록 유도할 수 있음을 시사한다. 다만, 프롬프트만을 활용한 접근이 객체 수량 오류를 완전히 제어할 수는 없어서 근본적인 한계 또한 여전히 존재함을 보여주었다. 따라서 향후 연구에서는 프롬프트 설계뿐 아니라 모델 구조나 학습 방식과 결합한 접근이 필요할 것으로 판단된다.
Heo et al. (Thu,) studied this question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: