본 연구는 Prompt Runner 프레임워크를 기반으로 GPT-4o-mini, Claude 4 Sonnet, Gemini 2.5 Flash 모델을 대상으로 프롬프트 유형별 성능을 비교하였다. 총 9개 유형, 90문항으로 구성된 프롬프트 데이터셋을 활용하여 정확도(Accuracy), 일관성(Consistency), 논리성(Logic), 창의성(Creativity), 응답 시간(Response Time)을 평가하였다. 정확도는 SBERT 임베딩 기반 코사인 유사도로 산출하였으며, 일관성과 논리성은 각각 정확도에 0.95, 0.9의 가중치를 적용하였다. 창의성은 새로움, 다양성, 유창성의 가중합(0.5N+0.3D+0.2F)으로 산출하였다. 분석 결과 Claude 4 Sonnet은 논리성(0.58)과 창의성(0.44)에서 우수한 성능을 보였으며, GPT-4o-mini는 빠른 응답시간을 나타냈고, Gemini 2.5 Flash는 정확도(0.66)와 일관성(0.62)에서 높은 성능을 보였다. 특히, Claude 4 Sonnet은 전반적인 성능과 응답 시간 간의 균형 측면에서 가장 안정적이고 일관된 성능을 보여, 효율성과 품질을 동시에 확보한 모델로 평가되었다. 본 연구를 통해 LLM 성능평가에서 각 AI 모델의 API 기반 정량적 성능지표를 비교 분석함으로써, 프롬프트 유형별 모델 특성과 성능 차이를 체계적으로 규명하였다.
Misun Lee (2025) studied this question.