Key points are not available for this paper at this time.
대규모 언어 모델(LLM)은 모델을 훈련하고 평가하기 위해 합성 데이터를 생성하는 데 점점 더 많이 사용되고 있습니다. 그러나 이들이 언어에 내재된 지식과 문화적 뉘앙스를 포함하는 질문 응답(QA) 데이터셋을 생성할 수 있는지 여부는 불확실합니다. 특히 자원이 제한된 언어에 대해 그러합니다. 본 연구에서는 인도네시아어와 순다어의 문화적으로 관련된 상식 QA 데이터셋을 생성하는 데 LLM을 사용하는 효과를 조사합니다. 이를 위해 LLM과 인간 주석자가 참여한 다양한 방법을 사용하여 이들 언어에 대한 데이터셋을 생성합니다. 우리의 실험 결과, 현재 최상의 성능을 보이는 LLM인 GPT-4 터보는 인도네시아어로 적절한 지식을 담은 질문을 생성할 수 있지만 순다어로는 그렇지 않음을 보여 주어, 중간 및 낮은 자원 언어 간의 성능 차이를 강조합니다. 또한, 우리가 생성한 데이터셋에 대해 다양한 LLM의 성능을 벤치마킹한 결과, LLM이 생성한 데이터셋에서 인간이 만든 데이터셋보다 더 나은 성능을 보였습니다.
Putri et al. (Tue,)는 이 질문을 연구하였습니다.