Key points are not available for this paper at this time.
이 연구는 영어와 아랍어로 된 대규모 언어 모델(LLMs)의 이중 언어 평가를 위한 새로운 기준을 소개합니다. LLM이 다양한 분야를 혁신했음에도 불구하고 아랍어로의 평가는 여전히 제한적입니다. 이 연구는 아랍어와 영어 모두에서 LLM에 대한 새로운 평가 방법을 제안하여 두 언어 성능 간의 직접 비교가 가능하도록 합니다. 우리는 아랍 세계에서 대학 입시에 널리 사용되는 표준화된 시험인 일반적성검사(GAT)를 기반으로 새로운 평가 데이터 세트를 구축하여 LLM의 언어 능력을 측정하는 데 활용합니다. ChatGPT의 언어 능력을 조사하고 영어가 아랍어보다 얼마나 더 우수한지를 정량화하기 위해 여러 실험을 수행합니다. 또한 아랍어에서 영어로, 또는 그 반대로 작업 설명을 변경하는 효과를 조사합니다. 추가로, fastText가 아랍어 단어 유사성을 찾는 데 있어 ChatGPT보다 우수할 수 있음을 발견합니다. 마지막으로, GPT-4의 아랍어 언어 능력이 ChatGPT의 아랍어 능력보다 훨씬 우수하며 ChatGPT의 영어 능력에 가까움을 보여주면서 결론을 맺습니다.
Mohamed Alkaoud (2024)는 이 질문을 연구하였습니다.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: