Key points are not available for this paper at this time.
자연어 지침에 따라 조건을 설정함으로써, 대형 언어 모델(LLM)은 범용 컴퓨터로서 인상적인 능력을 보여주었습니다. 그러나 작업 성능은 모델을 조정하는 데 사용되는 프롬프트의 질에 크게 의존하며, 가장 효과적인 프롬프트는 인간이 손수 제작한 것입니다. 고전적인 프로그램 합성과 인간의 프롬프트 엔지니어링 접근 방식에서 영감을 받아, 우리는 자동 명령 생성 및 선택을 위한 자동 프롬프트 엔지니어(APE)를 제안합니다. 우리의 방법에서 우리는 명령을 "프로그램"으로 간주하고, 선택된 점수 함수를 극대화하기 위해 LLM이 제안한 명령 후보 풀을 탐색하여 최적화합니다. 선택된 명령의 질을 평가하기 위해, 우리는 선택된 명령을 따르는 또 다른 LLM의 제로샷 성능을 평가합니다. 24개의 자연어 처리 작업에 대한 실험 결과, 우리의 자동으로 생성된 명령이 이전 LLM 기준 대비 큰 차이를 보이며, 24개 작업 중 19개 작업에서는 인간 주석자가 생성한 명령과 비교해 더 나은 성능을 발휘함을 보여줍니다. 우리는 APE의 성능을 탐구하기 위해 광범위한 질적 및 양적 분석을 수행합니다. 우리는 APE 엔지니어링된 프롬프트가 모델을 진실성과/또는 정보성으로 유도하고, 표준 맥락 학습 프롬프트에 단순히 추가함으로써 몇 개의 샷 학습 성능을 향상시킬 수 있음을 보여줍니다. 자세한 내용은 우리의 웹페이지인 https://sites.google.com/view/automatic-prompt-engineer를 확인하세요.
Zhou 외 (목요일,) 이 질문을 연구했습니다.