Key points are not available for this paper at this time.
대형 언어 모델(LLM)은 중간 사고 단계(Chain of Thought, CoT) 추론 단계를 생성하여 적은 양의 데이터와 제로 샷 환경에서 복잡한 추론을 수행할 수 있습니다. 또한 각 추론 단계는 코어 LLM 기능을 넘어서는 계산을 지원하기 위해 외부 도구에 의존할 수 있습니다(예: 검색/코드 실행). CoT 프롬프트와 도구 사용에 대한 이전 연구는 일반적으로 작업 특화된 시연을 손으로 제작하고 도구 사용과 모델 생성을 면밀히 조정된 방식으로 교차 연결하는 것을 요구합니다. 우리는 동결된 LLM을 사용하여 중간 추론 단계를 프로그램으로 자동 생성하는 프레임워크인 자동 추론 및 도구 사용(ART)을 소개합니다. 해결해야 할 새로운 작업이 주어지면 ART는 작업 라이브러리에서 다단계 추론 및 도구 사용에 대한 시연을 선택합니다. 테스트 시간에 ART는 외부 도구가 호출될 때마다 생성을 원활하게 일시 중지하고, 결과를 통합한 후 생성을 재개합니다. ART는 BigBench와 MMLU 벤치마크에서 보이지 않는 작업에 대해 적은 샷 프롬프트 및 자동 CoT보다 상당한 개선을 이루며, 이러한 작업의 대부분에 대해 수작업으로 제작된 CoT 프롬프트와 동등한 성능을 보여줍니다. ART는 또한 확장 가능하며, 작업 특화된 프로그램에서 오류를 수정하거나 새로운 도구를 통합하여 성능을 개선하기 쉽게 만듭니다. 우리는 최소한의 인간 개입으로 선택된 작업에서 성능을 극적으로 향상시킴으로써 이를 보여줍니다.
Paranjape et al. (Thu,)은 이 질문을 연구하였습니다.