최근 인공지능(AI), 특히 대형 언어 모델(LLM)의 발전은 엘리시테이션 인터뷰에서 요구사항 생성을 자동화할 수 있는 새로운 가능성을 제공합니다. 본 연구는 이해관계자 인터뷰를 전사한 내용을 바탕으로 소프트웨어 요구사항을 생성하는 ChatGPT-4와 DeepSeek-V3의 성능을 비교합니다. 두 가지 사례 연구를 통해 LLM이 기능적 및 비기능적 요구사항을 식별하도록 요청받았습니다. 결과는 ChatGPT-4가 정밀한 요구사항, 특히 비기능적 요구사항을 추출하는 데 더 나은 성능을 보인 반면, DeepSeek-V3는 효율성에서 장점을 나타냈음을 보여줍니다. 그러나 두 모델 모두 모호성을 처리하고 요구사항을 적절히 분류하는 데 한계를 보였습니다. 본 연구는 요구사항 공학에서 LLM의 잠재력을 강조하며 향상된 프롬프트/대화 기법과 인간의 감독 필요성을 강조합니다. 향후 연구는 요구사항 추출 정확성을 향상시키기 위해 하이브리드 AI-인간 접근법과 도메인별 미세 조정을 탐색해야 합니다.
Almeida et al. (수요일) 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: