대형 언어 모델(LLMs)에 의해 생성된 합성 데이터의 사용 증가가 데이터 기반 애플리케이션에서 기회와 도전을 모두 제공합니다. 합성 데이터는 모델 훈련을 촉진하기 위해 실세계 데이터에 대한 비용 효율적이고 확장 가능한 대안을 제공하지만, 그 다양성과 개인정보 위험은 충분히 탐구되지 않았습니다. 텍스트 기반 합성 데이터에 중점을 두고, 여러 최첨단 LLMs에 의해 생성된 합성 데이터 세트의 다양성(즉, 언어 표현, 감정, 사용자 관점)과 개인정보(즉, 재식별 위험 및 스타일적 이상)에 대해 정량적으로 평가하기 위한 포괄적인 지표 세트를 제안합니다. 실험 결과는 LLMs가 다양한 개인정보 보호 합성 데이터를 생성하는 데 상당한 한계가 있음을 보여줍니다. 평가 결과에 따라, 검토자의 개인정보를 보호하면서 합성 리뷰의 다양성을 향상시키기 위한 프롬프트 기반 접근 방식이 제안됩니다.
Atwal 외(Thu,)는 이 질문을 연구했습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: