Key points are not available for this paper at this time.
16S rRNA 유전자 프로파일링과 같은 고속 시퀀싱 기반 기술은 세계의 바다나 인간 장 내부에서 자생 미생물 공동체의 복잡한 내부 작용을 뚜렷하게 밝힐 수 있는 잠재력을 가지고 있습니다. 이러한 데이터를 탐색하는 중요한 단계는 이러한 공동체의 구성원 간의 의존성을 식별하는 것으로, 이는 일반적으로 상관관계 분석에 의해 달성됩니다. 그러나 Karl Pearson의 시대부터 이러한 기술로 생성된 데이터 유형(구성 데이터라고 함)의 분석이 보이는 데이터가 절대적인 풍부성보다 유전자나 종의 상대적인 분수 형태를 취하기 때문에 신뢰할 수 없는 결과를 초래할 수 있다는 것이 알려져 있습니다. 인체 마이크로바이옴 프로젝트의 시뮬레이션 및 실제 데이터를 사용하여 우리는 이러한 구성 효과가 광범위하고 심각할 수 있음을 보여줍니다: 일부 실제 데이터 세트에서는 세 간의 많은 상관관계가 인공적일 수 있으며, 진정한 상관관계는 심지어 반대 부호로 나타날 수 있습니다. 또한 우리는 공동체의 다양성이 이러한 구성 효과의 심각성을 조절하는 핵심 요소임을 보여주고, 구성 데이터에서 상관 값들을 추정할 수 있는 새로운 접근법인 SparCC(https://bitbucket.org/yonatanf/sparcc에서 사용 가능)를 개발합니다. SparCC의 잠재적 응용을 예시하기 위해 우리는 인체의 18개 장소에서 상호작용하는 수백 종을 연결하는 풍부한 생태 네트워크를 추론합니다. SparCC 네트워크를 기준으로 사용할 때, 우리는 표준 접근법이 진정한 상호작용 하나당 3개의 허위 종 간 상호작용을 생성하고 인체 마이크로바이옴 데이터에서 진정한 상호작용의 60%를 놓친다고 추정했으며, 예측된 바와 같이 대다수의 오류 링크는 가장 낮은 다양성을 가진 샘플에서 발견됩니다.
Friedman et al. (목요일) 이 질문을 연구했습니다.