Key points are not available for this paper at this time.
단백질 언어 모델은 각 잔여물에 대해 토큰 수준의 임베딩을 생성하여 서열 길이에 따라 차원이 달라지는 출력 행렬을 생성합니다. 그러나 하위 기계 학습 모델은 일반적으로 고정 길이 입력 벡터를 요구하므로, 출력 행렬을 전체 단백질의 단일 벡터 표현으로 압축하기 위한 풀링 방법이 필요합니다. 전통적인 풀링 방법은 종종 상당한 정보 손실을 초래하여 하위 작업 성능에 영향을 미칩니다. 우리는 생물학적 해석 가능성을 제공하면서 더 표현력이 풍부한 일반 용도의 단백질 임베딩 벡터를 생성하는 풀링 방법을 개발하고자 합니다. 우리는 내부 변환기 주의 행렬과 PageRank를 활용하여 토큰 중요도 가중치를 부여하는 새로운 풀링 방법인 Pool PaRTI를 소개합니다. 우리의 비지도 및 매개변수 없는 접근 방식은 기능에 대해 실험적으로 주석이 달린 잔여물을 지속적으로 우선시하여 이를 더 높은 중요도 점수를 부여합니다. 네 가지 다양한 단백질 기계 학습 작업에서 Pool PaRTI는 예측 성능에서 상당한 성능 향상을 가능하게 합니다. 또한 명시적 구조 데이터나 주석이 달린 훈련에 의존하지 않고 생물학적으로 관련된 영역을 식별하여 해석 가능성을 향상시킵니다. 일반화 가능성을 평가하기 위해 우리는 두 개의 인코더 전용 단백질 언어 모델로 Pool PaRTI를 평가했으며, 다양한 모델에서의 강건성을 확인했습니다. Pool PaRTI는 Python과 PyTorch에 구현되어 있으며 https://github.com/Helix-Research-Lab/PoolPaRTI.git에서 사용할 수 있습니다. Pool PaRTI 서열 임베딩과 UniProt의 모든 인간 단백질에 대한 잔여물 중요도 값은 https://zenodo.org/records/15036725에서 ESM2 및 protBERT에 대해 확인할 수 있습니다.
Tartici et al. (Sat,) 이 질문을 연구했습니다.