Key points are not available for this paper at this time.
희소 자동 인코더(SAE)는 신경망의 잠재 표현을 해석 가능한 특징으로 분해하기 위한 비지도 학습 방법입니다. 그 잠재력에 대한 최근의 흥미에도 불구하고, 산업 외의 연구 응용은 포괄적인 SAE 훈련의 높은 비용에 의해 제한됩니다. 본 연구에서는 Gemma 2 2B 및 9B의 모든 계층 및 하위 계층과 Gemma 2 27B 기반 모델의 선택된 계층에서 훈련된 JumpReLU SAE의 오픈 스위트인 Gemma Scope를 소개합니다. 우리는 주로 Gemma 2의 사전 훈련된 모델에서 SAE를 훈련하지만, 비교를 위해 지침 조정된 Gemma 2 9B에서 훈련된 SAE도 추가로 출시합니다. 우리는 표준 메트릭을 기준으로 각 SAE의 품질을 평가하고 이러한 결과를 공개합니다. SAE 가중치를 출시함으로써, 커뮤니티에 더 야심찬 안전성 및 해석 가능성 연구를 용이하게 하는 데 도움이 되기를 바랍니다. 가중치와 튜토리얼은 https://huggingface.co/google/gemma-scope에서 찾을 수 있으며, 대화형 데모는 https://www.neuronpedia.org/gemma-scope에서 찾을 수 있습니다.
Lieberum et al. (금요일) 이 질문을 연구했습니다.