Key points are not available for this paper at this time.
이 연구에서는 20억에서 270억 매개변수 범위의 경량 최신 공개 모델인 Gemma 패밀리에 새로운 추가인 Gemma 2를 소개합니다. 이 새로운 버전에서는 Transformer 아키텍처에 대해 지역-전역 주의력(interleaving local-global attentions, Beltagy et al., 2020a) 및 그룹 쿼리 주의력(group-query attention, Ainslie et al., 2023)과 같은 여러 알려진 기술 수정을 적용하였습니다. 또한 2B 및 9B 모델을 다음 토큰 예측 대신 지식 증류(knowledge distillation, Hinton et al., 2015)로 훈련합니다. 그 결과, 모델들은 그 크기 대비 최고의 성능을 제공하고, 심지어 2-3배 더 큰 모델에 대한 경쟁력 있는 대안을 제공합니다. 우리는 모든 모델을 커뮤니티에 공개합니다.
팀 외 (2024)는 이 질문을 연구하였습니다.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: