Key points are not available for this paper at this time.
텐서대시는 데이터 병렬 MAC 유닛이 입력 피연산자 스트림의 희소성을 활용할 수 있도록 하는 하드웨어 기반 기술입니다. 딥 러닝을 위한 하드웨어 가속기를 구성할 때 사용하면 훈련 과정을 가속화하면서 에너지 효율성도 향상시킬 수 있습니다. 텐서대시는 저비용 희소 입력 피연산자 상호 연결과 면적 효율적인 하드웨어 스케줄러를 결합합니다. 이 스케줄러는 활성화, 가중치 및 그래디언트에서 효과적으로 희소성을 추출할 수 있습니다. 다양한 애플리케이션을 포괄하는 최첨단 모델 집합에서, 텐서대시는 Tensorcore 기반 가속기에 통합되었을 때 5% 미만의 면적 오버헤드로 훈련 과정을 1.95배 가속화하고 1.5배 더 에너지 효율적입니다. 텐서대시는 데이터 유형에 구애받지 않으며 IEEE 표준 혼합 정밀도 부동소수점 유닛과 기계 학습 최적화된 인기 부동소수점 형식(BFloat16)으로 이를 시연합니다.
Mahmoud 외(Thu,)는 이 질문을 연구했습니다.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: