Key points are not available for this paper at this time.
이 기사는 배치된 기본 선형 대수 하위 프로그램(Batched BLAS 또는 BBLAS)에 대한 표준 API를 설명합니다. 이 문서의 초점은 소규모 행렬에서 많은 독립적인 BLAS 연산을 그룹화하여 단일 루틴인 배치 BLAS 루틴으로 처리하는 데 있습니다. 행렬은 균일한 크기의 그룹으로 묶이며, 모든 행렬의 크기가 같을 경우 하나의 그룹만 생성됩니다. 목표는 고성능 다중 코어 플랫폼에서 알고리즘의 보다 효율적이고 이식 가능한 구현을 제공하는 것입니다. 여기에는 다중 코어 및 다중 코어 CPU 프로세서, GPU 및 코 프로세서, 그리고 부동 소수점 계산 기능을 갖춘 기타 하드웨어 가속기가 포함됩니다. 표준 단일 및 배수 정밀도 외에도 우리는 표준에 반정밀도와 사중 정밀도를 포함합니다. 특히, 반정밀도는 기계 학습과 관련된 매우 대규모 애플리케이션에서 널리 사용됩니다.
Abdelfattah et al. (Sat,)은 이 질문을 연구했습니다.