Key points are not available for this paper at this time.
A multiplicação de matriz-vetor esparsa (SpMV) é uma operação fundamental em inúmeras aplicações, como computação científica, aprendizado de máquina e análise de grafos. Embora estudos recentes tenham feito grandes avanços na aceleração do SpMV em FPGAs equipados com HBM, ainda existem múltiplos desafios remanescentes para acelerar eficientemente o SpMV imbalanceado, onde a distribuição de não zeros na matriz esparsa é desigual em diferentes linhas. Primeiro, a distribuição de carga de trabalho imbalanceada entre os elementos de processamento paralelo (PEs) leva à subutilização dos PEs e à degradação do desempenho. Segundo, a dependência de leitura após gravação da acumulação de ponto flutuante de longa latência no vetor de saída causa paradas no pipeline dentro do PE, e as soluções de escalonamento existentes para matrizes balanceadas não funcionam mais efetivamente para as imbalanceadas. Terceiro, a latência de acesso à memória para o vetor de entrada, muitas vezes negligenciado, se torna um novo gargalo de desempenho após a aceleração do SpMV.
Rajashekar et al. (Mon,) estudaram essa questão.