GPUs limitadas estão amplamente presentes em linhas de produtos comerciais, onde muitas vezes existe uma lacuna significativa entre seu poder computacional anunciado e o desempenho real disponível, tornando ineficazes os métodos tradicionais de avaliação de desempenho baseados em FLOPs máximos. Baseando-se em observações iniciais da comunidade de que “desabilitar instruções FP32 FMA pode gerar ganhos de desempenho no CMP 170HX”, este artigo amplia a hipótese do mecanismo de restrição de uma única instrução para a supressão seletiva de desempenho acoplada em três dimensões: tipos de instruções, precisão numérica e unidades de execução. Para caracterizar sistematicamente o comportamento computacional de tais GPUs limitadas, este artigo propõe uma estrutura de análise de desempenho em nível de instrução. Isso inclui um modelo de normalização de a taxa de transferência de instruções e SM, um fator de execução de precisão eficaz, e uma métrica de densidade de energia em nível de instrução para quantificar a eficiência de execução real sob diferentes combinações de instrução e precisão. Com base nesta estrutura, uma análise experimental sistemática em nível de instrução é realizada no CMP 170HX (um acelerador restrito baseado na arquitetura GA100), com comparações feitas com GPUs não restritas da mesma geração. Além disso, este artigo resume e propõe quatro categorias de estratégias de contorno de desempenho em nível de operador: divisão de instruções, substituição de instruções intrínsecas, transformação algébrica e migração de unidades de execução, visando contornar caminhos de instrução restritos dentro do modelo de programação legal. Com base nessas estratégias, uma extensão de operador personalizada baseada em PyTorch é implementada e validada em três tarefas típicas de inferência de IA — inferência de modelo de linguagem Transformer, geração de imagens Stable Diffusion e Diffusion Transformer (DiT, por exemplo, Z-Image-Turbo). Resultados experimentais demonstram que no CMP 170HX, os métodos propostos podem atingir melhorias de desempenho de inferência end-to-end de até aproximadamente 2× sem comprometer significativamente a precisão numérica. Este estudo fornece uma estrutura de análise em nível de instrução reprodutível para avaliação de desempenho e utilização de engenharia de GPUs restritas, oferecendo referências práticas para a reutilização e otimização da eficiência energética de recursos computacionais de baixo custo.
Kangwei Xing (Fri,) estudou esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: