Los puntos clave no están disponibles para este artículo en este momento.
Mostramos empíricamente que en la capacitación SGD de redes neuronales profundas, se puede, sin pérdida de precisión o casi ninguna, cuantificar los gradientes de manera agresiva—hasta un bit por valor—si el error de cuantificación se mantiene a través de minibatches (retroalimentación de error). Esta reducción de tamaño hace que sea viable paralelizar SGD a través del paralelismo de datos con procesadores rápidos como las recientes GPUs. Implementamos SGD distribuido de manera determinista y paralela en datos combinando este hallazgo con AdaGrad, selección automática del tamaño de minibatch, doble almacenamiento en búfer y paralelismo de modelo. De manera inesperada, la cuantificación beneficia a AdaGrad, proporcionando una pequeña ganancia en precisión. Para un DNN típico de Switchboard con 46M de parámetros, alcanzamos velocidades de cálculo de 27k fotogramas por segundo (kfps) al usar 2880 muestras por minibatch, y 51kfps con 16k, en un servidor con 8 GPUs K20X. Esto corresponde a aumentos de velocidad sobre una sola GPU de 3.6 y 6.3, respectivamente. 7 pasadas de entrenamiento sobre 309h de datos se completan en menos de 7h. Un modelo de 160M de parámetros procesa 3300h de datos en menos de 16h en 20 servidores de GPU dual—un aumento de velocidad de 10 veces—aunque con una pequeña pérdida de precisión.
Seide et al. (Sun,) estudiaron esta cuestión.