Key points are not available for this paper at this time.
训练深度神经网络(DNN)的计算需求已经增长到现在并行训练成为标准做法的地步。现有的深度学习系统通常使用数据或模型并行性,但不幸的是,这些策略往往导致次优的并行化性能。在本文中,我们定义了一种更全面的DNN并行化策略搜索空间,称为SOAP,其中包括在样本、操作、属性和参数维度上并行化DNN的策略。我们还提出了FlexFlow,一种深度学习框架,它使用引导随机搜索SOAP空间来为特定并行机器寻找快速的并行化策略。为了加速这一搜索,FlexFlow引入了一种新颖的执行模拟器,可以准确预测并行化策略的性能,并且速度比以前必须执行每个策略的方法快三个数量级。我们在两个GPU集群上评估了FlexFlow的六个真实世界DNN基准,结果表明FlexFlow可以在包括搜索时间的情况下将训练吞吐量提高多达3.8倍,相比最先进的方法,并且还改善了可扩展性。
贾等(Sat,)研究了这个问题。