Key points are not available for this paper at this time.
许多大数据应用是批处理应用,它们利用专用框架在机器集群上执行大规模并行计算。处理所有输入所需的时间代表了应用程序的响应时间,这可能受到截止日期的限制。Spark,今天这些框架中可能最著名的一个,在执行开始时静态分配资源给应用程序,并且不管理偏差:为了满足应用程序的截止日期,必须小心地分配资源。本文提出了一种对Spark的扩展,称为dynaSpark,能够动态分配和重新分配资源以满足截止日期并应对意外应用程序的执行。这项工作基于两个关键使能因素:容器,以隔离Spark的并行执行器并允许动态快速分配资源,以及控制理论以在运行时管理资源分配并获得所需的精度和速度。我们的评估显示,dynaSpark能够(i)有效分配资源以执行单个应用程序,并遵守设定的截止日期,(ii)在同时执行多个并发应用程序时减少截止日期的违反(相对于Spark)。
Baresi等人(Mon,)研究了这个问题。