Key points are not available for this paper at this time.
数据处理框架如MapReduce和Dryad如今被广泛应用于客户期望有保证性能的商业环境中。然而,到目前为止,这些系统无法提供作业延迟的保证,因为调度策略基于公平共享,而操作员通过统计复用和超额订阅来追求高集群利用率。通过Jockey,我们为用SCOPE编写的数据并行作业提供延迟SLOs。Jockey使用一个模拟器预先计算统计数据,捕获作业复杂的内部依赖关系,准确高效地预测在不同资源分配和作业不同阶段下的剩余运行时间。我们的控制策略监控作业的性能,并动态调整共享集群中的资源分配,以最大化作业的经济效用,同时最小化对集群其他部分的影响。在我们在微软生产Cosmos集群中的实验中,Jockey满足了规定的作业延迟SLO,并对集群条件的变化做出了响应。
Ferguson等人(周二)研究了这个问题。