Key points are not available for this paper at this time.
来自一个运行中的Map-Reduce集群的经验表明,异常值显著延长了作业完成时间。异常值的成因包括处理器、内存及其他资源的运行时竞争、磁盘故障、网络路径上的带宽变化和拥堵,以及任务工作负载的不平衡。我们提出了Mantri,一个监控任务并使用因果和资源感知技术剔除异常值的系统。Mantri的策略包括重启异常值、网络感知的任务调度以及保护有价值任务的输出。通过实时进度报告,Mantri能够在异常值生命周期早期进行检测和响应。及时的行动释放出可供后续任务使用的资源,并整体加快作业速度。根据原因以及行动的资源和机会成本采取行动,使Mantri在只重复滞后任务的先前工作中有所改进。在Bing的生产集群和追踪驱动的模拟中的部署表明,Mantri提高了作业完成时间32%。
Ananthanarayanan等人(Mon,)研究了这个问题。