Key points are not available for this paper at this time.
A experiência de um cluster Map-Reduce operacional revela que os outliers prolongam significativamente a conclusão das tarefas. As causas para outliers incluem contenda em tempo de execução por processador, memória e outros recursos, falhas de disco, largura de banda variável e congestão ao longo de caminhos de rede, além de desequilíbrio na carga de trabalho das tarefas. Apresentamos o Mantri, um sistema que monitora tarefas e elimina outliers usando técnicas baseadas em causa e cientes dos recursos. As estratégias do Mantri incluem reiniciar outliers, colocação de tarefas ciente da rede e proteger saídas de tarefas valiosas. Usando relatórios de progresso em tempo real, o Mantri detecta e age sobre os outliers precocemente em seu ciclo de vida. Ação antecipada libera recursos que podem ser usados por tarefas subsequentes e acelera o trabalho como um todo. Agir baseado nas causas e no custo de recursos e oportunidades das ações permite que o Mantri melhore em relação a trabalhos anteriores que apenas duplicam os retardatários. A implantação nos clusters de produção do Bing e simulações baseadas em rastreamento mostram que o Mantri melhora os tempos de conclusão das tarefas em 32%.
Ananthanarayanan et al. (Mon,) estudaram esta questão.