Key points are not available for this paper at this time.
Hoje em dia, existem muitos repositórios de software, especialmente na web, que têm muitos desafios para serem automatizados. A detecção de relatórios de erros duplicados (DBRD) é um excelente problema dos sistemas de triagem de software como Bugzilla desde 2004, sendo um repositório de software essencial online. Existem duas principais abordagens para DBRD automático, incluindo abordagens baseadas em recuperação de informação (IR) e aprendizado de máquina (ML). Muitos trabalhos relacionados estão utilizando ambas as abordagens, mas não está claro qual delas é mais útil e tem melhor desempenho. Este estudo foca em introduzir uma metodologia para comparar o desempenho de validação de ambas as abordagens em uma condição específica. O conjunto de dados do Android é usado para avaliação, e cerca de 2 milhões de pares de relatórios de erros são analisados para 59 relatórios de erros que eram duplicados. Os resultados mostram que a abordagem baseada em ML tem melhor desempenho de validação, especialmente cerca de 40%. Além disso, a abordagem baseada em ML tem um critério de avaliação mais confiável, como precisão, exatidão e recall, em comparação com uma abordagem baseada em IR, que possui apenas precisão média (MAP) ou métricas de classificação.
Neysiani et al. (Quarta-feira,) estudaram esta questão.