O espaço de entrada dos componentes de Aprendizado de Máquina (ML) usados em aplicações críticas para a segurança é complexo. Testar tais componentes em conjuntos de dados exponencialmente grandes que cobrem todas as situações potenciais do mundo real para medir de forma significativa métricas de desempenho, como a taxa de falsos negativos, é inviável devido a restrições práticas. Consequentemente, devemos limitar os dados de teste enquanto cobrimos adequadamente os pontos de dados de entrada críticos. Inspirados pelos testes de software baseados em defeitos, um método para especificar casos de teste adequados para componentes de software, propomos um processo para coletar dados de teste adequados para componentes de ML. Concretamente, empregamos sistematicamente diferentes métricas de qualidade de dados de ML existentes e métodos para melhorar os dados de teste, para descobrir cenários críticos onde o componente de ML pode ter um desempenho inferior. Exemplificamos o uso do nosso processo em dois estudos de caso, cada um envolvendo um componente de ML implementando diferentes funcionalidades, ou seja, reconhecimento de sinais de parada e segmentação de trilhos de ferrovias.
Sahu et al. (Terça,) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: