Key points are not available for this paper at this time.
Os classificadores de aprendizado de máquina são conhecidos por serem vulneráveis a entradas construídas maliciosamente por adversários para forçar a má classificação. Esses exemplos adversariais têm sido amplamente estudados no contexto de aplicações de visão computacional. Neste trabalho, mostramos que ataques adversariais também são eficazes ao direcionar políticas de redes neurais em aprendizado por reforço. Especificamente, mostramos que técnicas existentes de elaboração de exemplos adversariais podem ser usadas para degradar significativamente o desempenho em tempo de teste das políticas treinadas. Nosso modelo de ameaça considera adversários capazes de introduzir pequenas perturbações na entrada bruta da política. Caracterizamos o grau de vulnerabilidade em diferentes tarefas e algoritmos de treinamento, para uma subclasse de ataques de exemplos adversariais em configurações de caixa-branca e caixa-preta. Independentemente da tarefa aprendida ou algoritmo de treinamento, observamos uma queda significativa no desempenho, mesmo com pequenas perturbações adversariais que não interferem na percepção humana. Vídeos estão disponíveis em http://rll.berkeley.edu/adversarial.
Huang et al. (Qua,) estudaram essa questão.