Key points are not available for this paper at this time.
A abordagem moderna da inteligência artificial (IA) visa conceber algoritmos que aprendem diretamente a partir dos dados. Esta abordagem alcançou resultados impressionantes e contribuiu significativamente para o progresso da IA, particularmente no âmbito do deep learning supervisionado. Também simplificou o desenvolvimento de sistemas de machine learning, uma vez que o processo de aprendizagem é altamente automatizado. No entanto, nem todas as tarefas de processamento de dados nos pipelines convencionais de deep learning foram automatizadas. Na maioria dos casos, os dados precisam de ser recolhidos manualmente, pré-processados e ampliados através de data augmentation antes de serem eficazes para o treino. Recentemente, surgiram técnicas específicas para automatizar estas tarefas. A automatização das tarefas de processamento de dados é impulsionada pela necessidade de utilizar grandes volumes de dados complexos e heterogéneos para aplicações de machine learning e big data. Atualmente, sistemas automatizados de processamento de dados de ponta a ponta baseados em técnicas de automated machine learning (AutoML) são capazes de receber dados brutos e transformá-los em atributos úteis para tarefas de Big Data, automatizando todas as fases intermédias de processamento. Neste trabalho, apresentamos uma revisão aprofundada de abordagens para a automatização de tarefas de processamento de dados em pipelines de deep learning, incluindo o pré-processamento automatizado de dados – p. ex., limpeza de dados, rotulagem, imputação de dados em falta e codificação de dados categóricos –, bem como data augmentation (incluindo a geração de dados sintéticos utilizando métodos de IA generativa) e engenharia de atributos – especificamente, extração automatizada de atributos, construção de atributos e seleção de atributos. Além de automatizar tarefas específicas de processamento de dados, discutimos o uso de métodos e ferramentas de AutoML para otimizar simultaneamente todas as etapas do pipeline de machine learning.
Mumuni et al. (Mon,) estudaram esta questão.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: