Key points are not available for this paper at this time.
Avec la popularité d'Internet et l'augmentation du niveau de la technologie de l'information, les cyberattaques sont devenues un problème de plus en plus sérieux. Elles représentent une grande menace pour la sécurité des individus, des entreprises et de l'État. Cela a rendu la technologie de détection des intrusions réseau d'une importance critique. Dans cet article, un modèle de détection de trafic malveillant est construit sur la base d'un classificateur d'arbre de décision d'entropie et d'un algorithme d'optimisation de politique proximale (PPO) d'apprentissage renforcé profond. Tout d'abord, l'idée de l'arbre de décision dans l'apprentissage automatique est utilisée pour faire un jugement de classification préliminaire sur l'ensemble de données basé sur l'entropie de l'information. Le score d'importance de chaque caractéristique dans le travail de classification est calculé et les caractéristiques ayant des contributions plus faibles sont supprimées. Ensuite, cela est confié au modèle de l'algorithme PPO pour la détection. Un terme de régularité d'entropie est introduit dans le processus de mise à jour de l'algorithme PPO. Enfin, l'algorithme d'apprentissage renforcé profond est utilisé pour entraîner et mettre à jour continuellement les paramètres pendant le processus de détection, et finalement, le modèle de détection avec une plus grande précision est obtenu. Des expériences montrent que la précision de classification binaire du modèle de détection de trafic malveillant basé sur l'algorithme PPO d'apprentissage renforcé profond peut atteindre 99,17 % sous l'ensemble de données CIC-IDS2017 utilisé dans cet article.
Zhao et al. (Tue,) ont étudié cette question.