Dans l’exploration de données, la détection d’anomalies (ou détection de valeurs aberrantes) consiste à identifier des éléments, des événements ou des observations qui ne correspondent pas à un modèle attendu ou à d’autres éléments d’un ensemble de données. En général, les éléments anormaux se traduisent par un problème quelconque, tel qu’une fraude bancaire, un défaut structurel, des problèmes médicaux ou des erreurs dans un texte. Les anomalies sont également appelées valeurs aberrantes, nouveautés, bruit, déviations et exceptions.
En particulier, dans le contexte de la détection d’abus et d’intrusions dans le réseau, les objets intéressants ne sont souvent pas des objets rares, mais des explosions d’activité inattendues. Ce modèle ne correspond pas à la définition statistique courante d’une valeur aberrante en tant qu’objet rare, et de nombreuses méthodes de détection de valeurs aberrantes (en particulier les méthodes non supervisées) échoueront sur de telles données, à moins qu’elles n’aient été agrégées de manière appropriée. Au lieu de cela, un algorithme d’analyse de cluster peut être en mesure de détecter les micro-clusters formés par ces modèles.
Il existe trois grandes catégories de techniques de détection d’anomalies. Les techniques de détection d’anomalies non supervisées détectent les anomalies dans un ensemble de données de test non étiqueté en supposant que la majorité des instances de l’ensemble de données sont normales en recherchant les instances qui semblent correspondre le moins au reste de l’ensemble de données. Les techniques de détection d’anomalies supervisées nécessitent un ensemble de données étiqueté comme « normal » et « anormal » et impliquent la formation d’un classificateur (la principale différence avec de nombreux autres problèmes de classification statistique est la nature intrinsèquement déséquilibrée de la détection des valeurs aberrantes).
Les techniques de détection d’anomalies semi-supervisées construisent un modèle représentant un comportement normal à partir d’un ensemble de données d’entraînement normal donné, puis testent la probabilité qu’une instance de test soit générée par le modèle appris.
Applications
La détection d’anomalies est applicable dans divers domaines, tels que la détection d’intrusion, la détection de fraude, la détection de pannes, la surveillance de l’état du système, la détection d’événements dans les réseaux de capteurs et la détection des perturbations de l’écosystème. Elle est souvent utilisée dans le prétraitement pour supprimer les données anormales de l’ensemble de données. Dans l’apprentissage supervisé, la suppression des données anormales de l’ensemble de données entraîne souvent une augmentation statistiquement significative de la précision.
Techniques courantes
Plusieurs techniques de détection d’anomalies ont été proposées dans la littérature. Certaines des techniques les plus courantes sont :
- Techniques basées sur la densité (k-plus proche voisin, facteur de valeur aberrante locale et de nombreuses autres variantes de ce concept).
- Détection de valeur aberrante basée sur le sous-espace et la corrélation pour les données de grande dimension.
- Machines à vecteurs de support à une classe.
- Réseaux neuronaux réplicateurs.
- Détection de valeur aberrante basée sur l’analyse de cluster.
- Écarts par rapport aux règles d’association et aux ensembles d’éléments fréquents.
- Détection de valeur aberrante basée sur la logique floue.
- Techniques d’ensemble, utilisant le regroupement de caractéristiques, la normalisation des scores et différentes sources de diversité.
Les performances des différentes méthodes dépendent beaucoup de l’ensemble de données et des paramètres, et les méthodes présentent peu d’avantages systématiques par rapport à une autre lorsqu’elles sont comparées à de nombreux ensembles de données et paramètres.
Application à la sécurité des données
La détection des anomalies a été proposée pour les systèmes de détection d’intrusion (IDS) par Dorothy Denning en 1986. La détection des anomalies pour les IDS est normalement réalisée à l’aide de seuils et de statistiques, mais peut également être effectuée à l’aide de calculs logiciels et d’apprentissage inductif. Les types de statistiques proposés en 1999 comprenaient des profils d’utilisateurs, de postes de travail, de réseaux, d’hôtes distants, de groupes d’utilisateurs et de programmes basés sur des fréquences, des moyennes, des variances, des covariances et des écarts types. L’équivalent de la détection d’anomalies dans la détection d’intrusion est la détection des abus.
Logiciel
ELKI est une boîte à outils d’exploration de données Java open source qui contient plusieurs algorithmes de détection d’anomalies, ainsi qu’une accélération d’index pour eux.
Source: Drew Bentley, Business Intelligence and Analytics. © 2017 Library Press, License CC BY-SA 4.0. Traduction et adaptation: Nicolae Sfetcu. © 2024 MultiMedia Publishing, L’informatique décisionnelle et l’analyse exploratoire des données dans les entreprises, Collection Sciences de l’information
En savoir plus sur MultiMedia
Subscribe to get the latest posts sent to your email.



Laisser un commentaire