Home » Articole » Articles » Ordinateurs » Internet » Mégadonnées » Détection d’anomalies dans l’exploration de donnée

Détection d’anomalies dans l’exploration de donnée

Dans l’exploration de données, la détection d’anomalies (ou détection de valeurs aberrantes) consiste à identifier des éléments, des événements ou des observations qui ne correspondent pas à un modèle attendu ou à d’autres éléments d’un ensemble de données. En général, les éléments anormaux se traduisent par un problème quelconque, tel qu’une fraude bancaire, un défaut structurel, des problèmes médicaux ou des erreurs dans un texte. Les anomalies sont également appelées valeurs aberrantes, nouveautés, bruit, déviations et exceptions.

En particulier, dans le contexte de la détection d’abus et d’intrusions dans le réseau, les objets intéressants ne sont souvent pas des objets rares, mais des explosions d’activité inattendues. Ce modèle ne correspond pas à la définition statistique courante d’une valeur aberrante en tant qu’objet rare, et de nombreuses méthodes de détection de valeurs aberrantes (en particulier les méthodes non supervisées) échoueront sur de telles données, à moins qu’elles n’aient été agrégées de manière appropriée. Au lieu de cela, un algorithme d’analyse de cluster peut être en mesure de détecter les micro-clusters formés par ces modèles.

Il existe trois grandes catégories de techniques de détection d’anomalies. Les techniques de détection d’anomalies non supervisées détectent les anomalies dans un ensemble de données de test non étiqueté en supposant que la majorité des instances de l’ensemble de données sont normales en recherchant les instances qui semblent correspondre le moins au reste de l’ensemble de données. Les techniques de détection d’anomalies supervisées nécessitent un ensemble de données étiqueté comme « normal » et « anormal » et impliquent la formation d’un classificateur (la principale différence avec de nombreux autres problèmes de classification statistique est la nature intrinsèquement déséquilibrée de la détection des valeurs aberrantes).

Les techniques de détection d’anomalies semi-supervisées construisent un modèle représentant un comportement normal à partir d’un ensemble de données d’entraînement normal donné, puis testent la probabilité qu’une instance de test soit générée par le modèle appris.

Applications

La détection d’anomalies est applicable dans divers domaines, tels que la détection d’intrusion, la détection de fraude, la détection de pannes, la surveillance de l’état du système, la détection d’événements dans les réseaux de capteurs et la détection des perturbations de l’écosystème. Elle est souvent utilisée dans le prétraitement pour supprimer les données anormales de l’ensemble de données. Dans l’apprentissage supervisé, la suppression des données anormales de l’ensemble de données entraîne souvent une augmentation statistiquement significative de la précision.

Techniques courantes

Plusieurs techniques de détection d’anomalies ont été proposées dans la littérature. Certaines des techniques les plus courantes sont :

  • Techniques basées sur la densité (k-plus proche voisin, facteur de valeur aberrante locale et de nombreuses autres variantes de ce concept).
  • Détection de valeur aberrante basée sur le sous-espace et la corrélation pour les données de grande dimension.
  • Machines à vecteurs de support à une classe.
  • Réseaux neuronaux réplicateurs.
  • Détection de valeur aberrante basée sur l’analyse de cluster.
  • Écarts par rapport aux règles d’association et aux ensembles d’éléments fréquents.
  • Détection de valeur aberrante basée sur la logique floue.
  • Techniques d’ensemble, utilisant le regroupement de caractéristiques, la normalisation des scores et différentes sources de diversité.

Les performances des différentes méthodes dépendent beaucoup de l’ensemble de données et des paramètres, et les méthodes présentent peu d’avantages systématiques par rapport à une autre lorsqu’elles sont comparées à de nombreux ensembles de données et paramètres.

Application à la sécurité des données

La détection des anomalies a été proposée pour les systèmes de détection d’intrusion (IDS) par Dorothy Denning en 1986. La détection des anomalies pour les IDS est normalement réalisée à l’aide de seuils et de statistiques, mais peut également être effectuée à l’aide de calculs logiciels et d’apprentissage inductif. Les types de statistiques proposés en 1999 comprenaient des profils d’utilisateurs, de postes de travail, de réseaux, d’hôtes distants, de groupes d’utilisateurs et de programmes basés sur des fréquences, des moyennes, des variances, des covariances et des écarts types. L’équivalent de la détection d’anomalies dans la détection d’intrusion est la détection des abus.

Logiciel

ELKI est une boîte à outils d’exploration de données Java open source qui contient plusieurs algorithmes de détection d’anomalies, ainsi qu’une accélération d’index pour eux.

Source: Drew Bentley, Business Intelligence and Analytics. © 2017 Library Press, License CC BY-SA 4.0. Traduction et adaptation: Nicolae Sfetcu. © 2024 MultiMedia Publishing, L’informatique décisionnelle et l’analyse exploratoire des données dans les entreprises, Collection Sciences de l’information

Intelligence artificielle dans le renseignement, la défense et la sécurité nationale
Intelligence artificielle dans le renseignement, la défense et la sécurité nationale

Déverrouiller l’avenir : l’intelligence artificielle dans la sécurité nationale

non noté 13.74 lei Choix des options Ce produit a plusieurs variations. Les options peuvent être choisies sur la page du produit
Introduction à l'informatique décisionnelle (business intelligence)
Introduction à l’informatique décisionnelle (business intelligence)

Transformez vos données en un avantage compétitif avec ce guide incontournable !

non noté 18.33 lei Choix des options Ce produit a plusieurs variations. Les options peuvent être choisies sur la page du produit
L’éthique des mégadonnées (Big Data) en recherche
L’éthique des mégadonnées (Big Data) en recherche

Un guide essentiel pour comprendre les défis éthiques de la science des données dans notre ère numérique.

non noté 0.00 lei Choix des options Ce produit a plusieurs variations. Les options peuvent être choisies sur la page du produit


En savoir plus sur MultiMedia

Subscribe to get the latest posts sent to your email.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *