Improving Binary Classifier Performance Through an Informed Sampling Approach and Imputation

Soroosh Ghorbani · PolyPublie (École Polytechnique de Montréal) · 2016

Au cours des deux dernières décennies, des progrès importants dans le domaine de l'apprentissage automatique ont été réalisés grâce à des techniques d'échantillonnage.Relevons par exemple le renforcement (boosting), une technique qui assigne des poids aux observations pour améliorer l'entraînement du modèle, ainsi que la technique d'apprentissage actif qui utilise des données non étiquetées partielles pour décider dynamiquement quels cas sont les plus pertinents à demander à un oracle d'étiqueter.Cette thèse s'inscrit dans ces recherches et présente une nouvelle technique d'échantillonnage qui utilise l'entropie des données pour guider l'échantillonnage, un processus que nous appelons l'échantillonnage informé.L'idée centrale est que la fiabilité de l'estimation des paramètres d'un modèle peut dépendre de l'entropie des variables.Donc, l'adaptation du taux d'échantillonnage de variables basée sur leur entropie peut conduire à de meilleures estimations des paramètres.Dans une série d'articles, nous étudions cette hypothèse pour trois modèles de classification, notamment Régression Logistique (LR), le modèle bayes naïf (NB) et le modèle d'arbre bayes naif (TAN-Tree Augmented Naive Bayes), en prenant une tâche de classification binaire avec une fonction d'erreur 0-1.Les résultats démontrent que l'échantillonnage d'entropie élevée (taux d'échantillonnage plus élevé pour les variables d'entropie élevée) améliore systématiquement les performances de prédiction du classificateur TAN.Toutefois, pour les classificateurs NB et LR, les résultats ne sont pas concluants.Des améliorations sont obtenues pour seulement la moitié des 11 ensembles de données utilisées et souvent les améliorations proviennent de l'échantillonnage à entropie élevée, rarement de l'échantillonnage à entropie faible.Cette première expérience est reproduite dans une deuxième étude, cette fois en utilisant un contexte plus réaliste où l'entropie des variables est inconnue à priori, mais plutôt estimée avec des données initiales et où l'échantillonnage est ajusté à la volée avec les nouvelles estimation de l'entropie.Les résultats démontrent qu'avec l'utilisation d'un ensemble de données initial de 1% du nombre total des exemplaires, qui variait de quelques centaines à environ 1000, les gains obtenus de l'étude précédente persistent pour le modèle TAN avec une amélioration moyenne de 13% dans la réduction l'erreur quadratique.Pour la même taille des semences, des améliorations ont également été obtenues pour le classificateur naïf bayésien par un facteur de 8% de l'entropie faible au lieu d'échantillonnage d'entropie élevée.

Read the paper · More papers on PaperTik