Contrôle du taux de faux positifs dans les ensembles de données structurées

Iqraa Meah · theses.fr (ABES) · 2023

Ce travail propose de nouvelles méthodologies pour contrôler la proportion de fausses découvertes (FDP) tout en tenant compte des structures inhérentes aux données contemporaines. Depuis les travaux fondamentaux de Benjamini et Hochberg (1995) (BH) introduisant le FDP, les procédures de tests multiples ont trouvé une application dans de nombreux domaines. La procédure BH a facilité l’identification de variables significatives dans de grands ensembles de données, permettant de répondre à des questions scientifiques dans des domaines tels que la biologie, les essais cliniques et le marketing, tout en fournissant des garanties sur la proportion de fausses découvertes. Toutefois, la procédure BH présente plusieurs limites : elle est plus efficace pour des p-valeurs uniformes sous l’hypothèse nulle ; elle est développée dans un cadre offline nécessitant la connaissance simultanée de toutes les p-valeurs ; les garanties de contrôle des fausses découvertes sont en espérance. Ces limitations peuvent entraîner une perte de puissance, une réduction de l’interprétabilité, voire une inflation de l’erreur de Type I dans différents contextes où les données sont considérées comme "structurées", tels que le contexte de p-valeurs discrètes, en ligne, pré-ordonnées ou pondérées. Ce travail vise à combler ces lacunes en fournissant de nouvelles procédures et méthodologies qui s’adaptent à chacun de ces contextes. Cela donne, in fine, au praticien des outils plus efficaces pour identifier les variables significatives dans un ensemble de données structurées, comme nous l’illustrons dans diverses expériences numériques.

Read the paper · More papers on PaperTik