Scalable Content-Based Video Copy Detection for Stream Monitoring and Video Mining
Sébastien Poullot · OpenGrey (Institut de l'Information Scientifique et Technique) · 2009
Le paysage video a recemment ete profondement bouleverse par de nombreuses innovations technologiques. Les methodes et acteurs de la distribution et de la production video ont notamment fortement evolues. Le nombre de canaux de diffusion televisuels augmente continuellement et parallelement Internet supporte de nombreux sites communautaires et blogs comportant de la video. Les utilisateurs finaux sont devenus eux-memes auteurs et createurs, le volume qu'ils generent concurrence largement celui produit par les professionnels. On peut aussi noter que les logiciels d'edition video sont aujourd'hui grand public et que la personnalisation de contenus est simple et tres en vogue. Les professionnels aussi reutilisent largement de vieux contenus pour faire du neuf. Une consequence directe est l'augmentation croissante du nombre de copies diffusees et hebergees sur les reseaux. L'existence de ces copies soulevent le probleme de la protection des droits. Un ayant droit peut exprimer legitimement le besoin d'etre remunere si un oeuvre lui appartenant est diffuse sur une chaine. L'INA est charge d'accomplir cette tâche en France et donc de surveiller les differents canaux pour noter ces rediffusions. Le challenge tient aux volumes a proteger et a surveiller. Le nombre d'heures numerisees est de l'ordre du demi million et le nombre de canaux de la centaine. Les documentalistes ne peuvent gerer une telle connaissance ni un tel afflux. Un pre travail automatique par ordinateur est obligatoire: un systeme de surveillance video par le contenu. Celui-ci est charge de lire les flux videos diffuses et de decider si dans ces flux apparaissent des videos issues de la base reference a proteger. La detection par le contenu signifie l'utilisation du signal video pour faire cette reconnaissance. Les videos representent de gros volumes de donnees, et l'exploitation du signal complet n'est pas envisageable. Par consequent on resume les videos par des descripteurs, sorte de quantificateurs du signal. Le probleme de la surveillance repose alors sur la recherche de descripteurs dans une base de descripteurs de reference. Ces bases contiennent des milliards de descripteurs qui sont des vecteurs de moyenne ou grande dimension (20 a quelques centaines). Un tel systeme pour etre viable demande alors un systeme d'indexation des descripteurs pour effectuer des recherches rapides. Apres cette recherche un processus prend la decision en utilisant les descripteurs issus de la recherche. Dans cette these nous presentons un nouveau schema d'indexation, appele Zgrid, pour faire la recherche rapide. Ce schema permet de faire une recherche approximative. Nous l'avons ameliore par des analyses de distribution des donnees dans l'espace de description. Par ailleurs nous proposons un nouveau modele des distortions subies par les descripteurs lors des processus de copies et un modele de densite locale pour corriger la recherche, celle-ci est alors plus selective et moins consommatrice de temps. L'utilisation croisee de ces differentes propositions permet de suivre en temps reel differe un flux video et de le comparer a une base de reference de 280,000 heures de video avec un simple PC. L'existence de nombreuses copies peut aussi presenter des avantages. La detection des differentes occurrences d'un meme contenu peut permettre par exemple de mutualiser des annotations ou d'aider a la navigation dans les bases videos. Le probleme prend alors une autre dimension avec une complexite quadratique: on doit rechercher l'ensemble des descripteurs d'une base sur cette meme base, ce qu'on appelle communement une auto jointure par similarite. Pour reduire la complexite de cette tâche nous proposons ici un nouveau descripteur dit Glocal qui utilise des descripteurs locaux pour construire un descripteur global au niveau de l'image. Ce changement de niveau permet par ailleurs de reduire aussi la complexite du processus de decision finale. Nous proposons aussi un nouveau systeme d'indexation adapte a l'auto jointure par similarite et a ce descripteur. La reduction globale des temps de calculs permet de trouver les occurrences dans une base de 10,000 heures avec un simple PC mais aussi de trouver ces occurrences dans une petite base (moins de 100 heures) en 30 secondes. On peut ainsi envisager des applications « off-line » pour les administrateurs de site videos et « online » pour les utilisateurs.