Multi-modal Pedestrian Detection
Alejandro González Alzate · 2015
La deteccion de peatones continua siendo un problema muy dificil en escenarios reales, donde diferentes situaciones como cambios en iluminacion, imagenes ruidosas, objetos inesperados, escenarios sin control y la variabilidad en la apariencia de los objetos ocurren constantemente. Todos estos problemas fuerzan el desarrollo de detectores mas robustos para aplicaciones relevantes como lo son los vehiculos autonomos basados en vision, vigilancia inteligente y el seguimiento de peatones para el analisis del comportamiento. Los detectores de peatones basados en vision mas confiables deciden basandose en descriptores extraidos usando un unico sensor y capturando caracteristicas complementarias, e.g., apariencia y textura. Estas caracteristicas son extraidas de una unica imagen, ignorando la informacion temporal, o incluyendo esta informacion en un paso de post procesamiento e.g., seguimiento o coherencia temporal. Teniendo en cuenta estos hechos, nos formulamos la siguiente pregunta: ?Podemos generar detectores de peatones mas robustos mediante la introduccion de nuevas fuentes de informacion en el paso de extraccion de caracteristicas? Para responder a esta pregunta desarrollamos diferentes propuestas para introducir nuevas fuentes de informacion a detectores de peatones bien conocidos. Empezamos por la inclusion de informacion temporal siguiendo el paradigma del aprendizaje secuencial apilado (SSL siglas en ingles), el cual sugiere que la informacion extraida de las muestras vecinas en una secuencia pueden mejorar la exactitud de un clasificador base. Despues nos enfocamos en la inclusion de informacion complementaria proveniente de sensores diferentes como nubes de puntos 3D (LIDAR - profundidad), imagenes infrarrojas (FIR) o mapas de disparidad (par estereo de camaras). Para tal fin desarrollamos un marco multimodal en el cual informacion proveniente de diferentes sensores es usada para incrementar la exactitud en la deteccion (aumentando la redundancia de la informacion). Finalmente proponemos un detector multi-vista, esta propuesta multi-vista divide el problema de deteccion en n sub-problemas. Cada uno de estos sub-problemas detectara objetos en una vista especifica dada, reduciendo asi el problema de la variabilidad que se tiene cuando un unico detector es usado para todo el problema. Demostramos que estas propuestas obtienen resultados competitivos con otros metodos en el estado del arte, pero enves de disenar nuevas caracteristicas, reutilizamos las existentes para mejorar el desempeno.