Perceptual image codingfor wavelet based encoders.
Martínez Rach, Miguel Onofre · 2015
En el ambito de la codificacion y compresion de imagen y video son numerosas las aportaciones que encontramos en la literatura que presentan mejoras sobre anteriores o sobre los estandares en algun aspecto. Unas plantean diferentes o nuevas formas de codificar, otras refinan los metodos ya existentes, para finalmente tratar de mejorar el rendimiento de la propuesta sobre las anteriores, bien en tiempo de codificacion, utilizacion de recursos, tasa de compresion o calidad de la imagen o el video reconstruido, etc... Una vez desarrollada una nueva propuesta la gran mayoria necesita comparar sus resultados con los de propuestas anteriores. Pero estas comparaciones no solo se producen cuando se tiene el nuevo codificador o un nuevo metodo completamente terminado, sino que lo que es mas costoso, es la necesidad de recurrir continuamente a comparativas durante el tiempo de diseno en cualquiera de sus aspectos, tiempo de procesamiento, memoria, calidad, etc. para modificar los metodos y lograr el mayor rendimiento. Si nos centramos en comparativas de calidad a una misma tasa de bits o bien en comparativas de tasa de bits para una misma calidad, vemos como la comunidad cientifica ha adoptado historicamente el MSE (Mean Square Error) y el PSNR (Peak to Noise Ratio) para medir la calidad y analizar los rendimientos en Rate/Distortion (R/D) de las distintas propuestas, pues posee cualidades muy atractivas [1] ya que es simple de calcular, su formula no necesita parametros, matematicamente se puede utilizar en algoritmos de optimizacion, es la forma natural de definir la energia del error de la senal y por ultimo es la metrica mas utilizada por lo que permite las comparaciones. La idea basica e indiscutible que favorecio al PSNR es que la mejor imagen reconstruida es la que es matematicamente identica a la original. Desde el punto de vista del disenador de un codificador lo interesante es determinar cuan buena es la propuesta para uno o varios rangos de rate, no unicamente para un rate determinado, pero sin que para ello sea necesario codificar y decodificar a todas las tasas. Por ello surgio la propuesta de Bjontegaard que propone un unico valor porcentual de la mejora de una propuesta respecto a otra basandose en el comportamiento R/D en PSNR de ambas y que ha sido adoptada como estandar de facto. Cuando la recuperacion de una imagen reconstruida ya no es matematicamente exacta, la percepcion visual de la calidad por el sistema visual humano dista mucho en ciertos casos de lo que la comparacion matematica dicta como valor de calidad. Como veremos mas adelante son muchos los ejemplos en los que la comparacion entre distintas imagenes reconstruidas, provenientes de distintas distorsiones, contra un mismo original resulta en un mismo valor de calidad PSNR, pero el sistema visual humano determina claramente diferentes calidades y una ordenacion diferente en cuanto a calidad. Por lo tanto surgio la necesidad de poder medir la calidad de las imagenes y videos reconstruidos de una forma mas parecida a como lo hace nuestro sistema visual. Como veremos son muchas las aportaciones en este ambito y desde muchas aproximaciones diferentes. En esta tesis realizamos una revision de las aportaciones mas relevantes en este ambito y nos centraremos en analizar el comportamiento de aquellas para las que dispusimos de su codigo fuente. A su vez revisamos y discutimos la metodologia para poder comparar metricas entre si utilizando una escala comun. La ecuacion que permite trasladar una metrica a esta escala comun requiere de unos parametros que no suelen publicarse en la literatura y como veremos posteriormente son muchos los factores que hacen variar los resultados de las comparativas, por tanto en esta tesis nosotros realizamos la comparativa completa publicando los parametros obtenidos. Esta comparativa determina el grado de correlacion de una metrica a la valoracion subjetiva de calidad. En este trabajo ademas se analiza como se comportan estas metricas en varios escenarios, en concreto, como responden las metricas frente a resultados de compresion y frente a la perdida de paquetes en redes moviles. Este estudio arroja conclusiones sobre que metrica se adapta mejor a que tipos de compresion y perdida. Como hemos comentado, el PSNR se convirtio en estandar de facto antes de que se pudieran utilizar metricas de calidad perceptual pero aun existiendo estas, posteriormente son pocos los trabajos que comparan su rendimiento utilizando metricas perceptuales a pesar de que esta ampliamente reconocido que tienen mejor correlacion con la valoracion subjetiva de calidad que el PSNR. En este trabajo tambien se revisan las tecnicas perceptuales mas importantes que se utilizan para incorporar aspectos perceptuales en la codificacion de imagen y video. Muchas son las propuestas que incluyen estas tecnicas en la codificacion de imagen y video. Al incluir algoritmos perceptuales en alguna de las etapas de un codificador o de una propuesta de mejora de estos, lo razonable es medir el rendimiento de la propuesta desde un punto de vista perceptual. Pero aun, mayoritariamente los trabajos siguen utilizando el PSNR o las curvas R/D donde el PSNR es la metrica de calidad, IX aunque ultimamente algunos trabajos comienzan a utilizar, ademas del PSNR, otras metricas de calidad perceptual. En este trabajo incluiremos tecnicas perceptuales de codificacion en un codificador wavelet no embebido, el S-LTW, para realizar una propuesta de un nuevo codificador, el PETW (Perceptually Enhanced Tree Wavelet). Muchas de las tecnicas que aqui exploramos y proponemos, pueden ser extrapoladas a otros codificadores basados en la transformada wavelet o en la DCT. Puesto que el codificador incluye elementos perceptuales, todas nuestras comparaciones de rendimiento se realizan utilizando la metrica perceptual VIF, que resulto la mas correlacionada con la valoracion subjetiva en las comparaciones realizadas. La tecnica perceptual mas extendida en la codificacion perceptual es la inclusion mediante la CSF (Contrast Sensitivity Function) de la sensibilidad al contraste del sistema visual humano en la etapa de cuantizacion. Muchos autores realizan test subjetivos con el fin de determinar la importancia perceptual de cada banda o subbanda de frecuencia y asi incluir la sensibilidad al contraste del HVS en los codificadores gracias a unas matrices de pesos empiricamente obtenidas. Otros autores, sin embargo, obtienen las matrices de pesos directamente de un modelo de la CSF. Con el fin de evitar los costosos test subjetivos, nosotros analizaremos esta tecnica y propondremos mejoras en la seleccion de pesos y mejorar por tanto el rendimiento del codificador al usar nuestra matriz de pesos. Nuestra propuesta sera contrastada en terminos R/D usando la VIF como metrica de calidad comparandola con la referencia y utilizando varios codificadores de imagen y video en modo intra en las comparativas. Por ultimo, y basado en resultados de varios estudios, incluimos en nuestro codificador un estimador adaptativo que en funcion de la imagen estima un valor optimo del ancho del dead zone para el cuantizador utilizado. Por ello modificamos la cuantizacion original de S-LTW para sustituirlo por un UVDZQ (Uniform Variable Dead Zone Quantizer). Este estimador determina el ancho del dead zone que permitira mejorar el rendimiento R/D perceptual respecto a usar el dead zone que usaba el S-LTW. El rendimiento de este estimador adaptativo se compara con otros codificadores de imagen muy conocidos. Nuestras comparaciones determinan que la union de las tecnicas utilizadas en esta tesis consiguen mejorar el comportamiento perceptual R/D de nuestro codificador frente al S-LTW y a otros codificadores, y conseguir considerables ahorros en rate al codificar una imagen a una misma calidad perceptual, es decir, para una misma calidad perceptual el PETW consigue reducir la tasa de bits utilizada.