Expression control of singing voice synthesis: modeling pitch and dynamics with unit selection and statistical approaches
Martí Umbert Morist · 2016
Las tecnologias de sintesis de sonido se han aplicado en diferentes campos, como el habla, los instrumentos musicales, y la voz cantada. Estas tecnologias deben tener una representacion realista del sonido original y tambien tienen que reproducir sus caracteristicas expresivas. Asi podemos hablar de sintesis expresiva del habla, de actuaciones expresivas de instrumentos, y de sintesis expresiva de voz cantada. De hecho, la voz cantada tiene puntos en comun con el habla (misma fuente sonora) y con los instrumentos (aspectos musicales como la melodia y otros recursos expresivos). Modelar la expresividad de la voz cantada es una tarea dificil. El instrumento nos es tan familiar que podemos detectar facilmente si los resultados obtenidos artificialmente son similares a los de un cantante. La dificultad de la tarea tambien esta vinculada a la variedad de caracteristicas a controlar relacionadas con la melodia, la dinamica, el ritmo y el timbre. El objetivo de esta tesis es generar los controles para sintetizadores de voz cantada y asi conseguir una expresividad parecida a la humana. Concretamente, nos fijaremos como objetivo obtener la frecuencia fundamental y la dinamica proponiendo cuatro sistemas. Respecto al sistema de seleccion de unidades hemos definido las funciones de costos para la seleccion de unidades asi como su transformacion i concatenacion. Con los sistemas estadisticos hemos modelado tanto secuencias de notas como secuencias de transiciones y sostenimientos. Tambien hemos presentado un ultimo sistema hibrido de los anteriores. Hemos entrenado todos estos sistemas con dos bases de datos expresivas que hemos disenado, registrado y etiquetado. El diseno lo hemos basado en secuencias de tres notas o silencios. Nuestra evaluacion perceptual compara los sistemas propuestos con un sistema por defecto y un sistema controlado por una voz humana. La evaluacion concluye que el sistema hibrido consigue la expresividad mas cercana a la de una voz humana. La evaluacion objetiva se centra en le eficiencia de los sistemas. Esta tesis contribuye al tema planteado en los siguientes aspectos: 1) recoge diversas definiciones que se han elaborado sobre la expresividad, 2) repasa trabajos anteriores en el control de la expresividad de la sintesis de la voz cantada, 3) presenta una recopilacion online de sonidos que muestran los resultados de estos trabajos, 4) propone una metodologia para la creacion de bases de datos expresivos, 5) implementa un sistema basado en la seleccion de unidades para el control de la expresividad, 6) propone dos sistemas estadisticos, 7) presenta un sistema hibrido, 8) compara los sistemas propuestos con sistemas de referencia, 9) propone otro caso de uso donde aplicar el control de expresividad, y finalmente, 10) proporciona una serie de propuestas para mejorar la evaluacion de sistemas de sintesis de voz cantada.