HMM-based visual speech recognition using intensity and location normalization

Oscar Vanegas, A. Tanaka, Keiichi Tokuda, Tadashi Kitamura · 1998

This paper describes intensity and location normalization techniques for improving the performance of visual speech recognizers used in audio-visual speech recognition. For auditory speech recognition, there exist many methods for dealing with channel characteristics and speaker individualities, e.g., CMN (cepstral mean normalization), SAT (speaker adaptive training). We present two techniques similar to CMN and SAT, respectively, for intensity and location normalization in visual speech recognition. Word recognition experiments based on HMM show that a significant improvement in recogniton performance is achieved by combining the two techniques.

Read the paper · More papers on PaperTik