Algorithms for Improving Audible Quality and Recognition Accuracy of Noisy Speech

Simone Cifani · Università Politecnica delle Marche (Università Politecnica delle Marche) · 2010

La crescente domanda di sistemi hands-free ed interfacce uomo-macchina basati su tecnologie vocali pone la necessità di algoritmi per il miglioramento della qualità acustica ed il riconoscimento vocale. Questo è dovuto alla degradazione del segnale vocale causata dal rumore additivo e/o dagli effetti della riverberazione. Oltre alla ricerca di feature robuste, le due principali linee di ricerca volte a migliorare le performance dei riconoscitori vocali in ambienti rumorosi sono la model-adaptation e il miglioramento delle feature acustiche. Anche se il primo approccio permette di ottenere risultati migliori, il secondo presenta comunque notevoli vantaggi. In primo luogo, l'indipendenza dal back-end: tutte le operazioni sono compiute sui vettori delle feature fuori dal motore di riconoscimento vocale, offrendo così notevoli vantaggi implementativi. In secondo luogo, la facilità di implementazione: la parametrizzazione degli algoritmi risulta estremamente più semplice rispetto agli algoritmi basati su model-adaptation e non è richiesto nessun adattamento del modello acustico. Questo giustifica perché le metodologie di miglioramento delle feature acustiche sono ancora largamente considerate. Questa tesi si occupa del miglioramento delle feature acustiche in scenari mono- e multi-canale. Verranno presentati diversi stimatori Bayesiani, sia nel dominio spettrale che in quello cepstrale. Verranno implementate alcune ottimizzazioni nel dominio spettrale e generalizzate a quello cepstrale, generando così soluzioni nuove ed efficaci rispetto a quelle recentemente apparse in letteratura.

Read the paper · More papers on PaperTik