Multi-channel algorithms for improving speech recognition accuracy in adverse environments
Rudy Rotili · Università Politecnica delle Marche (Università Politecnica delle Marche) · 2012
Oggigiorno l’interazione uomo-macchina ha un ruolo fondamentale nella vita quotidiana delle persone. In particolare, per l’uomo, la voce rappresenta un modo naturale per comunicare e quindi anche una delle soluzione più adatte per interagire con diversi tipi di macchine. Questo spiega perché tecnologie basate su voce hanno guadagnato l’attenzione della comunità scientifica in questi anni. I sistemi di riconoscimento automatico del parlato sono i mezzi attraverso i quali l’interazione vocale con il computer può avvenire. Il riconoscimento vocale è un campo di ricerca molto am-pio: per esempio, la ricerca è rivolta allo sviluppo di algoritmi di ricerca efficienti, oltre che alle tecniche di addestramento discriminativo. In questo lavoro, l’attenzione è focalizzata sulle tecniche processamento per aumentare la ro-bustezza al rumore additivo ed al riverbero. In particolare vengono presentate tecniche che im-piegano un solo microfono (mono-canale) o più microfoni (multi-canale). Per quanto riguarda le tecniche mono-canale sono state proposte due migliorie di algoritmi basati su minimum mean square error. Tecniche basate sullo smoothing della funzione guadagno e su soft-decision origina-riamente proposte nel dominio della frequenza sono state sviluppate nel dominio cepstrale. Al fi-ne di ottenere un algoritmo computazionalmente efficiente è stato anche proposto uno stimatore nel dominio cepstrale basato sul criterio maximum a posteriori. Per quanto riguarda invece le tecniche multi-canale, sono stati proposti due diversi stimatori bayesiani nel dominio cepstrale. I risultati sperimentali hanno dimostrato l’efficacia delle soluzioni proposte nell’aumentare l’accuratezza del riconoscimento rispetto alla loro controparte mono-canale, evidenziando allo stesso tempo una riduzione del carico computazionale rispetto ai metodi nel dominio della fre-quenza. Oltre agli stimatori bayesiani è stato proposto un algoritmo di histogram equalization multi-canale nel quale la presenza di più canali audio viene sfruttata per ridurre la varianza del rumore ed ottenere una più affidabile stima della cumulative density function del segnale rumoro-so. Al fine di alleviare il problema del riverbero sono state analizzate tecniche di blind deconvolu-tion. In particolare, sono state studiate ed analizzate le basi teoriche dell’identificazione blind di risposte impulsive in sottobande. L’uso dell’identificazione blind di risposte impulsive in un fra-mework a sottobande non è stato ancora investigato in dettaglio e dunque rappresenta un tema di ricerca innovativo. In tal senso questo lavoro vuole essere un primo approccio per poter com-prendere meglio le questioni relative alla sua applicazione in situazioni realistiche. Per aumentare le prestazione di sistemi di riconoscimento automatico del parlato in scenari di tipo meeting viene inoltre presentata un’implementazione real-time di un framework esistente per la separazione e la dereverberazione del segnale vocale. L’innovazione sta nel superamento di di-versi limiti presenti in tale sistema che non consentono la sua applicazione in scenari reali. In par-ticolare, viene proposto un metodo iterativo di inverse filtering che riduce significativamente il costo computazionale, per sostituire la soluzione least square utilizzata nell’approccio di riferi-mento. Questo permette l’inversione di risposte impulsive lunghe anche in applicazioni real-time. È stato aggiunto anche un algoritmo di speaker diarization in modo da poter pilotare corretta-mente tutti gli altri stadi del framework, permettendo così che l’identificazione possa essere diret-tamente eseguita utilizzando le misture microfoniche. Lo studio di scenari innovativi per tecnologie vocali ha portato allo sviluppo di un front-end vocale per applicazioni su schermi da tavolo. Lo scenario applicativo prevede la presenza di quat-tro parlatori seduti attorno al tavolo che discutono tra loro. Il sistema cattura alcune parole chiave predefinite, e mostra sullo schermo immagini o parole legate all’argomento della conversazione. Tali stimoli sono utili a favorire e supportare la conversazione tra gli individui. In questo lavoro, ci si è occupati della definizione dei moduli dell’interfaccia vocale, con attenzione particolare ri-volta allo stadio di cattura delle parole chiave. Al fine di verificare l’adeguatezza del sistema pro-posto, sono stati condotti esperimenti su segnali acquisiti in condizioni realistiche.