Speech Enhancement with a Generative Adversarial Network

Mira Lilleholt Vik · NORA - Norwegian Open Research Archives · 2019

Hvem har ikke vært i en samtale forvrengt av bakgrunnslyd som trafikk eller vind? En algoritme som kan forbedre et støyete talesignal er av interesse i mange hverdagslige situasjoner. Vi har implementert en deep learning algoritme for taleforbedring, et betinget generativt adversarielt nettverk inspirert av Pascual et al. (2017). Algoritmen lærer en transformasjon fra støyete til renere tale gjennom et topersonsspill mellom en generator og en diskriminator. Denne tilnærmingen er interessant på grunn av to ting: den forbedrer i tidsdomenet og konstruerer tapsfunksjonen på en utradisjonell måte. Det er vanskelig å fange både kvaliteten og forståeligheten til et støyende talesignal med en tradisjonell tapsfunksjon. Her læres tapsfunksjonen basert på konkurranse mellom generatoren og diskriminatoren; diskriminatoren lærer et tap for at generatorens forbedring skal være nøyaktig. I utgangspunktet var målet med et generativt adversarielt nettverk (GAN) å lære og generere fra en treningsfordeling. Generatoren mottar latent tilfeldig støy som input og lærer en transformasjon til ønsket fordeling. Den latente støyen gjør generert output av algoritmen stokastisk. I taleforbedringssituasjonen brukes støyete tale som en betinget variabel i både generator og diskriminator - målet å lære en god transformasjon fra støyete til ren tale. Hvis transformasjonen er god, er det ikke viktig om outputet er stokastisk eller ikke. Inspirert av lignende tilnærminger i bilde-til-bilde-settingen, har vi sammenlignet forbedringsresultatene for nettverk med og uten latent støy. Algoritmen ble trent med talesignaler fra 220 forskjellige talere fra en norsk taledatabase og 99 forskjellige lydsignaler fra to støydatabaser med naturlige støyopptak. Treningsfilene ble konstruert ved tale-til-støy-forhold på 0, 10 og 15 dB. Testsettet inneholder opptak fra 2 talere med 5 unike setninger hver. Det støyete testsettet ble konstruert ved å kombinere talesignaler med støysignaler, ved det usette tale-støyforholdet 5 dB i tillegg til forholdene 0, 10 og 15 dB. Støysignalene i testsettet er plukket ut for å være realistiske når det gjelder hva man møter i virkeligheten. Metodens ytelse ble evaluert objektivt ved bruk av ITU-T standarden "Perceptual Evaluation of Speech Quality" (PESQ) og "Short-Time Objective Intelligibility" (STOI). Det har også vært noen subjektive vurderinger på de forbedrede filene fra studenten. Det foreslåtte oppsettet uten latent støy forbedrer sammenlignbart med det opprinnelige oppsettet med latent støy, men resultatene oppnådd i form av PESQ og STOI er noe lavere i gjennomsnitt. Begge implementeringene oppnår forbedringer i PESQ som kan sammenliknes med andre implementeringer som bruker et GAN-rammeverk for taleforbedring. STOI-poengene avtar etter forbedring, men det kan være delvis fordi input STOI-poengsummene til de støyete testfilene var høye. Generelt har de forbedrede talesignalene et redusert støynivå, men noen ganger på bekostning av høyfrekvente artefakter og litt taleforvrengning. Treningsfremgangen er ustabil. "Early stopping" kunne ha blitt implementert for å sikre at den endelige modellen er den beste av de forskjellige versjonene som ble utviklet under trening. Pascual et al. (2019) ser ut til å ha funnet løsninger på både ustabile gradienter og høyfrekvente artefakter, men denne artikkelen ble ikke publisert før slutten av april, og ble dessverre oppdaget for sent for å bli inkludert i dette arbeidet.

Read the paper · More papers on PaperTik