Speech recognition model robust to battlefield noise

Se‐Hong Oh, Ju-Hyeon Park, Taekyeong Yuk, Ju-Ann Kim, Hyun Kwon · The Journal of the Korean Institute of Information and Communication Engineering · 2024

최근 Transformer 기반 음성인식 모델들의 발전으로, 다양한 환경에서의 음성인식 성능이 크게 향상되었다. 이러한 모델들은 소음이 포함된 데이터를 일부 학습하여, 소음이 포함된 음성데이터에 대해서도 우수한 성능을 발휘한다. 그러나 사람의 말소리보다 훨씬 큰 전장소음(총기, 포탄 소리)과 같은 극단적인 환경에서는 이들 모델의 성능이 상대적으로 저하된다. 본 연구에서는 전장소음이 음성인식 모델의 성능에 끼치는 영향을 확인하였으며, OpenAI의 Whisper 모델을 디노이징 기법과 파인튜닝을 적용하여, 전장소음에 강건한 모델로 개선하였다. 디노이징 기법과 파인튜닝을 통하여 전장소음의 강도 및 모델의 종류에 따른 에러율(CER, Character Error Rate)을 Medium모델 기준 평균 35%, Small모델 기준 평균 40% 감소시킴으로써, 강도 높은 소음이 존재하는 실제 전장 환경에서도 개선된 Whisper 모델이 효과적으로 활용될 수 있음을 시사한다.

Read the paper · More papers on PaperTik