Speech-Music Discrimination Using Deep Learning

Sang-Il Han · Journal of the Korea Academia-Industrial cooperation Society · 2021

음성, 음악 구분 방법은 전통적으로 퓨리에 분석치의 특성치를 직접 이용하는 방법이 사용되어 왔다. 하지만 딥러닝을 이용하면 end-to-end 방식으로 특성치를 별도로 부여하는 과정을 거치지 않고 구분이 가능하다. 본고에 사용된 자료는 국내 음악방송(FM 89.8MHz)에서 추출된 약 389만개의 음성, 음악 파일이다. 송출된 소리를 5초 단위로 구분하여 음성 2,401,040개 파일, 음악 1,489,168 총 3,890,208개의 파일을 구성했다. 5초 단위로 소리를 끊는 것은 일반적으로 음악 핑거프린팅이 5초 단위 소리를 사용하여 구분하기 때문이다. 이러한 자료에 대해 딥러닝 분석 기법인 CNN분석을 적용하되 기존의 이미지 학습을 이용한 전이학습(transfer learning)을 적용했다. 실험결과 모형의 복잡성을 높이지 않고도 기존 학습 모형을 응용해 약 89.6% 전후 정확도가 나왔다. 또한 혼동 행렬을 이용하면 음성을 음악으로 판단하는 오류는 12.3%, 음악을 음성으로 판단하는 오류는 12.2%를 보였다.

Read the paper · More papers on PaperTik