Correcting OCR Errors based on Error Patterns
Nara Kim, Yongseok Jo, Ho‐Hyun Park · Journal of KIISE · 2024
OCR(Optical Character Recognition)의 발달로 아날로그 문서의 디지털화가 가능해졌다. 정형화된 문서의 경우에는 높은 인식 정확도를 보이지만, 복잡한 형식의 문서에 대해서는 여전히 OCR 오류가 빈번히 발생하고 있다. 이를 해결하기 위해서 OCR 오류를 올바르게 교정하는 과정이 필요하다. OCR 오류는 동일한 문자에 대해 반복적으로 발생하는 경우가 대부분임에 따라 OCR 오류 수정 작업에서 OCR 오류 정보는 중요한 의미를 가진다. 하지만 오류 정보를 활용한 연구는 많지 않다. 따라서 본 연구는 OCR 오류 정보를 분석하여 그 패턴을 도출하고 이를 바탕으로 신경망 기계 번역기(Neural Machine Translator) 기반의 OCR 오류 수정 방법을 제안한다. 실험 결과, OCR 오류 정보를 사용한 모델이 OCR 오류 정보를 사용하지 않은 모델보다 높은 개선율을 나타내며 기존 모델 대비 최대 8%P 향상된 성능을 보이는 것을 확인할 수 있었다.