Automatic Classification of Mandatory SEC Filings using NLP Techniques: Filtering Form 8-K Disclosures with Confidential Treatment Redactions

Kyung-Ran Lee, C. Y. Kang · Han-guk jeonja georae hakoeji · 2023

기업에 대한 방대한 정보를 제공하는 공시자료는 기업간 거래 및 투자 결정에 있어 필수적인 정보 원천이며 기업 및 산업에 대한 중요 연구자료이다. 본 논문에서는 기계학습에 기반한 자연어처리 기법을 활용하여 공시자료의 분류를 자동화하는 방법에 대해 다룬다. 특히 비밀처리(confidential treatment, CT)를 가지는 미국 수시공시 회계문서 8-K 양식의 자동판별을 위한 자연어처리(natural language processing, NLP) 기계학습 모델을 제안한다. CT란 경쟁우위의 저하를 유발할 수 있는 배타적 정보를 공시자료에서 비공개 하도록 허용하는 제도를 말한다. 문서의 분류를 위해 의사결정나무 기반의 XGBoost 모형과 인공신경망 기반의 EmbedMixed, BERT 모형을 비교하였다. 그 결과 가장 우수한 성능을 보인 모형은 XGBoost 모형으로 재현율과 정밀도가 80%~90% 사이에서 서로 상쇄하는 수준을 보였다. 본 모델을 통해 비밀처리 문서 탐색의 효율성을 크게 높일 수 있으며 다른 유형의 공시문서 분류에도 유사한 접근법을 적용해 볼 수 있을 것으로 기대한다.

Read the paper · More papers on PaperTik