Patent Mining using Beta Regression and R Text Mining
Sunghae Jun · Journal of Korean institute of intelligent systems · 2018
개발된 기술에 대한 특허는 숫자, 문자, 그림 등으로 이루어진 문서형식이다. 특허 마이닝은 대규모 특허문서 데이터로부터 기술과 관련된 다양한 지식을 추출하는 도구와 방법이다. 문서는 대부분 텍스트로 구성되어 있기 때문에 특허 마이닝에서는 텍스트 데이터를 처리하고 분석할 수 있는 텍스트 마이닝이 필요하다. 텍스트 마이닝을 지원하는 프로그래밍 언어로 본 논문에서는 R을 사용한다. R은 텍스트 마이닝 뿐만 아니라 대부분의 통계분석과 기계학습 알고리즘을 지원한다. 제안 방법에서 사용되는 베타 회귀분석도 R의 통계 패키지를 이용하여 수행된다. 반응변수가 0에서 1사이의 값을 갖는 베타 회귀분석의 특성을 이용하여 본 연구에서는 특허문서로부터 추출된 키워드 사이의 기술 연관성을 찾는 방법을 제안한다. 제안모형의 성능평가를 위하여 실제 특허문서를 이용한 실험을 수행한다.