Computational Processing of the Polysemous Information
Dong Hyeok Lee · HAN-GEUL · 2006
이 글의 목적은 자연언어(natural language)를 기계적으로 처리하는 과정에서 다의성(polysemy)이 어떻게 규정되고, 다의성을 가지고 있는 다의어의 정보를 어떻게 저장하고 처리하는지를 설명하는 것이다. 기계 처리에서 한 표제어 아래에 둘 이상의 의미가 존재하면 이 표제어는 다의성이 있는 것이고 다의어라고 볼 수 있다. 반면에 같은 외형의 언어 표현이되 그 언어 표현이 서로 다른 전자사전의 표제어로 등재되어 있다면 동형어로 간주된다. 그리고 표제어의 용법이 상이한 문법 범주에 속하거나 목표 언어의 상이한 번역어에 속하면 의미 분절을 한다. 한편, 품사의 배열 순서와 하위 문법 범주별 배열 순서는 출현 빈도순으로 정해지며, 의미 배열의 순서는 연어에 의해 분절된 의미를 가장 먼저 배열하되 기본 의미의 자격을 지닌 의미는 가장 끝에 배열한다. 마지막으로 다의성을 해소하기 위해서는 전체 기계번역 시스템에서 다의성의 해소가 어떤 절차에서 이루어지는가를 고려해야 하고, 다의성의 해소를 위한 언어 정보가 무엇인지를 고려해야 한다.