Unsupervised Statistical Segmentation of Japanese Kanji Strings

Rie Kubota Ando, Lillian Lee · eCommons (Cornell University) · 1999

Word segmentation is an important issue in Japanese language processing because Japanese is written without space delimiters between words. We propose a simple dictionary-less method to segment Japanese kanji sequences into words based solely on character $n$-gram counts from an unannotated corpus. The performance was often better than that of rule-based morphological analyzers over a variety of both standard and novel error metrics.

Read the paper · More papers on PaperTik