Japanese-English Translation Selection Using Vector Space Model.

Tadashi Kumano, Hideki Kashioka, Hideki Tanaka · Journal of Natural Language Processing · 2003

SENSEVAL-2日本語翻訳タスクは, 日本語単語の語義をその訳語の異なりとして定義・分類し, 新たな表現に含まれる日本語単語の語義を判別する課題である. 実際の課題としては, 語義分類の定義として日英対訳用例を収集した翻訳メモリ (TM) が与えられ, 語義の選択はTM中から適切な用例を選択するか, 対象となる日本語単語の翻訳結果を示すことで解くことができる. 我々は, 入力表現の対象語周辺文脈が最も似ているTMの日本語表現を選択する単言語の問題と見なし, 本タスクを解くシステムを開発した. 対象語周辺文脈の類似度は, 対象語周辺文脈を特徴づける要素である「文脈素性」の出現を各次元に配置した「文脈素性ベクタ」を用い, ベクタ空間モデルを用いて計算する. 文脈素性は, 対象語周辺文脈の特徴を, 対象語との構文的/位置的関係と単語の形態的/意味的属性の組で表現したもので, これにより, TM表現問の文脈の違いを詳細に表現できる. SENSEVAL-2参加システムは, 形態素・構文解析器にJUMAN+KNP, シソーラスに日本語彙体系を用い, 精度・再現率はともに45.8%を達成した. 各素性の有効性について分析した結果, シソーラスからた意味属性に関する文脈素性が性能に最も寄与しており, 係り受けに関する素性は限定的にしか寄与していないことがわかった.

Read the paper · More papers on PaperTik