Identifying a cross-document relation between sentences
Yasunari Miyabe, Hiroya Takamura, Manabu Okumura · 2003
一つのトピックについて書かれた複数の新聞記事に対し,異なる記事中の文間が同じ内容を述べているか (同 等関係)を特定する機械学習に基づく手法を提案する.提案手法では,2つの文の類似度でデータを複数のクラ スに分け,分けられたクラスに合った特徴で学習することによって,データを分けずに学習するより,優れた 結果を得られることを示した.また,2つの文の類似度があまり高くない文間ぺアのクラスにおいて,「同等」 の数は,クラス内の全ての文間ペア数と比べて,大変少ない.このため,2つの文が同じ内容を述べていても, 「同等」関係であると特定できないときがある.この問題を解決するために,異なる記事中の文間に存在する, 同じ内容を簡潔に述べたり,詳しく述べたりする「同等と似た関係」を利用する.最初に「同等」と「同等と 似た関係」を一つの粗いクラスにまとめて特定し,次に粗いクラスから「同等」のみを特定する,2段階の特 定手法を提案する.この 2つの手法を組み合わせることによって,高い正解率が得られることを示した.