Discovered Rule Filtering System Using MEDLINE Information Retrieval
Yoshifumi Kitamura · 2003
A data mining system can semi-automatically discover knowledge by mining a large volume of data, but the discovered knowledge is not always novel and interesting to the user. We propose a discovered rule filtering method to filter rules discovered by a data mining system and to produce ones that are novel and interesting to the user by using information retrieval technique. In this method, we rank discovered rules according to results of information retrieval from the Internet. In this paper, firstly we show the steps of discovered rule filtering by using a concrete example of clinical data mining and MEDLINE document retrieval. Secondly, we show a prototype system to filter rules discovered by a hepatitis data mining. Lastly, we discuss micro and macro view approaches to discovered rule filtering. Keyword discovered rule filtering, data mining, information retrieval, relevance feedback, MEDLINE database 1. はじめに アクティブマイニングは情報収集,データマイニン グ,ユーザリアクションの技術を融合することにより, ユーザの目的にあった質の高い知識の効率的な発見を 目指すデータマイニングの新しいアプローチである [1].本稿ではインターネット上からの文献情報検索結 果に基づきデータマイニング結果をフィルタリングす る発見ルールフィルタリング手法 [7]について述べる. データマイニングは大量のデータを機械処理する ことにより,ユーザにとって有用な知識を自動的に発 見しようとする手法である.一般的には与えられたデ ータに含まれる属性間の関係から統計的に意味のある 関係を発見する.しかしながら単に統計的な特徴だけ でデータマイニングを行うなら,(1)ユーザが扱いきれ ないほどの大量の知識が得られる,(2)ユーザにとって 既知の知識が得られる,(3)ユーザにとって興味のない 知識が得られる,といった問題が生じる.そこで本研 究ではルール形式で得られる大量の発見知識の中から 新規でユーザにとって興味のあるもののみにフィルタ リングする発見ルールフィルタリングの開発を行って いる.この発見ルールフィルタリングを実現するには 発見されたルールが新規かどうかを判定する必要があ る.このためにわれわれはインターネット上の情報源 を用いている.またユーザにとっての興味の有無を判 定するためには適合性フィードバック手法を用いてい る. 本論文では以下,2 章においてデータマイニングと 情報検索の統合とその利点に関して述べる.3 章では 発見ルールフィルタリングの手順について,4 章では それを実装したプロトタイプシステムについて述べる. 5 章ではルールフィルタリングを行う際の手法として ミクロビューアプローチとマクロビューアプローチに ついて議論し,6 章でまとめとする. 2. データマイニングと情報検索の統合 データマイニングとは複数の属性集合A 1 , A 2 ,...,A n に対し,それらの関係を示す大量のデータ集合D(⊆A 1× A 2×... × A n )から特徴的な属性間の関係を発見するこ とと定義できる.(ここでは簡単のために各属性値は 0 あるいは 1 の値を取ると仮定する.)すなわちデータ マイニングはデータ集合を入力とし,属性間の関係を 表 す ル ー ル 集 合 を 出 力 と す る 関 数 m(D)⊆R={ }として定式化できる. このようなルール集合を求める手法としては一般的に は正答率 (precision)と再現率 (recall)を考慮する統計的 手法が用いられることが多い.ただし,新奇なルール を発見しようとするシステムでは再現性を犠牲にした 手法がとられることもある. 一 方 , 情 報 検 索 と は 多 数 の キ ー ワ ー ド 集 合 B 1 ,B 2 ,...,B mが与えられているときに,それらを含む大 量の文献集合D’⊆B 1× B 2×... × B mからキーワードの共 起数を求めることと定義できる.すなわち情報検索と は文献集合とキーワード集合を入力とし,キーワード の 共 起 数 を 出 力 と す る 関 数 ir(D’,{B k1 , B k2 ,...,B kp })∈Intとして定式化できる.(ここで Intは整 数の集合である.)実用上,情報検索では共起数そのも のよりも,共起数の多い順にソートされた文献リスト が出力となる. それではデータマイニングと情報検索を組み合わ せることによりどのようなことが可能であろうか.ま ずデータマイニングにおける属性A i を情報検索にお けるキーワードB jに関連付ける関数 c(A i )=B jを得るこ とができるなら,データマイニング結果と情報検索結 果を関連付けることが可能になる.例えば,データマ イニングの結果としてルール が 得られたとしよう.またこのルールを構成する属性に 関連するキーワードを用いて情報検索を行うと共起数 k が 得 ら れ る . す な わ ち , ir(D’,{c(A c1 ), c(A c2 ),...,c(A cm )})=kである.このときkの値の大きさに 応じて発見ルールのランク付けを行うことができる.k が非常に大きな数値であれば,発見されたルールは既 知のものである可能性が大きいし,その逆であれば未 知の可能性が大きい. 情報検索にはさらに付加的なキーワードやパラメ ータを追加することも可能である.例えば,ある文献 情報検索システムでは文献が出版された年を入力とし た検索が可能になっている.これにより発見されたル ールが過去のトピックであるのか,最新のトピックで あるのかを識別することが可能になる.また,利用者 が興味を持つ領域を表すキーワードを付加すれば発見 されたルールが利用者にとって興味があるかどうかに 関しても評価することが可能になる. 3. 発見ルールフィルタリングの手順 発見ルールフィルタリングではデータマイニング システムにより発見された知識に対して,それに関連 する情報をインターネット上から検索し,その結果に 基づき,発見ルールのフィルタリングを行う.ここで の議論をより具体的なものとするために,肝炎データ からのマイニングを知識発見の対象領域として議論を 進める.発見ルールフィルタリングの具体的な手順は 以下の通りである. 3.1. 発見ルールの獲得 データマイニングシステムを利用してルール形式 の知識を得る.静岡大学の山口グループでは,千葉大 学医学部より提供された肝炎データから肝炎の進行具 合を示す血液データ (GPT)と他の検査データとの時系 列的な相関関係に着目し,様々なルール形式の知識発 見が行われている [2].その一例は図 1 に示すようなも のである.