Extraction and Retrieval of Top Pages By Analyzing of Proxy Log
Kai Cheng, Shintaro Hirano, Yahiko Kambayashi · 2003
The page that appears first when a web browser is started is called the “Top Page” or “Homepage”. Top Page reflects user’s interests certainly and is expected to include links to important pages. Top Page of one user can be useful for other users. But no methods for sharing them have been proposed. In this study, we extract Top Pages from a proxy access log and develop a new search engine which treats them. By applying user behavior captured by analysis of the proxy access log to a page-scoring algorithm of a search engine, the search engine can satisfies users’ needs which will change according to user location and season, for example. Keyword Information Retrieval , Web and Internet , Data Warehouse , Personalization 1. はじめに インターネットに接続してブラウザを立ち上げた時 に,利用者が初めに見るページは「トップページ」もし くは「ホームページ」,「開始ページ」と呼ばれる.トッ プページは利用者が Web ブラウザに設定しているペー ジや,友人からの推薦によってアクセスされたページな どがあると考えられる.トップページは利用者が苦労し て集めたよいリンクの集合や,利用者の興味や仕事と最 も合った質の良い情報が含まれるサイトである可能性が 高く,利用者の興味を確実に反映したコンテンツである ことが予想される.しかし,利用者のトップページを調 べることは困難であり,利用者同士が共有することがで きない. このようにトップページは重要であるにもかかわら ず,これまでトップページの検出,共有を実現する手法 は提案されてこなかった.本研究では利用者のアクセス 履歴を用いたトップページの抽出方法を提案し,それら を共有するための検索サービスについて検討した.さら に利用者がトップページの次にアクセスするページ (セ カンドページ )がトップページのリンクを辿ったもので あるかを調べることによって,質の良いトップページを 集めることも可能である.トップページからのリンクを 用いていない場合はアクセスされたページは利用者がブ ックマークの中から選択したページと考えることができ る.これにより質の良いトップページが分かると共に, ブックマークという利用者にとって重要なページを知る ことが可能である. コンテンツのリンク構造用いて,ハブとオーソリティ ーの関係から重要なページの検出を行う方法 [4]がある が,このような静的な構造を用いるより,実際に利用者 がどのように使ったかという情報から得られるトップペ ージのほうが重要なページである可能性が高い. 検索システムにおいて各利用者の興味に関する情報 を用いてその個人向きの検索精度をあげる手法も使われ ている.例えばある利用者のグループがどのような内容 に興味を持っているかを知りたい場合は各個人の興味情 報を集める必要がある.これにはプライバシーの問題が あり困難である.あるグループの利用者に対するトップ ページ集合はその利用者集合が持つ興味を反映している といってよい.これは個人を特定しなくても良いためプ ライバシーの問題はない.本稿ではこのような目的のた めに,トップページの検出方法とそれを利用した検索に ついて述べている.実際のデータは,京都市のインター ネットサービスプロバイダーから提供されたもので,そ の履歴データから求めたトップページ情報を用いてペー ジの順位付けを行いその有用性を確認した.個人情報を 用いて検索をさらに個人向けにすることも可能であるが, その部分には新規性がないのでここでは検討していない. Web 上での利用者の活動を記録した物としてプロキ シログがある.そのログ上では利用者は IP アドレスによ って表現されている.このプロキシログを用いてトップ ページリストの抽出,リストを基にした実データの取得 そして共有を試みようとした時,個別の利用者のアクセ ス履歴を入手することが前提である.しかし,IP アドレ スからでは正確な入手は困難である.本研究では,どの 利用者がどの IP アドレスをいつ利用しているかを記す ラディウスログを利用することでこの問題を解決した. 利用価値のあるこれらのログ,特にラディウスログの利 用はプライバシーの問題に抵触する可能性があるため実 現が難しく,これらの情報を利用した研究は貴重である. 利用者特定したアクセス履歴から抽出したトップページ の実データの取得時にはノイズやフレーム処理,URL 転 送,ページ更新の問題に配慮した. 現在一般に普及している検索システムでは利用者は 検索するクエリーを提出するだけで地域や年齢などの利 用者に関する情報の提示はしない.多くの検索システム はコンテンツのクエリーに対する重要度の計算をする際 に,コンテンツ中に含まれるキーワードやリンク構造の みを用いて計算しているので利用者に返される結果は, 検索空間やその中のコンテンツの変化がない限り,常に 同じものになる.利用者の特性や利用履歴を各利用者の 個人サイトが記憶している場合,それを用いて質問修正 と結果のフィルタリングをすることによって検索を各個 人向きにすることは可能である.利用者の特性の例には 地域性や検索される時期(季節)がある.携帯端末におけ る利用者の位置を考慮する手法として [7]がある.また, EC(電子商取引 )サイト [8]では利用者の履歴を利用して いる.しかし,先に述べた理由でグループ対応の情報の 反映は不可能であった. 本研究では ISP の保持するプロキシログを利用するこ とで,個別の利用者ではなく ISP の会員という利用者集 合のトップページを抽出すると共に,それらを利用した 地域性や検索する時期といった特性を考慮した検索シス テム[UTPS(Usage-aware Top Page Search System)]を開発 した.これまでの検索エンジンでは扱うのが困難であっ た興味の時間的推移の問題に対処できると考えられ,位 置情報や検索履歴が不十分な利用者にも対処することが できると考えられる. 利用者の特性として,地域性のほかに家族の状況や財 政状況などもインターネットの利用状況に影響があると 考えられる.UTPS は ISP の新サービスとしての利用が 期待できる. 以下 2 章ではトップページの抽出について述べ,3 章 では利用状況を反映したトップページの検索,4 章では 開発した UTPS の実装及び評価,5 章では関連研究,最 後に6章で本研究の結論と将来研究について触れる. 2. プロキシログによるトップページの抽出 インターネットに接続してブラウザを立ち上げた時 に,利用者が初めに見るページは「トップページ」もし くは「ホームページ」,「開始ページ」と呼ばれる.ここ で扱うトップページとして次のものが考えられる. 1. 利用者が Web ブラウザにトップページとして設定 したもの 普段最初に利用されることから,トップページには 利用者の Web 活動の拠点であるページが設定されて いると考えられる.Web ブラウザにおいて利用者が 興味のあるページの URL を保存しておくことで,ア クセスを簡単にするツールとして bookmark などが あるが,トップページはその bookmark の中で利用者 にとって最も重要なページであると考えられる. 2. 他者の推薦や自分の bookmark によりアクセスした ページ Web ブラウザを立ち上げていない状態で,友人から のメールやメーリングリストに含まれるページの紹 介を参考にしてアクセスしたページや bookmark の 中から利用者が選んでアクセスしたページ. これらのトップページは利用者の Web 活動の起点であ り,利用者の興味に基づいてアクセスされたページであ 2.2. 利用者別のアクセス履歴の作成 ると考えられ,利用者の興味を確実に反映したコンテン ツであると言える.有名サイトが多いと考えられる 1 型 のトップページに対して,2 型のトップページは特に利 用者の興味や個性を現していることが期待できる.これ らのトップページを利用者同士で共有することができれ ば,利用者の新しい知識(Web ページ)の入手が可能にな ることが期待できる. 利用者を特定した新しいプロキシログを利用者 ID ご とに記録することによって利用者別のアクセス履歴を生 成することができる.生成した利用者別のアクセス履歴 からトップページの抽出を行う.利用者を特定したアク セス履歴は時刻に関して昇順に並んでいる.利用者 ID ごとにアクセス履歴を割り振れば利用者別のアクセス履 歴が生成できる.本研究ではこれらのデータを京都市の 運営する大規模 ISP,Kyoto I-net から提供されたものを 利用したが利用者のプライバシーを尊重し,利用者名が 特定できないようにデータを変換して用いている. トップページの抽出方法として,プロキシログを利用 してトップページを抽出する方法を提案する.まずプロ キシログについて説明する.プロキシログは利用者の Web 上での活動を時間順に保持したものであり,主要な 情報のみを記したテーブルは以下のとおりである. • Proxy( Time , IP , Size , URL) 2.3. トップページの抽出 Time はリクエストされた時刻,IP は URL リクエストし た IP アドレス,URL,Size はそれぞれリクエストされた URL とそのデータのサイズである.しかしこれらの情報 だけでは,IP アドレスがどの利用者なのか特定すること はできない.そこで,本手法では利用者特定を可能にす るためにプロキシログに加えてラディウスログを利用す る. 利用者別のアクセス履歴を用いてトップページの URL を抽出し,実データを取得する方法について述べる. 先ほど利用したラディウスログの Login(接続開始時刻) の情報を利用しトップページを抽出する.Login よりも 後で,なおかつもっとも近い時刻にリクエストされた URL が本研究での定義におけるトップページである.ト ップページ決定イメージは次の図 3 の通りである.2 番 目にアクセスされたページ (セカンドページ)が,トップ ページのリンクを辿ったものであるかを調べることで質 の良いトップページが分かると共に,ブックマークとい う利用者にとって重要なページを知ることも可能である. 2.1. ラディウスログを用いた利用者の特定 ラディウスログは,誰がどの期間にどの IP アドレスを 利用しているかを記録するアクセス履歴である.ラディ ウスログのテーブルは以下の通りである. • Radius( U_ID , IP , Login , Logout , TEL_NO) U_ID は利用者 ID , IP は利用 IP アドレス,Login , Logout , TEL_NO は順に接続開始時刻,接続終了時刻,接続元電 話番号を表している.これらの情報を用いたプロキシロ グ上における利用者特定は図 1 に示すとおりに行われる. プロキシログとラディウスログの IP アドレスが一致し, リクエストした時刻が接続開始時刻と接続終了時刻の間 にあることが結合条件である. 図 3.ある利用者Aのトップページの抽出イメージ このようにして決定したトップページのリストを作 り,それを基にトップページの実データを取得する.実 データとは Web コンテンツの HTML ソースを意味する. 実データの取得時における問題には,現在は削除されて しまっている可能性,残っていてもエラー表示の内容し か含まない可能性,フレーム情報のみでコンテンツの実 部分が含まれない可能性,内容はなく転送コードが記載 されている可能性がある.これらの問題をデータのサイ ズや,取得した HTML ソースの内容解析によって解決し 実データを収集した.実データの収集に関しては 4.1.2 節にて詳しく述べる. 図 1.ラディウスログを用いた利用者特定 プロキシログとラディウスログをこの方法によって結合 し利用者を特定することによって,個々の利用者の行動 を追うことが可能となる. 3. 利用状況を反映したトップページの検索 ) ( * ) , ( ) , ( t idf d t tf d t Weight = 多くの人がトップページとして利用しているページ は当然として,少数の人がトップページとしているペー ジの中には,他の利用者にとって重要なものが含まれて いる可能性がある.本研究では UTPS を開発することで 利用者の興味,情報の共有を実現した.本研究ではトッ プページを共有する方法として検索を用いた.トップペ ージのコンテンツを考慮せずに利用頻度順に並べること で,利用者に推薦方法がある.しかし,この方法では利 用者の興味に合ったトップページを探すことは難しい. 検索を用いることで利用者が自分の興味をキーワードで 表すことができるので,自分の興味に関連したトップペ ージを知ることが可能となる. 検索の対象となるコンテンツ集を TF/IDF 法を用いてベ クトル空間モデルで表現する.検索されたキーワードに 対して重みの大きいコンテンツを検索結果として返すこ とで検索を実現している. しかし利用者の住んでいる地域や検索する時期とい った利用者の特性によって検索に求める情報は異なるこ とがあると考えられる.ゆえに検索におけるコンテンツ の重要度の計算にはコンテンツの関連性だけでなく地域