Research Process of “Building a Commonsense Inference Dataset based on Basic Events and its Application”
Kazumasa Omura · Journal of Natural Language Processing · 2024
黒橋,2023)について,その研究過程を中心 に紹介する.著者は談話関係を推論する能力に焦点を当てたデータ構築とその応用に取り組ん でおり,まず,補足が必要と思われる原論文に関する用語を以下にまとめる. 談話関係 文や節などのテキストスパン間の意味的な関係.例えば, 因果 「お腹が空いたので,ご飯を食べる」 条件 「激しい運動をすると,汗をかく」 対比 「好きな食べ物は餃子で,嫌いな食べ物はブロッコリーです」 などがある. 談話標識 ある談話関係を明示する接続表現.日本語では「-ので(因果) 」や「一方で(対比) 」 などがある. 蓋然的関係 一方が他方を引き起こし得る事態間に成立する談話関係.因果や条件などの談話 関係の上位分類に相当する. (Penn Discourse Treebank (Prasad et al. 2019) における Contingency の日本語訳として定義) 2 原論文の概要 原論文は,図 1 右下のような,基本的な蓋然的関係を問う多肢選択式問題(常識推論問題)の 半自動的な生成手法を提案したものである.提案手法は以下の 4 ステップから成る(図 1) . (1) 格フレーム (Kawahara and Kurohashi 2006) から高頻度な述語項構造を「基本イベント の核となる表現(コアイベント) 」として獲得する. (2) テキストに係り受け解析・談話関係解析を適用し, 「蓋然的関係を表す談話標識で接続さ れ,コアイベントから成るイベントの組」を自動抽出する.