Constructing Maximum Entropy Language Models for Movie Review Subjectivity Analysis
陈博, 何慧, 郭军 · Acta Scientiarum Naturalium Universitatis Sunyatseni · 2008
文件主观分析成为了网文章内容采矿的一个重要方面。这个问题类似于传统的文章分类,因此,许多相关分类技术能这里被改编。然而,有一重要差别,更多的语言或语义信息为更好估计一个文件的主观被要求。因此在这篇论文,我们的焦点主要在二个方面上。一个人是怎么提取有用、有意义的语言特点,并且其它是怎么为这项特殊任务高效地构造适当语言模型。为第一个问题,我们进行全球过滤、本地重量的策略与不同订单并且在各种各样的距离窗户以内在一系列 n 克选择并且评估语言特点。为第二个问题,我们采用最大平均信息量(MaxEnt ) 构造我们的语言模型框架的建模方法。除古典 MaxEnt 模型以外,我们也分别地与 Gaussian 和指数的 priors 构造了二种改进模型。在这给的详细实验糊与选择的井和加权的语言特点,有指数的 priors 的 MaxEnt 模型是的表演显著地对文章主观分析任务更合适。电子增补材料这篇文章(doi:10.1007/s11390-008-9125-z ) 的联机版本包含增补材料,它对授权用户可得到。