Scaling Conditional Random Fields by One-Against-the-Other Decomposition
赵海, 揭春雨 · Acta Scientiarum Naturalium Universitatis Sunyatseni · 2008
作为把模型标记的一个强大的序列,有条件的随机场(CRF ) 在许多自然语言处理(NLP ) 有成功的应用任务。然而, CRF 训练的高复杂性仅仅允许一个很小的标签(或标签) 集合,因为训练是变得难处理,标记集合扩大。这篇论文求婚一训练改进分解并且为 CRF 学习的联合译码算法。而不是为所有标签训练一个单个 CRF 模型,它为每个标签独立地训练二进制 sub-CRF。一个最佳的标签序列然后被一个联合译码算法基于包含的所有 sub-CRFs 的概率的产量生产。测试它的有效性,我们把这条途径用于作为把问题标记的一个序列处理中国字切分(CWS ) 。我们的评估证明它能减少处理任务由的这种语言的计算费用 40 没有各种各样的大规模数据上的任何重要表演损失, 50% 设定。这篇文章(doi:10.1007/s11390-008-9157-4 ) 的联机版本包含增补材料,它对授权用户可得到。