论文部分内容阅读
文本相似度在自然语言处理领域中有着广泛的应用。基于语义的相似度计算方法能比较准确地反映词语之间的复杂关系,而基于统计的相似度计算方法能发掘词语中潜在的相关性。微博文本具有稀疏性、实时性、不规范性等特点,文章在综合两者优势的基础上,提出了一种语义和统计相结合的中文微博相似度计算方法。实验证明该方法在各项指标上都优于单一的相似度计算方法。