融合LSTM和LDA差异的新闻文本关键词抽取方法
【出 处】:
【作 者】:宁珊 严馨 周枫 王红斌 张金鹏
【摘 要】针对语义信息对TextRank的影响,同时考虑新闻标题信息高度浓缩以及关键词的覆盖性与差异性的特点,提出一种新的融合LSTM和LDA差异的关键词抽取方法。首先对新闻文本进行预处理,得到候选关键词;其次通过LDA主题模型得到候选关键词的主题差异影响度;然后结合LSTM模型和word2vec模型计算候选关键词与标题的语义相关性影响度;最后将候选关键词节点按照主题差异影响度和语义相关性影响度进行非均匀转移,得到最终的候选关键词排序,抽取关键词。该方法融合了关键词的语义重要性、覆盖性以及差异性的不同属性。在搜狗全网新闻语料上的实验结果表明,该方法的抽取结果相比于传统方法在准确率和召回率上都有明显提升。
相关热词搜索:关键词抽取; 新闻标题; TextRank算法; word2vec模型; LDA模型;
上一篇:主题模型在短文本上的应用研究
下一篇:基于CNN-SVM的护理不良事件文本分类研究