DOI：10.11772/j.issn.1001-9081.2020040549

用于网络新闻热点识别的热点新词发现

引用

摘要：

通过分析网络新闻热点词的特点,提出了一种用于网络新闻热点识别的热点新词发现方法.首先,用改进FP-tree算法提取频繁出现的词串作为热点新词候选,删除新闻数据中非频繁1-词串,并利用1、2-非频繁词串切割新闻数据,从而删除新闻数据中的大量无用信息,大幅降低FP-tree复杂度;其次,根据二元逐点互信息(PMI)扩展成多元PMI,并引入热点词的时间特征形成时间逐点互信息(TPMI),用TPMI判定热点新词候选的内部结合度和时间性,剔除不合格的候选词;最后,采用邻接熵确定候选新词边界,从而筛选出热点新词.采集百度网络新闻的7222条新闻标题作为数据集进行实验验证.在将半月内报道次数不低于8次的事件作为热点新闻且时间特征的调节系数为2时,采用TPMI可以正确识别51个热点词,丢失识别2个长时间热点词和2个低热度词,而采用不加入时间特征的多元PMI可正确识别全部热点词55个,但错误识别97个非热点词.分析可知所提的算法降低了FP-tree复杂度,从而减少了时间空间代价,实验结果表明判定热点新词时加入时间特征提高了热点新词识别率.

关键词：热点新词、FP-tree、逐点互信息(PMI)、邻接熵、时间特征

所属期刊栏目：40

分类号：TP391(计算技术、计算机技术)

资助基金：国家社会科学基金资助项目;河北省社会科学基金资助项目

在线出版日期：2021-01-11（万方平台首次上网日期，不代表论文的发表时间）

页数：共7页

页码：3513-3519

英文信息展示

期刊专题