10.11772/j.issn.1001-9081.2020040549
用于网络新闻热点识别的热点新词发现
通过分析网络新闻热点词的特点,提出了一种用于网络新闻热点识别的热点新词发现方法.首先,用改进FP-tree算法提取频繁出现的词串作为热点新词候选,删除新闻数据中非频繁1-词串,并利用1、2-非频繁词串切割新闻数据,从而删除新闻数据中的大量无用信息,大幅降低FP-tree复杂度;其次,根据二元逐点互信息(PMI)扩展成多元PMI,并引入热点词的时间特征形成时间逐点互信息(TPMI),用TPMI判定热点新词候选的内部结合度和时间性,剔除不合格的候选词;最后,采用邻接熵确定候选新词边界,从而筛选出热点新词.采集百度网络新闻的7222条新闻标题作为数据集进行实验验证.在将半月内报道次数不低于8次的事件作为热点新闻且时间特征的调节系数为2时,采用TPMI可以正确识别51个热点词,丢失识别2个长时间热点词和2个低热度词,而采用不加入时间特征的多元PMI可正确识别全部热点词55个,但错误识别97个非热点词.分析可知所提的算法降低了FP-tree复杂度,从而减少了时间空间代价,实验结果表明判定热点新词时加入时间特征提高了热点新词识别率.
热点新词、FP-tree、逐点互信息(PMI)、邻接熵、时间特征
40
TP391(计算技术、计算机技术)
国家社会科学基金资助项目;河北省社会科学基金资助项目
2021-01-11(万方平台首次上网日期,不代表论文的发表时间)
共7页
3513-3519