10.3969/j.issn.1006-9348.2007.12.086
用于聊天词汇的权重计算方法CDTF*IDF
随着聊天室的广泛使用,对聊天内容监控也变成亟待解决的问题.在聊天室监控中,为衡量聊天数据中词汇对聊天内容的描述能力,现在一般直接采用文本词汇的权重计算方法;然而,这种方法忽视了聊天数据与静态文本结构上的差异,导致计算出的权重并不能准确反应词汇描述聊天内容的能力.针对聊天数据的固有特点,提出了一种专门针对聊天数据的词汇权重计算方法CDTF*IDF.该方法通过分别计算词汇在不同数据源中的权值并汇总、并对重点词汇提高权重等方式来计算聊天数据的词汇权重.基于IRC聊天室内容监控的实验表明:该方法能较好地衡量聊天词汇的权重,同时基于该方法的监控系统能够准确地识别出聊天数据中的话题.
聊天室监控、词汇权重、话题识别
24
TP301.6(计算技术、计算机技术)
国家自然科学基金;国家重点基础研究发展计划(973计划);实验室开放基金
2008-04-09(万方平台首次上网日期,不代表论文的发表时间)
共4页
332-335