10.3969/j.issn.1003-3254.2015.11.017
基于领域模型的网页搜索排序算法
通用搜索引擎在检索过程中会出现查询结果与关键词所属领域无关的主题漂移现象.本文提出了面向特定领域的网页重排序算法-TSRR(Topic Sensitive Re-Ranking)算法,从一个新的视角对主题漂移问题加以解决.TSRR算法设计一种独立于网页排序的模型,用来表示领域,然后建立网页信息模型,在用户检索过程中结合领域向量模型和网页信息模型对网页搜索结果进行重排序.在爬取的特定领域的数据集上,以用户满意度和准确率为标准进行评估,实验结果表明,本文中提出的TSRR算法性能优异,比经典的基于Lucene的排序算法在用户满意度上平均提高17.3%,在准确率上平均提高41.9%.
领域模型、网页信息模型、网页重排序
24
TP3;G35
国家高技术研究发展计划8632012AA011005
2016-08-19(万方平台首次上网日期,不代表论文的发表时间)
共8页
107-114