基于Web页面链接和标签的聚类方法
针对目前Web聚类效率和准确率不高的问题,提出一种基于Web页面链接结构和标签信息的聚类方法CWPBLT(clustering web pages based on their links and tags),它是通过分析Web页面中的链接结构和重要标签信息来比较页面之间的相似度,从而对Web站点中的Web页面进行聚类,聚类过程同时兼顾了Web页面结构和页面标签提供的内容信息.实验结果表明,该方法有效地提高了聚类的时间效率和准确性,是对以往仅基于页面主题内容或页面结构聚类方法的改进.
聚类、Web挖掘、分装器、最小描述长度、链接结构
30
TP391(计算技术、计算机技术)
国家自然科学基金项目60773004;山西省自然科学基金项目2007011050;山西省自然科学基金项目2006011030
2009-11-24(万方平台首次上网日期,不代表论文的发表时间)
共4页
4266-4268,4271