DOI：10.3969/j.issn.1000-3428.2011.05.066

哈萨克语文本分类系统的设计与实现

引用

摘要：

利用K-最近距离算法对哈萨克语文本进行分类,通过统计词频信息和语言信息相结合的方法选择特征,实现一个哈萨克语文本分类系统.在计算特征权重值时不仅考虑词频,还利用特征的集中度、分散度,经过训练和统计对每一类哈萨克语文本形成特征的权重向量,根据K-最近距离算法判断测试文本的所属类别,实验结果表明该方法可行.

关键词：文本分类、K-最近距离、集中度、分散度

所属期刊栏目：37

分类号：TP18(自动化基础理论)

资助基金：国家自然科学基金资助项目"现代哈萨克语词级文本语料库构建技术研究"60763005;国家教育部、国家语委民族语言文字规范标准建设及信息化科研项目"基于语料库的哈萨克语词语标注规范研究"MZ115-92

在线出版日期：2011-05-04（万方平台首次上网日期，不代表论文的发表时间）

页数：共3页

页码：196-198

英文信息展示

期刊专题