10.3969/j.issn.1000-3428.2011.05.066
哈萨克语文本分类系统的设计与实现
利用K-最近距离算法对哈萨克语文本进行分类,通过统计词频信息和语言信息相结合的方法选择特征,实现一个哈萨克语文本分类系统.在计算特征权重值时不仅考虑词频,还利用特征的集中度、分散度,经过训练和统计对每一类哈萨克语文本形成特征的权重向量,根据K-最近距离算法判断测试文本的所属类别,实验结果表明该方法可行.
文本分类、K-最近距离、集中度、分散度
37
TP18(自动化基础理论)
国家自然科学基金资助项目"现代哈萨克语词级文本语料库构建技术研究"60763005;国家教育部、国家语委民族语言文字规范标准建设及信息化科研项目"基于语料库的哈萨克语词语标注规范研究"MZ115-92
2011-05-04(万方平台首次上网日期,不代表论文的发表时间)
共3页
196-198