DOI：10.3969/j.issn.1007-130X.2021.04.013

融合文本分布式表示的重复缺陷报告检测

引用

摘要：

重复缺陷报告检测能够避免对描述同一缺陷的多份报告进行重复的任务分派和修复,可降低软件维护成本.为了进一步提高检测的准确率,提出一种融合文本分布式表示的重复缺陷报告检测方法.首先,基于大规模缺陷报告数据库训练Doc2Vec模型并抽取缺陷报告的分布式表示,将不同长度的缺陷报告编码为统一长度的稠密向量.接着,通过比较这些向量来计算不同缺陷报告的相似程度,将其作为一种新特征与重复缺陷报告检测过程常用的其它特征进行融合,并利用机器学习算法训练二元分类模型.在公开的Bugzilla重复缺陷报告数据集上的实验结果表明,相比于代表性方法D_TS,本文方法的F1值平均提升了2％,说明了新特征的有效性.

关键词：重复缺陷报告、文本分布式表示、Doc2Vec模型、机器学习算法

所属期刊栏目：43

分类号：TP311.5(计算技术、计算机技术)

在线出版日期：2021-05-27（万方平台首次上网日期，不代表论文的发表时间）

页数：共11页

页码：670-680

英文信息展示

期刊专题