发明 一种基于图聚类的高维文本数据特征选择方法
大数据挖掘/文本分类/文档数据 【大数据挖掘/文本分类/文档数据】 3人
G06F16/35
摘要:本发明请求保护一种基于图聚类的高维文本数据特征选择方法,该方法包括:剔除不相关特征,并构造加权无向图;再结合社区发现算法快速地将特征聚类;并以“最大相关最小冗余”原则搜索类簇空间,剔除类簇内的冗余特征;最后根据特征与类别间的关系挑选出最佳特征子集。本发明旨在利用图能体现特征空间分布的特性,结合高效的社区发现进行特征聚类,选取出具有代表性的特征,并消除聚类过程中忽略数据分布情况和每个特征与类别都具有不同程度的重要性问题。同时解决聚类时的盲目性,使得文本分类结果具有更高的准确性和稳定性。