论文部分内容阅读
特征选择是基于内容的垃圾邮件过滤的重要过程,它有效地改善过滤效率和精度。文中分析了IG和CHI应用到垃圾邮件过滤中存在的不足,设计了一种改进的评价函数。而由于这种评价函数的特征选择方法只度量了特征与类的关系,忽略了特征之间依赖的关系,因此进一步用基于互信息的聚类方法来消除特征间冗余。实验结果表明该特征选择方法有效地提高了邮件过滤的性能。