论文部分内容阅读
自动文本分类技术是大规模文档数据处理的关键技术,在文本分类过程中通常先进行文本表示,即把文本转化为特征向量。这其中常用的特征有特征词、词频、N—gram等等。论文研究了一种新的特征,即词语的HNC概念符号。词语的HNC概念符号来自于HNC(概念层次网络,Hierarehical Network of Concepts)建立的语义网络,以符号表达式的方式表示了词语的语义信息。因此使用HNC概念符号作为特征实际上是以文本中蕴舍的语义信息作为特征.和词频等使用文本表层信息的特征有本质的不同。采用最大熵模型的方法