面向新闻领域的关键词提取方法研究及系统实现

来源 :山西大学 | 被引量 : 0次 | 上传用户:pyane
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着互联网技术的飞速发展,网络上的新闻数据呈指数级增长,对新闻语料进行关键词提取有助于终端用户快速了解新闻内容,有助于新闻媒体机构对新闻进行快速分类和检索,更有助于高效编辑和管理。传统关键词主要是通过手工标注方式,数据量大、维度高,同时需要大量昂贵人力和时间资源,已经远远不能满足系统高效实时可用等需求。本文基于新闻领域设计和实现了一个智能关键词提取系统,该系统利用深度学习模型自动进行特征学习,采用管道策略连接实体识别和关系抽取任务,并将候选词抽取、关键词优化两个阶段进行串联,通过可视化技术对系统关键词进行展示,进一步提高了系统的可用性和友好性。系统主要包括候选词抽取、关键词优化、关键词可视化三个核心功能,具体工作内容如下:(1)基于双向长短期记忆(Bi-directional Long-Short Term Memory,Bi LSTM)与条件随机场(Conditional Random Field,CRF)模型,完成关键词的抽取任务,该模型考虑了文本的上下文语义信息;条件随机场模块解决了序列标注中的标记偏差问题。(2)采用帝国主义竞争算法(Imperialist Competitive Algorithm,ICA)对候选词进行优化,该优化过程能对模型进行加速,提高模型的提取速度。(3)将提取结果进行可视化展示,使得用户可以更直观的查看关键词提取过程及结果。本文成功构建了关键词自动提取系统。该系统具有界面友好,操作便捷,可以有效地解决新闻领域的关键词提取问题。
其他文献
近年来,随着自然语言处理技术的快速发展,聚焦于词级、短语级的研究已取得显著进展,针对于句子级的语义分析任务还相对较少,因此侧重于理解句子语义的篇章句间关系识别任务得到了研究者们的广泛关注。该任务作为篇章语义分析中的一项核心任务,旨在研究篇章内部论述单元(简称为“论元”)的逻辑语义关系,如因果关系、比较关系等。如何更准确的挖掘论元的深层语义信息是研究该任务的关键,也是影响模型性能的主要因素。本文主要
在当今数据爆炸的时代,数据降维是机器学习、模式识别以及数据挖掘等领域的共性问题之一。伴随着数据采集相关技术的快速发展应运而生的是大规模的高维数据的出现,普遍存在于数据处理应用过程中。当今数据采集技术的发展水平的仍有局限,数据源种类众多,数据类型也发展的更为多元化,采集阶段会将部分低质量数据比如噪声数据纳入采集结果中。虽然高维数据具有更全面的特征信息,可以更好的去刻画数据内部结构,但是无疑会带来负面
从图像中提取有价值的信息是尤为重要的,它为视觉信息处理提供了必要的前提和技术基础。而显著性检测则是提取有用信息的有效手段之一,它通过模拟人类注意机制,可以检测出人的视觉系统优先关注到的区域,为后续复杂的图像处理任务降低了处理难度。因此,研究视觉显著性检测极具研究意义和应用价值。基于深度学习的显著性检测算法能够获得相较于传统方法更精细的检测结果。然而,目前的检测效果不能获得准确的显著目标定位,同时所
目标跟踪技术是机器视觉研究领域极为重要的组成部分,已在军用和民用领域得到了广泛应用。由于视觉跟踪技术需要面对目标被遮挡、光照变化、快速运动等具有挑战性的场景,同时,现有运算平台大多数是一些高功耗和大体积的系统。因此需要设计一种鲁棒的多策略目标跟踪算法,且使用低功耗和小体积的嵌入式开发系统。论文重点研究和设计一种能够解决实际场景问题的多策略目标跟踪系统,改进核相关滤波目标跟踪算法,并在嵌入式系统上完
随着物联网的发展,RFID技术目前正广泛地应用于越来越多的场景中。RFID系统通常需要在较远的读取范围内操作,并且要准确和低成本。有芯片RFID标签支持较远的读取范围,但成本较高。相比之下,无芯片RFID标签成为提高标签可靠性和降低成本的一种有效方案。由于没有芯片的存在,标签仅靠散射阅读器发射来的电磁波来传输有用信号,导致传输距离短。因此本文针对无芯片RFID远距离传感的问题展开研究,主要研究内容
逻辑推理是人类智能的核心,也是人工智能领域的一个关键且具有挑战性的研究课题。人工智能当前在图像的识别和分类任务上取得了显著的进步,但不足之处在于当前的识别系统缺乏推理能力。人工智能的目标之一是开发具有类似人类逻辑推理能力的机器,因此我们有必要来深入理解机器中的学习和推理。如何让计算机学习拥有类似人类的逻辑推理能力是一个非常重要的研究内容。当前的人工智能推理技术仍不成熟,让机器直接进行推理是比较困难
跨模态检索技术是信息检索领域的研究热点,该技术是指通过放入一种模态的数据进行查询,之后检索并返回的结果是与查询时不同的另一种模态的数据,但两种数据的表达相关。当前跨模态检索技术存在的根本问题是不同模态的数据在表达上虽然都是表示同一件事情,即它们在语义上具有关联性,但是抽取出的底层特征所处的空间结构差异太大,即特征空间上存在异构鸿沟。处理好跨模态检索技术难题的关键是解决底层特征上存在的结构差异性、关
半监督聚类是将半监督学习和聚类算法相结合,通过已有的先验信息指导聚类提高算法性能,在生物医学、图像处理、自然语言等领域广泛应用。先验信息主要分为少量带标签的样本集和成对约束两类,现阶段半监督聚类算法大多单一的使用一种监督信息指导聚类,这样会造成一些先验信息的浪费,本文将如何同时使用两种先验信息进行指导聚类算法进行了系统研究,并且扩充了成对约束信息从而提高了算法性能。主要工作如下:(1)提出了一种基
词义理解是人在阅读中必备的一种能力,也是考试阅读理解中重要的一项考察内容。词义理解题通常有两种形式:(1)词义辨析题:给定目标词语及其释义,判断该释义是否为目标词所在上下文的意义。(2)词义解释题:给定目标词及其上下文,给出目标词的意义解释。本文针对这两类挑战性问题提出了相应的解决策略。本文的主要工作如下:(1)尝试了基于相似度的多策略词义辨析题解答方法。本文从词义辨析题的解答难点及人类解题的思路