论文部分内容阅读
当前网络中地理信息以几何形式递增,为了高效地从海量网络信息中检索出高质量的地理信息,本文提出了一种基于主题爬行的地理信息分布式检索方法。本文采用面向对象的方法将网络地理数据按照四元组的要求进行分解和组织,对地物实体的主题文本特征、地理空间特征、时间维特征等相关信息进行封装,建立四元组实体对象,实现了地理信息数据的相互集成与组织。引入MapReduce模式的并行处理机制完成对网页中地理信息数据的优化存储与索引,并且通过分别计算网页文本、地理文本与查询关键词的主题相关性对爬取的网页进行有序的排列,从而提