论文部分内容阅读
本文研究论坛的增量搜集问题。由于在论坛中同一主题通常分布在多个页面上,而传统增量搜集技术的蕈抓取策略通常是基于单个页面,因此这些技术并不适于对论坛增量搜集。本文通过对许多论坛中版块变化规律的统计分析,提出丁基于版块的论坛增量搜集策略。该策略将属十同一版块的信息定义为一个版块对象,并以版块对象为重抓取的基本单位。同时该策略利用版块权重和局部时间规律分配抓取资源和确定抓取时间点。实验结果表明本策略对新增和新回复帖子的平均召回率为99.4%,并且与平均调度方法相比系统总延迟最高可减小42%。