论文部分内容阅读
大数据计算面对的是传统IT技术无法处理的数据量超大规模、服务请求高吞吐量和和数据类型异质多样的挑战。得益于国内外各大互联网公司的实际应用和开源代码贡献,源于Google的Apache Hadoop软件已成为PB量级大数据处理的成熟技术和事实标准。本文介绍了大数据计算系统中存储和索引两项研究工作,RCFile和CCIndex,分别有效解决了大数据计算系统的存储空间问题和查询性能问题。