Flexisample:个性化近似聚合查询系统
赵博1
左昌麒2
房俊1
1.北方工业大学信息学院 北京 100144;大规模流数据集成与分析技术北京市重点实验室 北京 1001442.北方工业大学信息学院 北京 100144
摘要:大数据交互式查询分析对于查询时延具有较高需求,基于采样技术的近似计算服务通过牺牲一定的准确性可以获得较少的查询时延,其在大数据近似查询分析方面具有良好的普适性和广阔的应用前景.论文所述系统Flexisample是一个基于采样技术的个性化近似聚合查询系统,实现了针对查询请求的解析重写和逻辑样本组合策略,使其可以满足个性化的多维聚合查询需求.为了在满足多样个性化聚合查询请求的同时保证一定的准确率,Flexisample维护了一组优化设计后的分层样本,并且为了扩大样本在时间维度上的覆盖范围,系统利用在线数据流对分层样本进行维护与更新.将系统应用于电能质量数据聚合查询,结果表明:针对多个个性化聚合查询请求和查询时延约束,系统可以在满足业务人员个性化查询需求的同时有效降低查询时延,在时间消耗仅为全量查询不足7%的条件下,全部分层的查询准确率均达到了88%以上,样本存储空间相比直接存储减少了87.5%.
关键词:近似计算聚合查询分层采样样本维护
分类号:C931.6(管理技术与方法)
资助基金:国家自然科学基金(62061136006)国家重点研发计划(2018YFB1402500)
论文发表日期:2021-12-20
在线出版日期:2025-08-15(本平台首次上网日期,不代表文献的发表时间)
页数:6( 2431-2436 )
英文信息
