首页 | 本学科首页   官方微博 | 高级检索  
     

MC-OLA:基于马尔可夫链的多表连接在线聚集技术
引用本文:史英杰,杜方.MC-OLA:基于马尔可夫链的多表连接在线聚集技术[J].计算机应用研究,2019,36(12).
作者姓名:史英杰  杜方
作者单位:北京服装学院信息工程学院,北京100029;宁夏大学信息工程学院,银川750021
基金项目:国家自然科学基金资助项目(61502279);北京市教委科技计划项目(KM201710012008);北京服装学院高水平教师队伍建设专项资金资助项目(BIFTQG201803);北京市服装产业数字化工程技术研究中心开放课题项目(KJCX1902-30299/009)
摘    要:多表连接查询是大数据分析领域重要的查询类型之一,然而连接查询的实现代价很高,从而影响了大数据分析结果的时效性。在线聚集能够在查询完成前反馈具有统计意义的估计结果,具有重要的意义。目前已有的多表连接在线聚集算法从各表进行统一随机采样,导致连接结果的产出率低,并且导致分组连接查询的估计准确率低。针对这一问题,提出了基于马尔可夫链的多表连接在线聚集技术,将多表连接的实现过程转换为马尔可夫链上的随机游走过程,确定好连接顺序后在游走起始层创建分层样本,并设计了相应的采样策略及结果估计方法。将所提出技术在在线化Hadoop平台上实现,实验结果证明所提出方案的响应时间优于已有算法,并且具有良好的扩展性。

关 键 词:在线聚集  马尔可夫链  分层采样  多表连接
收稿时间:2018/7/22 0:00:00
修稿时间:2019/10/31 0:00:00
本文献已被 万方数据 等数据库收录!
点击此处可从《计算机应用研究》浏览原始摘要信息
点击此处可从《计算机应用研究》下载全文
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号