基于数据仓库的海量搜索日志分析系统研究 |
| |
引用本文: | 黄玉蕾,唐明.基于数据仓库的海量搜索日志分析系统研究[J].电脑编程技巧与维护,2017(5). |
| |
作者姓名: | 黄玉蕾 唐明 |
| |
作者单位: | 西安培华学院,西安,710125 |
| |
基金项目: | 陕西省高等教育教学改革研究项目,西安培华学院校级课题+PHKT16045+智慧西安医疗云服务平台的数据仓库解决方案 |
| |
摘 要: | 针对传统分布式模型在海量日志并行处理时的可扩展性和并行程序编写困难的问题,提出了基于数据仓库的海量搜索日志分析系统架构.利用Hadoop分布式文件系统(HDFS)存储海量搜索日志,并对搜索日志进行清洗处理,采用impala对数据进行高速的处理,将处理后的统计结果导入到数据仓库中,使用Penta-hoBI对数据进行多维分析和统计报表.获取了关键词分析、查询频率、热词排行、查询词和时间分布、网站排名、用户统计等6个分析主题.分析结果对于搜索引擎的排序算法和系统优化都有一定的指导意义.
|
关 键 词: | 数据仓库 搜索引擎 用户行为分析 |
本文献已被 万方数据 等数据库收录! |
|