Spark框架下利用分布式NBC的大数据文本分类方法 |
| |
引用本文: | 臧艳辉,赵雪章,席运江. Spark框架下利用分布式NBC的大数据文本分类方法[J]. 计算机应用研究, 2019, 36(12) |
| |
作者姓名: | 臧艳辉 赵雪章 席运江 |
| |
作者单位: | 佛山职业技术学院,广东佛山528137;华南理工大学,广州510641 |
| |
基金项目: | 国家自然科学基金资助项目(71371077);佛山市科技计划项目(2015AB004241) |
| |
摘 要: | 针对现有面向大数据的计算框架在可扩展性机器学习研究中面临的挑战,提出了基于MapReduce和Apache Spark框架的分布式朴素贝叶斯文本分类方法。通过研究MapReduce和Apache Spark框架的适应性来探索朴素贝叶斯分类器(NBC),并研究了现有面向大数据的计算框架。首先,基于朴素贝叶斯文本分类模型将训练样本数据集分为◢m◣类;进一步在训练阶段中,将前一个MapReduce的输出作为后一个MapReduce的输入,采用四个MapReduce作业得出模型。该设计过程充分利用了MapReduce的并行优势,最后在分类器测试时取出最大值所属的类标签值。在Newgroups数据集进行实验,在所有五类新闻数据组上的分类都取得了99%以上的结果,并且均高于对比算法,证明了提出方法的准确性。
|
关 键 词: | 文本分类 MapReduce Spark框架 分布式 朴素贝叶斯分类器 机器学习 |
收稿时间: | 2018-07-02 |
修稿时间: | 2019-10-26 |
Text classification of big data using distributed NBC under Spark framework |
| |
Affiliation: | Foshan polytechnic |
| |
Abstract: |
|
| |
Keywords: | text classification MapReduce Spark framework distributed naive Bayes classifier(NBC) machine learning |
本文献已被 万方数据 等数据库收录! |
| 点击此处可从《计算机应用研究》浏览原始摘要信息 |
|
点击此处可从《计算机应用研究》下载全文 |