R语言——朴素贝叶斯文本分类

朴素贝叶斯方法是最常见的使用贝叶斯思想进行分类的方法,它是目前所知文本分类算法中最有效的一类,常常应用于文本分类。下面将会以一个含多个类别的BBC英文文本数据为例,介绍如何使用朴素贝叶斯方法对其进行数据分类。

1 文本数据准备与探索

    下面会直接导入已经预处理后的数据对其进行探索性分析,下面的程序是导入进行文本分类是需要的相关R包,以及数据的导入,数据一共有两个变量,分别是预处理后的文本内容变量text_pre,和类别标签变量lable。

library(tm);library(wordcloud2);library(tidytext);library(reshape2);library(dplyr);library(e1071);library(ggpol)## 读取数据,文本数据已经是预处理后的bbcdata <- read.csv("data/chap12/bbcdata.csv",stringsAsFactors = FALSE)bbcdata$label <- as.factor(bbcdata$label)

R语言——朴素贝叶斯文本分类_第1张图片

图1  文本数据的前几行

     针对文本数据可以使用词云对其进行可视化,在下面的程序中通过unnest_tokens()、group_by()等函数计算在所有文本中,每个词语出现的次数,然后使用letterCloud()函数可视化字母词云

你可能感兴趣的:(R语言大学作业,r语言,开发语言)