机器学习之路:python 文本特征提取 CountVectorizer, TfidfVectorizer
本特征提取:将文本数据转化成特征向量的过程比较常用的文本特征表示法为词袋法词袋法:不考虑词语出现的顺序,每个出现过的词汇单独作为一列特征这些不重复的特征词汇集合为词表每一个文本都可以在很长的词表上统计出一个很多列的特征向量如果每个文本都出现的词汇,一般被标记为停用词不计入特征向量主要有两个api来实现CountVectorizer和TfidfVectorizerCountVectorizer:只考