当成人网站遇上机器学习

成人网站在国内属于灰色地带,即使在国外的一些合法的国家对于未成年人群也需要限制访问。因此无论国内外对于此类信息的识别特别重要。

成人网站包含大量的色情信息,目前对于色情信息的研究分为多个方面。有基于图像识别,来判定色情图片,色情视频等,主要应用场景是一些聊天软件中。有基于域名等关键信息过滤的来限制对此类站点的访问,主要应用场景是网络出口处,例如教育网和企业出口。本场 Chat 所阐述的是基于文本分类的方法来识别成人网站,例如有的浏览器会提示你访问的网站包含色情信息,就会用到类似的方法。

本场 Chat 主要包括以下几个方面:

  1. 分析网站哪些信息可以作为识别的语料信息;
  2. 语料信息的获取;
  3. 分词,去停用词形成词向量特征;
  4. 模型的训练识别及分析;
  5. 基于本文所述方法的扩展应用。

阅读全文: http://gitbook.cn/gitchat/activity/5b6e47ae96a58162ebcdbbe5

您还可以下载 CSDN 旗下精品原创内容社区 GitChat App ,阅读更多 GitChat 专享技术内容哦。

FtooAtPSkEJwnW-9xkCLqSTRpBKX

你可能感兴趣的:(当成人网站遇上机器学习)