【译】mahout in action 6 分布式计算推荐器(Distributing Recommendation Computations)

本章包括:
。从维基百科统计分析大量的数据
。编写在hadoop上使用的推荐器和分布式算法
。伪分布式存在非分布式的推荐器

我们越来越关注日益增长的数据,自从开始这本书:从10个选择,到100,000到1千万,和现在1.7千万。这里仍旧只有半成品在推荐领域。本章,我们将再次处理大量的数据,超过1.3亿的“偏好”在提交维基百科的文章到文章的连接选择。在这个数据集合,用户和项目都是条件约束,他们展示怎么推荐可以有效的实施针对较少的常见内容。

针对展示1.3亿“偏好”仍然是易于控制的大小,它是一个这样的刻度:换句话说我们过去看到的,对单机处理很麻烦的推荐器。我们将部署新的推荐算法,使用分布式计算着手处理基于MapReduce和hadoop

你可能感兴趣的:(mapreduce,hadoop,算法)