ellende

mapreduce实现推荐系统（UserCF－基于用户的协同过滤算法）

博客说明：

博客内容用于学习与分享，有问题欢迎大家讨论留言。

关于作者：
程序员：杨洪（ellende）
blog: http://blog.csdn.net/ellende
email: [email protected]

转载请注明出处，引用部分网上博客，若有侵权还请作者联系与我。

用户推荐协同过滤算法(UserCF)原理说明

基于用户的协同过滤，通过不同用户对物品的评分来评测用户之间的相似性，基于用户之间的相似性做出推荐。简单来讲就是：给用户推荐和他兴趣相似的其他用户喜欢的物品。

1.原始数据输入

1,101,5.0

1,102,3.0

1,103,2.5

2,101,2.0

2,102,2.5

2,103,5.0

2,104,2.0

3,101,2.5

3,104,4.0

3,105,4.5

3,107,5.0

4,101,5.0

4,103,3.0

4,104,4.5

4,106,4.0

5,101,4.0

5,102,3.0

5,103,2.0

5,104,4.0

5,105,3.5

5,106,4.0

2.构成矩阵

101 102 103 104 105 106 107

[1,] 5.0 3.0 2.5 0.0 0.0 0 0

[2,] 2.0 2.5 5.0 2.0 0.0 0 0

[3,] 2.5 0.0 0.0 4.0 4.5 0 5

[4,] 5.0 0.0 3.0 4.5 0.0 4 0

[5,] 4.0 3.0 2.0 4.0 3.5 4 0

3.欧氏相似矩阵转换

[,1] [,2] [,3] [,4] [,5]

[1,] 0.0000000 0.6076560 0.2857143 1.0000000 1.0000000

[2,] 0.6076560 0.0000000 0.6532633 0.5568464 0.7761999

[3,] 0.2857143 0.6532633 0.0000000 0.5634581 1.0000000

[4,] 1.0000000 0.5568464 0.5634581 0.0000000 1.0000000

[5,] 1.0000000 0.7761999 1.0000000 1.0000000 0.0000000

计算方式：

相似度＝n/(1+sqrt(sum((Xi-Yi)^2)))

即需要对两个向量元素做差值并平方再求和再开方，开方后加1，最后n是有效向量差值个数。

如用户1和用户2的相似度计算：

(5.0-2.0)^2 + (3.0-2.5)^2 + (2.5-5.0)^2 = 15.5 //之所以只有3个向量元素做差值是因为要两个向量元素都为非0值才做差值计算

3/(1+sqrt(15.5)) = 0.607656

如用户1和用户4的相似度计算：

(5.0-5.0)^2 + (2.5-3.0)^2 = 0.25

2/(1+sqrt(0.25)) = 1.333333 因大于1 取相似度为1.000000（程序里去掉了这个限制）

4.最近邻矩阵

根据欧氏相似矩阵找出用户相似度最高的前2个用户，如下所示：

top1 top2

[1,] 4 5

[2,] 5 3

[3,] 5 2

[4,] 1 5

[5,] 1 3

如用户1相似度排序：4［1.0］，5［1.0］，2［0.607］，3［0.285］，1［0.0］

5.以用户1为例的推荐矩阵

用户1前2个最高相似度是用户4和用户5，分别列出对应评分矩阵：

101 102 103 104 105 106 107

1 5.0 3.0 2.5 0.0 0.0 0.0 0.0

4 5.0 0.0 3.0 4.5 0.0 4 0

5 4.0 3.0 2.0 4.0 3.5 4 0

去掉用户1已经买过的物品，即101，102，103，剩下用户1未买过的物品进行推荐，推荐矩阵如下：

101 102 103 104 105 106 107

4 0 0 0 4.5 0.0 4 0

5 0 0 0 4.0 3.5 4 0

6.以用户1为例的推荐结果

用户1未购买的物品分别得分：

104［(4.5+4)/2=4.25］，106［(4+4)/2=4］，105［(0+3.5)/2=1.75］，107［(0+0)/2=0］

最后推荐前2个物品，矩阵如下：

推荐物品物品得分

[1] "104" "4.25"

[2] "106" "4"

7.代码实现

主要基于hadoop实现mapreduce并行算法，UserCF算法在网上并行实现的不多，这里作为练习实现下，主要分为5步实现：

步骤1: 将数据输入整理，为计算欧氏相似矩阵准备数据。

步骤2: 依赖步骤1输出数据，计算欧氏相似矩阵完成。

步骤3: 依赖步骤2输出数据，根据欧氏相似矩阵找出用户相似度最高的前2个用户。

步骤4: 依赖步骤3输出数据和原始数据，计算出每个用户与相似度最高的2个用户之间未买过的物品进行推荐，输出推荐矩阵，输出数据是每个用户对应的推荐物品的平均值。

步骤5: 依赖步骤4输出数据，根据每个用户对应的推荐物品的平均值，计算出前3个推荐物品。

主要源文件：

1）HdfsDAO.java 是一个HDFS操作的工具，用API实现Hadoop的各种HDFS命令，请参考文章：Hadoop编程调用HDFS

2）UserCFHadoop.java 是main入口文件，实现目录配置，步骤运行。

3）UserCF_Step1.java 是步骤1实现文件

4）UserCF_Step2.java 是步骤2实现文件

5）UserCF_Step3.java 是步骤3实现文件

6）UserCF_Step4.java 是步骤4实现文件

7）UserCF_Step5.java 是步骤5实现文件

运行环境：

1）Centos6.5

2）hadoop 2.7.2

3）java sdk 1.7.079

主要代码如下：

1）HdfsDAO.java

package recommend.code1.hdfs;


import java.io.IOException;
import java.net.URI;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.FSDataInputStream;
import org.apache.hadoop.fs.FSDataOutputStream;
import org.apache.hadoop.fs.FileStatus;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IOUtils;
import org.apache.hadoop.mapred.JobConf;

public class HdfsDAO {

    private static final String HDFS = "hdfs://localhost:9000/";

    public HdfsDAO(Configuration conf) {
        this(HDFS, conf);
    }

    public HdfsDAO(String hdfs, Configuration conf) {
        this.hdfsPath = hdfs;
        this.conf = conf;
    }

    private String hdfsPath;
    private Configuration conf;

    public static void main(String[] args) throws IOException {
        JobConf conf = config();
        HdfsDAO hdfs = new HdfsDAO(conf);
        hdfs.mkdirs("/tmp/new");
        hdfs.copyFile("/home/yj/HadoopFile/userFile/small.csv", "/tmp/new");
        hdfs.ls("/tmp/new");
    }        
    
    public static JobConf config(){
        JobConf conf = new JobConf(HdfsDAO.class);
        conf.setJobName("HdfsDAO");
        conf.addResource("classpath:/hadoop/core-site.xml");
        conf.addResource("classpath:/hadoop/hdfs-site.xml");
        conf.addResource("classpath:/hadoop/mapred-site.xml");
        return conf;
    }
    
    public void mkdirs(String folder) throws IOException {
        Path path = new Path(folder);
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        if (!fs.exists(path)) {
            fs.mkdirs(path);
            System.out.println("Create: " + folder);
        }
        fs.close();
    }

    public void rmr(String folder) throws IOException {
        Path path = new Path(folder);
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        fs.deleteOnExit(path);
        System.out.println("Delete: " + folder);
        fs.close();
    }

    public void ls(String folder) throws IOException {
        Path path = new Path(folder);
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        FileStatus[] list = fs.listStatus(path);
        System.out.println("ls: " + folder);
        System.out.println("==========================================================");
        for (FileStatus f : list) {
            System.out.printf("name: %s, folder: %s, size: %d\n", f.getPath(), f.isDir(), f.getLen());
        }
        System.out.println("==========================================================");
        fs.close();
    }

    public void createFile(String file, String content) throws IOException {
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        byte[] buff = content.getBytes();
        FSDataOutputStream os = null;
        try {
            os = fs.create(new Path(file));
            os.write(buff, 0, buff.length);
            System.out.println("Create: " + file);
        } finally {
            if (os != null)
                os.close();
        }
        fs.close();
    }

    public void copyFile(String local, String remote) throws IOException {
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        fs.copyFromLocalFile(new Path(local), new Path(remote));
        System.out.println("copy from: " + local + " to " + remote);
        fs.close();
    }

    public void download(String remote, String local) throws IOException {
        Path path = new Path(remote);
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        fs.copyToLocalFile(path, new Path(local));
        System.out.println("download: from" + remote + " to " + local);
        fs.close();
    }
    
    public void cat(String remoteFile) throws IOException {
        Path path = new Path(remoteFile);
        FileSystem fs = FileSystem.get(URI.create(hdfsPath), conf);
        FSDataInputStream fsdis = null;
        System.out.println("cat: " + remoteFile);
        try {  
            fsdis =fs.open(path);
            IOUtils.copyBytes(fsdis, System.out, 4096, false);  
          } finally {  
            IOUtils.closeStream(fsdis);
            fs.close();
          }
    }

    public void location() throws IOException {
        // String folder = hdfsPath + "create/";
        // String file = "t2.txt";
        // FileSystem fs = FileSystem.get(URI.create(hdfsPath), new
        // Configuration());
        // FileStatus f = fs.getFileStatus(new Path(folder + file));
        // BlockLocation[] list = fs.getFileBlockLocations(f, 0, f.getLen());
        //
        // System.out.println("File Location: " + folder + file);
        // for (BlockLocation bl : list) {
        // String[] hosts = bl.getHosts();
        // for (String host : hosts) {
        // System.out.println("host:" + host);
        // }
        // }
        // fs.close();
    }

}

2）UserCFHadoop.java

package recommend.code1.recommend;

import java.util.HashMap;
import java.util.Map;
import java.util.regex.Pattern;

import org.apache.hadoop.conf.Configuration;

public class UserCFHadoop {

    public static final String HDFS = "hdfs://localhost:9000";
    public static final Pattern DELIMITER = Pattern.compile("[\t,]");
    
	/**
	 * @param args
	 */
	public static void main(String[] args) {
		// TODO Auto-generated method stub
        Map path = new HashMap();
        path.put("data", "/home/yj/HadoopFile/userFile/item.csv");// 本地的数据文件
        
        path.put("input_file", HDFS + "/user/yj/input/userCF/");// HDFS的目录
        path.put("input_step1",  path.get("input_file") + "/data");
        path.put("output_step1", path.get("input_file") + "/step1");
        path.put("input_step2",  path.get("output_step1"));
        path.put("output_step2", path.get("input_file") + "/step2");
        path.put("input_step3",  path.get("output_step2"));
        path.put("output_step3", path.get("input_file") + "/step3");
        path.put("input1_step4", path.get("output_step3"));
        path.put("input2_step4", path.get("input_step1"));
        path.put("output_step4", path.get("input_file") + "/step4");
        path.put("input_step5",  path.get("output_step4"));
        path.put("output_step5", path.get("input_file") + "/step5");
        
        try 
        {
        	UserCF_Step1.run(path);
        	UserCF_Step2.run(path);
        	UserCF_Step3.run(path);
        	UserCF_Step4.run(path);
        	UserCF_Step5.run(path);
        } 
        catch (Exception e) 
        {
          e.printStackTrace();
        }
        
        System.exit(0);
	}

    public static Configuration config() {// Hadoop集群的远程配置信息
    	Configuration conf = new Configuration();
        return conf;
    }
}

3）UserCF_Step1.java

package recommend.code1.recommend;

//import hadoop.myMapreduce.martrix.MainRun;

import java.io.IOException;
import java.util.HashMap;
import java.util.Iterator;
import java.util.Map;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.Reducer.Context;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.input.FileSplit;
import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;

import recommend.code1.hdfs.HdfsDAO;


public class UserCF_Step1 {
    public static class MyMapper extends Mapper {

        @Override
        public void map(LongWritable key, Text values, Context context) throws IOException, InterruptedException {
            String[] tokens = UserCFHadoop.DELIMITER.split(values.toString());
            
            if (tokens.length >= 3)
            {
	            Text k = new Text(tokens[1]);//itemid
	            Text v = new Text(tokens[0] + "," + tokens[2]);//userid + score
	            context.write(k, v);            	
            }
        }
    }

    public static class MyReducer extends Reducer {

        @Override
        public void reduce(Text key, Iterable values, Context context) throws IOException, InterruptedException {
        	Map map = new HashMap();
        	
            for (Text line : values) {
                String val = line.toString();
                String[] vlist = UserCFHadoop.DELIMITER.split(val);
                
                if (vlist.length >= 2)
                {
                	map.put(vlist[0], vlist[1]);
                }
            }

            Iterator iterA = map.keySet().iterator();
            while (iterA.hasNext())
            {
            	String k1 = iterA.next();
            	String v1 = map.get(k1);
            	Iterator iterB = map.keySet().iterator();
            	while (iterB.hasNext())
            	{
            		String k2 = iterB.next();
            		String v2 = map.get(k2);
            		context.write(new Text(k1 + "," + k2), new Text(v1 + "," + v2));
            	}
            }
        }
    }

    public static void run(Map path) throws IOException, InterruptedException, ClassNotFoundException {
    	Configuration conf = UserCFHadoop.config();

        String input  = path.get("input_step1");
        String output = path.get("output_step1");

        HdfsDAO hdfs = new HdfsDAO(UserCFHadoop.HDFS, conf);
        hdfs.rmr(path.get("input_file"));
        hdfs.rmr(input);
        hdfs.mkdirs(input);
        hdfs.copyFile(path.get("data"), input);

        Job job = Job.getInstance(conf, "UserCF_Step1 job");
        job.setJarByClass(UserCF_Step1.class);

        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(Text.class);
        
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(Text.class);

        job.setMapperClass(MyMapper.class);
        job.setReducerClass(MyReducer.class);

        job.setInputFormatClass(TextInputFormat.class);
        job.setOutputFormatClass(TextOutputFormat.class);

        FileInputFormat.setInputPaths(job, new Path(input));// 加载2个输入数据集
        FileOutputFormat.setOutputPath(job, new Path(output));

        System.out.println("input : " + input);
        System.out.println("output: " + output);
        
        if (!job.waitForCompletion(true))
        {
        	System.out.println("main run stop!");
			return;	
        }
        
        System.out.println("main run successfully!");
    }
}

4）UserCF_Step2.java

package recommend.code1.recommend;

//import hadoop.myMapreduce.martrix.MainRun;

import java.io.IOException;
import java.util.HashMap;
import java.util.Iterator;
import java.util.Map;
import java.lang.Math;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.Reducer.Context;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.input.FileSplit;
import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;

import recommend.code1.hdfs.HdfsDAO;


public class UserCF_Step2 {
    public static class MyMapper extends Mapper {

        @Override
        public void map(LongWritable key, Text values, Context context) throws IOException, InterruptedException {
            String[] tokens = UserCFHadoop.DELIMITER.split(values.toString());
            
            if (tokens.length >= 4)
            {
	            Text k = new Text(tokens[0] + "," + tokens[1]);
	            Text v = new Text(tokens[2] + "," + tokens[3]);
	            context.write(k, v);            	
            }
        }
    }

    public static class MyReducer extends Reducer {

        @Override
        public void reduce(Text key, Iterable values, Context context) throws IOException, InterruptedException {
        	double sum = 0.0;
        	double similarity = 0.0;
        	int num = 0;
        	
            for (Text line : values) {
                String val = line.toString();
                String[] vlist = UserCFHadoop.DELIMITER.split(val);
                
                if (vlist.length >= 2)
                {
                	sum += Math.pow((Double.parseDouble(vlist[0]) - Double.parseDouble(vlist[1])), 2);
                	num += 1;
                }
            }
            
            if (sum > 0.00000001)
            {
            	similarity = (double)num / (1 + Math.sqrt(sum));
            }
            
//            if (similarity > 1.0)
//            {
//            	similarity = 1.0;
//            }
            
            context.write(key, new Text(String.format("%.7f", similarity)));
        }
    }

    public static void run(Map path) throws IOException, InterruptedException, ClassNotFoundException {
    	Configuration conf = UserCFHadoop.config();

        String input  = path.get("input_step2");
        String output = path.get("output_step2");

        Job job = Job.getInstance(conf, "UserCF_Step2 job");
        job.setJarByClass(UserCF_Step2.class);

        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(Text.class);
        
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(Text.class);

        job.setMapperClass(MyMapper.class);
        job.setReducerClass(MyReducer.class);

        job.setInputFormatClass(TextInputFormat.class);
        job.setOutputFormatClass(TextOutputFormat.class);

        FileInputFormat.setInputPaths(job, new Path(input));// 加载2个输入数据集
        FileOutputFormat.setOutputPath(job, new Path(output));

        System.out.println("input : " + input);
        System.out.println("output: " + output);
        
        if (!job.waitForCompletion(true))
        {
        	System.out.println("main run stop!");
			return;	
        }
        
        System.out.println("main run successfully!");
    }
}

5）UserCF_Step3.java

package recommend.code1.recommend;

//import hadoop.myMapreduce.martrix.MainRun;

import java.io.IOException;
import java.util.ArrayList;
import java.util.Collections;
import java.util.Comparator;
import java.util.HashMap;
import java.util.Iterator;
import java.util.List;
import java.util.Map;
import java.lang.Math;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.Reducer.Context;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.input.FileSplit;
import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;

import recommend.code1.hdfs.HdfsDAO;


public class UserCF_Step3 {
    public static class MyMapper extends Mapper {

        @Override
        public void map(LongWritable key, Text values, Context context) throws IOException, InterruptedException {
            String[] tokens = UserCFHadoop.DELIMITER.split(values.toString());
            
            if (tokens.length >= 3)
            {
	            Text k = new Text(tokens[0]);
	            Text v = new Text(tokens[1] + "," + tokens[2]);
	            context.write(k, v);            	
            }
        }
    }

    public static class MyReducer extends Reducer {
    	private final int NEIGHBORHOOD_NUM = 2;
    	
        @Override
        public void reduce(Text key, Iterable values, Context context) throws IOException, InterruptedException {
        	Map map = new HashMap();
        	
            for (Text line : values) {
                String val = line.toString();
                String[] vlist = UserCFHadoop.DELIMITER.split(val);
                
                if (vlist.length >= 2)
                {
                	map.put(Double.parseDouble(vlist[1]), vlist[0]);
                }
            }
            
            List list = new ArrayList();
            Iterator iter = map.keySet().iterator();
            while (iter.hasNext()) {
            	Double similarity = iter.next();
                list.add(similarity);
            }
            
            //然后通过比较器来实现排序
            Collections.sort(list,new Comparator() {
                //降序排序
                public int compare(Double o1, Double o2) {
                    return o2.compareTo(o1);
                }
            });
            
//            for (int i = 0; i < NEIGHBORHOOD_NUM && i < list.size(); i++)
//            {
//        		context.write(key, new Text(map.get(list.get(i)) + "," + String.format("%.7f", list.get(i))));
//            }
            
            String v = "";
            for (int i = 0; i < NEIGHBORHOOD_NUM && i < list.size(); i++)
            {
            	v += "," + map.get(list.get(i)) + "," + String.format("%.7f", list.get(i));
            }
            context.write(key, new Text(v.substring(1)));
        }
    }

    public static void run(Map path) throws IOException, InterruptedException, ClassNotFoundException {
    	Configuration conf = UserCFHadoop.config();

        String input  = path.get("input_step3");
        String output = path.get("output_step3");

        Job job = Job.getInstance(conf, "UserCF_Step3 job");
        job.setJarByClass(UserCF_Step3.class);

        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(Text.class);
        
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(Text.class);

        job.setMapperClass(MyMapper.class);
        job.setReducerClass(MyReducer.class);

        job.setInputFormatClass(TextInputFormat.class);
        job.setOutputFormatClass(TextOutputFormat.class);

        FileInputFormat.setInputPaths(job, new Path(input));// 加载2个输入数据集
        FileOutputFormat.setOutputPath(job, new Path(output));

        System.out.println("input : " + input);
        System.out.println("output: " + output);
        
        if (!job.waitForCompletion(true))
        {
        	System.out.println("main run stop!");
			return;	
        }
        
        System.out.println("main run successfully!");
    }
}

6）UserCF_Step4.java

package recommend.code1.recommend;

//import hadoop.myMapreduce.martrix.MainRun;

import java.io.IOException;
import java.util.ArrayList;
import java.util.Collections;
import java.util.Comparator;
import java.util.HashMap;
import java.util.Iterator;
import java.util.List;
import java.util.Map;
import java.lang.Math;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.Reducer.Context;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.input.FileSplit;
import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;

import recommend.code1.hdfs.HdfsDAO;


public class UserCF_Step4 {
    public static class MyMapper extends Mapper {
    	private String flag;// A:step3 or B:data
    	private int itemNum = 7;
    	
        @Override
        protected void setup(Context context) throws IOException, InterruptedException {
            FileSplit split = (FileSplit) context.getInputSplit();
            flag = split.getPath().getParent().getName();// 判断读的数据集
            
            System.out.println(flag);
        }
        
        @Override
        public void map(LongWritable key, Text values, Context context) throws IOException, InterruptedException {
            String[] tokens = UserCFHadoop.DELIMITER.split(values.toString());
            int itemIndex = 100;
            
            if (flag.equals("step3")) {
            	for (int i = 1; i <= itemNum; i++)
            	{
            		Text k = new Text(Integer.toString(itemIndex + i));//itemid
            		Text v = new Text("A:" + tokens[0] + "," + tokens[1] + "," + tokens[3]);
            		context.write(k, v);
//            		System.out.println(k.toString() + "  " + v.toString());
            	}
            } else if (flag.equals("data")) {
                Text k = new Text(tokens[1]);//itemid
	            Text v = new Text("B:" + tokens[0] + "," + tokens[2]);//userid + score
	            context.write(k, v);  
//	            System.out.println(k.toString() + "  " + v.toString());
            }
        }
    }

    public static class MyReducer extends Reducer {
    	
        @Override
        public void reduce(Text key, Iterable values, Context context) throws IOException, InterruptedException {
        	Map mapA = new HashMap();
            Map mapB = new HashMap();

            for (Text line : values) {
                String val = line.toString();

                if (val.startsWith("A:")) {
                    String[] kv = UserCFHadoop.DELIMITER.split(val.substring(2));
                    mapA.put(kv[0], kv[1] + "," + kv[2]);
                } else if (val.startsWith("B:")) {
                    String[] kv = UserCFHadoop.DELIMITER.split(val.substring(2));
                    mapB.put(kv[0], kv[1]);
                }
            }
            
            Iterator iterA = mapA.keySet().iterator();
            while (iterA.hasNext())
            {
            	String userId = iterA.next();
            	if (!mapB.containsKey(userId))//不存在可以推荐 有买过这个物品的不推荐
            	{
            		String simiStr = mapA.get(userId);
            		String[] simi = UserCFHadoop.DELIMITER.split(simiStr);
            		if (simi.length >= 2)
            		{
            			double simiVal1 = mapB.containsKey(simi[0]) ? Double.parseDouble(mapB.get(simi[0])) : 0;
            			double simiVal2 = mapB.containsKey(simi[1]) ? Double.parseDouble(mapB.get(simi[1])) : 0;
            			double score = (simiVal1 + simiVal2) / 2;
            			
            			context.write(new Text(userId), new Text(key.toString() + "," + String.format("%.2f", score)));
            		}
            	}
            }
        }
    }

    public static void run(Map path) throws IOException, InterruptedException, ClassNotFoundException {
    	Configuration conf = UserCFHadoop.config();

        String input1 = path.get("input1_step4");
        String input2 = path.get("input2_step4");
        String output = path.get("output_step4");

        Job job = Job.getInstance(conf, "UserCF_Step4 job");
        job.setJarByClass(UserCF_Step4.class);

        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(Text.class);
        
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(Text.class);

        job.setMapperClass(MyMapper.class);
        job.setReducerClass(MyReducer.class);

        job.setInputFormatClass(TextInputFormat.class);
        job.setOutputFormatClass(TextOutputFormat.class);

        FileInputFormat.setInputPaths(job, new Path(input1), new Path(input2));// 加载2个输入数据集
        FileOutputFormat.setOutputPath(job, new Path(output));

        System.out.println("input1: " + input1);
        System.out.println("input2: " + input2);
        System.out.println("output: " + output);
        
        if (!job.waitForCompletion(true))
        {
        	System.out.println("main run stop!");
			return;	
        }
        
        System.out.println("main run successfully!");
    }
}

7）UserCF_Step5.java

package recommend.code1.recommend;

//import hadoop.myMapreduce.martrix.MainRun;

import java.io.IOException;
import java.util.ArrayList;
import java.util.Collections;
import java.util.Comparator;
import java.util.HashMap;
import java.util.Iterator;
import java.util.List;
import java.util.Map;
import java.lang.Math;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.Reducer.Context;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.input.FileSplit;
import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;

import recommend.code1.hdfs.HdfsDAO;


public class UserCF_Step5 {
    public static class MyMapper extends Mapper {

        @Override
        public void map(LongWritable key, Text values, Context context) throws IOException, InterruptedException {
            String[] tokens = UserCFHadoop.DELIMITER.split(values.toString());
            
            if (tokens.length >= 3)
            {
	            Text k = new Text(tokens[0]);
	            Text v = new Text(tokens[1] + "," + tokens[2]);
	            context.write(k, v);            	
            }
        }
    }

    public static class MyReducer extends Reducer {
    	private final int RECOMMENDER_NUM = 3;
    	
        @Override
        public void reduce(Text key, Iterable values, Context context) throws IOException, InterruptedException {
        	Map map = new HashMap();
        	
            for (Text line : values) {
                String val = line.toString();
                String[] vlist = UserCFHadoop.DELIMITER.split(val);
                
                if (vlist.length >= 2)
                {
                	map.put(Double.parseDouble(vlist[1]), vlist[0]);
                }
            }
            
            List list = new ArrayList();
            Iterator iter = map.keySet().iterator();
            while (iter.hasNext()) {
            	Double similarity = iter.next();
                list.add(similarity);
            }
            
            //然后通过比较器来实现排序
            Collections.sort(list,new Comparator() {
                //降序排序
                public int compare(Double o1, Double o2) {
                    return o2.compareTo(o1);
                }
            });
            
            String v = "";
            for (int i = 0; i < RECOMMENDER_NUM && i < list.size(); i++)
            {
            	if (list.get(i).compareTo(new Double(0.001)) > 0)
            	{
            		v += "," + map.get(list.get(i)) + "[" + String.format("%.2f", list.get(i)) + "]";
            	}
            }
            
            if (!v.isEmpty())
            {
            	context.write(key, new Text(v.substring(1)));
            }
            else
            {
            	context.write(key, new Text("none"));
            }
        }
    }

    public static void run(Map path) throws IOException, InterruptedException, ClassNotFoundException {
    	Configuration conf = UserCFHadoop.config();

        String input  = path.get("input_step5");
        String output = path.get("output_step5");

        Job job = Job.getInstance(conf, "UserCF_Step5 job");
        job.setJarByClass(UserCF_Step5.class);

        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(Text.class);
        
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(Text.class);

        job.setMapperClass(MyMapper.class);
        job.setReducerClass(MyReducer.class);

        job.setInputFormatClass(TextInputFormat.class);
        job.setOutputFormatClass(TextOutputFormat.class);

        FileInputFormat.setInputPaths(job, new Path(input));// 加载2个输入数据集
        FileOutputFormat.setOutputPath(job, new Path(output));

        System.out.println("input : " + input);
        System.out.println("output: " + output);
        
        if (!job.waitForCompletion(true))
        {
        	System.out.println("main run stop!");
			return;	
        }
        
        System.out.println("main run successfully!");
    }
}

8.结果运行：

1）原数据item.csv

1,101,5.0
1,102,3.0
1,103,2.5
2,101,2.0
2,102,2.5
2,103,5.0
2,104,2.0
3,101,2.5
3,104,4.0
3,105,4.5
3,107,5.0
4,101,5.0
4,103,3.0
4,104,4.5
4,106,4.0
5,101,4.0
5,102,3.0
5,103,2.0
5,104,4.0
5,105,3.5
5,106,4.0

2）step1输出

3,3	2.5,2.5
3,2	2.5,2.0
3,1	2.5,5.0
3,5	2.5,4.0
3,4	2.5,5.0
2,3	2.0,2.5
2,2	2.0,2.0
2,1	2.0,5.0
2,5	2.0,4.0
2,4	2.0,5.0
1,3	5.0,2.5
1,2	5.0,2.0
1,1	5.0,5.0
1,5	5.0,4.0
1,4	5.0,5.0
5,3	4.0,2.5
5,2	4.0,2.0
5,1	4.0,5.0
5,5	4.0,4.0
5,4	4.0,5.0
4,3	5.0,2.5
4,2	5.0,2.0
4,1	5.0,5.0
4,5	5.0,4.0
4,4	5.0,5.0
2,2	2.5,2.5
2,1	2.5,3.0
2,5	2.5,3.0
1,2	3.0,2.5
1,1	3.0,3.0
1,5	3.0,3.0
5,2	3.0,2.5
5,1	3.0,3.0
5,5	3.0,3.0
2,2	5.0,5.0
2,1	5.0,2.5
2,5	5.0,2.0
2,4	5.0,3.0
1,2	2.5,5.0
1,1	2.5,2.5
1,5	2.5,2.0
1,4	2.5,3.0
5,2	2.0,5.0
5,1	2.0,2.5
5,5	2.0,2.0
5,4	2.0,3.0
4,2	3.0,5.0
4,1	3.0,2.5
4,5	3.0,2.0
4,4	3.0,3.0
3,3	4.0,4.0
3,2	4.0,2.0
3,5	4.0,4.0
3,4	4.0,4.5
2,3	2.0,4.0
2,2	2.0,2.0
2,5	2.0,4.0
2,4	2.0,4.5
5,3	4.0,4.0
5,2	4.0,2.0
5,5	4.0,4.0
5,4	4.0,4.5
4,3	4.5,4.0
4,2	4.5,2.0
4,5	4.5,4.0
4,4	4.5,4.5
3,3	4.5,4.5
3,5	4.5,3.5
5,3	3.5,4.5
5,5	3.5,3.5
5,5	4.0,4.0
5,4	4.0,4.0
4,5	4.0,4.0
4,4	4.0,4.0
3,3	5.0,5.0

3）step2输出

1,1	0.0000000
1,2	0.6076560
1,3	0.2857143
1,4	1.3333333
1,5	1.4164079
2,1	0.6076560
2,2	0.0000000
2,3	0.6532633
2,4	0.5568464
2,5	0.7761999
3,1	0.2857143
3,2	0.6532633
3,3	0.0000000
3,4	0.5634581
3,5	1.0703675
4,1	1.3333333
4,2	0.5568464
4,3	0.5634581
4,4	0.0000000
4,5	1.6000000
5,1	1.4164079
5,2	0.7761999
5,3	1.0703675
5,4	1.6000000
5,5	0.0000000

4）step3输出

1	5,1.4164079,4,1.3333333
2	5,0.7761999,3,0.6532633
3	5,1.0703675,2,0.6532633
4	5,1.6000000,1,1.3333333
5	4,1.6000000,1,1.4164079

5）step4输出

6）step5输出

1	104[4.25],106[4.00],105[1.75]
2	105[4.00],107[2.50],106[2.00]
3	103[3.50],102[2.75],106[2.00]
4	102[3.00],105[1.75]
5	none

你可能感兴趣的:(hadoop学习)

Hadoop学习第三课（HDFS架构--读、写流程）小小程序员呀~ 数据库 hadoop 架构 big data
1.块概念举例1：一桶水1000ml，瓶子的规格100ml=>需要10个瓶子装完一桶水1010ml，瓶子的规格100ml=>需要11个瓶子装完一桶水1010ml，瓶子的规格200ml=>需要6个瓶子装完块的大小规格，只要是需要存储，哪怕一点点，也是要占用一个块的块大小的参数：dfs.blocksize官方默认的大小为128M官网：https://hadoop.apache.org/docs/r3.
Python大数据之Hadoop学习——day06_hive学习02 笨小孩124 大数据 hadoop 学习
一.hive内外表操作1.建表语法create[external]table[ifnotexists]表名(字段名字段类型,字段名字段类型,...)[partitionedby(分区字段名分区字段类型)]#分区表固定格式[clusteredby(分桶字段名)into桶个数buckets]#分桶表固定格式[sortedby(排序字段名asc|desc)][rowformatdelimitedfiel
C# Hadoop学习笔记第八个猴子大数据
记录一下学习地址http://www.360doc.com/content/14/0607/22/3218170_384675141.shtml转载于:https://www.cnblogs.com/TF12138/p/4170558.html
hadoop学习笔记草琳情 hadoop 学习笔记
下载安装伪分布式：1.国内源下载地址：https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/Indexof/apache/hadoop/commonhttps://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/https://mirrors.tuna.tsinghua.edu.cn/
Hadoop分布式计算实验踩坑实录及小结小童同学_ HIT hadoop 分布式 ubuntu java
目录Hadoop分布式计算实验踩坑实录及小结踩坑实录Hadoop学习Hadoop简介HDFSSomeconceptsMapReduce主要配置文件集群搭建来源与引用Hadoop分布式计算实验踩坑实录及小结踩坑实录单机jdk配置Ubuntu下安装jdk11，不熟悉apt-get的默认目录及目录配置，直接在Oracle找了Linux的压缩包在虚拟机上解压，解压到指定目录后配一下java环境变量。/et
Hadoop：学习HDFS，看完这篇就够了！爱写代码的July 大数据与云计算 hadoop 学习 hdfs 大数据云计算
HDFS（HadoopDistributedFileSystem）是ApacheHadoop生态系统中的分布式文件系统，用于存储和处理大规模数据集。由于其具有高容错性、高可靠性和高吞吐量等特点，因此广泛应用于大数据处理和分析场景。一认识Hadoop学习HDFS之前，让我们先来简单认识一下Hadoop是什么？Hadoop是Apache软件基金会旗下的一个开源分布式计算平台，为用户提供了系统底层细节透
手把手教Hadoop环境搭建，学不会你咬我～程序IT圈 hadoop jdk linux centos hdfs
之前后台小伙伴私信我想了解hadoop的单机环境安装，以方便用于hadoop学习，今天给大家安排上了，废话不多说，直接上干货。目录前置条件配置SSH免密登录Hadoop(HDFS)环境搭建Hadoop(YARN)环境搭建1、前置条件Hadoop的运行依赖JDK，需要预先安装，安装步骤见：1.1下载并解压在官网下载所需版本的JDK，这里我下载的版本为JDK1.8,下载后进行解压：[root@ jav
Hadoop学习之路（七） MapReduce框架Partitioner分区 shine_rainbow
Partitioner分区的作用是什么？在进行MapReduce计算时，有时候需要把最终输出数据分到不同的文件中，比如按照省份划分的话，需要把同一省份的数据放到一个文件中；按照性别划分的话，需要把同一性别的数据放到一个文件中。我们知道最终的输出数据是来自于Reducer任务。那么如果要得到多个文件，意味着有相同数量的Reducer任务在运行。Reducer任务的数据来自于Mapper任务，也就是M
《Hadoop大数据技术原理与运用》知识点总结呆小黎大数据 hadoop 数据库分布式
Hadoop学习过程中的一些笔记参考书籍《Hadoop大数据技术原理与应用》清华大学出版社黑马程序员/编著1.什么是大数据？大数据的四个特征是什么？答：一种规模大到在获取、存储、管理、分析方面大大超出了传统数据库软件工具能力范围的数据集合具有海量数据规模、快速数据流转、多样数据类型一级价值密度四大特征。2.另外，在Hadoop架构里面，元数据的含义是什么？答：文件的大小、位置、权限3.本书里面使用
第一章大数据Hadoop学习笔记(一） Thanks. hadoop 学习大数据
一、存储单位按顺序给出数据存储单位:bit、Byte、KB、MB、GB、TB、PB、EB、ZB、YB、BB、NB、DB。一般TB、PB、EB为单位的数据为大数据。1Byte=8bit1K=1024Byte1MB=1024K1G=1024M1T=1024G1P=1024T二、大数据主要解决海量数据的采集、存储和分析计算问题。三、大数据特点(4V)Volume(大量)、Velocity(高速)、Var
Hadoop学习之路（四）HDFS 读写流程详解 shine_rainbow
1.HDFS写操作1.1图解HDFS读过程hdfs写操作流程图.pngimage.png1.2数据写入过程详解1、使用HDFS提供的客户端Client,向远程的NameNode发起RPC请求；2、NameNode会检查要创建的文件是否已经存在，创建者是否有权限进行操作，成功则会为文件创建一个记录，否则会让客户端抛出异常；3、当客户端开始写入文件的时候，客户端会将文件切分为多个packets，并在内
【大数据进阶第三阶段之Hive学习笔记】Hive安装伊达 Hive 大数据大数据 hive 学习
1、环境准备安装hadoop以及zookeeper、mysql【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行环境搭建-CSDN博客《zookeeper的安装与配置》自行百度《Linux环境配置MySQL》自行百度2、下载安装CSDN下载：https://download.csdn.net/download/liguohuaty/88702104Hive官网下载：Downloads(a
大数据高级开发工程师——Hadoop学习笔记（4）讲文明的喜羊羊拒绝pua 大数据 hadoop mapreduce
文章目录Hadoop进阶篇MapReduce：Hadoop分布式并行计算框架MapReduce的理解MapReduce的核心思想MapReduce编程模型MapReduce编程指导思想【八大步骤】Map阶段2个步骤shuffle阶段4个步骤reduce阶段2个步骤MapReduce编程入门——单词统计hadoop当中常用的数据类型词频统计MapReduce的运行模式1.本地模式2.集群运行模式Ma
【大数据进阶第二阶段之Hadoop学习笔记】Hadoop 概述伊达 Hadoop 大数据大数据学习 hadoop
【大数据进阶第二阶段之Hadoop学习笔记】Hadoop概述-CSDN博客【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行环境搭建-CSDN博客【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行模式-CSDN博客1、Hadoop是什么（1）Hadoop是一个由Apache基金会所开发的分布式系统基础架构（2）主要解决海量数据的存储和海量数据的分析计算问题（3）广义上来说，Ha
【大数据进阶第二阶段之Hadoop学习笔记】Hadoop 运行环境搭建伊达大数据 Hadoop 大数据 hadoop 学习
【大数据进阶第二阶段之Hadoop学习笔记】Hadoop概述-CSDN博客【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行环境搭建-CSDN博客【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行模式-CSDN博客1、模板虚拟机环境准备1.1、hadoop100虚拟机配置要求如下（1）使用yum安装需要虚拟机可以正常上网，yum安装前可以先测试下虚拟机联网情况[root@had
【大数据进阶第二阶段之Hadoop学习笔记】Hadoop 运行模式伊达大数据 hadoop 学习
【大数据进阶第二阶段之Hadoop学习笔记】Hadoop概述-CSDN博客【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行环境搭建-CSDN博客【大数据进阶第二阶段之Hadoop学习笔记】Hadoop运行模式-CSDN博客目录1、Hadoop运行模式2、编写集群分发脚本xsync2.1、scp(securecopy)：安全拷贝2.2、rsync远程同步工具2.3、xsync集群分发脚本
大数据Hadoop入门学习线路图千_锋小小千
Hadoop是系统学习大数据的必会知识之一，Hadoop里面包括几个组件HDFS、MapReduce和YARN，HDFS是存储数据的地方就像我们电脑的硬盘一样文件都存储在这个上面，MapReduce是对数据进行处理计算的。YARN是一种新的Hadoop资源管理器，可为上层应用提供统一的资源管理和调度，它的引入为集群在利用率、资源统一管理和数据共享等方面带来了巨大好处。如何入门Hadoop学习，不妨
Hadoop学习笔记[6]-MapReduce与Yarn安装部署流程 kinglinch 大数据 mapreduce yarn hadoop 大数据
Hadoop学习笔记[6]-MapReduce与Yarn安装部署流程前面的文章已经对MR和Yarn做了基本介绍，本文主要介绍MR和Yarn的安装部署流程1、角色划分 NodeManager和DataNode一般都是1:1，主要是为了计算向数据移动，如果NM和DN分开，就得用网路拷贝数据，在Yarn的体系里NM也是从节点，既然其和DN是1:1的关系，所以配置中和HDFS共用一个slaves文件
【Hadoop学习笔记】（二）——Hive的原理及使用 wanger61 大数据开发 hadoop hive 大数据
一、Hive概述Hive是一个在Hadoop中用来处理结构化数据的数据仓库基础工具。它架构在Hadoop之上，用来进行数据提取、转化、加载，这是一种可以存储、查询和分析存储在Hadoop中的大规模数据的机制。Hive数据仓库工具能为HDFS上的数据提供类似SQL的查询语言（HiveQL），并将SQL语句转变成MapReduce任务来执行。Hive明显降低了Hadoop的使用门槛，任何熟悉SQL的用
四、Hadoop学习笔记————各种工具用法 weixin_30528371 大数据数据库
hive基本hql语法Sqoop(发音：skup)是一款开源的工具，主要用于在Hadoop(Hive)与传统的数据库(mysql、postgresql...)间进行数据的传递，可以将一个关系型数据库（例如：MySQL,Oracle,Postgres等）中的数据导进到Hadoop的HDFS中，也可以将HDFS的数据导进到关系型数据库中。数据传递转载于:https://www.cnblogs.com/
Hadoop学习笔记（17）Hive的数据类型和文件编码柏冉看世界 hadoop
一、Hive的常用内部命令1、有好几种方式可以与Hive进行交互。此处主要是命令行界面（CLI）。2、$HIVE_HOME/bin目录下包含了可以执行各种各样Hive服务的可执行文件，包括hive命令行界面（CLI是使用Hive的最常用方式）。[admin@master~]$cdapache-hive-1.2.2-bin/bin[admin@masterbin]$lsbeelineexthiveh
大数据高级开发工程师——Hadoop学习笔记（7）讲文明的喜羊羊拒绝pua 大数据 hadoop big data mapreduce yarn
文章目录Hadoop进阶篇YARN：Hadoop资源调度系统什么是YARNYARN架构剖析1.ResourceManager2.NodeManager3.Container4.ApplicationMaster5.JobHistoryServer6.TimelineServerYARN应用运行原理1.YARN应用提交过程2.MapReduceonYARN提交作业初始化作业Task任务分配Task任
Hadoop学习笔记（一）分布式文件存储系统 —— HDFS zhang35 大数据技术栈大数据分布式 Hadoop 入门 hdfs
概念HDFS（HadoopDistributedFileSystem），Hadoop分布式文件系统，用来存超大文件的。HDFS遵循主/从架构，由单个NameNode(NN)和多个DataNode(DN)组成：NameNode:负责执行有关文件系统命名空间的操作，例如打开，关闭、重命名文件和目录等。它同时还负责集群元数据的存储，记录着文件中各个数据块的位置信息。管理员，负责协调。DataNode：负
大数据高级开发工程师——Hadoop学习笔记（1）讲文明的喜羊羊拒绝pua 大数据大数据 hadoop hdfs 集群 zookeeper
文章目录Hadoop基础篇Hadoop集群安装环境准备服务器准备设置时钟同步三台虚拟机添加普通用户三台虚拟机定义统一目录三台虚拟机hadoop用户设置免密登录三台虚拟机安装jdkhadoop集群安装环境部署规划安装包下载查看hadoop支持的压缩方式以及本地库修改配置文件修改hadoop-env.sh修改core-site.xml修改hdfs-site.xml修改mapred-site.xml修改
Hadoop学习笔记(3)——MapReduce入门今天有没有写代码大数据 hadoop java
一、MapReduce介绍MapReduce思想在生活中处处可见。或多或少都曾接触过这种思想。MapReduce的思想核心是“分而治之”，适用于大量复杂的任务处理场景（大规模数据处理场景）。”map"负责分，即把复杂的任务分解为若干简单的任务来处理。前提是这些小任务可以并行计算，彼此间几乎没有依赖关系“Redude”负责合，即对map阶段的结果进行全局汇总1.MapReduce设计构思MapRed
linux及hadoop入门,Hadoop学习全程记录——Hadoop入门 weixin_39675926 linux及hadoop入门
开始学习Hadoop，从今天起，想把我学习hadoop全过程记录一下。我会记录在学习过程中碰到的问题、困难以及解决方法等等，如果你也是刚学hadoop，我们可以一起讨论。学了几天，好像入门了，在这里和大家分享，就当全程笔记的第一篇吧。新说明一下我的开发环境操作系统：在windows下使用wubi安装了Ubuntu10.10hadoop版本：hadoop-0.20上面这个地址是最新hadoop快速入
hadoop学习笔记(五)Hive安装部署 So.j hadoop学习笔记大数据 hive hadoop
Hive安装部署Hive安装及配置配置已经完成,在此处启动hadoop集群Hive常用命令将本地文件导入Hive案例安装MySqlHive元数据配置到MySqlHive安装及配置下载地址:https://pan.baidu.com/s/1_7g8Bw85Nw03t40H67sLfQ提取码:gj4n把apache-hive-1.2.1-bin.tar.gz上传到linux的/opt/software
Hadoop学习之HDFS——小白入门笔记 cainiao22222 hadoop hdfs hadoop hdfs
一、分布式文件系统1.分布式文件系统解决问题：海量数据的高效存储2.分布式文件系统是将文件分布存储到多个计算机节点上。（此处的计算机为普通计算机）3.分布式文件系统的多个节点分为两类：名称节点（主节点）：文件、目录的操作（创建、删除、重命名等），数据节点与文件块的映射关系数据节点（从节点）：数据的读取与存储二、HDFS概念1.名称节点：管理分布式文件的命名空间。包含FsImage，Editlog两
Hadoop学习之HDFS（HDFS客户端及API操作）心得顺其自然的济帅哈 Hadoop hadoop hdfs
HDFS客户端及API操作：一、准备条件：1.配置环境变量HADOOP_HOME(路径要求非中文)2.验证环境变量，双击winutils.exe（报错可能是缺少微软运行库MSVCR120.dll）3.在IDEA中创建一个Maven工程并且导入相应的依赖（hadoop-client、juint、slf4j-log4j12）4.新建HdfsClient类：1）客户端代码的三个步骤：获取一个客户端对象；
Hadoop学习(3)-mapreduce快速入门加yarn的安装 weixin_30323961 大数据操作系统 java
mapreduce是一个运算框架，让多台机器进行并行进行运算，他把所有的计算都分为两个阶段，一个是map阶段，一个是reduce阶段map阶段：读取hdfs中的文件，分给多个机器上的maptask，分文件的时候是按照文件的大小分的比如每个maptask都会处理128M的文件大小，然后有个500M的文件，就会启动ceil（500/128）个maptask每读取文件的一行的处理，需要自己去写，注意每个
矩阵求逆（JAVA）初等行变换 qiuwanchi 矩阵求逆（JAVA）
package gaodai.matrix; import gaodai.determinant.DeterminantCalculation; import java.util.ArrayList; import java.util.List; import java.util.Scanner; /** * 矩阵求逆(初等行变换) * @author 邱万迟 *
JDK timer antlove java jdk schedule code timer
1.java.util.Timer.schedule(TimerTask task, long delay)：多长时间（毫秒）后执行任务 2.java.util.Timer.schedule(TimerTask task, Date time)：设定某个时间执行任务 3.java.util.Timer.schedule(TimerTask task, long delay,longperiod
JVM调优总结 -Xms -Xmx -Xmn -Xss coder_xpf jvm 应用服务器
堆大小设置JVM 中最大堆大小有三方面限制：相关操作系统的数据模型（32-bt还是64-bit）限制；系统的可用虚拟内存限制；系统的可用物理内存限制。32位系统下，一般限制在1.5G~2G；64为操作系统对内存无限制。我在Windows Server 2003 系统，3.5G物理内存，JDK5.0下测试，最大可设置为1478m。典型设置： java -Xmx
JDBC连接数据库 Array_06 jdbc
package Util; import java.sql.Connection; import java.sql.DriverManager; import java.sql.ResultSet; import java.sql.SQLException; import java.sql.Statement; public class JDBCUtil { //完
Unsupported major.minor version 51.0（jdk版本错误） oloz java
java.lang.UnsupportedClassVersionError: cn/support/cache/CacheType : Unsupported major.minor version 51.0 (unable to load class cn.support.cache.CacheType) at org.apache.catalina.loader.WebappClassL
用多个线程处理1个List集合 362217990 多线程 thread list 集合
昨天发了一个提问，启动5个线程将一个List中的内容，然后将5个线程的内容拼接起来，由于时间比较急迫，自己就写了一个Demo，希望对菜鸟有参考意义。。 import java.util.ArrayList; import java.util.List; import java.util.concurrent.CountDownLatch; public c
JSP简单访问数据库香水浓 sql mysql jsp
学习使用javaBean，代码很烂，仅为留个脚印 public class DBHelper { private String driverName; private String url; private String user; private String password; private Connection connection; privat
Flex4中使用组件添加柱状图、饼状图等图表 AdyZhang Flex
1.添加一个最简单的柱状图 ? 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 <?xml version= "1.0"&n
Android 5.0 - ProgressBar 进度条无法展示到按钮的前面 aijuans android
在低于SDK < 21 的版本中，ProgressBar 可以展示到按钮前面，并且为之在按钮的中间，但是切换到android 5.0后进度条ProgressBar 展示顺序变化了，按钮再前面，ProgressBar 在后面了我的xml配置文件如下： [html] view plain copy <RelativeLa
查询汇总的sql baalwolf sql
select list.listname, list.createtime,listcount from dream_list as list , (select listid,count(listid) as listcount from dream_list_user group by listid order by count(
Linux du命令和df命令区别 BigBird2012 linux
1，两者区别 du，disk usage,是通过搜索文件来计算每个文件的大小然后累加，du能看到的文件只是一些当前存在的，没有被删除的。他计算的大小就是当前他认为存在的所有文件大小的累加和。
AngularJS中的$apply，用还是不用？ bijian1013 JavaScript AngularJS $apply
在AngularJS开发中，何时应该调用$scope.$apply()，何时不应该调用。下面我们透彻地解释这个问题。但是首先，让我们把$apply转换成一种简化的形式。 scope.$apply就像一个懒惰的工人。它需要按照命
[Zookeeper学习笔记十]Zookeeper源代码分析之ClientCnxn数据序列化和反序列化 bit1129 zookeeper
ClientCnxn是Zookeeper客户端和Zookeeper服务器端进行通信和事件通知处理的主要类，它内部包含两个类，1. SendThread 2. EventThread， SendThread负责客户端和服务器端的数据通信，也包括事件信息的传输，EventThread主要在客户端回调注册的Watchers进行通知处理 ClientCnxn构造方法 &
【Java命令一】jmap bit1129 Java命令
jmap命令的用法： [hadoop@hadoop sbin]$ jmap Usage: jmap [option] <pid> (to connect to running process) jmap [option] <executable <core> (to connect to a
Apache 服务器安全防护及实战 ronin47
此文转自IBM. Apache 服务简介 Web 服务器也称为 WWW 服务器或 HTTP 服务器 (HTTP Server)，它是 Internet 上最常见也是使用最频繁的服务器之一，Web 服务器能够为用户提供网页浏览、论坛访问等等服务。由于用户在通过 Web 浏览器访问信息资源的过程中，无须再关心一些技术性的细节，而且界面非常友好，因而 Web 在 Internet 上一推出就得到
unity 3d实例化位置出现布置？ brotherlamp unity教程 unity unity资料 unity视频 unity自学
问：unity 3d实例化位置出现布置？答：实例化的同时就可以指定被实例化的物体的位置,即 position Instantiate (original : Object, position : Vector3, rotation : Quaternion) : Object 这样你不需要再用Transform.Position了, 如果你省略了第二个参数(
《重构，改善现有代码的设计》第八章 Duplicate Observed Data bylijinnan java 重构
import java.awt.Color; import java.awt.Container; import java.awt.FlowLayout; import java.awt.Label; import java.awt.TextField; import java.awt.event.FocusAdapter; import java.awt.event.FocusE
struts2更改struts.xml配置目录 chiangfai struts.xml
struts2默认是读取classes目录下的配置文件，要更改配置文件目录，比如放在WEB-INF下，路径应该写成../struts.xml(非/WEB-INF/struts.xml) web.xml文件修改如下： <filter> <filter-name>struts2</filter-name> <filter-class&g
redis做缓存时的一点优化 chenchao051 redis hadoop pipeline
最近集群上有个job，其中需要短时间内频繁访问缓存，大概7亿多次。我这边的缓存是使用redis来做的，问题就来了。首先，redis中存的是普通kv，没有考虑使用hash等解结构，那么以为着这个job需要访问7亿多次redis，导致效率低，且出现很多redi
mysql导出数据不输出标题行 daizj mysql 数据导出去掉第一行去掉标题
当想使用数据库中的某些数据，想将其导入到文件中，而想去掉第一行的标题是可以加上-N参数如通过下面命令导出数据： mysql -uuserName -ppasswd -hhost -Pport -Ddatabase -e " select * from tableName" > exportResult.txt 结果为： studentid
phpexcel导出excel表简单入门示例 dcj3sjt126com PHP Excel phpexcel
先下载PHPEXCEL类文件，放在class目录下面，然后新建一个index.php文件，内容如下 <?php error_reporting(E_ALL); ini_set('display_errors', TRUE); ini_set('display_startup_errors', TRUE); if (PHP_SAPI == 'cli') die('
爱情格言 dcj3sjt126com 格言
1) I love you not because of who you are, but because of who I am when I am with you. 　　我爱你，不是因为你是一个怎样的人，而是因为我喜欢与你在一起时的感觉。 　　2) No man or woman is worth your tears, and the one who is, won‘t
转 Activity 详解——Activity文档翻译 e200702084 android UI sqlite 配置管理网络应用
activity 展现在用户面前的经常是全屏窗口，你也可以将 activity 作为浮动窗口来使用（使用设置了 windowIsFloating 的主题），或者嵌入到其他的 activity （使用 ActivityGroup ）中。当用户离开 activity 时你可以在 onPause() 进行相应的操作。更重要的是，用户做的任何改变都应该在该点上提交 ( 经常提交到 ContentPro
win7安装MongoDB服务 geeksun mongodb
1. 下载MongoDB的windows版本：mongodb-win32-x86_64-2008plus-ssl-3.0.4.zip，Linux版本也在这里下载，下载地址： http://www.mongodb.org/downloads 2. 解压MongoDB在D:\server\mongodb, 在D:\server\mongodb下创建d
Javascript魔法方法:__defineGetter__,__defineSetter__ hongtoushizi js
转载自： http://www.blackglory.me/javascript-magic-method-definegetter-definesetter/ 在javascript的类中,可以用defineGetter和defineSetter_控制成员变量的Get和Set行为例如,在一个图书类中,我们自动为Book加上书名符号: function Book(name){
错误的日期格式可能导致走nginx proxy cache时不能进行304响应 jinnianshilongnian cache
昨天在整合某些系统的nginx配置时，出现了当使用nginx cache时无法返回304响应的情况，出问题的响应头： Content-Type:text/html; charset=gb2312 Date:Mon, 05 Jan 2015 01:58:05 GMT Expires:Mon , 05 Jan 15 02:03:00 GMT Last-Modified:Mon, 05
数据源架构模式之行数据入口 home198979 PHP 架构行数据入口
注：看不懂的请勿踩，此文章非针对java，java爱好者可直接略过。一、概念行数据入口（Row Data Gateway）：充当数据源中单条记录入口的对象，每行一个实例。二、简单实现行数据入口为了方便理解，还是先简单实现： <?php /** * 行数据入口类 */ class OrderGateway { /*定义元数
Linux各个目录的作用及内容 pda158 linux 脚本
1）根目录“/” 　　根目录位于目录结构的最顶层，用斜线（/）表示，类似于 Windows 操作系统的“C:\“，包含Fedora操作系统中所有的目录和文件。　　2）/bin 　　/bin 　　目录又称为二进制目录，包含了那些供系统管理员和普通用户使用的重要 linux命令的二进制映像。该目录存放的内容包括各种可执行文件，还有某些可执行文件的符号连接。常用的命令有：cp、d
ubuntu12.04上编译openjdk7 ol_beta HotSpot jvm jdk OpenJDK
获取源码从openjdk代码仓库获取(比较慢) 安装mercurial Mercurial是一个版本管理工具。 sudo apt-get install mercurial 将以下内容添加到$HOME/.hgrc文件中，如果没有则自己创建一个： [extensions] forest=/home/lichengwu/hgforest-crew/forest.py fe
将数据库字段转换成设计文档所需的字段 vipbooks 设计模式工作正则表达式
哈哈，出差这么久终于回来了，回家的感觉真好！ PowerDesigner的物理数据库一出来，设计文档中要改的字段就多得不计其数，如果要把PowerDesigner中的字段一个个Copy到设计文档中，那将会是一件非常痛苦的事情。