顶尖高手养成计划

Spark3.x入门到精通-阶段五(SparkStreaming详解原理&java&scala双语实战)

SparkStreaming

简介

Spark Streaming 是 Spark 的一个子模块，用于快速构建可扩展，高吞吐量，高容错的流处理程序。具有以下特点：

通过高级 API 构建应用程序，简单易用；
支持多种语言，如 Java，Scala 和 Python；
良好的容错性，Spark Streaming 支持快速从失败中恢复丢失的操作状态；
能够和 Spark 其他模块无缝集成，将流处理与批处理完美结合；
Spark Streaming 可以从 HDFS，Flume，Kafka，Twitter 和 ZeroMQ 读取数据，也支持自定义数据源。

DStream

Spark Streaming 提供称为离散流 (DStream) 的高级抽象，用于表示连续的数据流。 DStream 可以从来自 Kafka，Flume 和 Kinesis 等数据源的输入数据流创建，也可以由其他 DStream 转化而来。在内部，DStream 表示为一系列 RDD。

Spark & Storm & Flink

storm 和 Flink 都是真正意义上的流计算框架，但 Spark Streaming 只是将数据流进行极小粒度的拆分，拆分为多个批处理，使得其能够得到接近于流处理的效果，但其本质上还是批处理（或微批处理）。

开始使用

hello world

java版本

public class JavaHelloWord {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
        //当使用Local模式启动Spark时，master URL必须为"local[n]"，且"n"的值必须大于"receivers"的数量：
        //否则会出现Expecting 1 replicas with only 0 处理
        sparkConf.setMaster("local[2]")
                .setAppName("JavaHelloWord");

        //Durations.seconds(1)表示每一秒拉去一次数据
        //每一秒就是一个batch，每一个batch里面会有多个rdd
        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(1));
        JavaReceiverInputDStream socketTextStream = javaStreamingContext.socketTextStream("master", 9999);

        //对于RDD里面每一个元素处理，这里的每一个元素是一行数据，其实中间的操作就是对于RDD里面元素的处理
        JavaDStream wordDStream = socketTextStream.flatMap(new FlatMapFunction() {
            @Override
            public Iterator call(String s) throws Exception {
                System.out.println(s);
                return Arrays.asList(s.split(" ")).iterator();
            }
        });

        JavaPairDStream wordCountDStream = wordDStream.mapToPair(new PairFunction() {
            @Override
            public Tuple2 call(String word) throws Exception {
                return new Tuple2(word, 1);
            }
        });

        JavaPairDStream resultDStream = wordCountDStream.reduceByKey(new Function2() {
            @Override
            public Integer call(Integer v1, Integer v2) throws Exception {
                return v1 + v2;
            }
        });

        resultDStream.foreachRDD(
                //这里对于每一batch所有的RDD进行分布式的发送到集群其他机器上面去执行
                rdd->{
                    rdd.foreach(new VoidFunction>() {
                        //对于RDD里面每一个分区里面的数据进行分布式计算
                        @Override
                        public void call(Tuple2 result) throws Exception {
                            System.out.println(result);
                        }
                    });
                }
        );

        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.close();
    }
}

打包后执行(下面是client提交，就会在提交的机器上面启动Driver,那么打印的时候就会直接在提交的窗口打印数据)

bin/spark-submit \
--master yarn \
--deploy-mode client \
--driver-memory 512m \
--executor-memory 512m \
--executor-cores 1 \
--num-executors 2 \
--queue default \
--class com.zhang.one.javasparkstreaming.JavaHelloWord \
/home/bigdata/spark/spark-yarn/original-sparkstart-1.0-SNAPSHOT.jar

下面用cluster提交(启动的Driver在集群的随机一台启动)

bin/spark-submit \
--master yarn \
--deploy-mode cluster \
--driver-memory 512m \
--executor-memory 512m \
--executor-cores 1 \
--num-executors 2 \
--queue default \
--class com.zhang.one.javasparkstreaming.JavaHelloWord \
/home/bigdata/spark/spark-yarn/original-sparkstart-1.0-SNAPSHOT.jar

下面是查看输出数据的步骤

scala版本

object ScalaStreaingWc {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf()
    conf.setAppName("ScalaStreaingWc")
      .setMaster("local[2]")

    val sparkStreaming = new StreamingContext(conf, Seconds(1))
    sparkStreaming.socketTextStream("master",9999)
      .flatMap(_.split(" "))
      .map((_,1))
      .reduceByKey(_+_)
      .foreachRDD(rdd=>rdd.foreach(println))

    sparkStreaming.start()
    sparkStreaming.awaitTermination()
    sparkStreaming.stop()
  }
}

SparkStreaming用Kafka作为数据源

Receiver模式(由于这种模式在spark3.x没有了所以就不写代码了)

关于上面为什么必须用local[*]图解，因为sparkstreaming会一直占用资源，必须有足够资源的前提它才能启动，下面以Reciver模式原理图解

Direct模式

java&scala双语实战

有点kafka的partition和RDD的partiton有一一对应的关系
能够保证spark仅仅消费一次kafka的数据

现在kafka创建对应的topic

 ./kafka-topics.sh --bootstrap-server master:9092 --create --topic spark-streaming-topic --partitions 2 --replication-factor 2

创建一个生产者

./kafka-console-producer.sh --broker-list master:9092 --topic spark-streaming-topic

java版本

public class JavaKafkaDirectStream {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
//对应kafka里面的分区一一对应
        sparkConf.setMaster("local[2]")
                .setAppName("JavaKafkaDirectStream");

        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(1));
        Map params = new HashMap<>();
        params.put("bootstrap.servers","master:9092");
        params.put("key.deserializer","org.apache.kafka.common.serialization.StringDeserializer");
        params.put("value.deserializer","org.apache.kafka.common.serialization.StringDeserializer");
        params.put("group.id","spark-streaming-group");
        params.put("auto.offset.reset","latest");
        params.put("enable.auto.commit",true);
        List topics = Arrays.asList("spark-streaming-topic");
        JavaInputDStream> kafkaDStream = KafkaUtils.createDirectStream(
                javaStreamingContext,
                LocationStrategies.PreferConsistent(),
                ConsumerStrategies.Subscribe(topics, params));

        JavaDStream kafkaValueDStream = kafkaDStream.map((Function, String>) v1 -> v1.value());
        JavaDStream woldDStream = kafkaValueDStream.flatMap((FlatMapFunction) s -> Arrays.asList(s.split(" ")).iterator());
        JavaPairDStream wordCountDStream = woldDStream.mapToPair((PairFunction) s -> new Tuple2(s, 1));
        JavaPairDStream resultDStream = wordCountDStream.reduceByKey((Function2) (v1, v2) -> v1 + v2);
        resultDStream.foreachRDD(rdd->rdd.foreach((VoidFunction>) result -> System.out.println(result)));

        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.stop();
    }
}

scala版本

object ScalaKafkaDirectStream {
  def main(args: Array[String]): Unit = {

    val sparkConf = new SparkConf().setAppName("ScalaKafkaDirectStream").setMaster("local[2]")
    val streamingContext = new StreamingContext(sparkConf, Seconds(5))

    val kafkaParams = Map[String, Object](
      /*
       * 指定 broker 的地址清单，清单里不需要包含所有的 broker 地址，生产者会从给定的 broker 里查找其他 broker 的信息。
       * 不过建议至少提供两个 broker 的信息作为容错。
       */
      "bootstrap.servers" -> "master:9092",
      /*键的序列化器*/
      "key.deserializer" -> classOf[StringDeserializer],
      /*值的序列化器*/
      "value.deserializer" -> classOf[StringDeserializer],
      /*消费者所在分组的 ID*/
      "group.id" -> "spark-streaming-group",
      /*
       * 该属性指定了消费者在读取一个没有偏移量的分区或者偏移量无效的情况下该作何处理:
       * latest: 在偏移量无效的情况下，消费者将从最新的记录开始读取数据（在消费者启动之后生成的记录）
       * earliest: 在偏移量无效的情况下，消费者将从起始位置读取分区的记录
       */
      "auto.offset.reset" -> "latest",
      /*是否自动提交*/
      "enable.auto.commit" -> (true: java.lang.Boolean)
    )

    /*可以同时订阅多个主题*/
    val topics = Array("spark-streaming-topic")
    val stream = KafkaUtils.createDirectStream[String, String](
      streamingContext,
      /*位置策略*/
      /**
       * 位置策略
       * Spark Streaming 中提供了如下三种位置策略，用于指定 Kafka 主题分区与 Spark 执行程序 Executors 之间的分配关系：
          PreferConsistent : 它将在所有的 Executors 上均匀分配分区；
          PreferBrokers : 当 Spark 的 Executor 与 Kafka Broker 在同一机器上时可以选择该选项，它优先将该 Broker 上的首领分区分配给该机器上的 Executor；
          PreferFixed : 可以指定主题分区与特定主机的映射关系，显示地将分区分配到特定的主机.
       */
      PreferConsistent,
      /*订阅主题*/
      /**
       *
       * @param 需要订阅的主题的集合
       * @param Kafka 消费者参数
       * @param offsets(可选): 在初始启动时开始的偏移量。如果没有，则将使用保存的偏移量或 auto.offset.reset 属性的
       *           def Subscribe[K, V](
                       topics: ju.Collection[jl.String],
                       kafkaParams: ju.Map[String, Object],
                       offsets: ju.Map[TopicPartition, jl.Long]): ConsumerStrategy[K, V] = { ... }
       */
      Subscribe[String, String](topics, kafkaParams)
    )

    /*打印输入流*/
    stream.map(_.value())
      .flatMap(_.split(" "))
      .map((_,1))
      .reduceByKey(_+_)
      .foreachRDD(rdd=>rdd.foreach(println))

    streamingContext.start()
    streamingContext.awaitTermination()
  }
}

常用的transform使用

updateStateByKey

对于每一个key维护一个状态
注意使用它的时候必须开始checkpoint(因为如果数据丢失了，还可以在磁盘中恢复数据)

java版本

public class JavaUpdateStateByKey {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
        sparkConf.setMaster("local[2]")
                .setAppName("JavaUpdateStateByKey");
        //解决权限问题
        System.setProperty("HADOOP_USER_NAME","bigdata");

        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(1));
        javaStreamingContext.checkpoint("hdfs://master:8020/sparkstreamingcheckpoing");
        JavaReceiverInputDStream socketTextStream = javaStreamingContext.socketTextStream("master", 9998);

        JavaDStream wordDStream = socketTextStream.flatMap(new FlatMapFunction() {
            @Override
            public Iterator call(String s) throws Exception {
                return Arrays.asList(s.split(" ")).iterator();
            }
        });

        //装换成key,value操作的
        JavaPairDStream wordCountDStream = wordDStream.mapToPair(new PairFunction() {
            @Override
            public Tuple2 call(String s) throws Exception {
                return new Tuple2(s, 1);
            }
        });

        //对于每一个key维护一个状态
        wordCountDStream.updateStateByKey(new Function2, Optional, Optional>(){
            @Override
            public Optional call(List newValues, Optional state) throws Exception {
                Integer initData=0;
                //如果有state了,就拿出这个state的值
                if(state.isPresent()){
                    initData=state.get();
                }
                //这里对于每一batch的新的数据对于state进行累加
                for (Integer newValue : newValues) {
                    initData+=newValue;
                }
                return Optional.of(initData);
            }
        }).foreachRDD(rdd->rdd.foreach((VoidFunction>) result -> System.out.println(result)));

        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.stop();
    }
}

scala版本

object ScalaUpdateStateByKey {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf()
    conf.setMaster("local[2]")
      .setAppName("ScalaUpdateStateByKey")
    //解决权限问题（主要一点要在得到sparkStreaming前配置）
    System.setProperty("HADOOP_USER_NAME", "bigdata")
    val sparkStreaming = new StreamingContext(conf, Seconds(1))
    sparkStreaming.checkpoint("hdfs://master:8020/scalasparkstreamingcheckpoing");

    sparkStreaming.socketTextStream("master",9998)
      .flatMap(_.split(" "))
      .map((_,1))
      .updateStateByKey((values:Seq[Int],state:Option[Int])=>{
        var res: Int = state.getOrElse(0)
        for (elem <- values) {
          res=res+elem
        }
        Option(res)
      }).foreachRDD(rdd=>rdd.foreach(println))

    sparkStreaming.start()
    sparkStreaming.awaitTermination()
    sparkStreaming.stop()
  }
}

transform

使用它是因为DStream只能和DStream执行join操作，当我们想和其他的RDD使用的时候就需要用到它

下面我们写一个事实黑名单点击过滤案例

java版本实现

public class JavaBlackList {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
        sparkConf.setMaster("local[2]")
                .setAppName("JavaHelloWord");

        //定义要过滤的黑名单的数据
        List> blackList = new ArrayList<>();
        blackList.add(new Tuple2<>("zhangsan",true));
        //得到每一批的数据的时候，我们为了测试把批次间隔调大一点
        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(5));
        JavaPairRDD blackListRDD = javaStreamingContext.sparkContext().parallelizePairs(blackList);

        JavaReceiverInputDStream socketTextStream = javaStreamingContext.socketTextStream("master", 9998);
        JavaPairDStream socketTupleUserMsg = socketTextStream.mapToPair(new PairFunction() {
            @Override
            public Tuple2 call(String s) throws Exception {
                String[] socketTextStringItem = s.split(" ");
                //因为假的输入的是name msg的形式
                String userName = socketTextStringItem[0];
                String msg = socketTextStringItem[1];
                return new Tuple2(userName, msg);
            }
        });

        //第一个参数是装换成的RDD，第二个是要返回什么RDD
        socketTupleUserMsg.transform(new Function, JavaRDD>() {
            @Override
            public JavaRDD call(JavaPairRDD socketKeyValue) throws Exception {
                //对于事实得到的用户数据和黑名单的数据进行左外连接的操作，
                JavaPairRDD>> allUser = socketKeyValue.leftOuterJoin(blackListRDD);
                //过滤出黑名单的数据
                JavaPairRDD>> filterUser = allUser.filter(new Function>>, Boolean>() {
                    @Override
                    public Boolean call(Tuple2>> v1) throws Exception {
                        //这里是Optional的特殊处理,isPresent表示这个Optional是否有值
                        //get()如果有值，并且左外连接以后匹配到了名字那么就是黑名单的数据我们直接过滤掉
                        if (v1._2._2.isPresent() && v1._2._2.get()) {
                            return false;
                        }
                        return true;
                    }
                });

                //对于连接的数据，我们只要之前输入的数据就行，那么就通过map进行装换处理

                return filterUser.map(new Function>>, String>() {
                    @Override
                    public String call(Tuple2>> v1) throws Exception {
                        return v1._2._1;
                    }
                });
            }
            //得到最后过滤出来的结果
        }).foreachRDD(rdd->rdd.foreach(new VoidFunction() {
            @Override
            public void call(String res) throws Exception {
                System.out.println(res);
            }
        }));


        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.stop();
    }
}

scala版本实现

object ScalaBlackList {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf()
    conf.setMaster("local[2]")
      .setAppName("ScalaBlackList")

    //定义用户黑名单
    val blackUser = List(
      ("a", true)
    )
    val sparkStreaming = new StreamingContext(conf, Seconds(2))
    val context: SparkContext = sparkStreaming.sparkContext
    val blackUserRDD: RDD[(String, Boolean)] = context.parallelize(blackUser)

    val socketDS: ReceiverInputDStream[String] = sparkStreaming.socketTextStream("master", 9998)
    socketDS.map(item => {
      val socketText: Array[String] = item.split(" ")
      val userName: String = socketText(0)
      val msg: String = socketText(1)
      (userName, msg)
    }).transform(rdd => {
      val allUser: RDD[(String, (String, Option[Boolean]))] = rdd.leftOuterJoin(blackUserRDD)
      //对于所有的数据进行过滤
      allUser.filter(item=>{
        //表示在黑名单里面没有数据的时候就是填充一个false作为默认值
        !item._2._2.getOrElse(false)
      }).map(item=>{
        (item._1,item._2._1)
      })
    }).foreachRDD(rdd=>rdd.foreach(println))

    sparkStreaming.start()
    sparkStreaming.awaitTermination()
    sparkStreaming.stop()
  }
}

window(滑动窗口)

案例

实时统计每10秒统计最近60秒的最多的搜索词top3

java版本

public class JavaWinddow {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
        sparkConf.setAppName("JavaWinddow")
                .setMaster("local[2]");

        //每一秒得到一份batch数据，里面其实一堆RDD
        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(1));
        JavaReceiverInputDStream socketTextStream = javaStreamingContext.socketTextStream("master", 9998);
        JavaPairDStream wordCount = socketTextStream.mapToPair(new PairFunction() {
            @Override
            public Tuple2 call(String s) throws Exception {
                return new Tuple2(s, 1);
            }
        });

        //这里使用窗口的特性，每10秒统计最近60秒的数据,也就是上面的数据会一直累积，到达条件以后往下面执行
        //第一个是reduceByKey的操作函数，
        // 第二个值是窗口大小
        //第三个值是滑动距离
        JavaPairDStream reduceWindowValue = wordCount.reduceByKeyAndWindow(new Function2() {
            @Override
            public Integer call(Integer v1, Integer v2) throws Exception {
                return v1 + v2;
            }
        }, Durations.seconds(60), Durations.seconds(10));

        JavaPairDStream integerStringJavaPairDStream = reduceWindowValue.mapToPair(new PairFunction, Integer, String>() {
            @Override
            public Tuple2 call(Tuple2 initData) throws Exception {
                return new Tuple2(initData._2, initData._1);
            }
        });
        //装换成RDD使用RDD的操作,对于60秒的数据进行排序
        JavaPairDStream sortDS = integerStringJavaPairDStream.transformToPair(rdd -> rdd.sortByKey(false));
        
        sortDS.mapToPair(new PairFunction, String, Integer>() {
            @Override
            public Tuple2 call(Tuple2 res) throws Exception {
                return new Tuple2(res._2, res._1);
            }
        }).foreachRDD(rdd->rdd.take(3).forEach(
                item->{
                    System.out.println(item);
                }
        ));


        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.stop();
    }
}

scala版本

object ScalaWindow {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf()
    conf.setAppName("ScalaWindow")
      .setMaster("local[2]")

    val sparkStreaming = new StreamingContext(conf, Seconds(1))
    val socketDS: ReceiverInputDStream[String] = sparkStreaming.socketTextStream("master", 9998)
    val reduceRDD: DStream[(String, Int)] = socketDS.map((_, 1))
      .reduceByKeyAndWindow((num1:Int,num2:Int)=>num2+num1, Seconds(60), Seconds(10))

    reduceRDD.map(item=>{
      (item._2,item._1)
    }).transform(rdd=>rdd.sortByKey(false)).foreachRDD(rdd=>rdd.take(3).foreach(println))

    sparkStreaming.start()
    sparkStreaming.awaitTermination()
    sparkStreaming.stop()
  }
}

foreachRDD详解

案例

实时处理10秒统计一次最近60秒的搜索按搜索的次数倒叙

public class JavaWinddow {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
        sparkConf.setAppName("JavaWinddow")
                .setMaster("local[2]");

        //每一秒得到一份batch数据，里面其实一堆RDD
        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(1));
        JavaReceiverInputDStream socketTextStream = javaStreamingContext.socketTextStream("master", 9998);
        JavaPairDStream wordCount = socketTextStream.mapToPair(new PairFunction() {
            @Override
            public Tuple2 call(String s) throws Exception {
                return new Tuple2(s, 1);
            }
        });

        //这里使用窗口的特性，每10秒统计最近60秒的数据,也就是上面的数据会一直累积，到达条件以后往下面执行
        //第一个是reduceByKey的操作函数，
        // 第二个值是窗口大小
        //第三个值是滑动距离
        JavaPairDStream reduceWindowValue = wordCount.reduceByKeyAndWindow(new Function2() {
            @Override
            public Integer call(Integer v1, Integer v2) throws Exception {
                return v1 + v2;
            }
        }, Durations.seconds(60), Durations.seconds(10));

        JavaPairDStream integerStringJavaPairDStream = reduceWindowValue.mapToPair(new PairFunction, Integer, String>() {
            @Override
            public Tuple2 call(Tuple2 initData) throws Exception {
                return new Tuple2(initData._2, initData._1);
            }
        });
        //装换成RDD使用RDD的操作,对于60秒的数据进行排序
        JavaPairDStream sortDS = integerStringJavaPairDStream.transformToPair(rdd -> rdd.sortByKey(false));

        sortDS.mapToPair(new PairFunction, String, Integer>() {
            @Override
            public Tuple2 call(Tuple2 res) throws Exception {
                return new Tuple2(res._2, res._1);
            }
        }).foreachRDD(rdd -> rdd.foreachPartition(new VoidFunction>>() {
            @Override
            public void call(Iterator> res) throws Exception {
                //得到连接，每一个连接处理一个分区的数据
                Jedis jedis = RedisHelper.getJedis();
                Map resMap = new HashMap<>();
                while (res.hasNext()) {
                    Tuple2 value = res.next();
                    String oldValue = resMap.get(value._1);
                    if (oldValue == null) {
                        oldValue = "0";
                    }
                    Integer newValue = Integer.valueOf(oldValue) + value._2;
                    resMap.put(value._1, newValue + "");
                }
                if(!resMap.isEmpty()){
                    jedis.del("hotWordTop3");
                    jedis.hset("hotWordTop3", resMap);
                }
                //把连接还回去
                RedisHelper.removeJedis(jedis);
            }
        }));


        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.stop();
    }
}

放入redis

        
            redis.clients
            jedis
            3.1.0

如果没有redis想快点使用的话下面提供docker安装

sudo yum install docker
sudo systemctl start docker
sudo systemctl enable docker

时间同步操作(有些时间不一样会有问题)

sudo yum install -y ntpdate
sudo ntpdate 120.24.81.91

#冲突时使用这个
sudo sudo systemctl stop ntp

镜像加速(由于自己提供的经常过期，可以自己去找下)

sudo systemctl daemon-reload
sudo systemctl restart docker

启动一个redis容器并且开机自启

sudo docker run -itd --name spark-redis -p 6379:6379  --restart=always  redis:6.0

创建一个redis的工具类

public class RedisHelper {

    private static JedisPool jedisPool=null;

    static {

        GenericObjectPoolConfig config = new GenericObjectPoolConfig();
        config.setMaxIdle(10);
        config.setMaxTotal(20);
        config.setMinIdle(5);
        jedisPool = new JedisPool(config, "node1");
    }

    public static Jedis getJedis() {
        Jedis resource = jedisPool.getResource();
        return resource;
    }

    public static void removeJedis(Jedis jedis){
        jedis.close();
    }
}

结合SparkSql实战

案例要求

每10秒统计最近60秒用户点击top3的数据

public class JavaStreamingSql {
    public static void main(String[] args) throws InterruptedException {
        SparkConf sparkConf = new SparkConf();
        sparkConf.setAppName("JavaStreamingSql")
                .setMaster("local[2]");
        //第一步得到sparkStreaming，我们可以认为DStream就是1s的一个RDD，但是事件上是产生了一个batch的数据
        //一个batch里面有很多RDD
        JavaStreamingContext javaStreamingContext = new JavaStreamingContext(sparkConf, Durations.seconds(1));
        JavaReceiverInputDStream socketTextStream = javaStreamingContext.socketTextStream("master", 9998);

        //得到的点击数据进行map
        JavaPairDStream wordCountDStream = socketTextStream.mapToPair(new PairFunction() {
            //得到的数据是每个用户名
            @Override
            public Tuple2 call(String userName) throws Exception {
                return new Tuple2(userName, 1);
            }
        });

        //第二步开窗并求聚合操作
        JavaPairDStream reduceByKeyAndWindowDStream = wordCountDStream.reduceByKeyAndWindow(new Function2() {
            @Override
            public Integer call(Integer v1, Integer v2) throws Exception {
                return v1 + v2;
            }
        }, Durations.seconds(60), Durations.seconds(10));

        //第三步根据得到的RDD使用SparkSql进行分析
        reduceByKeyAndWindowDStream.foreachRDD(rdd->{
            //根据RDD得到Row
            JavaRDD userClickRowCount = rdd.map(new Function, Row>() {
                @Override
                public Row call(Tuple2 rddItem) throws Exception {
                    return RowFactory.create(
                            rddItem._1,
                            rddItem._2
                    );
                }
            });

            //定义Row的元数据
            List rowMeta = new ArrayList<>();
            rowMeta.add(DataTypes.createStructField("userName",DataTypes.StringType,true));
            rowMeta.add(DataTypes.createStructField("clickNum",DataTypes.IntegerType,true));
            StructType rowMetastructType = DataTypes.createStructType(rowMeta);

            //使得Row和structType建立联系
            SQLContext sqlContext = new SQLContext(javaStreamingContext.sparkContext());
            Dataset userClickDataFrame = sqlContext.createDataFrame(userClickRowCount, rowMetastructType);
            userClickDataFrame.registerTempTable("userClickData");

            //这里开始对于每10秒统计最近60秒的数据
            Dataset res = sqlContext.sql(
                    "select userName,clickNum from " +
                            "(" +
                            "select userName,clickNum,row_number() over (order by clickNum desc) as rank  from " +
                            "userClickData" +
                            ") where rank<=3"
            );

            res.show();
        });

        javaStreamingContext.start();
        javaStreamingContext.awaitTermination();
        javaStreamingContext.stop();
    }
}

输出的结果是

+--------+--------+
|userName|clickNum|
+--------+--------+
|       c|      28|
|       a|      19|
|       f|      12|
+--------+--------+

scala版本

object ScalaSparkStreamSql {
  def main(args: Array[String]): Unit = {
    val conf = new SparkConf()
    conf.setAppName("ScalaSparkStreamSql")
      .setMaster("local[2]")

    val sparkStreaming = new StreamingContext(conf, Seconds(1))
    sparkStreaming.socketTextStream("master", 9998)
      .map((_, 1))
      //每10秒得到最近60秒的数据，60是窗口的大小,10是滑动的长度
      .reduceByKeyAndWindow((num1: Int, num2: Int) => {
        num1 + num2
      }, Seconds(60), Seconds(10))
      .foreachRDD(rdd => {
        //得到Row
        val userClickRow: RDD[Row] = rdd.map(
          mapItem => {
            Row(mapItem._1, mapItem._2)
          }
        )
        //得到数据
        val userClickStructTyoe: StructType = StructType(
          Array(
            StructField("userName", DataTypes.StringType, true),
            StructField("clickNum", DataTypes.IntegerType, true)
          )
        )

        //得到DataFrame
        val sparkSession: SparkSession = SparkSession
          .builder()
          .config(conf)
          .getOrCreate()

        //开始查询数据
        val userClickDataFrame: DataFrame = sparkSession.createDataFrame(userClickRow, userClickStructTyoe)
        userClickDataFrame.createTempView("userClickData")

        sparkSession.sql(
          """
            |select userName,clickNum from
            |(
            |	select userName,clickNum,row_number() over (order by clickNum desc) as rank  from
            |	userClickData
            |) where rank<=3
            |""".stripMargin
        ).show()

        //后面可以更具结果的数据自己处理保存到redis或者mysql
      })


    sparkStreaming.start()
    sparkStreaming.awaitTermination()
    sparkStreaming.stop()
  }
}

输出结果

+--------+--------+
|userName|clickNum|
+--------+--------+
|       a|       9|
|       v|       3|
|       c|       3|
+--------+--------+

缓存与持久化机制

sparkstreaming默认对窗口的操作，还有upstateBykey开启的持久化的操作
与RDD不同的是它默认都是会要序列化的

Sparkstreaming容错机制

分区容错

可靠receiver

SparkStreaming架构原理

sparkStreaming架构原理图解

接收数据的原理

写数据原理

SparkStreaming性能调优

对于receiver模式的处理，可以调高receiver的数量，提高并行度
对于每一批的RDD进行调优，因为RDD的分区和每一个batch里面的block有关，比如batch的间隔是2s,也就是JavaStreamingContext(sparkConf, Durations.seconds(2))，这里就是设置拉去batch的时间，每一批batch里面有若干的block，每一个block产生的时间是200毫秒，每一个block对应RDD的一个分区，这里调优的地方就是如果你的CPU有8核，但是如果你每一批的数据就是5个block的话，那么就是没有充分的利用cpu我们这个时候就可以对于block产生的时间减少
对于Kafka的Direct模式的话，我们只要设置的并行度和分区一样就可以了
使用CMS垃圾回收器，减少gc的时间，提高batch的处理速度

你可能感兴趣的:(spark,spark,scala,大数据)

nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
免费的GPT可在线直接使用（一键收藏） kkai人工智能 gpt
1、LuminAI（https://kk.zlrxjh.top）LuminAI标志着一款融合了星辰大数据模型与文脉深度模型的先进知识增强型语言处理系统，旨在自然语言处理（NLP）的技术开发领域发光发热。此系统展现了卓越的语义把握与内容生成能力，轻松驾驭多样化的自然语言处理任务。VisionAI在NLP界的应用领域广泛，能够胜任从机器翻译、文本概要撰写、情绪分析到问答等众多任务。通过对大量文本数据的
如何利用大数据与AI技术革新相亲交友体验 h17711347205 回归算法安全系统架构交友小程序
在数字化时代，大数据和人工智能（AI）技术正逐渐革新相亲交友体验，为寻找爱情的过程带来前所未有的变革（编辑h17711347205）。通过精准分析和智能匹配，这些技术能够极大地提高相亲交友系统的效率和用户体验。大数据的力量大数据技术能够收集和分析用户的行为模式、偏好和互动数据，为相亲交友系统提供丰富的信息资源。通过分析用户的搜索历史、浏览记录和点击行为，系统能够深入了解用户的兴趣和需求，从而提供更
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
[转载] NoSQL简介 weixin_30325793 大数据数据库运维
摘自“百度百科”。NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。虽然NoSQL流行语
svg图片兼容性和用法优缺点独行侠_ef93
svg图片的使用方法第一次来认认真真的研究了下svg图片，之前只是在网上见过，但都是一晃而过也没当回事，最近网站改版看到同事有用到svg格式的图片，想想自己干了几年的重构也没用过，这些细节的知识是应该好好研究研究了。暂时还没研究得完全透切，先记下目前为止所看到的吧不然又给忘了。svg可缩放矢量图形（ScalableVectorGraphics），顾名思义就是任意改变其大小也不会变形，是基于可扩展标
Kafka详细解析与应用分析芊言芊语 kafka 分布式
Kafka是一个开源的分布式事件流平台（EventStreamingPlatform），由LinkedIn公司最初采用Scala语言开发，并基于ZooKeeper协调管理。如今，Kafka已经被Apache基金会纳入其项目体系，广泛应用于大数据实时处理领域。Kafka凭借其高吞吐量、持久化、分布式和可靠性的特点，成为构建实时流数据管道和流处理应用程序的重要工具。Kafka架构Kafka的架构主要由
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
疫情，疫情东山草
2020年，疫情爆发，至今已近三年，反反复复，此起彼伏。不但没被消灭，还自我发展，从德尔塔到奥密克戎，与时俱进的变异着。去年11月，疫情之下，大数据800米范围内，都成为时空伴随者。“你的码儿有没有变颜色”“你绿码还是黄码”成为那段时间的流行语，当然少不了的还有全员核酸。段子手整出来一首歌：我走过你走过的路,这算不算相逢？我吹过你吹过的风，这算不算相拥？800米内我们不曾擦肩而过，你却要我14天相
在服务器计算节点中使用 jupyter Lab ranshan567 程序人生
JupyterLab是一个基于网页的交互式开发环境,用于科学计算、数据分析和机器学.jupyterlab是jupyternotebook的下一代产品,集成了更多功能,使用起来更方便.在进行数据分析及可视化时，个人电脑不能满足大数据的分析需求，就需要用到高性能计算机集群资源，然而计算机集群的计算节点往往没有联网功能，所以在计算机集群中使用jupyterLab需要进行一些配置。具体的步骤如下：
大数据真实面试题---SQL The博宇大数据面试题——SQL 大数据 mysql sql 数据库 big data
视频号数据分析组外包招聘笔试题时间限时45分钟完成。题目根据3张表表结构，写出具体求解的SQL代码（搞笑品类定义：视频分类或者视频创建者分类为“搞笑”）1、表创建语句：createtablet_user_video_action_d(dsint,user_idstring,video_idstring,action_typeint,`timestamp`bigint)rowformatdelimi
Spark 组件 GraphX、Streaming 叶域大数据 spark spark 大数据分布式
Spark组件GraphX、Streaming一、SparkGraphX1.1GraphX的主要概念1.2GraphX的核心操作1.3示例代码1.4GraphX的应用场景二、SparkStreaming2.1SparkStreaming的主要概念2.2示例代码2.3SparkStreaming的集成2.4SparkStreaming的应用场景SparkGraphX用于处理图和图并行计算。Graph
Flume：大规模日志收集与数据传输的利器傲雪凌霜，松柏长青后端大数据 flume 大数据
Flume：大规模日志收集与数据传输的利器在大数据时代，随着各类应用的不断增长，产生了海量的日志和数据。这些数据不仅对业务的健康监控至关重要，还可以通过深入分析，帮助企业做出更好的决策。那么，如何高效地收集、传输和存储这些海量数据，成为了一项重要的挑战。今天我们将深入探讨ApacheFlume，它是如何帮助我们应对这些挑战的。一、Flume概述ApacheFlume是一个分布式、可靠、可扩展的日志
探索未来，大规模分布式深度强化学习——深入解析IMPALA架构汤萌妮Margaret
探索未来，大规模分布式深度强化学习——深入解析IMPALA架构scalable_agent项目地址:https://gitcode.com/gh_mirrors/sc/scalable_agent在当今的人工智能研究前沿，深度强化学习（DRL）因其在复杂任务中的卓越表现而备受瞩目。本文要介绍的是一个开源于GitHub的重量级项目：“ScalableDistributedDeep-RLwithImp
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
车载以太网之SOME/IP IT_码农车载以太网车载以太网 SOME/IP
整体介绍SOME/IP(全称为：Scalableservice-OrientedMiddlewarEoverIP)，是运行在车载以太网协议栈基础之上的中间件，或者也可以称为应用层软件。发展历程AUTOSAR4.0-完成宝马SOME/IP消息的初步集成；AUTOSAR4.1-支持SOME/IP-SD及其发布/订阅功能；AUTOSAR4.2-添加transformer用于序列化以及其他相关优化；AUT
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
架构评审的自动化与人工智能: 如何提高效率光剑书架上的书架构自动化人工智能运维
1.背景介绍架构评审是软件开发过程中的一个关键环节，它旨在确保软件架构的质量、可维护性和可扩展性。传统的架构评审通常是由人工进行，需要大量的时间和精力。随着大数据技术和人工智能的发展，自动化和人工智能技术已经开始应用于架构评审，从而提高评审的效率和准确性。在本文中，我们将讨论如何通过自动化和人工智能技术来提高架构评审的效率。我们将从以下几个方面进行讨论：背景介绍核心概念与联系核心算法原理和具体操作
【数字化供应链】数字化供应链架构、全景管理、全流程贯通方案数字化建设方案数字化转型数据治理主数据数据仓库供应链数字仓储智慧物流智慧仓储物流园区架构微服务数据挖掘大数据人工智能
原文《数字化供应链架构、全景管理、全流程贯通方案》PPT格式。主要从供应链管理全景、智慧供应链建设总体目标、供应链总体业务流程、供应链总体功能架构、供应链总体技术架构、供应链全流程贯通、供应链全领域管理、供应链数据数据分析、供应链决策中台等进行建设。本文仅对主要内容进行介绍。来源网络公开渠道，旨在交流学习，如有侵权联系速删，更多参考公众号：优享智库基于先进IT技术、大数据能力、物联网应用、区块链平
80 鑫_259b
科普一个谈恋爱的方法。在以前，谈恋爱千难万难，就难在对对方不知底细，不知道对方希望自己是一个怎样的人，要耗费大量的时间去试探、再磨合，往往会因为一些小事一些细节，满盘皆输。在一个信息化的时代，在一个大数据近乎变成了流行语的时代，我们要跟上时代的步伐，通过大数据，去寻找异性最希望自己展现出来的形象是什么，才可以在爱情的道路上少走弯路。那这个大数据怎么操作呢？上街发问卷？问别人的择偶标准？一来会被打死
解锁企业潜能，Vatee万腾平台引领智能新纪元自媒体经济说其他
在数字化转型的浪潮中，企业正站在一个前所未有的十字路口，面对着前所未有的机遇与挑战。解锁企业内在潜能，实现跨越式发展，已成为众多企业的共同追求。而Vatee万腾平台，作为智能科技的先锋，正以其强大的智能赋能能力，引领企业步入一个全新的智能纪元。Vatee万腾平台，是一个集成了人工智能、大数据、云计算等前沿技术的综合性智能服务平台。它不仅仅是一个技术工具，更是企业转型升级的加速器，能够深入企业运营的
释放“AI+”新质生产力，深算院如何“把大数据变小”？ YashanDB YashanDB 国产数据库数据库数据库大数据
近期，南都·湾财社推出《新质·中国造》栏目，深入千行百业，遍访湾区企业，解锁湾区新质生产力，共探高质量发展之道。本期对话深圳计算科学研究院YashanDB首席技术官陈志标，探讨国产数据库如何实现创新突围，抢抓数字经济时代的新机遇。以下是专访内容：如何应对AI时代所面临的算力挑战？南都·湾财社：数据、算力和算法是发展人工智能的三要素，深算院做了怎样的前瞻性布局？陈志标：今年，政府工作报告中首次提及开
数字化智能工厂数字化供应链架构、全景管理、全流程贯通方案数字化建设方案智能制造数字工厂制造业数字化转型工业互联网架构
随着信息技术的飞速发展，数字化转型已成为制造企业提升竞争力的关键途径。数字化智能工厂通过集成先进的物联网(IoT)、大数据、云计算、人工智能(AI)等技术，实现了生产过程的智能化、供应链管理的精准化及决策的科学化。本方案旨在构建一套完善的数字化供应链架构，实现全景管理、全流程贯通、智慧化升级，以数据为驱动，强化技术支撑与安全管理体系，推动企业向智能制造迈进。一、数字化供应链架构1.**集成化平台构
日记——我的歌单静若小猴
又到一年一度大数据汇总的时候了，听歌已经成为很多人生活里的一种乐趣。春夏秋冬，我们都有自己喜欢的歌，歌词歌曲唱出沃尔玛你的心声。还记得大学时候最喜欢听的《春天里》，我有一天单曲回放了30遍，总觉得听着仿佛看到自己声音。还有的歌，初听不知曲中意，再听已经是曲终人，听着歌流泪，听着歌入睡……还记得那些年少的故事吗，总觉得自己才是故事外的人，却不是自己已经入歌。一段时间会喜欢一个人的音乐，一段时间会沉静
Linux dmesg命令：显示开机信息 fafadsj666 linux 数据库数据挖掘机器学习大数据
通过学习《Linux启动管理》一章可以知道，在系统启动过程中，内核还会进行一次系统检测（第一次是BIOS进行加测），但是检测的过程不是没有显示在屏幕上，就是会快速的在屏幕上一闪而过那么，如果开机时来不及查看相关信息，我们是否可以在开机后查看呢？答案是肯定的，使用dmesg命令就可以。无论是系统启动过程中，还是系统运行过程中，只要是内核产生的信息，都会被存储在系统缓冲区中，已经为大家精心准备了大数据
大数据新视界 --大数据大厂之揭秘大数据时代 Excel 魔法：大厂数据分析师进阶秘籍青云交大数据新视界 Excel 数据分析函数公式数据透视表图表功能规划求解数据分析工具库大数据新视界数据库
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
大数据新视界 --大数据大厂之数据挖掘入门：用 R 语言开启数据宝藏的探索之旅青云交大数据新视界数据库大数据数据挖掘 R 语言算法案例未来趋势应用场景学习建议大数据新视界
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
java数字签名三种方式知了ing java jdk
以下3钟数字签名都是基于jdk7的 1，RSA String password="test"; // 1.初始化密钥 KeyPairGenerator keyPairGenerator = KeyPairGenerator.getInstance("RSA"); keyPairGenerator.initialize(51
Hibernate学习笔记 caoyong Hibernate
1>、Hibernate是数据访问层框架，是一个ORM(Object Relation Mapping)框架，作者为:Gavin King 2>、搭建Hibernate的开发环境 a>、添加jar包: aa>、hibernatte开发包中/lib/required/所
设计模式之装饰器模式Decorator（结构型）漂泊一剑客 Decorator
1. 概述若你从事过面向对象开发，实现给一个类或对象增加行为，使用继承机制，这是所有面向对象语言的一个基本特性。如果已经存在的一个类缺少某些方法，或者须要给方法添加更多的功能（魅力），你也许会仅仅继承这个类来产生一个新类—这建立在额外的代码上。
读取磁盘文件txt，并输入String 一炮送你回车库 String
public static void main(String[] args) throws IOException { String fileContent = readFileContent("d:/aaa.txt"); System.out.println(fileContent);
js三级联动下拉框 3213213333332132 三级联动
//三级联动省/直辖市<select id="province"></select> 市/省直辖<select id="city"></select> 县/区 <select id="area"></select>
erlang之parse_transform编译选项的应用 616050468 parse_transform 游戏服务器属性同步 abstract_code
最近使用erlang重构了游戏服务器的所有代码，之前看过C++/lua写的服务器引擎代码，引擎实现了玩家属性自动同步给前端和增量更新玩家数据到数据库的功能，这也是现在很多游戏服务器的优化方向，在引擎层面去解决数据同步和数据持久化，数据发生变化了业务层不需要关心怎么去同步给前端。由于游戏过程中玩家每个业务中玩家数据更改的量其实是很少
JAVA JSON的解析 darkranger java
// { // “Total”：“条数”， // Code: 1, // // “PaymentItems”:[ // { // “PaymentItemID”:”支款单ID”, // “PaymentCode”:”支款单编号”, // “PaymentTime”:”支款日期”, // ”ContractNo”:”合同号”， //
POJ-1273-Drainage Ditches aijuans ACM_POJ
POJ-1273-Drainage Ditches http://poj.org/problem?id=1273 基本的最大流，按LRJ的白书写的 #include<iostream> #include<cstring> #include<queue> using namespace std; #define INF 0x7fffffff int ma
工作流Activiti5表的命名及含义 atongyeye 工作流 Activiti
activiti5 - http://activiti.org/designer/update在线插件安装 activiti5一共23张表 Activiti的表都以ACT_开头。第二部分是表示表的用途的两个字母标识。用途也和服务的API对应。 ACT_RE_*: 'RE'表示repository。这个前缀的表包含了流程定义和流程静态资源（图片，规则，等等）。 A
android的广播机制和广播的简单使用百合不是茶 android 广播机制广播的注册
Android广播机制简介在Android中，有一些操作完成以后，会发送广播，比如说发出一条短信，或打出一个电话，如果某个程序接收了这个广播，就会做相应的处理。这个广播跟我们传统意义中的电台广播有些相似之处。之所以叫做广播，就是因为它只负责“说”而不管你“听不听”，也就是不管你接收方如何处理。另外，广播可以被不只一个应用程序所接收，当然也可能不被任何应
Spring事务传播行为详解 bijian1013 java spring 事务传播行为
在service类前加上@Transactional，声明这个service所有方法需要事务管理。每一个业务方法开始时都会打开一个事务。 Spring默认情况下会对运行期例外(RunTimeException)进行事务回滚。这
eidtplus operate 征客丶 eidtplus
开启列模式: Alt+C 鼠标选择 OR Alt+鼠标左键拖动列模式替换或复制内容(多行): 右键-->格式-->填充所选内容-->选择相应操作 OR Ctrl+Shift+V(复制多行数据,必须行数一致) -------------------------------------------------------
【Kafka一】Kafka入门 bit1129 kafka
这篇文章来自Spark集成Kafka(http://bit1129.iteye.com/blog/2174765)，这里把它单独取出来，作为Kafka的入门吧下载Kafka http://mirror.bit.edu.cn/apache/kafka/0.8.1.1/kafka_2.10-0.8.1.1.tgz 2.10表示Scala的版本，而0.8.1.1表示Kafka
Spring 事务实现机制 BlueSkator spring 代理事务
Spring是以代理的方式实现对事务的管理。我们在Action中所使用的Service对象，其实是代理对象的实例，并不是我们所写的Service对象实例。既然是两个不同的对象，那为什么我们在Action中可以象使用Service对象一样的使用代理对象呢？为了说明问题，假设有个Service类叫AService，它的Spring事务代理类为AProxyService，AService实现了一个接口
bootstrap源码学习与示例：bootstrap-dropdown（转帖） BreakingBad bootstrap dropdown
bootstrap-dropdown组件是个烂东西，我读后的整体感觉。一个下拉开菜单的设计： <ul class="nav pull-right"> <li id="fat-menu" class="dropdown">
读《研磨设计模式》-代码笔记-中介者模式-Mediator bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ /* * 中介者模式（Mediator）：用一个中介对象来封装一系列的对象交互。 * 中介者使各对象不需要显式地相互引用，从而使其耦合松散，而且可以独立地改变它们之间的交互。 * * 在我看来，Mediator模式是把多个对象（
常用代码记录 chenjunt3 UI Excel J#
1、单据设置某行或某字段不能修改 //i是行号,"cash"是字段名称 getBillCardPanelWrapper().getBillCardPanel().getBillModel().setCellEditable(i, "cash", false); //取得单据表体所有项用以上语句做循环就能设置整行了 getBillC
搜索引擎与工作流引擎 comsci 算法工作搜索引擎网络应用
最近在公司做和搜索有关的工作，(只是简单的应用开源工具集成到自己的产品中)工作流系统的进一步设计暂时放在一边了，偶然看到谷歌的研究员吴军写的数学之美系列中的搜索引擎与图论这篇文章中的介绍，我发现这样一个关系(仅仅是猜想) -----搜索引擎和流程引擎的基础--都是图论，至少像在我在JWFD中引擎算法中用到的是自定义的广度优先
oracle Health Monitor daizj oracle Health Monitor
About Health Monitor Beginning with Release 11g, Oracle Database includes a framework called Health Monitor for running diagnostic checks on the database. About Health Monitor Checks Health M
JSON字符串转换为对象 dieslrae java json
作为前言,首先是要吐槽一下公司的脑残编译部署方式,web和core分开部署本来没什么问题,但是这丫居然不把json的包作为基础包而作为web的包,导致了core端不能使用,而且我们的core是可以当web来用的(不要在意这些细节),所以在core中处理json串就是个问题.没办法,跟编译那帮人也扯不清楚,只有自己写json的解析了.
C语言学习八结构体，综合应用，学生管理系统 dcj3sjt126com C语言
实现功能的代码： # include <stdio.h> # include <malloc.h> struct Student { int age; float score; char name[100]; }; int main(void) { int len; struct Student * pArr; int i,
vagrant学习笔记 dcj3sjt126com vagrant
想了解多主机是如何定义和使用的, 所以又学习了一遍vagrant 1. vagrant virtualbox 下载安装 https://www.vagrantup.com/downloads.html https://www.virtualbox.org/wiki/Downloads 查看安装在命令行输入vagrant 2.
14.性能优化-优化-软件配置优化 frank1234 软件配置性能优化
1.Tomcat线程池修改tomcat的server.xml文件： <Connector port="8080" protocol="HTTP/1.1" connectionTimeout="20000" redirectPort="8443" maxThreads="1200" m
一个不错的shell 脚本教程入门级 HarborChung linux shell
一个不错的shell 脚本教程入门级建立一个脚本　　Linux中有好多中不同的shell，但是通常我们使用bash (bourne again shell) 进行shell编程，因为bash是免费的并且很容易使用。所以在本文中笔者所提供的脚本都是使用bash（但是在大多数情况下，这些脚本同样可以在 bash的大姐，bourne shell中运行）。　　如同其他语言一样
Spring4新特性——核心容器的其他改进 jinnianshilongnian spring 动态代理 spring4 依赖注入
Spring4新特性——泛型限定式依赖注入 Spring4新特性——核心容器的其他改进 Spring4新特性——Web开发的增强 Spring4新特性——集成Bean Validation 1.1(JSR-349)到SpringMVC Spring4新特性——Groovy Bean定义DSL Spring4新特性——更好的Java泛型操作API Spring4新
Linux设置tomcat开机启动 liuxingguome tomcat linux 开机自启动
执行命令sudo gedit /etc/init.d/tomcat6 然后把以下英文部分复制过去。（注意第一句#!/bin/sh如果不写，就不是一个shell文件。然后将对应的jdk和tomcat换成你自己的目录就行了。 #!/bin/bash # # /etc/rc.d/init.d/tomcat # init script for tomcat precesses
第13章 Ajax进阶（下） onestopweb Ajax
index.html <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/
Troubleshooting Crystal Reports off BW blueoxygen BO
http://wiki.sdn.sap.com/wiki/display/BOBJ/Troubleshooting+Crystal+Reports+off+BW#TroubleshootingCrystalReportsoffBW-TracingBOE Quite useful, especially this part: SAP BW connectivity For t
Java开发熟手该当心的11个错误 tomcat_oracle java jvm 多线程单元测试
#1、不在属性文件或XML文件中外化配置属性。比如，没有把批处理使用的线程数设置成可在属性文件中配置。你的批处理程序无论在DEV环境中，还是UAT（用户验收测试）环境中，都可以顺畅无阻地运行，但是一旦部署在PROD 上，把它作为多线程程序处理更大的数据集时，就会抛出IOException，原因可能是JDBC驱动版本不同，也可能是#2中讨论的问题。如果线程数目可以在属性文件中配置，那么使它成为
正则表达式大全 yang852220741 html 编程正则表达式
今天向大家分享正则表达式大全，它可以大提高你的工作效率正则表达式也可以被当作是一门语言，当你学习一门新的编程语言的时候，他们是一个小的子语言。初看时觉得它没有任何的意义，但是很多时候，你不得不阅读一些教程，或文章来理解这些简单的描述模式。一、校验数字的表达式数字：^[0-9]*$ n位的数字：^\d{n}$ 至少n位的数字：^\d{n,}$ m-n位的数字：^\d{m,n}$