hanburgud

基于案例一节课贯通Spark Streaming流计算框架的运行源码

案例代码：

OnlineTheTop3ItemForEachCategory2DB.scala

package com.dt.spark.sparkstreaming

import org.apache.spark.SparkConf
import org.apache.spark.sql.Row
import org.apache.spark.sql.hive.HiveContext
import org.apache.spark.sql.types.{IntegerType, StringType, StructField, StructType}
import org.apache.spark.streaming.{Seconds, StreamingContext}

/**
  * 使用Spark Streaming+Spark SQL来在线动态计算电商中不同类别中最热门的商品排名，例如手机这个类别下面最热门的三种手机、电视这个类别
  * 下最热门的三种电视，该实例在实际生产环境下具有非常重大的意义；
  *
  * 新浪微博：http://weibo.com/ilovepains/
  *
  *
  *   实现技术：Spark Streaming+Spark SQL，之所以Spark Streaming能够使用ML、sql、graphx等功能是因为有foreachRDD和Transform
  * 等接口，这些接口中其实是基于RDD进行操作，所以以RDD为基石，就可以直接使用Spark其它所有的功能，就像直接调用API一样简单。
  *  假设说这里的数据的格式：user item category，例如Rocky Samsung Android
  */
object OnlineTheTop3ItemForEachCategory2DB {
  def main(args: Array[String]){
    /**
      * 第1步：创建Spark的配置对象SparkConf，设置Spark程序的运行时的配置信息，
      * 例如说通过setMaster来设置程序要链接的Spark集群的Master的URL,如果设置
      * 为local，则代表Spark程序在本地运行，特别适合于机器配置条件非常差（例如
      * 只有1G的内存）的初学者       *
      */
    val conf = new SparkConf() //创建SparkConf对象
    conf.setAppName("OnlineTheTop3ItemForEachCategory2DB") //设置应用程序的名称，在程序运行的监控界面可以看到名称
//    conf.setMaster("spark://Master:7077") //此时，程序在Spark集群
    conf.setMaster("local[6]")
    //设置batchDuration时间间隔来控制Job生成的频率并且创建Spark Streaming执行的入口
    val ssc = new StreamingContext(conf, Seconds(5))

    ssc.checkpoint("/root/Documents/SparkApps/checkpoint")


    val userClickLogsDStream = ssc.socketTextStream("Master", 9999)

    val formattedUserClickLogsDStream = userClickLogsDStream.map(clickLog =>
        (clickLog.split(" ")(2) + "_" + clickLog.split(" ")(1), 1))

//    val categoryUserClickLogsDStream = formattedUserClickLogsDStream.reduceByKeyAndWindow((v1:Int, v2: Int) => v1 + v2,
//      (v1:Int, v2: Int) => v1 - v2, Seconds(60), Seconds(20))

    val categoryUserClickLogsDStream = formattedUserClickLogsDStream.reduceByKeyAndWindow(_+_,
      _-_, Seconds(60), Seconds(20))

    categoryUserClickLogsDStream.foreachRDD { rdd => {
      if (rdd.isEmpty()) {
        println("No data inputted!!!")
      } else {
        val categoryItemRow = rdd.map(reducedItem => {
          val category = reducedItem._1.split("_")(0)
          val item = reducedItem._1.split("_")(1)
          val click_count = reducedItem._2
          Row(category, item, click_count)
        })

        val structType = StructType(Array(
          StructField("category", StringType, true),
          StructField("item", StringType, true),
          StructField("click_count", IntegerType, true)
        ))

        val hiveContext = new HiveContext(rdd.context)
        val categoryItemDF = hiveContext.createDataFrame(categoryItemRow, structType)

        categoryItemDF.registerTempTable("categoryItemTable")

        val reseltDataFram = hiveContext.sql("SELECT category,item,click_count FROM (SELECT category,item,click_count,row_number()" +
          " OVER (PARTITION BY category ORDER BY click_count DESC) rank FROM categoryItemTable) subquery " +
          " WHERE rank <= 3")
        reseltDataFram.show()

        val resultRowRDD = reseltDataFram.rdd   resultRowRDD.foreachPartition { partitionOfRecords => {

          if (partitionOfRecords.isEmpty){
            println("This RDD is not null but partition is null")
          } else {
            // ConnectionPool is a static, lazily initialized pool of connections
            val connection = ConnectionPool.getConnection()
            partitionOfRecords.foreach(record => {
              val sql = "insert into categorytop3(category,item,client_count) values('" + record.getAs("category") + "','" +
                record.getAs("item") + "'," + record.getAs("click_count") + ")"  val stmt = connection.createStatement();
              stmt.executeUpdate(sql);

            })
            ConnectionPool.returnConnection(connection) // return to the pool for future reuse

          }
        }
        }
      }


    }
    }



    /**
      * 在StreamingContext调用start方法的内部其实是会启动JobScheduler的Start方法，进行消息循环，在JobScheduler
      * 的start内部会构造JobGenerator和ReceiverTacker，并且调用JobGenerator和ReceiverTacker的start方法：
      *   1，JobGenerator启动后会不断的根据batchDuration生成一个个的Job
      *   2，ReceiverTracker启动后首先在Spark Cluster中启动Receiver（其实是在Executor中先启动ReceiverSupervisor），在Receiver收到
      *   数据后会通过ReceiverSupervisor存储到Executor并且把数据的Metadata信息发送给Driver中的ReceiverTracker，在ReceiverTracker
      *   内部会通过ReceivedBlockTracker来管理接受到的元数据信息
      * 每个BatchInterval会产生一个具体的Job，其实这里的Job不是Spark Core中所指的Job，它只是基于DStreamGraph而生成的RDD
      * 的DAG而已，从Java角度讲，相当于Runnable接口实例，此时要想运行Job需要提交给JobScheduler，在JobScheduler中通过线程池的方式找到一个
      * 单独的线程来提交Job到集群运行（其实是在线程中基于RDD的Action触发真正的作业的运行），为什么使用线程池呢？
      *   1，作业不断生成，所以为了提升效率，我们需要线程池；这和在Executor中通过线程池执行Task有异曲同工之妙；
      *   2，有可能设置了Job的FAIR公平调度的方式，这个时候也需要多线程的支持；
      *
      */
    ssc.start()
    ssc.awaitTermination()

  }
}

ConnectionPool.java

package com.dt.spark.sparkstreaming;

import java.sql.Connection;
import java.sql.DriverManager;
import java.util.LinkedList;
public class ConnectionPool {

    static LinkedList<Connection> connectionQueue = null;

    static {
        try {
            Class.forName("com.mysql.jdbc.Driver");
        } catch (ClassNotFoundException e) {
            e.printStackTrace();
        }
    }

    public synchronized static Connection getConnection() {
        try {
            if(connectionQueue == null) {
                connectionQueue = new LinkedList<Connection>();
                for(int i = 0 ; i < 5 ; i++) {
                    Connection conn = DriverManager.getConnection("jdbc:mysql://192.168.110.237:3306/sparkstreaming","root","123456");
                    connectionQueue.push(conn);
                }
            }
        } catch (Exception e) {
            e.printStackTrace();
        }
        return connectionQueue.poll();
    }

    public static void returnConnection(Connection conn) {
        connectionQueue.push(conn);
    }
}

1、打包程序，放到服务器上。

2、需要先执行nc，如果直接执行打包的程序，会报错，会报端口被拒绝的错误，因为9999端口确实未启动。

$ nc -lk 9999

peter samsung androidphone

mike huawei androidphone

jim xiaomi

jaker apple applephone

lili samsung androidphone

zhangsan samsung androidpad

lisi samsung androidpad

peter samsung androidpad

jack apple applephone

3、把打包的代码提交到集群当中。

$ vim OnlineTheTop3ItemForEachCategory2DB.sh

内容如下：

/usr/local/spark-1.6.1-bin-hadoop2.6/bin/spark-submit --class com.dt.spark.sparkstreaming.OnlineTheTop3ItemForEachCategory2DB --jars /home/SparkApps/mysql-connector-java-5.1.26-bin.jar --master spark://Master:7077 /home/SparkApps/OnlineTheTop3ItemForEachCategory2DB.jar

执行shell代码：

$ sh OnlineTheTop3ItemForEachCategory2DB .sh

执行过程

1、进入到App IDapp-20160506093713-0009里。

2、会看到生成了很多个Job。

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第1张图片

3、点击 Job Id 1 Streaming job running receiver 0

start at OnlineTheTop3ItemForEachCategory2DB.scala:118

这是接受数据的Receiver。

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第2张图片

4、进入 Job Id 2 Streaming job from [output operation 0, batch time 09:37:50]

isEmpty at OnlineTheTop3ItemForEachCategory2DB.scala:51

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第3张图片

StreamingContext.scala

 
  class StreamingContext private[streaming] (
     sc_ : SparkContext,
     cp_ : Checkpoint,
     batchDur_ : Duration 
 

) extends Logging {

 
  private[streaming] def createNewSparkContext(conf: SparkConf): SparkContext = {
   new SparkContext(conf)
 } 
 

 
  private[streaming] def createNewSparkContext(
     master: String,
     appName: String,
     sparkHome: String,
     jars: Seq[String],
     environment: Map[String, String]
   ): SparkContext = {
   val conf = SparkContext.updatedConf(
     new SparkConf(), master, appName, sparkHome, jars, environment)
   new SparkContext(conf) 
 

}

 
  def socketTextStream(
     hostname: String,
     port: Int,
     storageLevel: StorageLevel = StorageLevel.MEMORY_AND_DISK_SER_2
   ): ReceiverInputDStream[String] = withNamedScope("socket text stream") {
   socketStream[String](hostname, port, SocketReceiver.bytesToLines, storageLevel) 
 

}

 
  def socketStream[T: ClassTag](
     hostname: String,
     port: Int,
     converter: (InputStream) => Iterator[T],
     storageLevel: StorageLevel
   ): ReceiverInputDStream[T] = {
   new SocketInputDStream[T](this, hostname, port, converter, storageLevel)
 } 
 

 
  /**
  
   * Start the execution of the streams.
  
   *
  
   *  
  @throws  
  IllegalStateException if the StreamingContext is already stopped.
  
   */
  
  def start(): Unit = synchronized { 
  
  state  
  match { 
  
  case  
  INITIALIZED => 
  
  startSite.set(DStream. 
  getCreationSite()) 
  
       StreamingContext. 
  ACTIVATION_LOCK.synchronized { 
  
         StreamingContext. 
  assertNoOtherContextIsActive() 
  
  try { 
  
           validate() 
  
  // Start the streaming scheduler in a new thread, so that thread local properties
  
            // like call sites and job groups can be reset without affecting those of the
  
            // current thread.
  
            ThreadUtils. 
  runInNewThread( 
  "streaming-start") { 
  
             sparkContext.setCallSite( 
  startSite.get) 
  
             sparkContext.clearJobGroup() 
  
             sparkContext.setLocalProperty(SparkContext. 
  SPARK_JOB_INTERRUPT_ON_CANCEL,  
  "false") 
  
  scheduler.start()
           } 
  
  state = StreamingContextState. 
  ACTIVE
  
          }  
  catch { 
  
  case  
  NonFatal( 
  e) => 
  
             logError( 
  "Error starting the context, marking it as stopped",  
  e) 
  
  scheduler.stop( 
  false) 
  
  state = StreamingContextState. 
  STOPPED
  
   throw  
  e
  
          } 
  
         StreamingContext. 
  setActiveContext( 
  this) 
  
       } 
  
  shutdownHookRef = ShutdownHookManager. 
  addShutdownHook( 
  
         StreamingContext. 
  SHUTDOWN_HOOK_PRIORITY)(stopOnShutdown) 
  
  // Registering Streaming Metrics at the start of the StreamingContext
  
  assert( 
  env. 
  metricsSystem !=  
  null) 
  
  env. 
  metricsSystem.registerSource( 
  streamingSource) 
  
  uiTab.foreach(_.attach()) 
  
       logInfo( 
  "StreamingContext started") 
  
  case  
  ACTIVE => 
  
       logWarning( 
  "StreamingContext has already been started") 
  
  case  
  STOPPED => 
  
  throw new IllegalStateException( 
  "StreamingContext has already been stopped") 
  
   } 
  
 }

SocketInputDStream.scala

 
  private[streaming]
 class SocketInputDStream[T: ClassTag](
     ssc_ : StreamingContext,
     host: String,
     port: Int,
     bytesToObjects: InputStream => Iterator[T],
     storageLevel: StorageLevel
   ) extends ReceiverInputDStream[T](ssc_) {
 
   def getReceiver(): Receiver[T] = {
     new SocketReceiver(host, port, bytesToObjects, storageLevel)
   }
 } 
 

/* SocketReceiver里onStart方法里开启了线程，这个线程run的时候执行receive方法，receive方法就会连上Socket，一直循环这个接受数据。*/

 
  class SocketReceiver[T: ClassTag](
     host: String,
     port: Int,
     bytesToObjects: InputStream => Iterator[T],
     storageLevel: StorageLevel
   ) extends Receiver[T](storageLevel) with Logging {
 
   def onStart() {
     // Start the thread that receives data over a connection
      new Thread("Socket Receiver") {
       setDaemon(true)
       override def run() { receive() }
     }.start() 
 

}

 
  
 
    /** Create a socket connection and receive data until receiver is stopped */
    def receive() {
     var socket: Socket = null
     try {
       logInfo("Connecting to " + host + ":" + port)
       socket = new Socket(host, port)
       logInfo("Connected to " + host + ":" + port)
       val iterator = bytesToObjects(socket.getInputStream())
       while(!isStopped && iterator.hasNext) {
         store(iterator.next)
       }
       if (!isStopped()) {
         restart("Socket data stream had no more data")
       } else {
         logInfo("Stopped receiving")
       }
     } catch {
       case e: java.net.ConnectException =>
         restart("Error connecting to " + host + ":" + port, e)
       case NonFatal(e) =>
         logWarning("Error receiving data", e)
         restart("Error receiving data", e)
     } finally {
       if (socket != null) {
         socket.close()
         logInfo("Closed socket to " + host + ":" + port)
       }
     }
   }
 } 
 

ReceiverInputDStream.scala

/* 这是所有输入流的基类，这个类提供了start和stop方法，当 Spark Streaming 系统启动和启动接受数据的时候被回调 */

 
  abstract class ReceiverInputDStream[ 
  T: ClassTag]( 
  ssc_ : StreamingContext) 
  
  extends InputDStream[ 
  T]( 
  ssc_) {

 
  def getReceiver(): Receiver[ 
  T]

 
  def start() {} 
  
  def stop() {}

InputDStream.scala

 
  abstract class InputDStream[ 
  T: ClassTag] ( 
  ssc_ : StreamingContext) 
 

extends DStream[T](ssc_) {

DStream.scala

/* 是RDD的模板 */

 
  abstract class DStream[ 
  T: ClassTag] ( 
  
  @transient  
  private[streaming]  
  var  
  ssc: StreamingContext 
  
   )  
  extends Serializable  
  with Logging {

 
  private[ 
  streaming]  
  var  
  generatedRDDs =  
  new HashMap[Time, RDD[ 
  T]] () 
  
 
 

/**

* 获得Batch Duration中的相应的RDD，从cache或compute-and-cache中读取;

 
   */
  
  private[streaming]  
  final def getOrCompute( 
  time: Time): Option[RDD[ 
  T]] = { 
  
  // If RDD was already generated, then retrieve it from HashMap,
  
    // or else compute the RDD
  
  generatedRDDs.get( 
  time).orElse { 
  
  // Compute the RDD if time is valid (e.g. correct time in a sliding window)
  
      // of RDD generation, else generate nothing.
  
  if (isTimeValid( 
  time)) { 
  
  val  
  rddOption = createRDDWithLocalProperties( 
  time,  
  displayInnerRDDOps =  
  false) { 
  
  // Disable checks for existing output directories in jobs launched by the streaming
  
          // scheduler, since we may need to write output to an existing directory during checkpoint
  
          // recovery; see SPARK-4835 for more details. We need to have this call here because
  
          // compute() might cause Spark jobs to be launched.
  
          PairRDDFunctions. 
  disableOutputSpecValidation.withValue( 
  true) { 
  
           compute( 
  time) 
  
         } 
  
       } 
  
  rddOption.foreach {  
  case  
  newRDD => 
  
  // Register the generated RDD for caching and checkpointing
  
  if ( 
  storageLevel != StorageLevel. 
  NONE) { 
  
  newRDD.persist( 
  storageLevel) 
  
           logDebug( 
  s"Persisting RDD  
  ${ 
  newRDD. 
  id} 
   for time  
  $ 
  time 
   to  
  $ 
  storageLevel 
  ") 
  
         } 
  
  if ( 
  checkpointDuration !=  
  null && ( 
  time -  
  zeroTime).isMultipleOf( 
  checkpointDuration)) { 
  
  newRDD.checkpoint() 
  
           logInfo( 
  s"Marking RDD  
  ${ 
  newRDD. 
  id} 
   for time  
  $ 
  time 
   for checkpointing") 
  
         } 
  
  generatedRDDs.put( 
  time,  
  newRDD) 
  
       } 
  
  rddOption
  
      }  
  else { 
  
       None 
  
     } 
  
   } 
  
 }

DStream的集成结构:

InputDSream的集成结构

ReceiverInputDStream的集成结构

ForEachDStream.scala

 
  package org.apache.spark.streaming.dstream 
  
  import org.apache.spark.rdd.RDD 
  
  import org.apache.spark.streaming.{Duration, Time} 
  
  import org.apache.spark.streaming.scheduler.Job 
  
  import scala.reflect.ClassTag

/**

* 类似于Output DStream

 
   */
  
  private[streaming] 
  
  class ForEachDStream[ 
  T: ClassTag] ( 
  
  parent: DStream[ 
  T], 
  
  foreachFunc: (RDD[ 
  T], Time) => Unit, 
  
  displayInnerRDDOps: Boolean 
  
   )  
  extends DStream[Unit]( 
  parent. 
  ssc) { 
  
  override def dependencies:  
  List[DStream[_]] =  
  List( 
  parent) 
  
  override def slideDuration: Duration =  
  parent.slideDuration 
  
  override def compute( 
  validTime: Time): Option[RDD[Unit]] = None 
  
  override def generateJob( 
  time: Time): Option[Job] = { 
  
  parent.getOrCompute( 
  time)  
  match { 
  
  case  
  Some( 
  rdd) => 
  
  val  
  jobFunc = () => createRDDWithLocalProperties( 
  time,  
  displayInnerRDDOps) { 
  
  foreachFunc( 
  rdd,  
  time) 
  
         } 
  
  Some( 
  new Job( 
  time,  
  jobFunc)) 
  
  case None => None 
  
     } 
  
   } 
  
 }

 
  /**
  
   * Start the execution of the streams.
  
   *
  
   *  
  @throws  
  IllegalStateException  
  if the StreamingContext is already stopped.
  
   */
  
  def  
  start(): Unit = synchronized { 
  
  state  
  match { 
  
  case  
  INITIALIZED => 
  
  startSite.set( 
  DStream. 
  getCreationSite()) 
  
  StreamingContext. 
  ACTIVATION_LOCK.synchronized { 
  
  StreamingContext. 
  assertNoOtherContextIsActive() 
  
  try { 
  
           validate() 
  
  // Start the streaming scheduler in a new thread, so that thread local properties
  
            // like call sites and job groups can be reset without affecting those of the
  
            // current thread.
  
   ThreadUtils. 
  runInNewThread( 
  "streaming-start") { 
  
             sparkContext.setCallSite( 
  startSite.get) 
  
             sparkContext.clearJobGroup() 
  
             sparkContext.setLocalProperty( 
  SparkContext. 
  SPARK_JOB_INTERRUPT_ON_CANCEL,  
  "false") 
  
  scheduler.start()
           } 
  
  state =  
  StreamingContextState. 
  ACTIVE
  
          }  
  catch { 
  
  case  
  NonFatal(e) => 
  
             logError( 
  "Error starting the context, marking it as stopped", e) 
  
  scheduler.stop( 
  false) 
  
  state =  
  StreamingContextState. 
  STOPPED
  
   throw e 
  
         } 
  
  StreamingContext. 
  setActiveContext( 
  this) 
  
       } 
  
  shutdownHookRef =  
  ShutdownHookManager. 
  addShutdownHook( 
  
  StreamingContext. 
  SHUTDOWN_HOOK_PRIORITY)(stopOnShutdown) 
  
  // Registering Streaming Metrics at the start of the StreamingContext
  
   assert( 
  env.metricsSystem !=  
  null) 
  
  env.metricsSystem.registerSource( 
  streamingSource) 
  
  uiTab.foreach(_.attach()) 
  
       logInfo( 
  "StreamingContext started") 
  
  case  
  ACTIVE => 
  
       logWarning( 
  "StreamingContext has already been started") 
  
  case  
  STOPPED => 
  
  throw new IllegalStateException( 
  "StreamingContext has already been stopped") 
  
   } 
  
 }

进入到scheduler.start()方法：

JobScheduler.scala中的start方法：

 
  def  
  start(): Unit = synchronized { 
  
  if ( 
  eventLoop !=  
  null)  
  return  
  // scheduler has already been started
  
    logDebug( 
  "Starting JobScheduler") 
  
    eventLoop = new EventLoop[JobSchedulerEvent]("JobScheduler") {
     override protected def onReceive(event: JobSchedulerEvent): Unit = processEvent(event)
 
     override protected def onError(e: Throwable): Unit = reportError("Error in job scheduler", e)
   }
   eventLoop.start()
  
  // attach rate controllers of input streams to receive batch completion updates
  
   for { 
  
     inputDStream <- ssc. 
  graph.getInputStreams 
  
     rateController <- inputDStream. 
  rateController
  
    } ssc.addStreamingListener(rateController) 
  
  listenerBus.start(ssc.sparkContext) 
  
  receiverTracker =  
  new ReceiverTracker(ssc) 
  
  inputInfoTracker =  
  new InputInfoTracker(ssc) 
  
    receiverTracker.start()
   jobGenerator.start()
   logInfo( 
  "Started JobScheduler") 
  
 }

EventLoop.scala的onReceive方法：

 
  package org.apache.spark.util 
  
  import java.util.concurrent.atomic.AtomicBoolean 
  
  import java.util.concurrent.{BlockingQueue, LinkedBlockingDeque} 
  
  import scala.util.control.NonFatal 
  
  import org.apache.spark.Logging 
  
  /**
  
   * An event loop to receive events from the caller and process all events in the event thread. It
  
   * will start an exclusive event thread to process all events.
  
   *
  
   * Note: The event queue will grow indefinitely. So subclasses should make sure  
  ` 
  onReceive 
  `  
  can
  
   * handle events in time to avoid the potential OOM.
  
   */
  
  private[spark]  
  abstract class EventLoop[ 
  E]( 
  name:  
  String)  
  extends Logging { 
  
  private val  
  eventQueue: BlockingQueue[ 
  E] =  
  new LinkedBlockingDeque[ 
  E]() 
  
  private val  
  stopped =  
  new AtomicBoolean( 
  false) 
  
  private val  
  eventThread =  
  new Thread( 
  name) { 
  
     setDaemon( 
  true) 
  
  override def run(): Unit = { 
  
  try {

while (!stopped.get) {

/* 先进进出的方式 */

             
  val  
  event =  
  eventQueue.take() 
  
  try { 
  
  onReceive( 
  event) 
  
           }  
  catch { 
  
  case  
  NonFatal( 
  e) => { 
  
  try { 
  
                 onError( 
  e) 
  
               }  
  catch { 
  
  case  
  NonFatal( 
  e) => logError( 
  "Unexpected error in " +  
  name,  
  e) 
  
               } 
  
             } 
  
           } 
  
         } 
  
       }  
  catch { 
  
  case  
  ie:  
  InterruptedException =>  
  // exit even if eventQueue is not empty
  
  case  
  NonFatal( 
  e) => logError( 
  "Unexpected error in " +  
  name,  
  e) 
  
       } 
  
     } 
  
   } 
  
  def start(): Unit = { 
  
  if ( 
  stopped.get) { 
  
  throw new IllegalStateException( 
  name +  
  " has already been stopped") 
  
     } 
  
  // Call onStart before starting the event thread to make sure it happens before onReceive
  
      onStart() 
  
  eventThread.start() 
  
   } 
  
  def stop(): Unit = { 
  
  if ( 
  stopped.compareAndSet( 
  false,  
  true)) { 
  
  eventThread.interrupt() 
  
  var  
  onStopCalled =  
  false
  
        try { 
  
  eventThread.join() 
  
  // Call onStop after the event thread exits to make sure onReceive happens before onStop
  
  onStopCalled =  
  true
  
          onStop() 
  
       }  
  catch { 
  
  case  
  ie:  
  InterruptedException => 
  
           Thread. 
  currentThread().interrupt() 
  
  if (! 
  onStopCalled) { 
  
  // ie is thrown from `eventThread.join()`. Otherwise, we should not call `onStop` since
  
              // it's already called.
  
              onStop() 
  
           } 
  
       } 
  
     }  
  else { 
  
  // Keep quiet to allow calling `stop` multiple times.
  
      } 
  
   } 
  
  /**
  
     * Put the event into the event queue. The event thread will process it later.
  
     */
  
  def post( 
  event:  
  E): Unit = { 
  
  eventQueue.put( 
  event) 
  
   } 
  
  /**
  
     * Return if the event thread has already been started but not yet stopped.
  
     */
  
  def isActive: Boolean =  
  eventThread.isAlive 
  
  /**
  
     * Invoked when  
  ` 
  start() 
  `  
  is called but before the event thread starts.
  
     */
  
  protected def onStart(): Unit = {} 
  
  /**
  
     * Invoked when  
  ` 
  stop() 
  `  
  is called and the event thread exits.
  
     */
  
  protected def onStop(): Unit = {} 
  
  /**
  
     * Invoked in the event thread when polling events from the event queue.
  
     *
  
     * Note: Should avoid calling blocking actions in  
  ` 
  onReceive 
  ` 
  , or the event thread will be blocked
  
     * and cannot process events in time. If you want to call some blocking actions, run them in
  
     * another thread.
  
     */
  
  protected def onReceive( 
  event:  
  E): Unit 
  
  /**
  
     * Invoked if  
  ` 
  onReceive 
  `  
  throws any non fatal error. Any non fatal error thrown from  
  ` 
  onError 
  ` 
  
  * will be ignored.
  
     */
  
  protected def onError( 
  e:  
  Throwable): Unit 
  
 }

StreamingContext.scala里JobScheduler。

JobScheduler.scala

 
  class JobScheduler( 
  val  
  ssc: StreamingContext)  
  extends Logging { 
 

 
  def start(): Unit = synchronized { 
  
  if ( 
  eventLoop !=  
  null)  
  return  
  // scheduler has already been started
  
    logDebug( 
  "Starting JobScheduler") 
  
  eventLoop =  
  new EventLoop[JobSchedulerEvent]( 
  "JobScheduler") { 
  
  override protected def onReceive( 
  event: JobSchedulerEvent): Unit = processEvent( 
  event) 
  
  override protected def onError( 
  e:  
  Throwable): Unit = reportError( 
  "Error in job scheduler",  
  e) 
  
   } 
  
  eventLoop.start() 
  
  // attach rate controllers of input streams to receive batch completion updates
  
  for { 
  
  inputDStream <-  
  ssc. 
  graph.getInputStreams 
  
  rateController <-  
  inputDStream. 
  rateController
  
    }  
  ssc.addStreamingListener( 
  rateController)

listenerBus.start(ssc.sparkContext) // listenerBus是StreamingL istenerBus

     
  receiverTracker =  
  new ReceiverTracker( 
  ssc) 
  
  inputInfoTracker =  
  new InputInfoTracker( 
  ssc) 
  
  receiverTracker.start() 
  
  jobGenerator.start() 
  
   logInfo( 
  "Started JobScheduler") 
  
 }

processEvent(event) 方法：

 
  private def processEvent( 
  event: JobSchedulerEvent) { 
  
   
  try { 
  
     
  event  
  match { 
  
       
  case  
  JobStarted( 
  job,  
  startTime) => handleJobStart( 
  job,  
  startTime) 
  
       
  case  
  JobCompleted( 
  job,  
  completedTime) => handleJobCompletion( 
  job,  
  completedTime) 
  
       
  case  
  ErrorReported( 
  m,  
  e) => handleError( 
  m,  
  e) 
  
     } 
  
   }  
  catch { 
  
     
  case  
  e:  
  Throwable => 
  
       reportError( 
  "Error in job scheduler",  
  e) 
  
   } 
  
 } 
  
 
 

ReceiverTracker.scala的start方法：

 
  /** Start the endpoint and receiver execution thread. */
  
  def start(): Unit = synchronized { 
  
  if (isTrackerStarted) { 
  
  throw new SparkException( 
  "ReceiverTracker already started") 
  
   } 
  
  if (! 
  receiverInputStreams.isEmpty) { 
  
  endpoint =  
  ssc. 
  env. 
  rpcEnv.setupEndpoint( 
  
  "ReceiverTracker",  
  new  
  ReceiverTrackerEndpoint( 
  ssc. 
  env. 
  rpcEnv)) 
  
  if (! 
  skipReceiverLaunch) launchReceivers() 
  
     logInfo( 
  "ReceiverTracker started") 
  
  trackerState =  
  Started
  
    } 
  
 }

private class ReceiverTrackerEndpoint(override val rpcEnv: RpcEnv) extends ThreadSafeRpcEndpoint

 
    override def receive: PartialFunction[Any, Unit] = { 
  
  // Local messages
  
  case  
  StartAllReceivers( 
  receivers) => 
  
  val  
  scheduledLocations =  
  schedulingPolicy.scheduleReceivers( 
  receivers, getExecutors) 
  
  for ( 
  receiver <-  
  receivers) { 
  
  val  
  executors =  
  scheduledLocations( 
  receiver.streamId) 
  
         updateReceiverScheduledExecutors( 
  receiver.streamId,  
  executors) 
  
  receiverPreferredLocations( 
  receiver.streamId) =  
  receiver.preferredLocation 
  
         startReceiver( 
  receiver,  
  executors) 
  
       } 
  
  case  
  RestartReceiver( 
  receiver) => 
  
  // Old scheduled executors minus the ones that are not active any more
  
  val  
  oldScheduledExecutors = getStoredScheduledExecutors( 
  receiver.streamId) 
  
  val  
  scheduledLocations =  
  if ( 
  oldScheduledExecutors.nonEmpty) { 
  
  // Try global scheduling again
  
  oldScheduledExecutors
  
          }  
  else { 
  
  val  
  oldReceiverInfo =  
  receiverTrackingInfos( 
  receiver.streamId) 
  
  // Clear "scheduledLocations" to indicate we are going to do local scheduling
  
  val  
  newReceiverInfo =  
  oldReceiverInfo.copy( 
  
  state = ReceiverState. 
  INACTIVE,  
  scheduledLocations = None) 
  
  receiverTrackingInfos( 
  receiver.streamId) =  
  newReceiverInfo
  
  schedulingPolicy.rescheduleReceiver( 
  
  receiver.streamId, 
  
  receiver.preferredLocation, 
  
  receiverTrackingInfos, 
  
             getExecutors) 
  
         } 
  
  // Assume there is one receiver restarting at one time, so we don't need to update
  
        // receiverTrackingInfos
  
   startReceiver( 
  receiver,  
  scheduledLocations) 
  
  case  
  c: CleanupOldBlocks => 
  
  receiverTrackingInfos.values.flatMap(_. 
  endpoint).foreach(_.send( 
  c)) 
  
  case  
  UpdateReceiverRateLimit( 
  streamUID,  
  newRate) => 
  
  for ( 
  info <-  
  receiverTrackingInfos.get( 
  streamUID);  
  eP <-  
  info. 
  endpoint) { 
  
  eP.send( 
  UpdateRateLimit( 
  newRate)) 
  
       } 
  
  // Remote messages
  
  case  
  ReportError( 
  streamId,  
  message,  
  error) => 
  
       reportError( 
  streamId,  
  message,  
  error) 
  
   }

 
  /**
  
   * Start a receiver along with its scheduled executors
  
   */
  
  private def  
  startReceiver( 
  
  receiver: Receiver[_], 
  
  scheduledLocations:  
  Seq[TaskLocation]): Unit = { 
  
  def shouldStartReceiver: Boolean = { 
  
  // It's okay to start when trackerState is Initialized or Started
  
      !(isTrackerStopping || isTrackerStopped) 
  
   } 
  
  val  
  receiverId =  
  receiver.streamId 
  
  if (!shouldStartReceiver) { 
  
     onReceiverJobFinish( 
  receiverId) 
  
  return
  
    } 
  
  val  
  checkpointDirOption =  
  Option( 
  ssc. 
  checkpointDir) 
  
  val  
  serializableHadoopConf = 
  
  new SerializableConfiguration( 
  ssc.sparkContext.hadoopConfiguration) 
  
  // Function to start the receiver on the worker node
  
  val  
  startReceiverFunc:  
  Iterator[Receiver[_]] => Unit = 
  
     (iterator:  
  Iterator[Receiver[_]]) => { 
  
  if (!iterator.hasNext) { 
  
  throw new SparkException( 
  
  "Could not start receiver as object not found.") 
  
       } 
  
  if (TaskContext. 
  get().attemptNumber() ==  
  0) { 
  
  val  
  receiver = iterator.next() 
  
  assert(iterator.hasNext ==  
  false) 
  
  val  
  supervisor =  
  new ReceiverSupervisorImpl( 
  
  receiver, SparkEnv. 
  get,  
  serializableHadoopConf. 
  value,  
  checkpointDirOption) 
  
  supervisor.start()
         
  supervisor.awaitTermination() 
  
       }  
  else { 
  
  // It's restarted by TaskScheduler, but we want to reschedule it again. So exit it.
  
        } 
  
     } 
  
  // Create the RDD using the scheduledLocations to run the receiver in a Spark job
  
  val  
  receiverRDD: RDD[Receiver[_]] = 
  
  if ( 
  scheduledLocations.isEmpty) { 
  
  ssc. 
  sc.makeRDD( 
  Seq( 
  receiver),  
  1) 
  
     }  
  else { 
  
  val  
  preferredLocations =  
  scheduledLocations.map(_.toString).distinct 
  
  ssc. 
  sc.makeRDD( 
  Seq( 
  receiver ->  
  preferredLocations)) 
  
     } 
  
  receiverRDD.setName( 
  s"Receiver  
  $ 
  receiverId 
  ") 
  
  ssc.sparkContext.setJobDescription( 
  s"Streaming job running receiver  
  $ 
  receiverId 
  ") 
  
  ssc.sparkContext.setCallSite( 
  Option( 
  ssc.getStartSite()).getOrElse(Utils. 
  getCallSite())) 
  
  val  
  future =  
  ssc.sparkContext.submitJob[Receiver[_], Unit, Unit]( 
  
  receiverRDD,  
  startReceiverFunc,  
  Seq( 
  0), (_, _) => Unit, ()) 
  
  // We will keep restarting the receiver job until ReceiverTracker is stopped
  
  future.onComplete { 
  
  case  
  Success(_) => 
  
  if (!shouldStartReceiver) { 
  
         onReceiverJobFinish( 
  receiverId) 
  
       }  
  else { 
  
         logInfo( 
  s"Restarting Receiver  
  $ 
  receiverId 
  ") 
  
         self.send( 
  RestartReceiver( 
  receiver)) 
  
       } 
  
  case  
  Failure( 
  e) => 
  
  if (!shouldStartReceiver) { 
  
         onReceiverJobFinish( 
  receiverId) 
  
       }  
  else { 
  
         logError( 
  "Receiver has been stopped. Try to restart it.",  
  e) 
  
         logInfo( 
  s"Restarting Receiver  
  $ 
  receiverId 
  ") 
  
         self.send( 
  RestartReceiver( 
  receiver)) 
  
       } 
  
   }( 
  submitJobThreadPool) 
  
   logInfo( 
  s"Receiver  
  ${ 
  receiver.streamId} 
   started") 
  
 }

 
  supervisor.start() 
 

val supervisor = new ReceiverSupervisorImpl

ReceiverSupervisor.scala

 
   /** Start the supervisor */
  
   def start() { 
   
   onStart() 
   
   startReceiver() 
   
 }

 
   /** Start receiver */
  
   def startReceiver(): Unit = synchronized { 
   
   try { 
   
   if ( 
   onReceiverStart()) { 
   
       logInfo( 
   "Starting receiver") 
   
   receiverState =  
   Started
  
    receiver.onStart() 
   
       logInfo( 
   "Called receiver onStart") 
   
     }  
   else { 
   
   // The driver refused us
  
         stop( 
   "Registered unsuccessfully because Driver refused to start receiver " +  
   streamId, None) 
   
     } 
   
   }  
   catch { 
   
   case  
   NonFatal( 
   t) => 
   
       stop( 
   "Error starting receiver " +  
   streamId,  
   Some( 
   t)) 
   
   } 
   
 }

ReceiverSupervisorImpl.scala

 
  override protected def onStart() { 
  
  registeredBlockGenerators.foreach { _.start() } 
  
 }

 
  override protected def  
  onReceiverStart(): Boolean = { 
  
  val  
  msg =  
  RegisterReceiver( 
  
  streamId,  
  receiver.getClass.getSimpleName,  
  host,  
  executorId,  
  endpoint) 
  
  trackerEndpoint.askWithRetry[Boolean]( 
  msg) 
  
 }

ReceiverTracker.scala

 
  /**
  
   * Get the receivers from the ReceiverInputDStreams, distributes them to the
  
   * worker nodes as a parallel collection, and runs them.
  
   */
  
  private def  
  launchReceivers(): Unit = { 
  
  val  
  receivers =  
  receiverInputStreams.map(nis => { 
  
  val  
  rcvr = nis.getReceiver() 
  
  rcvr.setReceiverId(nis. 
  id) 
  
  rcvr
  
    }) 
  
  runDummySparkJob() 
  
   logInfo( 
  "Starting " +  
  receivers.length +  
  " receivers") 
  
  endpoint.send( 
  StartAllReceivers( 
  receivers))

}

 
  /**
  
   * Run the dummy Spark job to ensure that all slaves have registered. This avoids all the
  
   * receivers to be scheduled on the same node.
  
   *
  
   *  
  TODO Should poll the executor number and wait for executors according to
  
  * "spark.scheduler.minRegisteredResourcesRatio" and
  
   * "spark.scheduler.maxRegisteredResourcesWaitingTime" rather than running a dummy job.
  
   */
  
  private def  
  runDummySparkJob(): Unit = { 
  
  if (! 
  ssc.sparkContext.isLocal) { 
  
  ssc.sparkContext.makeRDD( 
  1 to  
  50,  
  50).map(x => (x,  
  1)).reduceByKey(_ + _,  
  20).collect() 
  
   } 
  
  assert(getExecutors.nonEmpty) 
  
 }

 
  private val  
  receivedBlockTracker =  
  new  
  ReceivedBlockTracker( 
  
   ssc.sparkContext.conf, 
  
   ssc.sparkContext.hadoopConfiguration, 
  
  receiverInputStreamIds, 
  
   ssc. 
  scheduler. 
  clock, 
  
   ssc. 
  isCheckpointPresent, 
  
  Option(ssc. 
  checkpointDir)

)

 
  /** Start the endpoint and receiver execution thread. */
  
  def start(): Unit = synchronized { 
  
  if (isTrackerStarted) { 
  
  throw new SparkException( 
  "ReceiverTracker already started") 
  
   } 
  
  if (! 
  receiverInputStreams.isEmpty) { 
  
  endpoint =  
  ssc. 
  env. 
  rpcEnv.setupEndpoint( 
  
  "ReceiverTracker",  
  new ReceiverTrackerEndpoint( 
  ssc. 
  env. 
  rpcEnv)) 
  
  if (! 
  skipReceiverLaunch) launchReceivers() 
  
     logInfo( 
  "ReceiverTracker started") 
  
  trackerState =  
  Started
  
    } 
  
 }

 
  override def receive: PartialFunction[Any, Unit] = { 
 

ReceivedBlockTracker.scala

/**

* 当你接受到数据，ReceivedBlockTracker都会有你的元数据信息，Driver调度的时候把哪些数据分配给我们具体的Job的时候，

* Driver也会找ReceivedBlockTracker来获得这个batch duration的数据。

 
  private[streaming]  
  class  
  ReceivedBlockTracker( 
  
     conf:  
  SparkConf, 
  
     hadoopConf:  
  Configuration, 
  
     streamIds: Seq[Int], 
  
     clock: Clock, 
  
     recoverFromWriteAheadLog: Boolean, 
  
     checkpointDirOption: Option[String]) 
  
  extends Logging {

JobGenerator.scala

 
  class  
  JobGenerator(jobScheduler:  
  JobScheduler)  
  extends Logging { 
 

 
  private val  
  timer =  
  new  
  RecurringTimer( 
  clock,  
  ssc. 
  graph. 
  batchDuration.milliseconds, 
 

longTime => eventLoop.post(GenerateJobs(new Time(longTime))), "JobGenerator")

代码流程图：

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第4张图片

DStream的集成结构:

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第5张图片

InputDSream的集成结构

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第6张图片

ReceiverInputDStream的集成结构

基于案例一节课贯通Spark Streaming流计算框架的运行源码_第7张图片

备注：技术来源：

大数据Spark高手：王家林

QQ：1740415547

你可能感兴趣的:(spark,spark,大数据,Streaming,Streaming)

nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
免费的GPT可在线直接使用（一键收藏） kkai人工智能 gpt
1、LuminAI（https://kk.zlrxjh.top）LuminAI标志着一款融合了星辰大数据模型与文脉深度模型的先进知识增强型语言处理系统，旨在自然语言处理（NLP）的技术开发领域发光发热。此系统展现了卓越的语义把握与内容生成能力，轻松驾驭多样化的自然语言处理任务。VisionAI在NLP界的应用领域广泛，能够胜任从机器翻译、文本概要撰写、情绪分析到问答等众多任务。通过对大量文本数据的
如何利用大数据与AI技术革新相亲交友体验 h17711347205 回归算法安全系统架构交友小程序
在数字化时代，大数据和人工智能（AI）技术正逐渐革新相亲交友体验，为寻找爱情的过程带来前所未有的变革（编辑h17711347205）。通过精准分析和智能匹配，这些技术能够极大地提高相亲交友系统的效率和用户体验。大数据的力量大数据技术能够收集和分析用户的行为模式、偏好和互动数据，为相亲交友系统提供丰富的信息资源。通过分析用户的搜索历史、浏览记录和点击行为，系统能够深入了解用户的兴趣和需求，从而提供更
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
[转载] NoSQL简介 weixin_30325793 大数据数据库运维
摘自“百度百科”。NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。虽然NoSQL流行语
Kafka详细解析与应用分析芊言芊语 kafka 分布式
Kafka是一个开源的分布式事件流平台（EventStreamingPlatform），由LinkedIn公司最初采用Scala语言开发，并基于ZooKeeper协调管理。如今，Kafka已经被Apache基金会纳入其项目体系，广泛应用于大数据实时处理领域。Kafka凭借其高吞吐量、持久化、分布式和可靠性的特点，成为构建实时流数据管道和流处理应用程序的重要工具。Kafka架构Kafka的架构主要由
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
疫情，疫情东山草
2020年，疫情爆发，至今已近三年，反反复复，此起彼伏。不但没被消灭，还自我发展，从德尔塔到奥密克戎，与时俱进的变异着。去年11月，疫情之下，大数据800米范围内，都成为时空伴随者。“你的码儿有没有变颜色”“你绿码还是黄码”成为那段时间的流行语，当然少不了的还有全员核酸。段子手整出来一首歌：我走过你走过的路,这算不算相逢？我吹过你吹过的风，这算不算相拥？800米内我们不曾擦肩而过，你却要我14天相
在服务器计算节点中使用 jupyter Lab ranshan567 程序人生
JupyterLab是一个基于网页的交互式开发环境,用于科学计算、数据分析和机器学.jupyterlab是jupyternotebook的下一代产品,集成了更多功能,使用起来更方便.在进行数据分析及可视化时，个人电脑不能满足大数据的分析需求，就需要用到高性能计算机集群资源，然而计算机集群的计算节点往往没有联网功能，所以在计算机集群中使用jupyterLab需要进行一些配置。具体的步骤如下：
大数据真实面试题---SQL The博宇大数据面试题——SQL 大数据 mysql sql 数据库 big data
视频号数据分析组外包招聘笔试题时间限时45分钟完成。题目根据3张表表结构，写出具体求解的SQL代码（搞笑品类定义：视频分类或者视频创建者分类为“搞笑”）1、表创建语句：createtablet_user_video_action_d(dsint,user_idstring,video_idstring,action_typeint,`timestamp`bigint)rowformatdelimi
Spark 组件 GraphX、Streaming 叶域大数据 spark spark 大数据分布式
Spark组件GraphX、Streaming一、SparkGraphX1.1GraphX的主要概念1.2GraphX的核心操作1.3示例代码1.4GraphX的应用场景二、SparkStreaming2.1SparkStreaming的主要概念2.2示例代码2.3SparkStreaming的集成2.4SparkStreaming的应用场景SparkGraphX用于处理图和图并行计算。Graph
Flume：大规模日志收集与数据传输的利器傲雪凌霜，松柏长青后端大数据 flume 大数据
Flume：大规模日志收集与数据传输的利器在大数据时代，随着各类应用的不断增长，产生了海量的日志和数据。这些数据不仅对业务的健康监控至关重要，还可以通过深入分析，帮助企业做出更好的决策。那么，如何高效地收集、传输和存储这些海量数据，成为了一项重要的挑战。今天我们将深入探讨ApacheFlume，它是如何帮助我们应对这些挑战的。一、Flume概述ApacheFlume是一个分布式、可靠、可扩展的日志
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
架构评审的自动化与人工智能: 如何提高效率光剑书架上的书架构自动化人工智能运维
1.背景介绍架构评审是软件开发过程中的一个关键环节，它旨在确保软件架构的质量、可维护性和可扩展性。传统的架构评审通常是由人工进行，需要大量的时间和精力。随着大数据技术和人工智能的发展，自动化和人工智能技术已经开始应用于架构评审，从而提高评审的效率和准确性。在本文中，我们将讨论如何通过自动化和人工智能技术来提高架构评审的效率。我们将从以下几个方面进行讨论：背景介绍核心概念与联系核心算法原理和具体操作
【数字化供应链】数字化供应链架构、全景管理、全流程贯通方案数字化建设方案数字化转型数据治理主数据数据仓库供应链数字仓储智慧物流智慧仓储物流园区架构微服务数据挖掘大数据人工智能
原文《数字化供应链架构、全景管理、全流程贯通方案》PPT格式。主要从供应链管理全景、智慧供应链建设总体目标、供应链总体业务流程、供应链总体功能架构、供应链总体技术架构、供应链全流程贯通、供应链全领域管理、供应链数据数据分析、供应链决策中台等进行建设。本文仅对主要内容进行介绍。来源网络公开渠道，旨在交流学习，如有侵权联系速删，更多参考公众号：优享智库基于先进IT技术、大数据能力、物联网应用、区块链平
80 鑫_259b
科普一个谈恋爱的方法。在以前，谈恋爱千难万难，就难在对对方不知底细，不知道对方希望自己是一个怎样的人，要耗费大量的时间去试探、再磨合，往往会因为一些小事一些细节，满盘皆输。在一个信息化的时代，在一个大数据近乎变成了流行语的时代，我们要跟上时代的步伐，通过大数据，去寻找异性最希望自己展现出来的形象是什么，才可以在爱情的道路上少走弯路。那这个大数据怎么操作呢？上街发问卷？问别人的择偶标准？一来会被打死
解锁企业潜能，Vatee万腾平台引领智能新纪元自媒体经济说其他
在数字化转型的浪潮中，企业正站在一个前所未有的十字路口，面对着前所未有的机遇与挑战。解锁企业内在潜能，实现跨越式发展，已成为众多企业的共同追求。而Vatee万腾平台，作为智能科技的先锋，正以其强大的智能赋能能力，引领企业步入一个全新的智能纪元。Vatee万腾平台，是一个集成了人工智能、大数据、云计算等前沿技术的综合性智能服务平台。它不仅仅是一个技术工具，更是企业转型升级的加速器，能够深入企业运营的
释放“AI+”新质生产力，深算院如何“把大数据变小”？ YashanDB YashanDB 国产数据库数据库数据库大数据
近期，南都·湾财社推出《新质·中国造》栏目，深入千行百业，遍访湾区企业，解锁湾区新质生产力，共探高质量发展之道。本期对话深圳计算科学研究院YashanDB首席技术官陈志标，探讨国产数据库如何实现创新突围，抢抓数字经济时代的新机遇。以下是专访内容：如何应对AI时代所面临的算力挑战？南都·湾财社：数据、算力和算法是发展人工智能的三要素，深算院做了怎样的前瞻性布局？陈志标：今年，政府工作报告中首次提及开
数字化智能工厂数字化供应链架构、全景管理、全流程贯通方案数字化建设方案智能制造数字工厂制造业数字化转型工业互联网架构
随着信息技术的飞速发展，数字化转型已成为制造企业提升竞争力的关键途径。数字化智能工厂通过集成先进的物联网(IoT)、大数据、云计算、人工智能(AI)等技术，实现了生产过程的智能化、供应链管理的精准化及决策的科学化。本方案旨在构建一套完善的数字化供应链架构，实现全景管理、全流程贯通、智慧化升级，以数据为驱动，强化技术支撑与安全管理体系，推动企业向智能制造迈进。一、数字化供应链架构1.**集成化平台构
日记——我的歌单静若小猴
又到一年一度大数据汇总的时候了，听歌已经成为很多人生活里的一种乐趣。春夏秋冬，我们都有自己喜欢的歌，歌词歌曲唱出沃尔玛你的心声。还记得大学时候最喜欢听的《春天里》，我有一天单曲回放了30遍，总觉得听着仿佛看到自己声音。还有的歌，初听不知曲中意，再听已经是曲终人，听着歌流泪，听着歌入睡……还记得那些年少的故事吗，总觉得自己才是故事外的人，却不是自己已经入歌。一段时间会喜欢一个人的音乐，一段时间会沉静
Linux dmesg命令：显示开机信息 fafadsj666 linux 数据库数据挖掘机器学习大数据
通过学习《Linux启动管理》一章可以知道，在系统启动过程中，内核还会进行一次系统检测（第一次是BIOS进行加测），但是检测的过程不是没有显示在屏幕上，就是会快速的在屏幕上一闪而过那么，如果开机时来不及查看相关信息，我们是否可以在开机后查看呢？答案是肯定的，使用dmesg命令就可以。无论是系统启动过程中，还是系统运行过程中，只要是内核产生的信息，都会被存储在系统缓冲区中，已经为大家精心准备了大数据
大数据新视界 --大数据大厂之揭秘大数据时代 Excel 魔法：大厂数据分析师进阶秘籍青云交大数据新视界 Excel 数据分析函数公式数据透视表图表功能规划求解数据分析工具库大数据新视界数据库
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
大数据新视界 --大数据大厂之数据挖掘入门：用 R 语言开启数据宝藏的探索之旅青云交大数据新视界数据库大数据数据挖掘 R 语言算法案例未来趋势应用场景学习建议大数据新视界
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
高职人工智能训练师边缘计算实训室解决方案武汉唯众智创人工智能训练师边缘计算实训室人工智能训练师实训室边缘计算实训室
一、引言随着物联网（IoT）、大数据、人工智能（AI）等技术的飞速发展，计算需求日益复杂和多样化。传统的云计算模式虽在一定程度上满足了这些需求，但在处理海量数据、保障实时性与安全性、提升计算效率等方面仍面临诸多挑战。在此背景下，边缘计算作为一种新兴的计算模式应运而生，通过将计算能力推向数据生成或用户所在的网络边缘，显著降低了数据传输的延迟，提升了处理效率，并增强了数据安全性。针对高等职业院校的人工
python基于django/flask的NBA球员大数据分析与可视化python+java+node.js QQ_511008285 python django flask java spring boot 数据分析
前端开发框架:vue.js数据库mysql版本不限后端语言框架支持：1java(SSM/springboot)-idea/eclipse2.Nodejs+Vue.js-vscode3.python(flask/django)--pycharm/vscode4.php(thinkphp/laravel)-hbuilderx数据库工具：Navicat/SQLyog等都可以本文针对NBA球员的大数据进行
Java基于spring boot的国产电影数据分析与可视化python+java+node.js QQ_511008285 java spring boot 数据分析 python django vue.js flask
前端开发框架:vue.js数据库mysql版本不限后端语言框架支持：1java(SSM/springboot)-idea/eclipse2.Nodejs+Vue.js-vscode3.python(flask/django)--pycharm/vscode4.php(thinkphp/laravel)-hbuilderx数据库工具：Navicat/SQLyog等都可以该系统使用进行大数据处理和
web报表工具FineReport常见的数据集报错错误代码和解释老A不折腾 web报表 finereport 代码可视化工具
在使用finereport制作报表，若预览发生错误，很多朋友便手忙脚乱不知所措了，其实没什么，只要看懂报错代码和含义，可以很快的排除错误，这里我就分享一下finereport的数据集报错错误代码和解释，如果有说的不准确的地方，也请各位小伙伴纠正一下。 NS-war-remote=错误代码\:1117 压缩部署不支持远程设计 NS_LayerReport_MultiDs=错误代码
Java的WeakReference与WeakHashMap bylijinnan java 弱引用
首先看看 WeakReference wiki 上 Weak reference 的一个例子： public class ReferenceTest { public static void main(String[] args) throws InterruptedException { WeakReference r = new Wea
Linux——（hostname）主机名与ip的映射 eksliang linux hostname
一、什么是主机名无论在局域网还是INTERNET上，每台主机都有一个IP地址，是为了区分此台主机和彼台主机，也就是说IP地址就是主机的门牌号。但IP地址不方便记忆，所以又有了域名。域名只是在公网（INtERNET)中存在，每个域名都对应一个IP地址，但一个IP地址可有对应多个域名。域名类型 linuxsir.org 这样的；主机名是用于什么的呢？答：在一个局域网中，每台机器都有一个主
oracle 常用技巧 18289753290
oracle常用技巧 ①复制表结构和数据 create table temp_clientloginUser as select distinct userid from tbusrtloginlog ②仅复制数据如果表结构一样 insert into mytable select * &nb
使用c3p0数据库连接池时出现com.mchange.v2.resourcepool.TimeoutException 酷的飞上天空 exception
有一个线上环境使用的是c3p0数据库，为外部提供接口服务。最近访问压力增大后台tomcat的日志里面频繁出现 com.mchange.v2.resourcepool.TimeoutException: A client timed out while waiting to acquire a resource from com.mchange.v2.resourcepool.BasicResou
IT系统分析师如何学习大数据蓝儿唯美大数据
我是一名从事大数据项目的IT系统分析师。在深入这个项目前需要了解些什么呢？学习大数据的最佳方法就是先从了解信息系统是如何工作着手，尤其是数据库和基础设施。同样在开始前还需要了解大数据工具，如Cloudera、Hadoop、Spark、Hive、Pig、Flume、Sqoop与Mesos。系统分析师需要明白如何组织、管理和保护数据。在市面上有几十款数据管理产品可以用于管理数据。你的大数据数据库可能
spring学习——简介 a-john spring
Spring是一个开源框架，是为了解决企业应用开发的复杂性而创建的。Spring使用基本的JavaBean来完成以前只能由EJB完成的事情。然而Spring的用途不仅限于服务器端的开发，从简单性，可测试性和松耦合的角度而言，任何Java应用都可以从Spring中受益。其主要特征是依赖注入、AOP、持久化、事务、SpringMVC以及Acegi Security 为了降低Java开发的复杂性，
自定义颜色的xml文件 aijuans xml
<?xml version="1.0" encoding="utf-8"?> <resources> <color name="white">#FFFFFF</color> <color name="black">#000000</color> &
运营到底是做什么的？ aoyouzi 运营到底是做什么的？
文章来源：夏叔叔（微信号：woshixiashushu），欢迎大家关注！很久没有动笔写点东西，近些日子，由于爱狗团产品上线，不断面试，经常会被问道一个问题。问：爱狗团的运营主要做什么？答：带着用户一起嗨。为什么是带着用户玩起来呢？究竟什么是运营？运营到底是做什么的？那么，我们先来回答一个更简单的问题——互联网公司对运营考核什么？以爱狗团为例，绝大部分的移动互联网公司，对运营部门的考核分为三块——用
js面向对象类和对象百合不是茶 js 面向对象函数创建类和对象
接触js已经有几个月了,但是对js的面向对象的一些概念根本就是模糊的,js是一种面向对象的语言但又不像java一样有class,js不是严格的面向对象语言 ,js在java web开发的地位和java不相上下 ,其中web的数据的反馈现在主流的使用json,json的语法和js的类和属性的创建相似下面介绍一些js的类和对象的创建的技术一:类和对
web.xml之资源管理对象配置 resource-env-ref bijian1013 java web.xml servlet
resource-env-ref元素来指定对管理对象的servlet引用的声明，该对象与servlet环境中的资源相关联 <resource-env-ref> <resource-env-ref-name>资源名</resource-env-ref-name> <resource-env-ref-type>查找资源时返回的资源类
Create a composite component with a custom namespace sunjing
https://weblogs.java.net/blog/mriem/archive/2013/11/22/jsf-tip-45-create-composite-component-custom-namespace When you developed a composite component the namespace you would be seeing would
【MongoDB学习笔记十二】Mongo副本集服务器角色之Arbiter bit1129 mongodb
一、复本集为什么要加入Arbiter这个角色回答这个问题，要从复本集的存活条件和Aribter服务器的特性两方面来说。什么是Artiber？ An arbiter does not have a copy of data set and cannot become a primary. Replica sets may have arbiters to add a
Javascript开发笔记白糖_ JavaScript
获取iframe内的元素通常我们使用window.frames["frameId"].document.getElementById("divId").innerHTML这样的形式来获取iframe内的元素，这种写法在IE、safari、chrome下都是通过的，唯独在fireforx下不通过。其实jquery的contents方法提供了对if
Web浏览器Chrome打开一段时间后，运行alert无效 bozch Web chorme alert 无效
今天在开发的时候，突然间发现alert在chrome浏览器就没法弹出了，很是怪异。试了试其他浏览器，发现都是没有问题的。开始想以为是chorme浏览器有啥机制导致的，就开始尝试各种代码让alert出来。尝试结果是仍然没有显示出来。这样开发的结果，如果客户在使用的时候没有提示，那会带来致命的体验。哎，没啥办法了就关闭浏览器重启。结果就好了，这也太怪异了。难道是cho
编程之美-高效地安排会议图着色问题贪心算法 bylijinnan 编程之美
import java.util.ArrayList; import java.util.Collections; import java.util.List; import java.util.Random; public class GraphColoringProblem { /**编程之美高效地安排会议图着色问题贪心算法 * 假设要用很多个教室对一组
机器学习相关概念和开发工具 chenbowen00 算法 matlab 机器学习
基本概念：机器学习(Machine Learning, ML)是一门多领域交叉学科，涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为，以获取新的知识或技能，重新组织已有的知识结构使之不断改善自身的性能。它是人工智能的核心，是使计算机具有智能的根本途径，其应用遍及人工智能的各个领域，它主要使用归纳、综合而不是演绎。开发工具 M
[宇宙经济学]关于在太空建立永久定居点的可能性 comsci 经济
大家都知道,地球上的房地产都比较昂贵,而且土地证经常会因为新的政府的意志而变幻文本格式........ 所以,在地球议会尚不具有在太空行使法律和权力的力量之前,我们外太阳系统的友好联盟可以考虑在地月系的某些引力平衡点上面,修建规模较大的定居点
oracle 11g database control 证书错误 daizj oracle 证书错误 oracle 11G 安装
oracle 11g database control 证书错误 win7 安装完oracle11后打开 Database control 后，会打开em管理页面，提示证书错误，点“继续浏览此网站”，还是会继续停留在证书错误页面解决办法：是 KB2661254 这个更新补丁引起的，它限制了 RSA 密钥位长度少于 1024 位的证书的使用。具体可以看微软官方公告：
Java I/O之用FilenameFilter实现根据文件扩展名删除文件游其是你 FilenameFilter
在Java中，你可以通过实现FilenameFilter类并重写accept(File dir, String name) 方法实现文件过滤功能。在这个例子中，我们向你展示在“c:\\folder”路径下列出所有“.txt”格式的文件并删除。 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16
C语言数组的简单以及一维数组的简单排序算法示例，二维数组简单示例 dcj3sjt126com c array
# include <stdio.h> int main(void) { int a[5] = {1, 2, 3, 4, 5}; //a 是数组的名字 5是表示数组元素的个数，并且这五个元素分别用a[0], a[1]...a[4] int i; for (i=0; i<5; ++i) printf("%d\n",
PRIMARY, INDEX, UNIQUE 这3种是一类 PRIMARY 主键。就是唯一且不能为空。 INDEX 索引，普通的 UNIQUE 唯一索引 dcj3sjt126com primary
PRIMARY, INDEX, UNIQUE 这3种是一类PRIMARY 主键。就是唯一且不能为空。INDEX 索引，普通的UNIQUE 唯一索引。不允许有重复。FULLTEXT 是全文索引，用于在一篇文章中，检索文本信息的。举个例子来说，比如你在为某商场做一个会员卡的系统。这个系统有一个会员表有下列字段：会员编号 INT会员姓名
java集合辅助类 Collections、Arrays shuizhaosi888 Collections Arrays HashCode
Arrays、Collections 1 ）数组集合之间转换 public static <T> List<T> asList(T... a) { return new ArrayList<>(a); } a）Arrays.asL
Spring Security（10）——退出登录logout 234390216 logout Spring Security 退出登录 logout-url LogoutFilter
要实现退出登录的功能我们需要在http元素下定义logout元素，这样Spring Security将自动为我们添加用于处理退出登录的过滤器LogoutFilter到FilterChain。当我们指定了http元素的auto-config属性为true时logout定义是会自动配置的，此时我们默认退出登录的URL为“/j_spring_secu
透过源码学前端之 Backbone 三 Model 逐行分析JS源代码 backbone 源码分析 js学习
Backbone 分析第三部分 Model 概述： Model 提供了数据存储，将数据以JSON的形式保存在 Model的 attributes里，但重点功能在于其提供了一套功能强大，使用简单的存、取、删、改数据方法，并在不同的操作里加了相应的监听事件，如每次修改添加里都会触发 change，这在据模型变动来修改视图时很常用，并且与collection建立了关联。
SpringMVC源码总结（七）mvc:annotation-driven中的HttpMessageConverter 乒乓狂魔 springMVC
这一篇文章主要介绍下HttpMessageConverter整个注册过程包含自定义的HttpMessageConverter，然后对一些HttpMessageConverter进行具体介绍。 HttpMessageConverter接口介绍： public interface HttpMessageConverter<T> { /** * Indicate
分布式基础知识和算法理论 bluky999 算法 zookeeper 分布式一致性哈希 paxos
分布式基础知识和算法理论 BY [email protected] 本文永久链接：http://nodex.iteye.com/blog/2103218 在大数据的背景下，不管是做存储，做搜索，做数据分析，或者做产品或服务本身，面向互联网和移动互联网用户，已经不可避免地要面对分布式环境。笔者在此收录一些分布式相关的基础知识和算法理论介绍，在完善自我知识体系的同
Android Studio的.gitignore以及gitignore无效的解决 bell0901 android gitignore
　　github上.gitignore模板合集，里面有各种.gitignore ： https://github.com/github/gitignore 　　自己用的Android Studio下项目的.gitignore文件，对github上的android.gitignore添加了　　　　　　# OSX files　　　　　　//mac os下　　　　　　.DS_Store
成为高级程序员的10个步骤 tomcat_oracle 编程
What 软件工程师的职业生涯要历经以下几个阶段：初级、中级，最后才是高级。这篇文章主要是讲如何通过 10 个步骤助你成为一名高级软件工程师。 Why 得到更多的报酬！因为你的薪水会随着你水平的提高而增加提升你的职业生涯。成为了高级软件工程师之后，就可以朝着架构师、团队负责人、CTO 等职位前进历经更大的挑战。随着你的成长，各种影响力也会提高。
mongdb在linux下的安装 xtuhcy mongodb linux
一、查询linux版本号： lsb_release -a LSB Version: :base-4.0-amd64:base-4.0-noarch:core-4.0-amd64:core-4.0-noarch:graphics-4.0-amd64:graphics-4.0-noarch:printing-4.0-amd64:printing-4.0-noa