挖矿的小强

SparkSQL读取HBase数据，通过自定义外部数据源（hbase的Hive外关联表）

关键字：SparkSQL读取HBase、SparkSQL自定义外部数据源

前面文章介绍了SparSQL通过Hive操作HBase表。

SparkSQL从1.2开始支持自定义外部数据源(External DataSource)，这样就可以通过API接口来实现自己的外部数据源。这里基于Spark1.4.0，简单介绍SparkSQL自定义外部数据源，访问HBase表。

在HBase中表如下：

   
   
   
   
    
    
    
    create 'lxw1234',{NAME => 'f1',VERSIONS => 1},{NAME => 'f2',VERSIONS => 1},{NAME => 'f3',VERSIONS => 1}
    
    
    
     
    
    
    
    put 'lxw1234','lxw1234.com','f1:c1','name1'
    
    
    
    put 'lxw1234','lxw1234.com','f1:c2','name2'
    
    
    
    put 'lxw1234','lxw1234.com','f2:c1','age1'
    
    
    
    put 'lxw1234','lxw1234.com','f2:c2','age2'
    
    
    
    put 'lxw1234','lxw1234.com','f3:c1','job1'
    
    
    
    put 'lxw1234','lxw1234.com','f3:c2','job2'
    
    
    
    put 'lxw1234','lxw1234.com','f3:c3','job3'
    
    
    
     
    
    
    
    hbase(main):025:0* scan 'lxw1234'
    
    
    
    ROW COLUMN+CELL
    
    
    
    lxw1234.com column=f1:c1, timestamp=1435624625198, value=name1
    
    
    
    lxw1234.com column=f1:c2, timestamp=1435624591717, value=name2
    
    
    
    lxw1234.com column=f2:c1, timestamp=1435624608759, value=age1
    
    
    
    lxw1234.com column=f2:c2, timestamp=1435624635261, value=age2
    
    
    
    lxw1234.com column=f3:c1, timestamp=1435624662282, value=job1
    
    
    
    lxw1234.com column=f3:c2, timestamp=1435624697028, value=job2
    
    
    
    lxw1234.com column=f3:c3, timestamp=1435624697065, value=job3

进入spark-shell

   
   
   
   
    
    
    
    sh /usr/local/spark-1.4.0-bin-hadoop2.3/bin/spark-shell --jars /tmp/sparksql-hbase.jar --total-executor-cores 30 --executor-memory 4G --master spark://lxw1234.com:7077

运行以下代码：

   
   
   
   
    
    
    
    import sqlContext._
    
    
    
     
    
    
    
     
    
    
    
    var hbasetable = sqlContext.read.format("com.lxw1234.sparksql.hbase").options(Map(
    
    
    
    "sparksql_table_schema" -> "(row_key string, c1 string, c2 string, c3 string)",
    
    
    
    "hbase_table_name" -> "lxw1234",
    
    
    
    "hbase_table_schema" -> "(:key , f1:c2 , f2:c2 , f3:c3 )"
    
    
    
    )).load()
    
    
    
     
    
    
    
    //sparksql_table_schema参数为sparksql中表的定义
    
    
    
    //hbase_table_name参数为HBase中表名
    
    
    
    //hbase_table_schema参数为HBase表中需要映射到SparkSQL表中的列族和列，这里映射过//去的字段要和sparksql_table_schema中定义的一致，包括顺序。
    
    
    
     
    
    
    
     
    
    
    
    scala> hbasetable.printSchema()
    
    
    
    root
    
    
    
     |-- row_key: string (nullable = false)
    
    
    
     |-- c1: string (nullable = false)
    
    
    
     |-- c2: string (nullable = false)
    
    
    
     |-- c3: string (nullable = false)
    
    
    
     
    
    
    
    hbasetable.registerTempTable("lxw1234")
    
    
    
     
    
    
    
     
    
    
    
    sqlContext.sql("SELECT * from lxw1234").collect
    
    
    
    res3: Array[org.apache.spark.sql.Row] = Array([lxw1234.com,name2,age2,job3])
    
    
    
     
    
    
    
    sqlContext.sql("SELECT row_key,concat(c1,'|',c2,'|',c3) from lxw1234").collect
    
    
    
    res3: Array[org.apache.spark.sql.Row] = Array([lxw1234.com,name2|age2|job3])

源码

HBaseRelation.scala

   
   
   
   
    
    
    
    package com.lxw1234.sparksql.hbase
    
    
    
     
    
    
    
    import java.io.Serializable
    
    
    
    import org.apache.hadoop.fs.Path
    
    
    
    import org.apache.spark.sql._
    
    
    
    import org.apache.spark.sql.sources.TableScan
    
    
    
    import scala.collection.immutable.{HashMap, Map}
    
    
    
    import org.apache.hadoop.hbase.client.{Result, Scan, HTable, HBaseAdmin}
    
    
    
    import org.apache.spark.sql._
    
    
    
    import org.apache.spark.rdd.NewHadoopRDD
    
    
    
    import org.apache.hadoop.hbase.HBaseConfiguration
    
    
    
    import org.apache.hadoop.hbase.mapreduce.TableInputFormat
    
    
    
    import scala.collection.JavaConversions._
    
    
    
    import scala.collection.JavaConverters._
    
    
    
    import scala.collection.mutable.ArrayBuffer
    
    
    
    import org.apache.spark.sql.types.StructType
    
    
    
    import org.apache.spark.sql.types.DataType
    
    
    
    import org.apache.spark.sql.types.StructField
    
    
    
    import org.apache.spark.sql.types.LongType
    
    
    
    import org.apache.spark.sql.types.IntegerType
    
    
    
    import org.apache.spark.sql.types.StringType
    
    
    
    import org.apache.spark.sql.types.MapType
    
    
    
    import org.apache.spark.sql.sources.BaseRelation
    
    
    
     
    
    
    
     
    
    
    
    object Resolver extends  Serializable {
    
    
    
     
    
    
    
      def resolve (hbaseField: HBaseSchemaField, result: Result ): Any = {
    
    
    
        val cfColArray = hbaseField.fieldName.split(":",-1)
    
    
    
        val cfName = cfColArray(0)
    
    
    
        val colName =  cfColArray(1)
    
    
    
        var fieldRs: Any = null
    
    
    
        //resolve row key otherwise resolve column
    
    
    
        if(cfName=="" && colName=="key") {
    
    
    
          fieldRs = resolveRowKey(result, hbaseField.fieldType)
    
    
    
        } else {
    
    
    
          fieldRs =  resolveColumn(result, cfName, colName,hbaseField.fieldType)
    
    
    
        }
    
    
    
        fieldRs
    
    
    
      }
    
    
    
     
    
    
    
      def resolveRowKey (result: Result, resultType: String): Any = {
    
    
    
         val rowkey = resultType match {
    
    
    
          case "string" =>
    
    
    
            result.getRow.map(_.toChar).mkString
    
    
    
          case "int" =>
    
    
    
            result  .getRow.map(_.toChar).mkString.toInt
    
    
    
          case "long" =>
    
    
    
            result.getRow.map(_.toChar).mkString.toLong
    
    
    
        }
    
    
    
        rowkey
    
    
    
      }
    
    
    
     
    
    
    
      def resolveColumn (result: Result, columnFamily: String, columnName: String, resultType: String): Any = {
    
    
    
        val column = resultType match {
    
    
    
          case "string" =>
    
    
    
            result.getValue(columnFamily.getBytes,columnName.getBytes).map(_.toChar).mkString
    
    
    
          case "int" =>
    
    
    
            result.getValue(columnFamily.getBytes,columnName.getBytes).map(_.toChar).mkString.toInt
    
    
    
          case "long" =>
    
    
    
            result.getValue(columnFamily.getBytes,columnName.getBytes).map(_.toChar).mkString.toLong
    
    
    
        }
    
    
    
        column
    
    
    
      }
    
    
    
    }
    
    
    
     
    
    
    
    /**
    
    
    
       val hbaseDDL = s"""
    
    
    
          |CREATE TEMPORARY TABLE hbase_people
    
    
    
          |USING com.shengli.spark.hbase
    
    
    
          |OPTIONS (
    
    
    
          |  sparksql_table_schema   '(row_key string, name string, age int, job string)',
    
    
    
          |   hbase_table_name     'people',
    
    
    
          | hbase_table_schema '(:key , profile:name , profile:age , career:job )'
    
    
    
          |)""".stripMargin
    
    
    
     */
    
    
    
    case class HBaseRelation(@transient val hbaseProps: Map[String,String])(@transient val sqlContext: SQLContext) extends BaseRelation with Serializable with TableScan{
    
    
    
     
    
    
    
      val hbaseTableName =  hbaseProps.getOrElse("hbase_table_name", sys.error("not valid schema"))
    
    
    
      val hbaseTableSchema =  hbaseProps.getOrElse("hbase_table_schema", sys.error("not valid schema"))
    
    
    
      val registerTableSchema = hbaseProps.getOrElse("sparksql_table_schema", sys.error("not valid schema"))
    
    
    
      val rowRange = hbaseProps.getOrElse("row_range", "->")
    
    
    
      //get star row and end row
    
    
    
      val range = rowRange.split("->",-1)
    
    
    
      val startRowKey = range(0).trim
    
    
    
      val endRowKey = range(1).trim
    
    
    
     
    
    
    
      val tempHBaseFields = extractHBaseSchema(hbaseTableSchema) //do not use this, a temp field
    
    
    
      val registerTableFields = extractRegisterSchema(registerTableSchema)
    
    
    
      val tempFieldRelation = tableSchemaFieldMapping(tempHBaseFields,registerTableFields)
    
    
    
     
    
    
    
      val hbaseTableFields = feedTypes(tempFieldRelation)
    
    
    
      val fieldsRelations =  tableSchemaFieldMapping(hbaseTableFields,registerTableFields)
    
    
    
      val queryColumns =  getQueryTargetCloumns(hbaseTableFields)
    
    
    
     
    
    
    
      def  feedTypes( mapping: Map[HBaseSchemaField, RegisteredSchemaField]) :  Array[HBaseSchemaField] = {
    
    
    
             val hbaseFields = mapping.map{
    
    
    
               case (k,v) =>
    
    
    
                   val field = k.copy(fieldType=v.fieldType)
    
    
    
                   field
    
    
    
            }
    
    
    
            hbaseFields.toArray
    
    
    
      }
    
    
    
     
    
    
    
      def isRowKey(field: HBaseSchemaField) : Boolean = {
    
    
    
        val cfColArray = field.fieldName.split(":",-1)
    
    
    
        val cfName = cfColArray(0)
    
    
    
        val colName =  cfColArray(1)
    
    
    
        if(cfName=="" && colName=="key") true else false
    
    
    
      }
    
    
    
     
    
    
    
      //eg: f1:col1  f1:col2  f1:col3  f2:col1
    
    
    
      def getQueryTargetCloumns(hbaseTableFields: Array[HBaseSchemaField]): String = {
    
    
    
        var str = ArrayBuffer[String]()
    
    
    
        hbaseTableFields.foreach{ field=>
    
    
    
             if(!isRowKey(field)) {
    
    
    
               str +=  field.fieldName
    
    
    
             }
    
    
    
        }
    
    
    
        str.mkString(" ")
    
    
    
      }
    
    
    
      lazy val schema = {
    
    
    
        val fields = hbaseTableFields.map{ field=>
    
    
    
            val name  = fieldsRelations.getOrElse(field, sys.error("table schema is not match the definition.")).fieldName
    
    
    
            val relatedType =  field.fieldType match  {
    
    
    
              case "string" =>
    
    
    
                SchemaType(StringType,nullable = false)
    
    
    
              case "int" =>
    
    
    
                SchemaType(IntegerType,nullable = false)
    
    
    
              case "long" =>
    
    
    
                SchemaType(LongType,nullable = false)
    
    
    
            }
    
    
    
            StructField(name,relatedType.dataType,relatedType.nullable)
    
    
    
        }
    
    
    
        StructType(fields)
    
    
    
      }
    
    
    
     
    
    
    
      def tableSchemaFieldMapping( externalHBaseTable: Array[HBaseSchemaField],  registerTable : Array[RegisteredSchemaField]): Map[HBaseSchemaField, RegisteredSchemaField] = {
    
    
    
           if(externalHBaseTable.length != registerTable.length) sys.error("columns size not match in definition!")
    
    
    
           val rs = externalHBaseTable.zip(registerTable)
    
    
    
           rs.toMap
    
    
    
      }
    
    
    
     
    
    
    
        /**
    
    
    
         * spark sql schema will be register
    
    
    
         *   registerTableSchema   '(rowkey string, value string, column_a string)'
    
    
    
          */
    
    
    
      def extractRegisterSchema(registerTableSchema: String) : Array[RegisteredSchemaField] = {
    
    
    
             val fieldsStr = registerTableSchema.trim.drop(1).dropRight(1)
    
    
    
             val fieldsArray = fieldsStr.split(",").map(_.trim)
    
    
    
             fieldsArray.map{ fildString =>
    
    
    
               val splitedField = fildString.split("\\s+", -1)
    
    
    
               RegisteredSchemaField(splitedField(0), splitedField(1))
    
    
    
             }
    
    
    
       }
    
    
    
     
    
    
    
      //externalTableSchema '(:key , f1:col1 )'
    
    
    
      def extractHBaseSchema(externalTableSchema: String) : Array[HBaseSchemaField] = {
    
    
    
            val fieldsStr = externalTableSchema.trim.drop(1).dropRight(1)
    
    
    
            val fieldsArray = fieldsStr.split(",").map(_.trim)
    
    
    
            fieldsArray.map(fildString => HBaseSchemaField(fildString,""))
    
    
    
      }
    
    
    
     
    
    
    
     
    
    
    
     
    
    
    
      // By making this a lazy val we keep the RDD around, amortizing the cost of locating splits.
    
    
    
      lazy val buildScan = {
    
    
    
     
    
    
    
        val hbaseConf = HBaseConfiguration.create()
    
    
    
        hbaseConf.set(TableInputFormat.INPUT_TABLE, hbaseTableName)
    
    
    
        hbaseConf.set(TableInputFormat.SCAN_COLUMNS, queryColumns);
    
    
    
        hbaseConf.set(TableInputFormat.SCAN_ROW_START, startRowKey);
    
    
    
        hbaseConf.set(TableInputFormat.SCAN_ROW_STOP, endRowKey);
    
    
    
     
    
    
    
        val hbaseRdd = sqlContext.sparkContext.newAPIHadoopRDD(
    
    
    
          hbaseConf,
    
    
    
          classOf[org.apache.hadoop.hbase.mapreduce.TableInputFormat],
    
    
    
          classOf[org.apache.hadoop.hbase.io.ImmutableBytesWritable],
    
    
    
          classOf[org.apache.hadoop.hbase.client.Result]
    
    
    
        )
    
    
    
     
    
    
    
     
    
    
    
        val rs = hbaseRdd.map(tuple => tuple._2).map(result => {
    
    
    
          var values = new ArrayBuffer[Any]()
    
    
    
          hbaseTableFields.foreach{field=>
    
    
    
            values += Resolver.resolve(field,result)
    
    
    
          }
    
    
    
          Row.fromSeq(values.toSeq)
    
    
    
        })
    
    
    
        rs
    
    
    
      }
    
    
    
     
    
    
    
      private case class SchemaType(dataType: DataType, nullable: Boolean)
    
    
    
    //
    
    
    
    //  private def toSqlType(hbaseSchema: Schema): SchemaType = {
    
    
    
    //    SchemaType(StringType,true)
    
    
    
    //  }
    
    
    
    }

DefaultSource.scala

   
   
   
   
    
    
    
    package com.lxw1234.sparksql.hbase
    
    
    
     
    
    
    
    import org.apache.spark.sql.SQLContext
    
    
    
    import org.apache.spark.sql.sources.RelationProvider
    
    
    
     
    
    
    
     
    
    
    
    class DefaultSource extends RelationProvider {
    
    
    
      def createRelation(sqlContext: SQLContext, parameters: Map[String, String]) = {
    
    
    
        HBaseRelation(parameters)(sqlContext)
    
    
    
      }
    
    
    
    }

package.scala

   
   
   
   
    
    
    
    package com.lxw1234.sparksql
    
    
    
     
    
    
    
    import org.apache.spark.sql.SQLContext
    
    
    
    import scala.collection.immutable.HashMap
    
    
    
     
    
    
    
     
    
    
    
     
    
    
    
    package object hbase {
    
    
    
     
    
    
    
      abstract class SchemaField extends Serializable
    
    
    
     
    
    
    
       case class RegisteredSchemaField(fieldName: String, fieldType: String)  extends  SchemaField  with Serializable
    
    
    
     
    
    
    
       case class HBaseSchemaField(fieldName: String, fieldType: String)  extends  SchemaField  with Serializable
    
    
    
     
    
    
    
       case class Parameter(name: String)
    
    
    
     
    
    
    
     
    
    
    
      protected  val SPARK_SQL_TABLE_SCHEMA = Parameter("sparksql_table_schema")
    
    
    
      protected  val HBASE_TABLE_NAME = Parameter("hbase_table_name")
    
    
    
      protected  val HBASE_TABLE_SCHEMA = Parameter("hbase_table_schema")
    
    
    
      protected  val ROW_RANGE = Parameter("row_range")
    
    
    
      /**
    
    
    
       * Adds a method, `hbaseTable`, to SQLContext that allows reading data stored in hbase table.
    
    
    
       */
    
    
    
      implicit class HBaseContext(sqlContext: SQLContext) {
    
    
    
        def hbaseTable(sparksqlTableSchema: String, hbaseTableName: String, hbaseTableSchema: String, rowRange: String = "->") = {
    
    
    
          var params = new HashMap[String, String]
    
    
    
          params += ( SPARK_SQL_TABLE_SCHEMA.name -> sparksqlTableSchema)
    
    
    
          params += ( HBASE_TABLE_NAME.name -> hbaseTableName)
    
    
    
          params += ( HBASE_TABLE_SCHEMA.name -> hbaseTableSchema)
    
    
    
          //get star row and end row
    
    
    
          params += ( ROW_RANGE.name -> rowRange)
    
    
    
          sqlContext.baseRelationToDataFrame(HBaseRelation(params)(sqlContext));
    
    
    
          //sqlContext.baseRelationToSchemaRDD(HBaseRelation(params)(sqlContext))
    
    
    
        }
    
    
    
      }
    
    
    
     
    
    
    
    //  implicit class HBaseSchemaRDD(schemaRDD: SchemaRDD) {
    
    
    
    //    def saveIntoTable(tableName: String): Unit = ???
    
    
    
    //  }
    
    
    
    }

相关配置和说明

本来在SparkSQL中通过外部数据源建表的语法是：

CREATE TEMPORARY TABLE hbasetable

USING com.lxw1234.sparksql.hbase

OPTIONS (

sparksql_table_schema ‘(row_key string, c1 string, c2 string, c3 string)’,

hbase_table_name ‘lxw1234′,

hbase_table_schema ‘(:key , f1:c2 , f2:c2 , f3:c3)’

)

在我的Spark1.4中报错，会使用Hive的语法解析器解析这个DDL语句，因为Hive0.13中没有这种语法，因此报错。

是否是因为Spark1.4包的编译了Hive的原因？

上面源码的编译依赖HBase的相关jar包：

hbase-client-0.96.1.1-cdh5.0.0.jar

hbase-common-0.96.1.1-cdh5.0.0.jar

hbase-protocol-0.96.1.1-cdh5.0.0.jar

hbase-server-0.96.1.1-cdh5.0.0.jar

还有HBase的集群信息：

hbase.zookeeper.quorum

hbase.client.scanner.caching

我之前在配置时候已经将这几个jar包和参数加到Spark集群的CLASSPATH中了，可参考 http://lxw1234.com/archives/2015/07/330.htm

此程序是OopsOutOfMemory基于Spark1.2开发的，我只做了很小的修改。

https://github.com/OopsOutOfMemory/spark-sql-hbase

此程序只做学习和测试使用，并未测试性能

nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
Spark 组件 GraphX、Streaming 叶域大数据 spark spark 大数据分布式
Spark组件GraphX、Streaming一、SparkGraphX1.1GraphX的主要概念1.2GraphX的核心操作1.3示例代码1.4GraphX的应用场景二、SparkStreaming2.1SparkStreaming的主要概念2.2示例代码2.3SparkStreaming的集成2.4SparkStreaming的应用场景SparkGraphX用于处理图和图并行计算。Graph
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
Spark集群的三种模式 MelodyYN #Spark spark hadoop big data
文章目录1、Spark的由来1.1Hadoop的发展1.2MapReduce与Spark对比2、Spark内置模块3、Spark运行模式3.1Standalone模式部署配置历史服务器配置高可用运行模式3.2Yarn模式安装部署配置历史服务器运行模式4、WordCount案例1、Spark的由来定义：Hadoop主要解决，海量数据的存储和海量数据的分析计算。Spark是一种基于内存的快速、通用、可
Java中的大数据处理框架对比分析省赚客app开发者 java 开发语言
Java中的大数据处理框架对比分析大家好，我是微赚淘客系统3.0的小编，是个冬天不穿秋裤，天冷也要风度的程序猿！今天，我们将深入探讨Java中常用的大数据处理框架，并对它们进行对比分析。大数据处理框架是现代数据驱动应用的核心，它们帮助企业处理和分析海量数据，以提取有价值的信息。本文将重点介绍ApacheHadoop、ApacheSpark、ApacheFlink和ApacheStorm这四种流行的
写出渗透测试信息收集详细流程卿酌南烛_b805
一、扫描域名漏洞：域名漏洞扫描工具有AWVS、APPSCAN、Netspark、WebInspect、Nmap、Nessus、天镜、明鉴、WVSS、RSAS等。二、子域名探测：1、dns域传送漏洞2、搜索引擎查找（通过Google、bing、搜索c段）3、通过ssl证书查询网站：https://myssl.com/ssl.html和https://www.chinassl.net/ssltools
Spark MLlib模型训练—推荐算法 ALS(Alternative Least Squares) 不二人生 Spark ML 实战 spark-ml 推荐算法算法
SparkMLlib模型训练—推荐算法ALS(AlternativeLeastSquares)如果你平时爱刷抖音，或者热衷看电影，不知道有没有过这样的体验：这类影视App你用得越久，它就好像会读心术一样，总能给你推荐对胃口的内容。其实这种迎合用户喜好的推荐，离不开机器学习中的推荐算法。在今天这一讲，我们就结合两个有趣的电影推荐场景，为你讲解SparkMLlib支持的协同过滤与频繁项集算法电影推荐场
Python基础知识进阶之正则表达式_头歌python正则表达式进阶前端陈萨龙程序员 python 学习面试
最后硬核资料：关注即可领取PPT模板、简历模板、行业经典书籍PDF。技术互助：技术群大佬指点迷津，你的问题可能不是问题，求资源在群里喊一声。面试题库：由技术群里的小伙伴们共同投稿，热乎的大厂面试真题，持续更新中。知识体系：含编程语言、算法、大数据生态圈组件（Mysql、Hive、Spark、Flink）、数据仓库、Python、前端等等。网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是
分布式离线计算—Spark—基础介绍测试开发abbey 人工智能—大数据
原文作者：饥渴的小苹果原文地址：【Spark】Spark基础教程目录Spark特点Spark相对于Hadoop的优势Spark生态系统Spark基本概念Spark结构设计Spark各种概念之间的关系Executor的优点Spark运行基本流程Spark运行架构的特点Spark的部署模式Spark三种部署方式Hadoop和Spark的统一部署摘要：Spark是基于内存计算的大数据并行计算框架Spar
spark常用命令我是浣熊的微笑 spark
查看报错日志：yarnlogsapplicationIDspark2-submit--masteryarn--classcom.hik.ReadHdfstest-1.0-SNAPSHOT.jar进入$SPARK_HOME目录，输入bin/spark-submit--help可以得到该命令的使用帮助。hadoop@wyy:/app/hadoop/spark100$bin/spark-submit--
spark启动命令学不会又听不懂 spark 大数据分布式
hadoop启动：cd/root/toolssstart-dfs.sh，只需在hadoop01上启动stop-dfs.sh日志查看：cat/root/toolss/hadoop/logs/hadoop-root-datanode-hadoop03.outzookeeper启动：cd/root/toolss/zookeeperbin/zkServer.shstart，三台都要启动bin/zkServ
大数据领域的深度分析——AI是在帮助开发者还是取代他们？阳爱铭大数据与数据中台技术沉淀大数据人工智能后端数据库架构数据库开发 etl工程师 chatgpt
在大数据领域，生成式人工智能（AIGC）的应用正在迅速扩展，改变了数据科学家和开发者的工作方式。本文将从大数据的专业视角，探讨AI工具在这一领域的作用，以及它们是如何帮助开发者而非取代他们的。1.大数据领域的AI工具现状在大数据领域，AI工具已经取得了显著进展，以下是几款主要的AI工具及其功能和实际应用：ApacheSpark+MLlib：ApacheSpark是一个开源的分布式计算系统，广泛用于
大数据新视界 --大数据大厂之 Spark 性能优化秘籍：从配置到代码实践青云交大数据新视界 Spark 性能优化内存分配并行度存储级别 shuffle 减少算法优化代码实践数据读取广播变量数据倾斜 Spark 数据库
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
编程常用命令总结 Yellow0523 Linux BigData 大数据
编程命令大全1.软件环境变量的配置JavaScalaSparkHadoopHive2.大数据软件常用命令Spark基本命令Spark-SQL命令Hive命令HDFS命令YARN命令Zookeeper命令kafka命令Hibench命令MySQL命令3.Linux常用命令Git命令conda命令pip命令查看Linux系统的详细信息查看Linux系统架构(X86还是ARM，两种方法都可)端口号命令L
【面试系列】Spark 高频面试题解答野老杂谈全网最全IT公司面试宝典面试 spark 职场和发展大数据
欢迎来到我的博客，很高兴能够在这里和您见面！欢迎订阅相关专栏：⭐️全网最全IT互联网公司面试宝典：收集整理全网各大IT互联网公司技术、项目、HR面试真题.⭐️AIGC时代的创新与未来：详细讲解AIGC的概念、核心技术、应用领域等内容。⭐️大数据平台建设指南：全面讲解从数据采集到数据可视化的整个过程，掌握构建现代化数据平台的核心技术和方法。⭐️《遇见Python：初识、了解与热恋》：涵盖了Pytho
spark常见面试题爱敲代码的小黑 spark 大数据分布式
文章目录1.Spark的运行流程？2.Spark中的RDD机制理解吗？3.RDD的宽窄依赖4.DAG中为什么要划分Stage？5.Spark程序执行，有时候默认为什么会产生很多task，怎么修改默认task执行个数？6.RDD中reduceBykey与groupByKey哪个性能好，为什么？7.SparkMasterHA主从切换过程不会影响到集群已有作业的运行，为什么？8.SparkMaster使
Spark面试题 golove666 面试题大全 spark 大数据分布式面试
Spark面试题1.Spark基础概念1.1解释Spark是什么以及它的主要特点Spark是什么？Spark的主要特点1.2描述Spark运行时架构和组件主要的Spark架构组件：1.3讲述Spark中的弹性分布式数据集（RDD）和数据帧（DataFrame）弹性分布式数据集（RDD）主要特征：创建和转换：使用场景：数据帧（DataFrame）主要特征：创建和操作：使用场景：RDD与DataFra
图计算：基于SparkGrpahX计算聚类系数妙龄少女郭德纲 Spark 图算法 Scala 聚类数据挖掘机器学习
图计算：基于SparkGrpahX计算聚类系数文章目录图计算：基于SparkGrpahX计算聚类系数一、什么是聚类系数二、基于SparkGraphX的聚类系数代码实现总结一、什么是聚类系数聚类系数（ClusteringCoefficient）是图计算和网络分析中的一个重要概念，用于衡量网络中节点的局部聚集程度。它有助于理解网络中节点之间的紧密程度和网络的结构特性。这是一种用来衡量图中节点聚类程度的
2024年最全使用Python求解方程_python解方程(1)，字节面试官迟到 2401_84569545 程序员 python 学习面试
最后硬核资料：关注即可领取PPT模板、简历模板、行业经典书籍PDF。技术互助：技术群大佬指点迷津，你的问题可能不是问题，求资源在群里喊一声。面试题库：由技术群里的小伙伴们共同投稿，热乎的大厂面试真题，持续更新中。知识体系：含编程语言、算法、大数据生态圈组件（Mysql、Hive、Spark、Flink）、数据仓库、Python、前端等等。网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是
Spark运行时架构 tooolik spark 架构大数据
目录一，Spark运行时架构二，YARN集群架构（一）YARN集群主要组件1、ResourceManager-资源管理器2、NodeManager-节点管理器3、Task-任务4、Container-容器5、ApplicationMaster-应用程序管理器6，总结（二）YARN集群中应用程序的执行流程三、SparkStandalone架构（一）client提交方式（二）cluster提交方式四、
使用SparkSql进行表的分析与统计 xingyuan8 大数据 java
背景我们的数据挖掘平台对数据统计有比较迫切的需求，而Spark本身对数据统计已经做了一些工作，希望梳理一下Spark已经支持的数据统计功能，后期再进行扩展。准备数据在参考文献6中下载鸢尾花数据，此处格式为iris.data格式，先将data后缀改为csv后缀（不影响使用，只是为了保证后续操作不需要修改）。数据格式如下：SepalLengthSepalWidthPetalLengthPetalWid
13.Spark Core-Spark中广播变量和累加器 __元昊__
一、前述Spark中因为算子中的真正逻辑是发送到Executor中去运行的，所以当Executor中需要引用外部变量时，需要使用广播变量。累机器相当于统筹大变量，常用于计数，统计。二、具体原理1、广播变量广播变量理解图image注意事项1、能不能将一个RDD使用广播变量广播出去？不能，因为RDD是不存储数据的。可以将RDD的结果广播出去。2、广播变量只能在Driver端定义，不能在Executor
比较Spark与Flink 傲雪凌霜，松柏长青大数据后端 spark flink 大数据
ApacheSpark和ApacheFlink都是目前非常流行的大数据处理引擎，但它们在架构、处理模式、应用场景等方面有一些显著的区别。下面是二者的对比：1.处理模式Spark:主要支持批处理（BatchProcessing），也能通过SparkStreaming处理流式数据，但SparkStreaming本质上是通过微批（micro-batching）的方式处理流数据，延迟相对较高。SparkS
Spark底层逻辑傲雪凌霜，松柏长青大数据后端 spark 大数据
ApacheSpark的底层逻辑可以从其核心概念、组件和执行流程等方面来理解。Spark提供了一个分布式数据处理框架，其底层逻辑基于批处理架构，能够在大规模集群中高效地处理数据。以下是Spark的底层逻辑的详细介绍：1.核心概念Spark的底层基于几个核心概念来实现分布式计算，包括：RDD（ResilientDistributedDataset，弹性分布式数据集）：RDD是Spark最基础的数据抽
Spark - 升级版数据源JDBC2 大猪大猪
在spark的数据源中，只支持Append,Overwrite,ErrorIfExists,Ignore,这几种模式，但是我们在线上的业务几乎全是需要upsert功能的，就是已存在的数据肯定不能覆盖，在mysql中实现就是采用：ONDUPLICATEKEYUPDATE，有没有这样一种实现？官方：不好意思，不提供，dounine：我这有呀，你来用吧。哈哈，为了方便大家的使用我已经把项目打包到mave
PySpark 静听山水 Spark spark
PySpark的本质确实是Python的一个接口层，它允许你使用Python语言来编写ApacheSpark应用程序。通过这个接口，你可以利用Spark强大的分布式计算能力，同时享受Python的易用性和灵活性。1、PySpark的工作原理PySpark的工作原理可以概括为以下几个步骤：编写Python代码：开发者使用Python语法来编写Spark应用程序。这些程序通常涉及创建RDDs（弹性分布
Ubuntu的ssh 请不要问我是谁
安装sshsudoapt-getupdatesudoapt-getinstallopenssh-server检测ssh是否启动sudops-e|grepssh创建root用户sudopasswdroot配置本机无密码ssh登录cd/home/spark0ssh-keygen-trsa-P""cat.ssh/id_rsa.pub>>.ssh/authorized_keyschmod600.ssh/a
2024年大数据最新实时数仓之实时数仓架构(Hudi) 2401_84185556 程序员大数据架构
技术框架Kafka：用于接入数据源；FlinkCDC：如果直接接入业务数据源可以考虑CDC方式，如果通过Kafka缓冲接入业务数据可以忽略;Flink：用于数据ETL，包括接入数据、处理数据及输出数据全链路数据计算任务；Spark：用于数据ETL，包括处理数据及输出数据全链路数据计算任务；Hudi：湖仓一体数据管理框架，用来管理模型数据，包括ODS/DWD/DWS/DIM/ADS等；Doris：O
实时数仓之实时数仓架构(Hudi)(1)，2024年最新熬夜整理华为最新大数据开发笔试题 2401_84181221 程序员架构大数据
+Hudi：湖仓一体数据管理框架，用来管理模型数据，包括ODS/DWD/DWS/DIM/ADS等；+Doris：OLAP引擎，同步数仓结果模型，对外提供数据服务支持；+Hbase：用来存储维表信息，维表数据来源一部分有Flink加工实时写入，另一部分是从Spark任务生产，其主要作用用来支持FlinkETL处理过程中的LookupJoin功能。这里选用Hbase原因主要因为Table的HbaseC
web报表工具FineReport常见的数据集报错错误代码和解释老A不折腾 web报表 finereport 代码可视化工具
在使用finereport制作报表，若预览发生错误，很多朋友便手忙脚乱不知所措了，其实没什么，只要看懂报错代码和含义，可以很快的排除错误，这里我就分享一下finereport的数据集报错错误代码和解释，如果有说的不准确的地方，也请各位小伙伴纠正一下。 NS-war-remote=错误代码\:1117 压缩部署不支持远程设计 NS_LayerReport_MultiDs=错误代码
Java的WeakReference与WeakHashMap bylijinnan java 弱引用
首先看看 WeakReference wiki 上 Weak reference 的一个例子： public class ReferenceTest { public static void main(String[] args) throws InterruptedException { WeakReference r = new Wea
Linux——（hostname）主机名与ip的映射 eksliang linux hostname
一、什么是主机名无论在局域网还是INTERNET上，每台主机都有一个IP地址，是为了区分此台主机和彼台主机，也就是说IP地址就是主机的门牌号。但IP地址不方便记忆，所以又有了域名。域名只是在公网（INtERNET)中存在，每个域名都对应一个IP地址，但一个IP地址可有对应多个域名。域名类型 linuxsir.org 这样的；主机名是用于什么的呢？答：在一个局域网中，每台机器都有一个主
oracle 常用技巧 18289753290
oracle常用技巧 ①复制表结构和数据 create table temp_clientloginUser as select distinct userid from tbusrtloginlog ②仅复制数据如果表结构一样 insert into mytable select * &nb
使用c3p0数据库连接池时出现com.mchange.v2.resourcepool.TimeoutException 酷的飞上天空 exception
有一个线上环境使用的是c3p0数据库，为外部提供接口服务。最近访问压力增大后台tomcat的日志里面频繁出现 com.mchange.v2.resourcepool.TimeoutException: A client timed out while waiting to acquire a resource from com.mchange.v2.resourcepool.BasicResou
IT系统分析师如何学习大数据蓝儿唯美大数据
我是一名从事大数据项目的IT系统分析师。在深入这个项目前需要了解些什么呢？学习大数据的最佳方法就是先从了解信息系统是如何工作着手，尤其是数据库和基础设施。同样在开始前还需要了解大数据工具，如Cloudera、Hadoop、Spark、Hive、Pig、Flume、Sqoop与Mesos。系统分析师需要明白如何组织、管理和保护数据。在市面上有几十款数据管理产品可以用于管理数据。你的大数据数据库可能
spring学习——简介 a-john spring
Spring是一个开源框架，是为了解决企业应用开发的复杂性而创建的。Spring使用基本的JavaBean来完成以前只能由EJB完成的事情。然而Spring的用途不仅限于服务器端的开发，从简单性，可测试性和松耦合的角度而言，任何Java应用都可以从Spring中受益。其主要特征是依赖注入、AOP、持久化、事务、SpringMVC以及Acegi Security 为了降低Java开发的复杂性，
自定义颜色的xml文件 aijuans xml
<?xml version="1.0" encoding="utf-8"?> <resources> <color name="white">#FFFFFF</color> <color name="black">#000000</color> &
运营到底是做什么的？ aoyouzi 运营到底是做什么的？
文章来源：夏叔叔（微信号：woshixiashushu），欢迎大家关注！很久没有动笔写点东西，近些日子，由于爱狗团产品上线，不断面试，经常会被问道一个问题。问：爱狗团的运营主要做什么？答：带着用户一起嗨。为什么是带着用户玩起来呢？究竟什么是运营？运营到底是做什么的？那么，我们先来回答一个更简单的问题——互联网公司对运营考核什么？以爱狗团为例，绝大部分的移动互联网公司，对运营部门的考核分为三块——用
js面向对象类和对象百合不是茶 js 面向对象函数创建类和对象
接触js已经有几个月了,但是对js的面向对象的一些概念根本就是模糊的,js是一种面向对象的语言但又不像java一样有class,js不是严格的面向对象语言 ,js在java web开发的地位和java不相上下 ,其中web的数据的反馈现在主流的使用json,json的语法和js的类和属性的创建相似下面介绍一些js的类和对象的创建的技术一:类和对
web.xml之资源管理对象配置 resource-env-ref bijian1013 java web.xml servlet
resource-env-ref元素来指定对管理对象的servlet引用的声明，该对象与servlet环境中的资源相关联 <resource-env-ref> <resource-env-ref-name>资源名</resource-env-ref-name> <resource-env-ref-type>查找资源时返回的资源类
Create a composite component with a custom namespace sunjing
https://weblogs.java.net/blog/mriem/archive/2013/11/22/jsf-tip-45-create-composite-component-custom-namespace When you developed a composite component the namespace you would be seeing would
【MongoDB学习笔记十二】Mongo副本集服务器角色之Arbiter bit1129 mongodb
一、复本集为什么要加入Arbiter这个角色回答这个问题，要从复本集的存活条件和Aribter服务器的特性两方面来说。什么是Artiber？ An arbiter does not have a copy of data set and cannot become a primary. Replica sets may have arbiters to add a
Javascript开发笔记白糖_ JavaScript
获取iframe内的元素通常我们使用window.frames["frameId"].document.getElementById("divId").innerHTML这样的形式来获取iframe内的元素，这种写法在IE、safari、chrome下都是通过的，唯独在fireforx下不通过。其实jquery的contents方法提供了对if
Web浏览器Chrome打开一段时间后，运行alert无效 bozch Web chorme alert 无效
今天在开发的时候，突然间发现alert在chrome浏览器就没法弹出了，很是怪异。试了试其他浏览器，发现都是没有问题的。开始想以为是chorme浏览器有啥机制导致的，就开始尝试各种代码让alert出来。尝试结果是仍然没有显示出来。这样开发的结果，如果客户在使用的时候没有提示，那会带来致命的体验。哎，没啥办法了就关闭浏览器重启。结果就好了，这也太怪异了。难道是cho
编程之美-高效地安排会议图着色问题贪心算法 bylijinnan 编程之美
import java.util.ArrayList; import java.util.Collections; import java.util.List; import java.util.Random; public class GraphColoringProblem { /**编程之美高效地安排会议图着色问题贪心算法 * 假设要用很多个教室对一组
机器学习相关概念和开发工具 chenbowen00 算法 matlab 机器学习
基本概念：机器学习(Machine Learning, ML)是一门多领域交叉学科，涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为，以获取新的知识或技能，重新组织已有的知识结构使之不断改善自身的性能。它是人工智能的核心，是使计算机具有智能的根本途径，其应用遍及人工智能的各个领域，它主要使用归纳、综合而不是演绎。开发工具 M
[宇宙经济学]关于在太空建立永久定居点的可能性 comsci 经济
大家都知道,地球上的房地产都比较昂贵,而且土地证经常会因为新的政府的意志而变幻文本格式........ 所以,在地球议会尚不具有在太空行使法律和权力的力量之前,我们外太阳系统的友好联盟可以考虑在地月系的某些引力平衡点上面,修建规模较大的定居点
oracle 11g database control 证书错误 daizj oracle 证书错误 oracle 11G 安装
oracle 11g database control 证书错误 win7 安装完oracle11后打开 Database control 后，会打开em管理页面，提示证书错误，点“继续浏览此网站”，还是会继续停留在证书错误页面解决办法：是 KB2661254 这个更新补丁引起的，它限制了 RSA 密钥位长度少于 1024 位的证书的使用。具体可以看微软官方公告：
Java I/O之用FilenameFilter实现根据文件扩展名删除文件游其是你 FilenameFilter
在Java中，你可以通过实现FilenameFilter类并重写accept(File dir, String name) 方法实现文件过滤功能。在这个例子中，我们向你展示在“c:\\folder”路径下列出所有“.txt”格式的文件并删除。 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16
C语言数组的简单以及一维数组的简单排序算法示例，二维数组简单示例 dcj3sjt126com c array
# include <stdio.h> int main(void) { int a[5] = {1, 2, 3, 4, 5}; //a 是数组的名字 5是表示数组元素的个数，并且这五个元素分别用a[0], a[1]...a[4] int i; for (i=0; i<5; ++i) printf("%d\n",
PRIMARY, INDEX, UNIQUE 这3种是一类 PRIMARY 主键。就是唯一且不能为空。 INDEX 索引，普通的 UNIQUE 唯一索引 dcj3sjt126com primary
PRIMARY, INDEX, UNIQUE 这3种是一类PRIMARY 主键。就是唯一且不能为空。INDEX 索引，普通的UNIQUE 唯一索引。不允许有重复。FULLTEXT 是全文索引，用于在一篇文章中，检索文本信息的。举个例子来说，比如你在为某商场做一个会员卡的系统。这个系统有一个会员表有下列字段：会员编号 INT会员姓名
java集合辅助类 Collections、Arrays shuizhaosi888 Collections Arrays HashCode
Arrays、Collections 1 ）数组集合之间转换 public static <T> List<T> asList(T... a) { return new ArrayList<>(a); } a）Arrays.asL
Spring Security（10）——退出登录logout 234390216 logout Spring Security 退出登录 logout-url LogoutFilter
要实现退出登录的功能我们需要在http元素下定义logout元素，这样Spring Security将自动为我们添加用于处理退出登录的过滤器LogoutFilter到FilterChain。当我们指定了http元素的auto-config属性为true时logout定义是会自动配置的，此时我们默认退出登录的URL为“/j_spring_secu
透过源码学前端之 Backbone 三 Model 逐行分析JS源代码 backbone 源码分析 js学习
Backbone 分析第三部分 Model 概述： Model 提供了数据存储，将数据以JSON的形式保存在 Model的 attributes里，但重点功能在于其提供了一套功能强大，使用简单的存、取、删、改数据方法，并在不同的操作里加了相应的监听事件，如每次修改添加里都会触发 change，这在据模型变动来修改视图时很常用，并且与collection建立了关联。
SpringMVC源码总结（七）mvc:annotation-driven中的HttpMessageConverter 乒乓狂魔 springMVC
这一篇文章主要介绍下HttpMessageConverter整个注册过程包含自定义的HttpMessageConverter，然后对一些HttpMessageConverter进行具体介绍。 HttpMessageConverter接口介绍： public interface HttpMessageConverter<T> { /** * Indicate
分布式基础知识和算法理论 bluky999 算法 zookeeper 分布式一致性哈希 paxos
分布式基础知识和算法理论 BY [email protected] 本文永久链接：http://nodex.iteye.com/blog/2103218 在大数据的背景下，不管是做存储，做搜索，做数据分析，或者做产品或服务本身，面向互联网和移动互联网用户，已经不可避免地要面对分布式环境。笔者在此收录一些分布式相关的基础知识和算法理论介绍，在完善自我知识体系的同
Android Studio的.gitignore以及gitignore无效的解决 bell0901 android gitignore
　　github上.gitignore模板合集，里面有各种.gitignore ： https://github.com/github/gitignore 　　自己用的Android Studio下项目的.gitignore文件，对github上的android.gitignore添加了　　　　　　# OSX files　　　　　　//mac os下　　　　　　.DS_Store
成为高级程序员的10个步骤 tomcat_oracle 编程
What 软件工程师的职业生涯要历经以下几个阶段：初级、中级，最后才是高级。这篇文章主要是讲如何通过 10 个步骤助你成为一名高级软件工程师。 Why 得到更多的报酬！因为你的薪水会随着你水平的提高而增加提升你的职业生涯。成为了高级软件工程师之后，就可以朝着架构师、团队负责人、CTO 等职位前进历经更大的挑战。随着你的成长，各种影响力也会提高。
mongdb在linux下的安装 xtuhcy mongodb linux
一、查询linux版本号： lsb_release -a LSB Version: :base-4.0-amd64:base-4.0-noarch:core-4.0-amd64:core-4.0-noarch:graphics-4.0-amd64:graphics-4.0-noarch:printing-4.0-amd64:printing-4.0-noa

SparkSQL读取HBase数据，通过自定义外部数据源（hbase的Hive外关联表）

源码

相关配置和说明

你可能感兴趣的:(spark)