weixin_30355437

Spark-SQL之DataFrame操作大全

　　Spark SQL中的DataFrame类似于一张关系型数据表。在关系型数据库中对单表或进行的查询操作，在DataFrame中都可以通过调用其API接口来实现。可以参考，Scala提供的DataFrame API。

　　本文中的代码基于Spark-1.6.2的文档实现。

一、DataFrame对象的生成

　　Spark-SQL可以以其他RDD对象、parquet文件、json文件、hive表，以及通过JDBC连接到其他关系型数据库作为数据源来生成DataFrame对象。本文将以MySQL数据库为数据源，生成DataFrame对象后进行相关的DataFame之上的操作。
　　文中生成DataFrame的代码如下：

object DataFrameOperations {
  def main (args: Array[String ]) {
    val sparkConf = new SparkConf().setAppName( "Spark SQL DataFrame Operations").setMaster( "local[2]" )
    val sparkContext = new SparkContext(sparkConf)

    val sqlContext = new SQLContext(sparkContext)
    val url = "jdbc:mysql://m000:3306/test"

    val jdbcDF = sqlContext.read.format( "jdbc" ).options(
      Map( "url" -> url,
        "user" -> "root",
        "password" -> "root",
        "dbtable" -> "spark_sql_test" )).load()

    val joinDF1 = sqlContext.read.format( "jdbc" ).options(
      Map("url" -> url ,
        "user" -> "root",
        "password" -> "root",
        "dbtable" -> "spark_sql_join1" )).load()

    val joinDF2 = sqlContext.read.format( "jdbc" ).options(
      Map ( "url" -> url ,
        "user" -> "root",
        "password" -> "root",
        "dbtable" -> "spark_sql_join2" )).load()

    ... ...
  }
}

　　后续代码都在上面... ...处。

二、DataFrame对象上Action操作

1、`show`：展示数据

　　以表格的形式在输出中展示jdbcDF中的数据，类似于select * from spark_sql_test的功能。
　　show方法有四种调用方式，分别为，
（1）show
　　只显示前20条记录。
　　示例：

jdbcDF.show

　　结果：
　　

（2）show(numRows: Int)
　　显示numRows条
　　示例：

jdbcDF.show(3)

　　结果：
　　

（3）show(truncate: Boolean)
　　是否最多只显示20个字符，默认为true。
　　示例：

jdbcDF.show(true)
jdbcDF.show(false)

　　结果：
　　

（4）show(numRows: Int, truncate: Boolean)
　　综合前面的显示记录条数，以及对过长字符串的显示格式。
　　示例：

jdbcDF.show(3, false)

　　结果：
　　

2、`collect`：获取所有数据到数组

　　不同于前面的show方法，这里的collect方法会将jdbcDF中的所有数据都获取到，并返回一个Array对象。

jdbcDF.collect()

　　结果如下，结果数组包含了jdbcDF的每一条记录，每一条记录由一个GenericRowWithSchema对象来表示，可以存储字段名及字段值。
　　

3、`collectAsList`：获取所有数据到List

　　功能和collect类似，只不过将返回结构变成了List对象，使用方法如下

jdbcDF.collectAsList()

　　结果如下，
　　

4、`describe(cols: String*)`：获取指定字段的统计信息

　　这个方法可以动态的传入一个或多个String类型的字段名，结果仍然为DataFrame对象，用于统计数值类型字段的统计值，比如count, mean, stddev, min, max等。
　　使用方法如下，其中c1字段为字符类型，c2字段为整型，c4字段为浮点型

jdbcDF .describe("c1" , "c2", "c4" ).show()

　　结果如下，
　　

5、`first, head, take, takeAsList`：获取若干行记录

　　这里列出的四个方法比较类似，其中
　　（1）first获取第一行记录
　　（2）head获取第一行记录，head(n: Int)获取前n行记录
　　（3）take(n: Int)获取前n行数据
　　（4）takeAsList(n: Int)获取前n行数据，并以List的形式展现
　　以Row或者Array[Row]的形式返回一行或多行数据。first和head功能相同。
　　take和takeAsList方法会将获得到的数据返回到Driver端，所以，使用这两个方法时需要注意数据量，以免Driver发生OutOfMemoryError

　　使用和结果略。

二、DataFrame对象上的条件查询和join等操作

　　以下返回为DataFrame类型的方法，可以连续调用。

1、where条件相关

（1）where(conditionExpr: String)：SQL语言中where关键字后的条件
　　传入筛选条件表达式，可以用and和or。得到DataFrame类型的返回结果，
　　示例：

jdbcDF .where("id = 1 or c1 = 'b'" ).show()

　　结果，
　　

（2）filter：根据字段进行筛选
　　传入筛选条件表达式，得到DataFrame类型的返回结果。和where使用条件相同
　　示例：

jdbcDF .filter("id = 1 or c1 = 'b'" ).show()

　　结果，
　　

2、查询指定字段

（1）select：获取指定字段值
　　根据传入的String类型字段名，获取指定字段的值，以DataFrame类型返回
　　示例：

jdbcDF.select( "id" , "c3" ).show( false)

　　结果：
　　

　　还有一个重载的select方法，不是传入String类型参数，而是传入Column类型参数。可以实现select id, id+1 from test这种逻辑。

jdbcDF.select(jdbcDF( "id" ), jdbcDF( "id") + 1 ).show( false)

　　结果：
　　

　　能得到Column类型的方法是apply以及col方法，一般用apply方法更简便。

（2）selectExpr：可以对指定字段进行特殊处理
　　可以直接对指定字段调用UDF函数，或者指定别名等。传入String类型参数，得到DataFrame对象。
　　示例，查询id字段，c3字段取别名time，c4字段四舍五入：

jdbcDF .selectExpr("id" , "c3 as time" , "round(c4)" ).show(false)

　　结果，
　　

（3）col：获取指定字段
　　只能获取一个字段，返回对象为Column类型。
　　val idCol = jdbcDF.col(“id”)果略。

（4）apply：获取指定字段
　　只能获取一个字段，返回对象为Column类型
　　示例：

val idCol1 = jdbcDF.apply("id")
val idCol2 = jdbcDF("id")

　　结果略。

（5）drop：去除指定字段，保留其他字段
　　返回一个新的DataFrame对象，其中不包含去除的字段，一次只能去除一个字段。
　　示例：

jdbcDF.drop("id")
jdbcDF.drop(jdbcDF("id"))

　　结果：
　　

3、limit

　　limit方法获取指定DataFrame的前n行记录，得到一个新的DataFrame对象。和take与head不同的是，limit方法不是Action操作。

jdbcDF.limit(3).show( false)

　　结果，
　　

4、order by

（1）orderBy和sort：按指定字段排序，默认为升序
　　示例1，按指定字段排序。加个-表示降序排序。sort和orderBy使用方法相同

jdbcDF.orderBy(- jdbcDF("c4")).show(false)
// 或者
jdbcDF.orderBy(jdbcDF("c4").desc).show(false)

　　结果，
　　

　　示例2，按字段字符串升序排序

jdbcDF.orderBy("c4").show(false)

　　结果，
　　

（2）sortWithinPartitions
　　和上面的sort方法功能类似，区别在于sortWithinPartitions方法返回的是按Partition排好序的DataFrame对象。

5、group by

（1）groupBy：根据字段进行group by操作
　　groupBy方法有两种调用方式，可以传入String类型的字段名，也可传入Column类型的对象。
　　使用方法如下，

jdbcDF .groupBy("c1" )
jdbcDF.groupBy( jdbcDF( "c1"))

（2）cube和rollup：group by的扩展
　　功能类似于SQL中的group by cube/rollup，略。

（3）GroupedData对象
　　该方法得到的是GroupedData类型对象，在GroupedData的API中提供了group by之后的操作，比如，

max(colNames: String*)方法，获取分组中指定字段或者所有的数字类型字段的最大值，只能作用于数字型字段
min(colNames: String*)方法，获取分组中指定字段或者所有的数字类型字段的最小值，只能作用于数字型字段
mean(colNames: String*)方法，获取分组中指定字段或者所有的数字类型字段的平均值，只能作用于数字型字段
sum(colNames: String*)方法，获取分组中指定字段或者所有的数字类型字段的和值，只能作用于数字型字段
count()方法，获取分组中的元素个数

　　运行结果示例：
　　count
　　

　　max
　　

　　这里面比较复杂的是以下两个方法，
agg，该方法和下面介绍的类似，可以用于对指定字段进行聚合操作。

pivot

6、distinct

（1）distinct：返回一个不包含重复记录的DataFrame
　　返回当前DataFrame中不重复的Row记录。该方法和接下来的dropDuplicates()方法不传入指定字段时的结果相同。
　　示例：

jdbcDF.distinct()

　　结果，
　　

（2）dropDuplicates：根据指定字段去重
　　根据指定字段去重。类似于select distinct a, b操作
　　示例：

jdbcDF.dropDuplicates(Seq("c1"))

　　结果：
　　

7、聚合

　　聚合操作调用的是agg方法，该方法有多种调用方式。一般与groupBy方法配合使用。
　　以下示例其中最简单直观的一种用法，对id字段求最大值，对c4字段求和。

jdbcDF.agg("id" -> "max", "c4" -> "sum")

　　结果：
　　

8、union

　　unionAll方法：对两个DataFrame进行组合
　　类似于SQL中的UNION ALL操作。
　　示例：

jdbcDF.unionALL(jdbcDF.limit(1))

　　结果：
　　

9、join

　　重点来了。在SQL语言中用得很多的就是join操作，DataFrame中同样也提供了join的功能。
　　接下来隆重介绍join方法。在DataFrame中提供了六个重载的join方法。
（1）、笛卡尔积

joinDF1.join(joinDF2)

（2）、using一个字段形式
　　下面这种join类似于a join b using column1的形式，需要两个DataFrame中有相同的一个列名，

joinDF1.join(joinDF2, "id")

　　joinDF1和joinDF2根据字段id进行join操作，结果如下，using字段只显示一次。
　　

（3）、using多个字段形式
　　除了上面这种using一个字段的情况外，还可以using多个字段，如下

joinDF1.join(joinDF2, Seq("id", "name")）

（4）、指定join类型
　　两个DataFrame的join操作有inner, outer, left_outer, right_outer, leftsemi类型。在上面的using多个字段的join情况下，可以写第三个String类型参数，指定join的类型，如下所示

joinDF1.join(joinDF2, Seq("id", "name"), "inner"）

（5）、使用Column类型来join
　　如果不用using模式，灵活指定join字段的话，可以使用如下形式

joinDF1.join(joinDF2 , joinDF1("id" ) === joinDF2( "t1_id"))

　　结果如下，
　　

（6）、在指定join字段同时指定join类型
　　如下所示

joinDF1.join(joinDF2 , joinDF1("id" ) === joinDF2( "t1_id"), "inner")

10、获取指定字段统计信息

　　stat方法可以用于计算指定字段或指定字段之间的统计信息，比如方差，协方差等。这个方法返回一个DataFramesStatFunctions类型对象。
　　下面代码演示根据c4字段，统计该字段值出现频率在30%以上的内容。在jdbcDF中字段c1的内容为"a, b, a, c, d, b"。其中a和b出现的频率为2 / 6，大于0.3

jdbcDF.stat.freqItems(Seq ("c1") , 0.3).show()

　　结果如下：
　　

11、获取两个DataFrame中共有的记录

　　intersect方法可以计算出两个DataFrame中相同的记录，

jdbcDF.intersect(jdbcDF.limit(1)).show(false)

　　结果如下：
　　

12、获取一个DataFrame中有另一个DataFrame中没有的记录

　　示例：

jdbcDF.except(jdbcDF.limit(1)).show(false)

　　结果如下，
　　

13、操作字段名

（1）withColumnRenamed：重命名DataFrame中的指定字段名
　　如果指定的字段名不存在，不进行任何操作。下面示例中将jdbcDF中的id字段重命名为idx。

jdbcDF.withColumnRenamed( "id" , "idx" )

　　结果如下：
　　

（2）withColumn：往当前DataFrame中新增一列
　　whtiColumn(colName: String , col: Column)方法根据指定colName往DataFrame中新增一列，如果colName已存在，则会覆盖当前列。
　　以下代码往jdbcDF中新增一个名为id2的列，

jdbcDF.withColumn("id2", jdbcDF("id")).show( false)

　　结果如下，
　　

14、行转列

　　有时候需要根据某个字段内容进行分割，然后生成多行，这时可以使用explode方法
　　下面代码中，根据c3字段中的空格将字段内容进行分割，分割的内容存储在新的字段c3_中，如下所示

jdbcDF.explode( "c3" , "c3_" ){time: String => time.split( " " )}

　　结果如下，
　　

15、其他操作

　　API中还有na, randomSplit, repartition, alias, as方法，待后续补充。

三、DataFrame对象上的结构类操作

四、DataFrame对象上的输出操作

五、DataFrame对象上的RDD操作

六、DataFrame对象上的未归类操作

转载于:https://www.cnblogs.com/wuyida/p/6300215.html

你可能感兴趣的:(Spark-SQL之DataFrame操作大全)

【数据结构】栈和队列加油，旭杏数据结构 java 开发语言
一、栈1.1栈的概念以及结构栈：一种特殊的线性表，其只允许在固定的一端进行插入和删除元素的操作，进行数据插入和删除操作的一端称为栈顶，另一端称为栈底。栈中的数据元素遵守后进先出的原则。压栈：栈的插入操作叫做进栈/压栈/入栈，入数据在栈顶出栈：栈的删除操作叫做出栈，出数据在栈顶1.2栈的实现栈的实现一般可以使用数组或者链表实现，相对而言数组的结构实现更加优一些，因为数组在尾上插入数据的代价比较小。二
java数组 TwitCoder java 算法
目录一、数组概念二、数组的声明与初始化三、数组操作示例四、数组属性与注意事项五、内存结构分析六、常见操作七、二维数组八、稀疏数组一、数组概念数组是Java中用于存储相同类型数据的有序集合，具有以下特性：类型一致性：所有元素必须属于同一数据类型有序性：元素按顺序排列，通过索引访问长度固定：创建后无法改变容量二、数组的声明与初始化声明数组//推荐写法int[]numbers;初始化方式：动态初始化nu
python网格插值站点_在python中，在二维零网格上两点之间插值一条值线 weixin_39965490 python网格插值站点
TLDR:在2dnumpy数组中找到2个点后，如何在0数组中在它们之间插值一条1行？在上下文：目前我正在尝试从二值化的医学图像数据(0和1)对一个3d数组执行2d操作。最终目标是在填充体素/像素(即第一个和最后一个实例)的起点和终点之间添加一条1s的线。在为此，我使用SimpleITK分割一行，然后将其转换为numpy数组。在其他示例之后，我编写了返回一组数组的函数，这些数组显示填充(1)个像素和
地理数据中的分辨率转换木叶清风666 地理信息数据处理 matlab python 开发语言
数据分辨率问题气象海洋数据在实际应用中，常常涉及到重采样，即分辨率的提高或降低等操作。本文提供了matlab以及python的样例程序，以降低（网格平均）或提高（线性插值）数据的分辨率。1.高分辨率——>低分辨率可以使用循环逐个网格进行操作,但循环次数过多,存在效率低下的问题。%---需要的分辨率0.25°,以及经纬度网格点deg=0.25;lat_era=16:deg:47.75;lon_era
解决注入mapper报红的问题 Jyannis spring Spring Boot spring mybatis spring boot java bean
在spring系列集成mybatis时，我们经常遇到这样的问题：明明注入没有问题，但是intellijidea会报红。这是因为我们没有手动在代码里把mapper接口注入spring容器中，而@Autowired注入方式默认要求注入的对象必须是在spring容器中存在的。所以idea认为这里的userMapper不存在，而用户（我们）选择注入，是一种错误操作，就报红。那么怎么解决这个问题呢？以下提供
Storyboard 之segue用法总结月未央 iOS学习总结 iOS
Storyboard的好玩之处在于它可以帮我们省略了很多要手动写的代码，其中segue的功劳功不可没，现总结一下学习心得，若有错误之处，望指正。创建工程，选择SingleViewApplication，给工程起个名字，这里是SegueDemo，注意要把下面的UseStoryboard选项勾选上，我使用ARC，这里可以随意。点选工程文件中的MainStoryboard.storyboard文件，可以
mysql迁移docker_docker迁入迁出mysql 困困斐 mysql迁移docker
docker迁出mysql数据库测试环境：docker服务器mysql服务器IP192.168.163.19192.168.163.16操作系统CentOS7.8CentOS7.8docker版本Docker18.09.9/数据库版本MySQL8.0.22MySQL8.0.221.查看docker相关情况[root@docker-test/data/mysql/data]$dockerps启动my
GIT日常记录码农汉子 elasticsearch 大数据搜索引擎
sudogitclonehttps://gitee.com/yiketalks/yike_admin.git命令行下载项目命令（进入本地项目地址下）//查看远程仓库地址gitremote-v//切换远程仓库gitremoteset-urloriginhttps://gitee.com/yike_php/yike_work.git分支操作gitbranch//显示分支一览表，同时确认当前所在的分支1
计算机组成原理（知识点+易错点，超详细）|第四章指令系统 sailing_c 计算机组成原理计算机组成原理学习笔记
目录4.1指令系统4.1.1指令集体系结构4.1.2指令的基本格式4.1.3定长操作码指令格式4.1.4扩展操作码指令格式4.1.5指令的操作类型4.2指令的寻址方式4.2.1指令寻址和数据寻址4.2.2常见的数据寻址方式4.3程序的机器级代码表示4.3.1常用汇编指令介绍4.3.2选择语句的机器级表示4.3.3循环语句的机器级表示4.3.4过程调用的机器级表示4.4CISC和RISC的基本概念4
云原生：K8s（Kubernetes）高频典型面试题汇总老舅的火箭爱扫地云原生 kubernetes 容器
1.简述etcd及其特点？答：etcd是CoreOS团队发起的开源项目，是一个管理配置信息和服务发现（servicediscovery）的项目，它的目标是构建一个高可用的分布式键值（key-value）数据库，基于Go语言实现。特点：l简单：支持REST风格的HTTP+JSONAPIl安全：支持HTTPS方式的访问l快速：支持并发1k/s的写操作l可靠：支持分布式结构，基于Raft的一致性算法，R
Hive----Hive进阶操作(三) HIVE 特殊分隔符处理 XiaodunLP Hive
HIVE特殊分隔符处理补充：hive读取数据的机制：1、首先用InputFormat的一个具体实现类读入文件数据，返回一条一条的记录（可以是行，或者是你逻辑中的“行”）2、然后利用SerDe的一个具体实现类，对上面返回的一条一条的记录进行字段切割Hive对文件中字段的分隔符默认情况下只支持单字节分隔符，如果数据文件中的分隔符是多字符的，如下所示：01||huangbo02||xuzheng03||
Docker 中 MySQL 迁移策略（单节点） Java咩 docker mysql 容器
目录一、简介二、操作流程2.1进入mysql容器2.2导出MySQL数据2.3.将导出的文件复制到宿主机2.4创建DockerCompose配置2.5启动新的Docker容器2.6导入数据到新的容器2.7验证数据2.8删除旧的容器（删除操作需慎重）三、推荐配置四、写在后面一、简介本人发现自己Docker中Mysql的时区不对，导致每次连接数据库都需要设置时区，所以考虑进行数据库迁移，重新搭建一个正
鸿蒙开发2024【面试题库】讲解，近期需要面试的可千万别错过！鸿蒙系统小能手Mr.Li 鸿蒙开发 harmonyos 面试鸿蒙 OpenHarmony 鸿蒙系统程序员移动开发
1.请简述鸿蒙OS与AndroidOS的主要区别是什么？设备兼容性：鸿蒙OS是一款面向各种设备的分布式操作系统，支持手机、平板电脑、智能手表、智能家居、汽车等多种设备类型，并能在这些设备之间实现无缝切换和共享数据。而Android系统则主要用于移动设备，如手机和平板电脑。系统架构：鸿蒙OS采用分布式技术架构，通过分布式技术实现多设备间的协作和数据共享，更加灵活、安全、高效。而Android则采用单
前端 - js - - 防抖和节流 cv高级工程师YKY vue.js 前端 javascript
1、防抖短时间内重复执行相同操作时只执行最后一次常见场景：浏览器输入文字后下面会有模糊提示实现思路：延时器控制事件在几秒后执行每次触发事件时都会重置延时器constfn=()=>{//先定义timeout避免第一次触发时clearTimeout报错lettimeout;//每次触发事件重置延时器clearTimeout(timeout)//规定一秒后再执行timeout=setTimeout(()
HarmonyNext实战：基于ArkTS的高性能3D渲染引擎开发 harmonyos-next
HarmonyNext实战：基于ArkTS的高性能3D渲染引擎开发引言3D渲染引擎是现代图形应用的核心，广泛应用于游戏开发、虚拟现实、工业设计等领域。HarmonyNext作为新一代操作系统，提供了强大的图形处理能力，而ArkTS作为其开发语言，能够帮助开发者高效实现高性能的3D渲染引擎。本文将详细讲解如何在HarmonyNext平台上使用ArkTS开发一个3D渲染引擎。我们将从3D渲染的基本原理
HarmonyNext实战：基于ArkTS的高性能区块链应用开发 harmonyos-next
HarmonyNext实战：基于ArkTS的高性能区块链应用开发引言区块链技术以其去中心化、不可篡改和透明性等特点，正在金融、供应链、物联网等领域掀起革命性变革。HarmonyNext作为新一代操作系统，提供了强大的分布式计算和网络通信能力，而ArkTS作为其开发语言，能够帮助开发者高效实现高性能的区块链应用。本文将详细讲解如何在HarmonyNext平台上使用ArkTS开发一个区块链应用。我们将
HarmonyNext实战：基于ArkTS的分布式数据同步应用开发 harmonyos-next
HarmonyNext实战：基于ArkTS的分布式数据同步应用开发引言在分布式系统中，数据同步是一个核心问题，尤其是在多设备协同的场景下。HarmonyNext作为新一代操作系统，提供了强大的分布式能力，而ArkTS作为其开发语言，能够帮助开发者高效实现分布式数据同步。本文将详细讲解如何在HarmonyNext平台上使用ArkTS开发一个分布式数据同步应用。我们将从分布式数据同步的基本原理入手，逐
Ubuntu常用命令欲登绝巘 ubuntu linux 运维
以下是一些常用的Ubuntu命令，可以帮助您在终端中进行各种任务和操作：文件和目录操作:ls：列出当前目录下的文件和目录。cd：切换目录。pwd：显示当前工作目录的路径。mkdir：创建新目录。rm：删除文件或目录。cp：复制文件和目录。mv：移动文件和目录。系统信息和管理:uname-a：显示系统信息，包括内核版本和硬件架构。top：实时显示系统资源使用情况和运行进程。free：显示内存使用情况
IP 证书：为什么 2025 年所有云服务器都必须安装的 “数字防火墙”？ ssl证书
IP证书作为一种关键的安全工具，已成为所有云服务器都必须安装的“数字防火墙”。一、保障数据传输安全数据在云服务器与用户之间传输时，极易被黑客盯上。IP证书采用SSL协议对数据进行加密，就像给数据穿上了一层密不透风的铠甲。无论是用户登录信息、支付数据，还是企业的商业机密，加密后第三方难以窃听和篡改。例如，当电商用户在云服务器支持的平台上进行支付操作，IP证书能确保支付信息安全传输，避免被黑客窃取。同
【C++修炼之路】C++动态内存管理 f狐0狸x 【c++修炼之路】c++开发语言 c语言数据结构
️专栏：【C++修炼之路】主页：f狐o狸x“于高山之巅，方见大河奔涌；于群峰之上，更觉长风浩荡”目录一、C++内存管理方式1.1new/delete处理内置类型1.2new/delete处理自定义类型二、operatornew与operatordelete函数三、new和delete的实现原理3.1内置类型3.2自定义类型new的原理delete的原理newT[N]的原理delete[]的原理C
【数据结构实战篇】深入浅出：C语言中的栈数据结构 f狐0狸x 【数据结构实战篇】数据结构 c语言栈算法数据挖掘
️专栏：【数据结构实战篇】主页：f狐o狸x前面几期内容里面我们详细的了解了数据结构中链表的结构，现在我们在来了解一下栈的结构一、栈1.1栈的概念及结构栈：一种特殊的线性表，其只允许在固定的一端进行插入和删除元素操作。进行数据插入和删除操作的一端称为栈顶，另一端称为栈底。栈中的数据元素遵守后进先出LIFO（LastInFirstOut）的原则。压栈：栈的插入操作叫做进栈/压栈/入栈，入数据在栈顶。出
C++和C语言的区别有哪些残余的记忆 c++c语言数据结构开发语言
C++和C语言是两种不同的编程语言，虽然它们有许多相似之处，但是它们之间也存在着很多区别。本文将介绍C++和C语言之间的一些主要区别。1.面向对象编程C++是一种面向对象编程语言，相较于C语言，其具有更多的特性。面向对象编程（OOP）作为一种编程方法论，通过对数据进行封装、继承、多态等操作，来实现程序的灵活性和可维护性。C++提供了很多面向对象编程的特性，例如类、继承、多态等。这些特性能够让程序员
Ubuntu 常用指令手册时光旅人01号 ubuntu linux 运维神经网络深度学习服务器
文件/目录操作1.基础操作#递归复制目录（含子目录）cp-rsource_dir/target_dir/#递归删除目录（强制删除不提示）rm-rfdir_name/#查看当前路径pwd#创建多级目录mkdir-pparent_dir/child_dir2.权限管理#修改文件权限（755=rwxr-xr-x）chmod755filename#递归修改目录权限chmod-R755dir_name/#修
健康养生：开启高品质生活之门 yy0821yy 生活
健康是人生最宝贵的财富，而养生则是守护健康的智慧之选。在快节奏的现代生活中，掌握健康养生之道，能让我们精力充沛地面对每一天。饮食养生首当其冲。我们应追求均衡饮食，确保每餐都有适量的碳水化合物、蛋白质、脂肪、维生素和矿物质。主食多选择粗粮，如燕麦、玉米等，它们富含膳食纤维，能促进肠道蠕动。优质蛋白质来源包括豆类、鱼类、鸡胸肉等，它们是身体修复和生长的基石。减少高油、高盐、高糖食物的摄入，多吃新鲜的蔬
IntelliJ IDEA 2023.3.1安装指南从下载到配置的完整教程（附资源下载）心灵宝贝 intellij-idea java ide
安装IntelliJIDEA2023.3.1非常简单，以下是详细的安装步骤，适用于Windows、macOS和Linux系统。1.下载IntelliJIDEAIntelliJIDEA下载链接：https://pan.quark.cn/s/3ad975664934选择适合你的操作系统的版本：Ultimate版：功能全面，支持所有开发语言和框架（需付费）。Community版：免费版，适合Java和K
2025-03-15 学习记录--C/C++-PTA 练习3-4 统计字符小呀小萝卜儿学习-C/C++学习 c语言
合抱之木，生于毫末；九层之台，起于累土；千里之行，始于足下。一、题目描述⭐️练习3-4统计字符本题要求编写程序，输入10个字符，统计其中英文字母、空格或回车、数字字符和其他字符的个数。输入格式:输入为10个字符。最后一个回车表示输入结束，不算在内。输出格式:在一行内按照letter=英文字母个数,blank=空格或回车个数,digit=数字字符个数,other=其他字符个数的格式输出。输入样例:a
2025-03-13 学习记录--C/C++-PTA 练习2-9 整数四则运算小呀小萝卜儿学习-C/C++学习 c语言
合抱之木，生于毫末；九层之台，起于累土；千里之行，始于足下。一、题目描述⭐️练习2-9整数四则运算本题要求编写程序，计算2个正整数的和、差、积、商并输出。题目保证输入和输出全部在整型范围内。输入格式:输入在一行中给出2个正整数A和B。输出格式:在4行中按照格式“A运算符B=结果”顺序输出和、差、积、商。输入样例:32输出样例:3+2=53-2=13*2=63/2=1二、代码（C语言）⭐️#incl
python 中 Re库函数 re.search() weixin_43964993 python python
re.search(pattern,string,flags=0)在一个字符串中搜索匹配正则表达式的第一个位置，返回match对象pattern:正则表达式的字符串或原生字符串表示string:待匹配字符串flags:正则表达式使用时的控制标记常用标记说明re.I re.IGNORECASE忽略正则表达式的大小写，[A‐Z]能够匹配小写字符re.M re.MULTILINE正则表达式中的^操作
别猜了！华为新机竟把屏幕“拉面式”展开？这波操作连余承东都憋不住了！国货崛起华为
家人们，今天数码圈集体翻车了！之前全网都在赌华为3月20日要发“小胖子折叠屏”，结果人家余承东反手甩出个泳池变宽的视频，配文“1610大开想象”——好家伙，这哪是折叠屏啊？分明是让手机玩起了瑜伽，直接把屏幕“抻面条”式展开啊！一、折叠屏？我们都猜错啦！之前数码博主们信誓旦旦说新机是3:2比例小折叠，连苹果定制4:3屏的冷知识都搬出来了。结果华为反手一个泳池拉宽特效，把网友整不会了：合着这屏幕不是叠
pandas 读写excel jimox_ai pandas
在Python中，使用Pandas库读写Excel文件是一个常见的操作。Pandas提供了`read_excel`和`to_excel`方法来分别实现读取和写入Excel文件的功能。以下是一些基本的示例：###读取Excel文件```pythonimportpandasaspd#读取Excel文件df=pd.read_excel('path_to_your_excel_file.xlsx')#显示
springmvc 下 freemarker页面枚举的遍历输出杨白白 enum freemarker
spring mvc freemarker 中遍历枚举 1枚举类型有一个本地方法叫values（），这个方法可以直接返回枚举数组。所以可以利用这个遍历。 enum public enum BooleanEnum { TRUE(Boolean.TRUE, "是"), FALSE(Boolean.FALSE, "否");
实习简要总结 byalias 工作
来白虹不知不觉中已经一个多月了，因为项目还在需求分析及项目架构阶段，自己在这段时间都是在学习相关技术知识，现在对这段时间的工作及学习情况做一个总结：（1）工作技能方面大体分为两个阶段，Java Web 基础阶段和Java EE阶段 1）Java Web阶段在这个阶段，自己主要着重学习了 JSP, Servlet, JDBC, MySQL，这些知识的核心点都过了一遍，也
Quartz——DateIntervalTrigger触发器 eksliang quartz
转载请出自出处：http://eksliang.iteye.com/blog/2208559 一.概述 simpleTrigger 内部实现机制是通过计算间隔时间来计算下次的执行时间，这就导致他有不适合调度的定时任务。例如我们想每天的 1：00AM 执行任务，如果使用 SimpleTrigger，间隔时间就是一天。注意这里就会有一个问题，即当有 misfired 的任务并且恢复执行时，该执行时间
Unix快捷键 18289753290 unix Unix；快捷键;
复制，删除，粘贴： dd:删除光标所在的行 &nbs
获取Android设备屏幕的相关参数酷的飞上天空 android
包含屏幕的分辨率以及屏幕宽度的最大dp 高度最大dp TextView text = (TextView)findViewById(R.id.text); DisplayMetrics dm = new DisplayMetrics(); text.append("getResources().ge
要做物联网？先保护好你的数据蓝儿唯美数据
根据Beecham Research的说法，那些在行业中希望利用物联网的关键领域需要提供更好的安全性。在Beecham的物联网安全威胁图谱上，展示了那些可能产生内外部攻击并且需要通过快速发展的物联网行业加以解决的关键领域。 Beecham Research的技术主管Jon Howes说：“之所以我们目前还没有看到与物联网相关的严重安全事件，是因为目前还没有在大型客户和企业应用中进行部署，也就
Java取模（求余）运算随便小屋 java
整数之间的取模求余运算很好求，但几乎没有遇到过对负数进行取模求余，直接看下面代码： /** * * @author Logic * */ public class Test { public static void main(String[] args) { // TODO A
SQL注入介绍 aijuans sql注入
二、SQL注入范例这里我们根据用户登录页面 <form action="" > 用户名：<input type="text" name="username"><br/> 密码：<input type="password" name="passwor
优雅代码风格 aoyouzi 代码
总结了几点关于优雅代码风格的描述：代码简单：不隐藏设计者的意图，抽象干净利落，控制语句直截了当。接口清晰：类型接口表现力直白，字面表达含义，API 相互呼应以增强可测试性。依赖项少：依赖关系越少越好，依赖少证明内聚程度高，低耦合利于自动测试，便于重构。没有重复：重复代码意味着某些概念或想法没有在代码中良好的体现，及时重构消除重复。战术分层：代码分层清晰，隔离明确，
布尔数组百合不是茶 java 布尔数组
androi中提到了布尔数组; 布尔数组默认的是false, 并且只会打印false或者是true 布尔数组的例子; 根据字符数组创建布尔数组 char[] c = {'p','u','b','l','i','c'}; //根据字符数组的长度创建布尔数组的个数 boolean[] b = new bool
web.xml之welcome-file-list、error-page bijian1013 java web.xml servlet error-page
welcome-file-list 1.定义： <welcome-file-list> <welcome-file>login.jsp</welcome> </welcome-file-list> 2.作用：用来指定WEB应用首页名称。 error-page1.定义： <error-page&g
richfaces 4 fileUpload组件删除上传的文件 sunjing clear Richfaces 4 fileupload
页面代码 <h:form id="fileForm"> <rich:
技术文章备忘 bit1129 技术文章
Zookeeper http://wenku.baidu.com/view/bab171ffaef8941ea76e05b8.html http://wenku.baidu.com/link?url=8thAIwFTnPh2KL2b0p1V7XSgmF9ZEFgw4V_MkIpA9j8BX2rDQMPgK5l3wcs9oBTxeekOnm5P3BK8c6K2DWynq9nfUCkRlTt9uV
org.hibernate.hql.ast.QuerySyntaxException: unexpected token: on near line 1解决方案白糖_ Hibernate
文章摘自：http://blog.csdn.net/yangwawa19870921/article/details/7553181 在编写HQL时，可能会出现这种代码： select a.name,b.age from TableA a left join TableB b on a.id=b.id 如果这是HQL，那么这段代码就是错误的，因为HQL不支持
sqlserver按照字段内容进行排序 bozch 按照内容排序
在做项目的时候，遇到了这样的一个需求：从数据库中取出的数据集，首先要将某个数据或者多个数据按照地段内容放到前面显示，例如:从学生表中取出姓李的放到数据集的前面； select * fro
编程珠玑-第一章-位图排序 bylijinnan java 编程珠玑
import java.io.BufferedWriter; import java.io.File; import java.io.FileWriter; import java.io.IOException; import java.io.Writer; import java.util.Random; public class BitMapSearch {
Java关于==和equals chenbowen00 java
关于==和equals概念其实很简单，一个是比较内存地址是否相同，一个比较的是值内容是否相同。虽然理解上不难，但是有时存在一些理解误区，如下情况： 1、 String a = "aaa"; a=="aaa"; ==> true 2、 new String("aaa")==new String("aaa
[IT与资本]软件行业需对外界投资热情保持警惕 comsci it
我还是那个看法,软件行业需要增强内生动力,尽量依靠自有资金和营业收入来进行经营,避免在资本市场上经受各种不同类型的风险,为企业自主研发核心技术和产品提供稳定,温和的外部环境... 如果我们在自己尚未掌握核心技术之前,企图依靠上市来筹集资金,然后使劲往某个领域砸钱,然
oracle 数据块结构 daizj oracle 块数据块块结构行目录
oracle 数据块是数据库存储的最小单位，一般为操作系统块的N倍。其结构为：块头－－〉空行－－〉数据，其实际为纵行结构。块的标准大小由初始化参数DB_BLOCK_SIZE指定。具有标准大小的块称为标准块（Standard Block）。块的大小和标准块的大小不同的块叫非标准块（Nonstandard Block）。同一数据库中，Oracle9i及以上版本支持同一数据库中同时使用标
github上一些觉得对自己工作有用的项目收集 dengkane github
github上一些觉得对自己工作有用的项目收集技能类 markdown语法中文说明回到顶部全文检索 elasticsearch bigdesk elasticsearch管理插件回到顶部 nosql mapdb 支持亿级别map, list, 支持事务. 可考虑做为缓存使用 C
初二上学期难记单词二 dcj3sjt126com english word
dangerous 危险的 panda 熊猫 lion 狮子 elephant 象 monkey 猴子 tiger 老虎 deer 鹿 snake 蛇 rabbit 兔子 duck 鸭 horse 马 forest 森林 fall 跌倒；落下 climb 爬；攀登 finish 完成；结束 cinema 电影院；电影 seafood 海鲜；海产食品 bank 银行
8、mysql外键(FOREIGN KEY)的简单使用 dcj3sjt126com mysql
一、基本概念 1、MySQL中“键”和“索引”的定义相同，所以外键和主键一样也是索引的一种。不同的是MySQL会自动为所有表的主键进行索引，但是外键字段必须由用户进行明确的索引。用于外键关系的字段必须在所有的参照表中进行明确地索引，InnoDB不能自动地创建索引。 2、外键可以是一对一的，一个表的记录只能与另一个表的一条记录连接，或者是一对多的，一个表的记录与另一个表的多条记录连接。 3、如
java循环标签 Foreach shuizhaosi888 标签 java循环 foreach
1. 简单的for循环 public static void main(String[] args) { for (int i = 1, y = i + 10; i < 5 && y < 12; i++, y = i * 2) { System.err.println("i=" + i + " y="
Spring Security（05）——异常信息本地化 234390216 exception Spring Security 异常信息本地化
异常信息本地化 Spring Security支持将展现给终端用户看的异常信息本地化，这些信息包括认证失败、访问被拒绝等。而对于展现给开发者看的异常信息和日志信息（如配置错误）则是不能够进行本地化的，它们是以英文硬编码在Spring Security的代码中的。在Spring-Security-core-x
DUBBO架构服务端告警Failed to send message Response javamingtingzhao 架构 DUBBO
废话不多说，警告日志如下，不知道有哪位遇到过，此异常在服务端抛出(服务器启动第一次运行会有这个警告)，后续运行没问题，找了好久真心不知道哪里错了。 WARN 2015-07-18 22:31:15,272 com.alibaba.dubbo.remoting.transport.dispatcher.ChannelEventRunnable.run(84)
JS中Date对象中几个用法 leeqq JavaScript Date 最后一天
近来工作中遇到这样的两个需求 1. 给个Date对象，找出该时间所在月的第一天和最后一天 2. 给个Date对象，找出该时间所在周的第一天和最后一天需求1中的找月第一天很简单，我记得api中有setDate方法可以使用使用setDate方法前，先看看getDate var date = new Date(); console.log(date); // Sat J
MFC中使用ado技术操作数据库你不认识的休道人 sql mfc
1.在stdafx.h中导入ado动态链接库 #import"C:\Program Files\Common Files\System\ado\msado15.dll" no_namespace rename("EOF","end")2.在CTestApp文件的InitInstance()函数中domodal之前写::CoIniti
Android Studio加速 rensanning android studio
Android Studio慢、吃内存！启动时后会立即通过Gradle来sync & build工程。（1）设置Android Studio a) 禁用插件 File -> Settings... Plugins 去掉一些没有用的插件。比如：Git Integration、GitHub、Google Cloud Testing、Google Cloud
各数据库的批量Update操作 tomcat_oracle java oracle sql mysql sqlite
MyBatis的update元素的用法与insert元素基本相同，因此本篇不打算重复了。本篇仅记录批量update操作的 sql语句，懂得SQL语句，那么MyBatis部分的操作就简单了。　　注意：下列批量更新语句都是作为一个事务整体执行，要不全部成功，要不全部回滚。 MSSQL的SQL语句　WITH R AS（　　SELECT 'John' as name, 18 as
html禁止清除input文本输入缓存 xp9802 input
多数浏览器默认会缓存input的值，只有使用ctl+F5强制刷新的才可以清除缓存记录。如果不想让浏览器缓存input的值，有2种方法：方法一：在不想使用缓存的input中添加 autocomplete="off"; eg: <input type="text" autocomplete="off" name

Spark-SQL之DataFrame操作大全

一、DataFrame对象的生成

二、DataFrame对象上Action操作

1、show：展示数据

2、collect：获取所有数据到数组

3、collectAsList：获取所有数据到List

4、describe(cols: String*)：获取指定字段的统计信息

5、first, head, take, takeAsList：获取若干行记录

二、DataFrame对象上的条件查询和join等操作

1、where条件相关

2、查询指定字段

3、limit

4、order by

5、group by

6、distinct

7、聚合

8、union

9、join

10、获取指定字段统计信息

11、获取两个DataFrame中共有的记录

12、获取一个DataFrame中有另一个DataFrame中没有的记录

13、操作字段名

14、行转列

15、其他操作

三、DataFrame对象上的结构类操作

四、DataFrame对象上的输出操作

五、DataFrame对象上的RDD操作

六、DataFrame对象上的未归类操作

你可能感兴趣的:(Spark-SQL之DataFrame操作大全)

1、`show`：展示数据

2、`collect`：获取所有数据到数组

3、`collectAsList`：获取所有数据到List

4、`describe(cols: String*)`：获取指定字段的统计信息

5、`first, head, take, takeAsList`：获取若干行记录