:Concerto

Spark-核心常见面试题集锦(RDD、shuffle类型、数据倾斜优化、小文件问题、性能调优、streaming流程、checkpoint机制)

1 Spark的任务执行流程

第一种standalone模式

整体：driver中有sparkcontext，RDD DAG和DAGScheduler和taskscheduler，master是资源管理，worker中executor，executor中有多个task
构建一个application环境，driver创建sparkcontext
sparkcontext中的taskcheduler连接到集群管理器master申请资源，此时worker也会向master定期发送心跳信息以及executor的状态
master根据sparkcontext的资源申请和worker的心跳信息决定在哪一个worker分配资源，被选中的worker启动standaloneexecutorbackend并向sparkcontext反向注册，这样driver就知道哪些excutor是可以进行服务的
sparkcontext开始执行代码，spark RDD通过transaction操作，形成了RDD血缘关系，构建DAG有向无环图，最后遇到action算子调用，触发job并调度，生成两个调度器DAGschedule和taskscheduler。
DAGschedule负责分解stage，主要将job切分为若干个stage，具体划分：窄依赖RDD会被划分到一个stage中，宽依赖会被划分多个stage，为并为每一个stage组装一批task组成taskset

宽依赖：指的是多个子RDD的分区会依赖同一个父RDD的分区
窄依赖：每一个父RDD的分区最多被一个子RDD的分区使用
job,stage,task的关系：一个job含有多个stage，一个stage含有多个task，stage的数量=宽依赖数量+1

然后将taskset交给taskscheduler，taskscheduler会将taskset封装成tasksetmanager加入到调度队列中，调度过程中schedulerbackend负责提供可用资源，schedulerbackend也会定期询问taskscheduler是否有任务要运行。最后taskscheduler将taskset分配给到worker。
worker中的excutor执行进行反序列化，会将driver发送过来的taskset封装进去一个taskrunner的线程，放到本地线程池，调度我们的作业
资源注销

第二种yarn cluster模式

yarn集群中，driver是运行在applicationmaster上的，applicationmaster进程同时负责驱动application和从yarn申请资源。
client向yarn中提交应用程序，
resourcemanager在某一个nodemanager中启动container，并将applicationmaster分配到该nodemanager上
nodemanager收到resourcemanager分配后，启动application master进行sparkcontext的初始化，这个时候nodemanager相当于driver
applicationmaster向resourcemanager注册，用户可以直接通过applicationmaster查看应用程序的与运行状态，然后它将采用的轮询的方式通过RPC协议为各个任务申请资源，并监控它们的运行状态直到结束
申请到资源的applicationmaster向nodemanager进行通信，要求nodemanager启动coarsegrainedexecutorbackend并向applicationmaster中sparkcontext注册并申请
applicationmaster中sparkcontext分配task给coarsegrainedexecutorbackend执行
excutor向nodemanager上的applicationmaster注册汇报并完成相应的任务。
applicationmaster和resourcemanager申请注销并关闭自己

作业调度

driver的主要是初始化sparkcontext对象，准备运行所需要的上下文
一方面和applicationmaster的RPC连接，通过applicationmaster申请资源
另一方面根据业务逻辑调度任务，将任务下放到空闲的excutor上

第三种 yarn-client和yarn-cluster的区别

yarn-cluster模式下，driver在applicationmaster中负责资源申请以及监督作业。用户提交作业，可以关闭client，作业会继续在yarn运行，但是不适合运行交互类型的作业
yarn-client模式下，applicationmaster仅仅向yarn请求executor，client会和container通信，yarn不能离开

2 spark的特点

spark实现了DAG执行引擎，可以基于内存处理数据流。与MR基于磁盘比快了很多
计算的中间结果是存在于内存中的,减少低效磁盘io。和hadoop中间写入磁盘比快
jvm优化，MR是一个task启动一个jvm，spark是一个executor启动jvm，task是在线程复用的
基于DAG高效的调度算法
缓存方式：cache

易用

shell/python/scala/java都可以使用

通用

sparksql，spark streaming，spark core等，还有spark mllib和图计算

兼容性

和yarn和mesos作为资源管理和调度，和其他开源产品融合使用

3 spark源码的任务调度

DAG产生：叫做有向无环图，原始的RDD通过一系列的转换就形成了DAG，根据依赖关系将DAG划分为不同的stage，对于宽依赖来说，由于存在shuffle，因此只能在parent RDD处理后完成。

宽依赖：指的是多个子RDD的分区会依赖同一个父RDD的分区
窄依赖：每一个父RDD的分区最多被一个子RDD的分区使用

4 spark的yarn-cluster涉及的参数有哪些

5 spark处理数据的具体流程/如何从kafka读数据/双流join/怎么保证数据不丢失/数据持久化/exactly once

spark streaming 处理数据流程

待补充

6 spark的join分类

broadcast hash join：使用小表很小的

broadcast阶段：将小表广播分发到大表的分区，先给到driver，driver再统一给到executor
hash join阶段：大表的分区在内存中和executor上的小表join

shuffle hash join：按照相同join key进行分区，将大表划分为小表的join，再利用集群并行化处理。

shuffle阶段：分别将两张表按照join key进行分区，相同的分布到同一个节点。默认分区200
hash join：在分区节点执行单机hash join

sort-merge join：适用于两个表都特别大

shuffle阶段：按照相同join key进行分区，散布到集群，利用分布式处理
sort阶段：对单个分区节点的两张表，进行排序
merge阶段：对排好序的两张分区表进行join操作

7 map join 原理

将小份RDD直接通过collect算子拉取到driver加载到内存中，对其创建一个broadcast变量。
对另一个RDD执行map类算子，并从broadcast变量获取较少的RDD全量数据，与当前RDDkey值相同的话，就直接进行join
常用场景：

小表建立索引，然后建立map表，用rdd.collectAsMap算子，但是value不可重复，需要另算。
还得注意driver的节点内存充足。可以在任务提交的时候参数写大一些。
executor需要处理广播过来的数据，因此也需要确保executor内存足够。

8 什么时候会产生spark shuffle？

repartition类的操作：repartition、coalesce、repartitionAndSortWithinPartitions(分组然后排序)
bykey：reducebykey、groupbykey、sortbykey
join：join、cogroup(计算区内元素个数)

9 spark shuffle以及优缺点

hash shuffle

取余操作

优化过后的hashshuffle

合并机制是使用复用butter，相同的key值的放在同一个butter缓冲中，然后写入封装成core为单位的本地磁盘文件，对应参数：spark.shuffle.consolidateFiles
优点：和sort的优化比是省略不必要的排序开销以及排序内存开销
缺点：写到磁盘本地文件的话，会带来一定的磁盘以及文件系统的开销，以及和内存交互，对内存也是有压力的。

sort shuffle

数据写入内存缓冲，并对key值进行排序，内存满了后分批溢写入磁盘
- 合并操作，最后的task合并刚刚的磁盘文件并写道最终文件磁盘，并创建单独的索引文件

bypass sortshuffle

条件：小于默认分区200+不是聚合类的算子
优化过后的hashshuffle+最终的合并
合并：最后的task合并刚刚的磁盘文件并写道最终文件磁盘，并创建单独的索引文件。

tungsten sort shuffle

条件：没有聚合操作+PartitionId<2的24次方+Serializer序列化器支持relocation序列化值重定向
排序+内存溢写磁盘
优点：使用UnSafe API不用进行序列化以及反序列化
缺点：map端以及记录本身的排序耗性能

10 spark数据倾斜

表现：不同key值数量导致不同task的数据量处理问题，有的task显示很慢或者直接表现为内存溢出OOM
避免shuffle过程：map join的办法，使join在map段解决
增大key值粒度
过滤倾斜的key值或者单独处理倾斜的key值后续放回去
提高reduce的并行度，增加reducetask的数量，使每一个task处理的数据量少了，shuffle的算子中可以传入一个并行度的设置参数，例如reducebykey(500)

并行度：各个stage的task数量，可以说是等于RDD的一个分区

使用随机key实现双重聚合

给每个key值添加上随机数前缀，进行第一次聚合
去掉key值得随机数前缀再次聚合
适用：join的shuffle操作

11 spark的stage的划分

stage的产生：job按照RDD之间的依赖关系分为宽依赖，由DAGscheduler划分为一个stage
result stage：使action操作后得到的计算结果
shuffle map stage：在shuffle之前出现

12 spark的内存模型

堆内内存：默认堆内内存

executor内存：用户存放shuffle，sort等计算过程中的中间临时文件
storage内存：存放spark的cache的数据，例如RDD的缓存，broadcast的数据
用户内存：主要存储RDD转换操作所需要的数据，RDD依赖
预留内存：系统预留内存，用来存储spark的内部对象

堆外内存：

表示分配在java虚拟机的堆以外的内存，表示spark是可以直接操作操作系统的内存的，减少了不必要的开销体现在可以精确的申请和释放，而不是jvm内存清理的不明确时间点。

13 spark的RDD、DataFrame、DateSet和DateStream区别

RDD：分布式弹性数据集
DateFrame：

与RDD的区别是，前者带有schema元信息，即二位数据集的每一列都带有名称以及类型。
允许不用必须去注册临时表或者生成sql表达式
拥有内存管理[二进制存储]和查询优化器
创建：使用toDF/createdataframe创建DateFrame

DataSet：

是DateFrame的拓展，由更好的lambda函数能力以及sparksql的优化执行引擎
比DateFrame比，是可以知道字段以及字段类型的
类型和比DateFrame比是安全的，是强类型Dataset[Car]

spark SQL

SQL查询和spark程序无缝连接使用
sql进行语法解释器、分析器以及优化器都可以定义

14 spark的容错机制

spark是记录更新的方式，即血缘容错
血缘容错记录了较粗粒度的操作：例如filter、map、join，当rdd的部分分区数据丢失的时候，可以通过血缘来重新运算以及恢复丢失的分区。
如果是窄依赖：只要把丢失的父依赖的分区重新计算即可；但是是宽依赖：需要恢复父依赖的分区并且重新计算，开销会大。
因此有了checkpoint机制：将内存的变化持久化到磁盘持久存储，可以把RDD保存在hdfs的namenode中元数据edit log中并刷新到磁盘fsimage，斩断所需的依赖链，如果没有才往前追溯。
一般可以通过冗余数据和日志记录更新操作。
cache机制：将RDD的结果写入内存，运行后缓存自动消失
persist机制：将结果写入磁盘

15 sparkbatchsize中小文件问题

窄依赖计算结果会出现大量小文件，因此采用coalese方法和repartition方法最后返回一个特定分区的RDD。
降低spark的并行度，生成的文件就会少一些
新增一个任务专门合并小文件

将原来任务写道一个临时分区，在其一个并行度为1的文件
要用group by的原因是利用宽依赖形成一个分区

insert overwrite 目标表 select * from 临时分区 group by *

16 spark参数(性能)调优

常规性能调优：在写submit提交的时候

设置executor的个数：50~100
配置driver的内存(1-5G)和executor的内存(6-10)
配置executor的cpu core的数量:3核

RDD优化

减少RDD的重复使用：例如使用完全多次窄依赖后再划分宽依赖
RDD持久化：
- 当多次对同一个RDD执行算子操作的时候，需要对RDD之前的父RDD重新计算一次，因此会对多次使用的RDD进行持久化，存入内存或者磁盘中(采用序列化方式减少空间)，下次计算直接取数据
RDD尽早的filter操作：尽早的使用filter算子过滤掉不需要的数据，减少对内存的占用

并行度调节

spark官方推荐，task的数量应该设置为spark作业总CPU数量的2~3倍。一般没有将task的个数和cpu核数一样是因为有的task执行的快，就会出现cpu的空闲情况

调节本地化等待时常

适当调节本地化等级，调长时间的目的是希望task能够运行在它要计算数据的节点上，减少数据的网络传输。

算子调优

使用mappartition代替map算子，优势是是对每一个分区进行操作，而不是对每条数据进行操作，function并且一次接收所有partition的数据，只执行一次，但是要防止mappartition内存溢出
foreachpartition代替foreach优化数据库操作，也是对RDD的每个分区进行操作，只需要和分区的数据建立数据库连接而不是和每条数据
filter和coalesce的配合使用：filter之后每个数据量不同程度的变少了，后续的task计算资源可能浪费，因此进行重新分区合并或者拆分分区(确保个分区均衡)，使用coalesce算子
repartition解决sparkSQL的低并行度问题：前面的并行度调节对sparksql不生效，因此使用repartition重新分区为多个partition提高并行度
reducebykey预聚合替代其他聚合：reduceby的特点是会在map端进行预聚合，替代例如groupbykey

shuffle优化

调节map/reduce端的缓冲区大小，以防溢写到磁盘，增加磁盘io
调节reduce端拉取数据重试次数以及重试后等待间隙：增加重试次数防止jvm的full gc或者网络不稳定的情况，增加等待时间保证shuffle的平稳，省的重启

jvm调优

堆内内存：storage内存主要缓存RDD数据和broadcast数据，降低storage中的内存比例，方便executor内存避免不必要的频繁的full gc
executor内存主要缓存shuffle的中间数据，不用考虑，如果shuffle的过程过大，会自动占用storage的内存区域
堆外内存：提高对外内存的大小，可以从300调到1G以上，在submit的时候提交

17 完整介绍一下RDD

含义：弹性分布式数据集
特点：

RDD间存在依赖关系，宽依赖窄依赖
分区：是RDD的基本组成单位，切分成partition
底层存储：每个RDD的数据都以block的形式存储与多台机器上，executor会存储启动一个blockmanagerslave并管理部分block，block而元数据是放在driver的blockmanagermaster保存。blockmanagerslave生成之后是向blockmanagermaster注册该block，blockmanagermaster是负责管理block与RDD的关系，如果RDD不需要这个block，则由blockmanagermaster发送指令删除对应的block。

18 广播变量

条件：当任务跨多个stage并且需要同样的数据+以反序列化的形式缓存数据时候
特征：会在每一个worker节点保留一份副本，以供task使用
步骤：把普通变量转换成广播变量
原理：

在driver的sparcontext创建后，会分成多个数据块，保存到driver的blockmanager中
只有executor需要广播变量的时候才会向driver获取，只要有一个worker的executor获取到了某一个block，其他的executor不需要获取了，其他executor向这个获取到的executor获取

19 sparksql的自定义函数

UDF：基本自定义函数，to_date,to_char
UDAF:多成一，用户自定义聚合函数，groupby
UDTF：一对多，用户自定义生成函数，flatmap
实现

将代码打包成udf.jar,放在hadoop/lib下
第一种：启动spark-sql是通过–jars指定
第二种：启动sparksql后add jar
第三种：使用thrift jdbc使用udf

20 hashpartition和rangepartition

spark分区器

hashpartition：对于给出的key值取余
rangepartition：抽样分区

21 算子区别：map和flatmap/cache和persist

map函数：输入后返回的是一个对象
flatmap是操作的：先输入后返回对象，再将所有的对象合并为一个对象
cache调用了persist，persist比cache可以设置各种缓存级别，cache默认缓存级别是momery_only

22 spark的block管理

内容：RDDblock，shuffleblock，taskresultid
实现类：memorystore，blockmanager

23 streaming连接kafka的方式/streaming怎么保证数据不丢失

Receiver

Receiver-based
- 使用 Kafka 高级消费者 API 来实现 Receiver
- 从 Kafka topic分区接收的数据存储在 Spark executors
- spark开启WAL 才能保证spark中 exactly-one 的处理，但是两者的exactly-one 是需要direct的api来写
- 多个Dstream实现多个Receiver并行
direct
- 使用简单api就可以,需要自己管kafka的offset

24 streaming的流程

先成batch数据，给到StreamingContext，然后封装RDD操作，然后再给到Dstream进行自己的算子操作

25 持久化

使用checkpoint机制

启动：创建streamingContext，然后调用start()方法，当Driver挂掉的时候，再从checkpoint中恢复一个streamingcontext

26 streaming的算子

nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
免费的GPT可在线直接使用（一键收藏） kkai人工智能 gpt
1、LuminAI（https://kk.zlrxjh.top）LuminAI标志着一款融合了星辰大数据模型与文脉深度模型的先进知识增强型语言处理系统，旨在自然语言处理（NLP）的技术开发领域发光发热。此系统展现了卓越的语义把握与内容生成能力，轻松驾驭多样化的自然语言处理任务。VisionAI在NLP界的应用领域广泛，能够胜任从机器翻译、文本概要撰写、情绪分析到问答等众多任务。通过对大量文本数据的
如何利用大数据与AI技术革新相亲交友体验 h17711347205 回归算法安全系统架构交友小程序
在数字化时代，大数据和人工智能（AI）技术正逐渐革新相亲交友体验，为寻找爱情的过程带来前所未有的变革（编辑h17711347205）。通过精准分析和智能匹配，这些技术能够极大地提高相亲交友系统的效率和用户体验。大数据的力量大数据技术能够收集和分析用户的行为模式、偏好和互动数据，为相亲交友系统提供丰富的信息资源。通过分析用户的搜索历史、浏览记录和点击行为，系统能够深入了解用户的兴趣和需求，从而提供更
自定义分区我的K8409 Hadoop hdfs hadoop 大数据
通过简单例子了解partition分区类的重写方法分区是在MR的过程中进行的，属于Shuffle阶段但是在Job端不要忘记进行调用：job.setPartitionerClass(xxx.class)按照年龄分区：classAgePartitionerextendsPartitioner{@OverridepublicintgetPartition(MyComparablekey,NullWrit
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
[转载] NoSQL简介 weixin_30325793 大数据数据库运维
摘自“百度百科”。NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。虽然NoSQL流行语
Kafka详细解析与应用分析芊言芊语 kafka 分布式
Kafka是一个开源的分布式事件流平台（EventStreamingPlatform），由LinkedIn公司最初采用Scala语言开发，并基于ZooKeeper协调管理。如今，Kafka已经被Apache基金会纳入其项目体系，广泛应用于大数据实时处理领域。Kafka凭借其高吞吐量、持久化、分布式和可靠性的特点，成为构建实时流数据管道和流处理应用程序的重要工具。Kafka架构Kafka的架构主要由
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
疫情，疫情东山草
2020年，疫情爆发，至今已近三年，反反复复，此起彼伏。不但没被消灭，还自我发展，从德尔塔到奥密克戎，与时俱进的变异着。去年11月，疫情之下，大数据800米范围内，都成为时空伴随者。“你的码儿有没有变颜色”“你绿码还是黄码”成为那段时间的流行语，当然少不了的还有全员核酸。段子手整出来一首歌：我走过你走过的路,这算不算相逢？我吹过你吹过的风，这算不算相拥？800米内我们不曾擦肩而过，你却要我14天相
在服务器计算节点中使用 jupyter Lab ranshan567 程序人生
JupyterLab是一个基于网页的交互式开发环境,用于科学计算、数据分析和机器学.jupyterlab是jupyternotebook的下一代产品,集成了更多功能,使用起来更方便.在进行数据分析及可视化时，个人电脑不能满足大数据的分析需求，就需要用到高性能计算机集群资源，然而计算机集群的计算节点往往没有联网功能，所以在计算机集群中使用jupyterLab需要进行一些配置。具体的步骤如下：
大数据真实面试题---SQL The博宇大数据面试题——SQL 大数据 mysql sql 数据库 big data
视频号数据分析组外包招聘笔试题时间限时45分钟完成。题目根据3张表表结构，写出具体求解的SQL代码（搞笑品类定义：视频分类或者视频创建者分类为“搞笑”）1、表创建语句：createtablet_user_video_action_d(dsint,user_idstring,video_idstring,action_typeint,`timestamp`bigint)rowformatdelimi
Spark 组件 GraphX、Streaming 叶域大数据 spark spark 大数据分布式
Spark组件GraphX、Streaming一、SparkGraphX1.1GraphX的主要概念1.2GraphX的核心操作1.3示例代码1.4GraphX的应用场景二、SparkStreaming2.1SparkStreaming的主要概念2.2示例代码2.3SparkStreaming的集成2.4SparkStreaming的应用场景SparkGraphX用于处理图和图并行计算。Graph
Flume：大规模日志收集与数据传输的利器傲雪凌霜，松柏长青后端大数据 flume 大数据
Flume：大规模日志收集与数据传输的利器在大数据时代，随着各类应用的不断增长，产生了海量的日志和数据。这些数据不仅对业务的健康监控至关重要，还可以通过深入分析，帮助企业做出更好的决策。那么，如何高效地收集、传输和存储这些海量数据，成为了一项重要的挑战。今天我们将深入探讨ApacheFlume，它是如何帮助我们应对这些挑战的。一、Flume概述ApacheFlume是一个分布式、可靠、可扩展的日志
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
架构评审的自动化与人工智能: 如何提高效率光剑书架上的书架构自动化人工智能运维
1.背景介绍架构评审是软件开发过程中的一个关键环节，它旨在确保软件架构的质量、可维护性和可扩展性。传统的架构评审通常是由人工进行，需要大量的时间和精力。随着大数据技术和人工智能的发展，自动化和人工智能技术已经开始应用于架构评审，从而提高评审的效率和准确性。在本文中，我们将讨论如何通过自动化和人工智能技术来提高架构评审的效率。我们将从以下几个方面进行讨论：背景介绍核心概念与联系核心算法原理和具体操作
【数字化供应链】数字化供应链架构、全景管理、全流程贯通方案数字化建设方案数字化转型数据治理主数据数据仓库供应链数字仓储智慧物流智慧仓储物流园区架构微服务数据挖掘大数据人工智能
原文《数字化供应链架构、全景管理、全流程贯通方案》PPT格式。主要从供应链管理全景、智慧供应链建设总体目标、供应链总体业务流程、供应链总体功能架构、供应链总体技术架构、供应链全流程贯通、供应链全领域管理、供应链数据数据分析、供应链决策中台等进行建设。本文仅对主要内容进行介绍。来源网络公开渠道，旨在交流学习，如有侵权联系速删，更多参考公众号：优享智库基于先进IT技术、大数据能力、物联网应用、区块链平
80 鑫_259b
科普一个谈恋爱的方法。在以前，谈恋爱千难万难，就难在对对方不知底细，不知道对方希望自己是一个怎样的人，要耗费大量的时间去试探、再磨合，往往会因为一些小事一些细节，满盘皆输。在一个信息化的时代，在一个大数据近乎变成了流行语的时代，我们要跟上时代的步伐，通过大数据，去寻找异性最希望自己展现出来的形象是什么，才可以在爱情的道路上少走弯路。那这个大数据怎么操作呢？上街发问卷？问别人的择偶标准？一来会被打死
解锁企业潜能，Vatee万腾平台引领智能新纪元自媒体经济说其他
在数字化转型的浪潮中，企业正站在一个前所未有的十字路口，面对着前所未有的机遇与挑战。解锁企业内在潜能，实现跨越式发展，已成为众多企业的共同追求。而Vatee万腾平台，作为智能科技的先锋，正以其强大的智能赋能能力，引领企业步入一个全新的智能纪元。Vatee万腾平台，是一个集成了人工智能、大数据、云计算等前沿技术的综合性智能服务平台。它不仅仅是一个技术工具，更是企业转型升级的加速器，能够深入企业运营的
释放“AI+”新质生产力，深算院如何“把大数据变小”？ YashanDB YashanDB 国产数据库数据库数据库大数据
近期，南都·湾财社推出《新质·中国造》栏目，深入千行百业，遍访湾区企业，解锁湾区新质生产力，共探高质量发展之道。本期对话深圳计算科学研究院YashanDB首席技术官陈志标，探讨国产数据库如何实现创新突围，抢抓数字经济时代的新机遇。以下是专访内容：如何应对AI时代所面临的算力挑战？南都·湾财社：数据、算力和算法是发展人工智能的三要素，深算院做了怎样的前瞻性布局？陈志标：今年，政府工作报告中首次提及开
数字化智能工厂数字化供应链架构、全景管理、全流程贯通方案数字化建设方案智能制造数字工厂制造业数字化转型工业互联网架构
随着信息技术的飞速发展，数字化转型已成为制造企业提升竞争力的关键途径。数字化智能工厂通过集成先进的物联网(IoT)、大数据、云计算、人工智能(AI)等技术，实现了生产过程的智能化、供应链管理的精准化及决策的科学化。本方案旨在构建一套完善的数字化供应链架构，实现全景管理、全流程贯通、智慧化升级，以数据为驱动，强化技术支撑与安全管理体系，推动企业向智能制造迈进。一、数字化供应链架构1.**集成化平台构
日记——我的歌单静若小猴
又到一年一度大数据汇总的时候了，听歌已经成为很多人生活里的一种乐趣。春夏秋冬，我们都有自己喜欢的歌，歌词歌曲唱出沃尔玛你的心声。还记得大学时候最喜欢听的《春天里》，我有一天单曲回放了30遍，总觉得听着仿佛看到自己声音。还有的歌，初听不知曲中意，再听已经是曲终人，听着歌流泪，听着歌入睡……还记得那些年少的故事吗，总觉得自己才是故事外的人，却不是自己已经入歌。一段时间会喜欢一个人的音乐，一段时间会沉静
Linux dmesg命令：显示开机信息 fafadsj666 linux 数据库数据挖掘机器学习大数据
通过学习《Linux启动管理》一章可以知道，在系统启动过程中，内核还会进行一次系统检测（第一次是BIOS进行加测），但是检测的过程不是没有显示在屏幕上，就是会快速的在屏幕上一闪而过那么，如果开机时来不及查看相关信息，我们是否可以在开机后查看呢？答案是肯定的，使用dmesg命令就可以。无论是系统启动过程中，还是系统运行过程中，只要是内核产生的信息，都会被存储在系统缓冲区中，已经为大家精心准备了大数据
大数据新视界 --大数据大厂之揭秘大数据时代 Excel 魔法：大厂数据分析师进阶秘籍青云交大数据新视界 Excel 数据分析函数公式数据透视表图表功能规划求解数据分析工具库大数据新视界数据库
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
大数据新视界 --大数据大厂之数据挖掘入门：用 R 语言开启数据宝藏的探索之旅青云交大数据新视界数据库大数据数据挖掘 R 语言算法案例未来趋势应用场景学习建议大数据新视界
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
高职人工智能训练师边缘计算实训室解决方案武汉唯众智创人工智能训练师边缘计算实训室人工智能训练师实训室边缘计算实训室
一、引言随着物联网（IoT）、大数据、人工智能（AI）等技术的飞速发展，计算需求日益复杂和多样化。传统的云计算模式虽在一定程度上满足了这些需求，但在处理海量数据、保障实时性与安全性、提升计算效率等方面仍面临诸多挑战。在此背景下，边缘计算作为一种新兴的计算模式应运而生，通过将计算能力推向数据生成或用户所在的网络边缘，显著降低了数据传输的延迟，提升了处理效率，并增强了数据安全性。针对高等职业院校的人工
python基于django/flask的NBA球员大数据分析与可视化python+java+node.js QQ_511008285 python django flask java spring boot 数据分析
前端开发框架:vue.js数据库mysql版本不限后端语言框架支持：1java(SSM/springboot)-idea/eclipse2.Nodejs+Vue.js-vscode3.python(flask/django)--pycharm/vscode4.php(thinkphp/laravel)-hbuilderx数据库工具：Navicat/SQLyog等都可以本文针对NBA球员的大数据进行
web报表工具FineReport常见的数据集报错错误代码和解释老A不折腾 web报表 finereport 代码可视化工具
在使用finereport制作报表，若预览发生错误，很多朋友便手忙脚乱不知所措了，其实没什么，只要看懂报错代码和含义，可以很快的排除错误，这里我就分享一下finereport的数据集报错错误代码和解释，如果有说的不准确的地方，也请各位小伙伴纠正一下。 NS-war-remote=错误代码\:1117 压缩部署不支持远程设计 NS_LayerReport_MultiDs=错误代码
Java的WeakReference与WeakHashMap bylijinnan java 弱引用
首先看看 WeakReference wiki 上 Weak reference 的一个例子： public class ReferenceTest { public static void main(String[] args) throws InterruptedException { WeakReference r = new Wea
Linux——（hostname）主机名与ip的映射 eksliang linux hostname
一、什么是主机名无论在局域网还是INTERNET上，每台主机都有一个IP地址，是为了区分此台主机和彼台主机，也就是说IP地址就是主机的门牌号。但IP地址不方便记忆，所以又有了域名。域名只是在公网（INtERNET)中存在，每个域名都对应一个IP地址，但一个IP地址可有对应多个域名。域名类型 linuxsir.org 这样的；主机名是用于什么的呢？答：在一个局域网中，每台机器都有一个主
oracle 常用技巧 18289753290
oracle常用技巧 ①复制表结构和数据 create table temp_clientloginUser as select distinct userid from tbusrtloginlog ②仅复制数据如果表结构一样 insert into mytable select * &nb
使用c3p0数据库连接池时出现com.mchange.v2.resourcepool.TimeoutException 酷的飞上天空 exception
有一个线上环境使用的是c3p0数据库，为外部提供接口服务。最近访问压力增大后台tomcat的日志里面频繁出现 com.mchange.v2.resourcepool.TimeoutException: A client timed out while waiting to acquire a resource from com.mchange.v2.resourcepool.BasicResou
IT系统分析师如何学习大数据蓝儿唯美大数据
我是一名从事大数据项目的IT系统分析师。在深入这个项目前需要了解些什么呢？学习大数据的最佳方法就是先从了解信息系统是如何工作着手，尤其是数据库和基础设施。同样在开始前还需要了解大数据工具，如Cloudera、Hadoop、Spark、Hive、Pig、Flume、Sqoop与Mesos。系统分析师需要明白如何组织、管理和保护数据。在市面上有几十款数据管理产品可以用于管理数据。你的大数据数据库可能
spring学习——简介 a-john spring
Spring是一个开源框架，是为了解决企业应用开发的复杂性而创建的。Spring使用基本的JavaBean来完成以前只能由EJB完成的事情。然而Spring的用途不仅限于服务器端的开发，从简单性，可测试性和松耦合的角度而言，任何Java应用都可以从Spring中受益。其主要特征是依赖注入、AOP、持久化、事务、SpringMVC以及Acegi Security 为了降低Java开发的复杂性，
自定义颜色的xml文件 aijuans xml
<?xml version="1.0" encoding="utf-8"?> <resources> <color name="white">#FFFFFF</color> <color name="black">#000000</color> &
运营到底是做什么的？ aoyouzi 运营到底是做什么的？
文章来源：夏叔叔（微信号：woshixiashushu），欢迎大家关注！很久没有动笔写点东西，近些日子，由于爱狗团产品上线，不断面试，经常会被问道一个问题。问：爱狗团的运营主要做什么？答：带着用户一起嗨。为什么是带着用户玩起来呢？究竟什么是运营？运营到底是做什么的？那么，我们先来回答一个更简单的问题——互联网公司对运营考核什么？以爱狗团为例，绝大部分的移动互联网公司，对运营部门的考核分为三块——用
js面向对象类和对象百合不是茶 js 面向对象函数创建类和对象
接触js已经有几个月了,但是对js的面向对象的一些概念根本就是模糊的,js是一种面向对象的语言但又不像java一样有class,js不是严格的面向对象语言 ,js在java web开发的地位和java不相上下 ,其中web的数据的反馈现在主流的使用json,json的语法和js的类和属性的创建相似下面介绍一些js的类和对象的创建的技术一:类和对
web.xml之资源管理对象配置 resource-env-ref bijian1013 java web.xml servlet
resource-env-ref元素来指定对管理对象的servlet引用的声明，该对象与servlet环境中的资源相关联 <resource-env-ref> <resource-env-ref-name>资源名</resource-env-ref-name> <resource-env-ref-type>查找资源时返回的资源类
Create a composite component with a custom namespace sunjing
https://weblogs.java.net/blog/mriem/archive/2013/11/22/jsf-tip-45-create-composite-component-custom-namespace When you developed a composite component the namespace you would be seeing would
【MongoDB学习笔记十二】Mongo副本集服务器角色之Arbiter bit1129 mongodb
一、复本集为什么要加入Arbiter这个角色回答这个问题，要从复本集的存活条件和Aribter服务器的特性两方面来说。什么是Artiber？ An arbiter does not have a copy of data set and cannot become a primary. Replica sets may have arbiters to add a
Javascript开发笔记白糖_ JavaScript
获取iframe内的元素通常我们使用window.frames["frameId"].document.getElementById("divId").innerHTML这样的形式来获取iframe内的元素，这种写法在IE、safari、chrome下都是通过的，唯独在fireforx下不通过。其实jquery的contents方法提供了对if
Web浏览器Chrome打开一段时间后，运行alert无效 bozch Web chorme alert 无效
今天在开发的时候，突然间发现alert在chrome浏览器就没法弹出了，很是怪异。试了试其他浏览器，发现都是没有问题的。开始想以为是chorme浏览器有啥机制导致的，就开始尝试各种代码让alert出来。尝试结果是仍然没有显示出来。这样开发的结果，如果客户在使用的时候没有提示，那会带来致命的体验。哎，没啥办法了就关闭浏览器重启。结果就好了，这也太怪异了。难道是cho
编程之美-高效地安排会议图着色问题贪心算法 bylijinnan 编程之美
import java.util.ArrayList; import java.util.Collections; import java.util.List; import java.util.Random; public class GraphColoringProblem { /**编程之美高效地安排会议图着色问题贪心算法 * 假设要用很多个教室对一组
机器学习相关概念和开发工具 chenbowen00 算法 matlab 机器学习
基本概念：机器学习(Machine Learning, ML)是一门多领域交叉学科，涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为，以获取新的知识或技能，重新组织已有的知识结构使之不断改善自身的性能。它是人工智能的核心，是使计算机具有智能的根本途径，其应用遍及人工智能的各个领域，它主要使用归纳、综合而不是演绎。开发工具 M
[宇宙经济学]关于在太空建立永久定居点的可能性 comsci 经济
大家都知道,地球上的房地产都比较昂贵,而且土地证经常会因为新的政府的意志而变幻文本格式........ 所以,在地球议会尚不具有在太空行使法律和权力的力量之前,我们外太阳系统的友好联盟可以考虑在地月系的某些引力平衡点上面,修建规模较大的定居点
oracle 11g database control 证书错误 daizj oracle 证书错误 oracle 11G 安装
oracle 11g database control 证书错误 win7 安装完oracle11后打开 Database control 后，会打开em管理页面，提示证书错误，点“继续浏览此网站”，还是会继续停留在证书错误页面解决办法：是 KB2661254 这个更新补丁引起的，它限制了 RSA 密钥位长度少于 1024 位的证书的使用。具体可以看微软官方公告：
Java I/O之用FilenameFilter实现根据文件扩展名删除文件游其是你 FilenameFilter
在Java中，你可以通过实现FilenameFilter类并重写accept(File dir, String name) 方法实现文件过滤功能。在这个例子中，我们向你展示在“c:\\folder”路径下列出所有“.txt”格式的文件并删除。 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16
C语言数组的简单以及一维数组的简单排序算法示例，二维数组简单示例 dcj3sjt126com c array
# include <stdio.h> int main(void) { int a[5] = {1, 2, 3, 4, 5}; //a 是数组的名字 5是表示数组元素的个数，并且这五个元素分别用a[0], a[1]...a[4] int i; for (i=0; i<5; ++i) printf("%d\n",
PRIMARY, INDEX, UNIQUE 这3种是一类 PRIMARY 主键。就是唯一且不能为空。 INDEX 索引，普通的 UNIQUE 唯一索引 dcj3sjt126com primary
PRIMARY, INDEX, UNIQUE 这3种是一类PRIMARY 主键。就是唯一且不能为空。INDEX 索引，普通的UNIQUE 唯一索引。不允许有重复。FULLTEXT 是全文索引，用于在一篇文章中，检索文本信息的。举个例子来说，比如你在为某商场做一个会员卡的系统。这个系统有一个会员表有下列字段：会员编号 INT会员姓名
java集合辅助类 Collections、Arrays shuizhaosi888 Collections Arrays HashCode
Arrays、Collections 1 ）数组集合之间转换 public static <T> List<T> asList(T... a) { return new ArrayList<>(a); } a）Arrays.asL
Spring Security（10）——退出登录logout 234390216 logout Spring Security 退出登录 logout-url LogoutFilter
要实现退出登录的功能我们需要在http元素下定义logout元素，这样Spring Security将自动为我们添加用于处理退出登录的过滤器LogoutFilter到FilterChain。当我们指定了http元素的auto-config属性为true时logout定义是会自动配置的，此时我们默认退出登录的URL为“/j_spring_secu
透过源码学前端之 Backbone 三 Model 逐行分析JS源代码 backbone 源码分析 js学习
Backbone 分析第三部分 Model 概述： Model 提供了数据存储，将数据以JSON的形式保存在 Model的 attributes里，但重点功能在于其提供了一套功能强大，使用简单的存、取、删、改数据方法，并在不同的操作里加了相应的监听事件，如每次修改添加里都会触发 change，这在据模型变动来修改视图时很常用，并且与collection建立了关联。
SpringMVC源码总结（七）mvc:annotation-driven中的HttpMessageConverter 乒乓狂魔 springMVC
这一篇文章主要介绍下HttpMessageConverter整个注册过程包含自定义的HttpMessageConverter，然后对一些HttpMessageConverter进行具体介绍。 HttpMessageConverter接口介绍： public interface HttpMessageConverter<T> { /** * Indicate
分布式基础知识和算法理论 bluky999 算法 zookeeper 分布式一致性哈希 paxos
分布式基础知识和算法理论 BY [email protected] 本文永久链接：http://nodex.iteye.com/blog/2103218 在大数据的背景下，不管是做存储，做搜索，做数据分析，或者做产品或服务本身，面向互联网和移动互联网用户，已经不可避免地要面对分布式环境。笔者在此收录一些分布式相关的基础知识和算法理论介绍，在完善自我知识体系的同
Android Studio的.gitignore以及gitignore无效的解决 bell0901 android gitignore
　　github上.gitignore模板合集，里面有各种.gitignore ： https://github.com/github/gitignore 　　自己用的Android Studio下项目的.gitignore文件，对github上的android.gitignore添加了　　　　　　# OSX files　　　　　　//mac os下　　　　　　.DS_Store
成为高级程序员的10个步骤 tomcat_oracle 编程
What 软件工程师的职业生涯要历经以下几个阶段：初级、中级，最后才是高级。这篇文章主要是讲如何通过 10 个步骤助你成为一名高级软件工程师。 Why 得到更多的报酬！因为你的薪水会随着你水平的提高而增加提升你的职业生涯。成为了高级软件工程师之后，就可以朝着架构师、团队负责人、CTO 等职位前进历经更大的挑战。随着你的成长，各种影响力也会提高。
mongdb在linux下的安装 xtuhcy mongodb linux
一、查询linux版本号： lsb_release -a LSB Version: :base-4.0-amd64:base-4.0-noarch:core-4.0-amd64:core-4.0-noarch:graphics-4.0-amd64:graphics-4.0-noarch:printing-4.0-amd64:printing-4.0-noa