datavotee

Hadoop架构分析

一直想对Hadoop有一个比较全面的了解，这次正好趁做作业的机会，对第一代和第二代Hadoop架构进行了整理和分析。文中第二代Hadoop的内容主要来自第一篇参考文献——发表在SoCC2013上的一篇文章。（文中的图片都来自于文后所列出的参考文献。）

1 前言

Hadoop是一个开源的分布式系统框架，由Apache基金会开发，是当前最热门的大数据技术。它一开始主要应用在一些大型网站，如Yahoo!、Facebook、淘宝、百度等。随着人们对大数据的价值越来越重视，Hadoop开始在各类企业中得到广泛应用，成为人们对大数据进行存储、分析和挖掘的最主要的工具。Hadoop的应用已经形成了一个强大稳定的生态系统。

Hadoop的出现受到Google两篇论文(The Google File System和MapReduce: SimplifiedData Processing on Large Clusters)的启发。其设计初衷是解决搜索引擎中的可扩展性问题。Hadoop最大的特点是可以将数千台普通的廉价商用服务器组成一个稳定可靠、计算能力强大的集群，能够对PB量级的数据进行存储和计算。

Hadoop可以使用户可以在不了解底层细节的情况下，开发分布式的应用程序，实现高效可靠的分布式计算。Hadoop基于java开发，用户可以用java, C/C++开发自己的应用。

Hadoop技术以其低廉的成本和强大的计算能力得到人们的广泛认可。人们对Hadoop技术的使用已经远远超出了Hadoop最初的设计目标，同时也暴露出越来越多的问题。人们对Hadoop的可扩展性、可靠性、可用性都提出了更高的要求。2013年末，第二代Hadoop系统YARN发布。新的架构在原来的基础上作了很多改进，性能和可扩展性更高，而且可以支持更多的计算模型。

本文第二部分介绍第一代Hadoop技术的架构，并分析其优缺点；第三部分介绍第二代Hadoop技术YARN的架构；第四部分简单介绍跟Hadoop类似的计算框架；第五部分对本文进行总结。

2 第一代Hadoop系统

第一代Hadoop从资源管理到任务调度都采用了主从结构。如图1所示，Hadoop有两个核心组件：HDFS和MapReduce编程框架。下面分别对这两个组件进行介绍。

图 1 第一代Hadoop 生态系统

2.1 HDFS

HDFS是Hadoop Distributed File System的简称。它是一个高度容错的分布式文件系统，可以部署在廉价集群上，实现高吞吐量的数据访问。在HDFS中，大的数据集被分成很多小块，每一块有多个备份并保存在不同的节点上，从而实现大规模数据的分布式可靠存储。另外，在计算时，数据并不需要大量移动，而是由调度器将执行程序加载到存储数据的节点上，通过数据的本地化降低数据访问开销，节省网络带宽。这保证了在处理数据密集型任务时的高效性。

如图 2所示，HDFS采用主从结构（master-slave)，由NameNode、Secondary NameNode和DataNode几个组件组成。用户 ( Client)必须通过NameNode跟DataNode交互，访问HDFS中的文件。

（1） NameNode

NameNode是整个Hadoop系统的控制节点（master），负责管理HDFS的目录树和相关文件的元数据信息。一个Hadoop集群中只有一个NameNode，用户通过它跟Hadoop集群交互，加载计算任务。NameNode还负责监控各个DataNode的健康状态。

（2） SecondaryNameNode

SecondaryNamenode并不是NameNode的备份节点，而是定期合并fsimage和edits日志，并发送给NameNode。其目的是为了减轻NameNode的压力。

图 2 第一代Hadoop中的资源管理和任务调度

（3） DataNode

每个Slave节点都是一个DataNode，它负责实际的数据存储，并将数据信息态定期汇报给NameNode。DataNode以固定大小的块为基本单位组织文件内容，块的默认大小为64MB。当用户上传一个大于64MB的文件时，该文件会被切成若干块，每一块都有多个备份（配置中默认为3），并且保存在不同的DataNode上，以实现可靠的数据存储。

2.2 MapReduce编程框架

如图 2所示，MapReduce 框架也是一个主从结构，主要由JobTracker和TaskTracker组成。其中，JobTracker运行在NameNode上，是MapReduce 框架的master；而每个DataNode上都有一个TaskTraker。JobTracker和各个TaskTracker通过心跳协议进行通信，监视hadoop集群的资源占用和任务运行。

（1） JobTracker

JobTracker 负责资源监控和作业调度。它监控所有TaskTracker 与作业的健康状况，一旦发现失败情况就会将相应的任务转移到其他节点。同时，JobTracker 会跟踪任务的执行进度、资源使用量等信息，并将这些信息告诉任务调度器。调度器根据资源的空闲状态，加载合适的计算任务。在Hadoop 中，任务调度器是一个可插拔的模块，用户可以根据自己的需要设计相应的调度器。

（2） TaskTracker

TaskTracker通过心跳协议周期性地将本节点上的资源占用和任务运行情况汇报给JobTracker，同时接收JobTracker 发送过来的命令并执行相应的操作（如启动新任务、杀死任务等）。TaskTracker 使用“slot”划分本节点上的资源。在MapReduce框架中，有Map slot 和Reduce slot 两种。每个任务使用的Map slot 和Reduce slot一旦分配好就不能再动态改变，而且这两种slot也不能相互替换使用。所以slot分配不合理会导致资源利用率下降。同时，slot 数目也限定了任务的并发度。

图3 MapReduce任务

一个MapReduce任务的运行如图3所示。左边为用户的输入数据，被分成多份保存在HDFS文件系统中。该任务包括3个map和1个reduce，分别在不同的DataNode上运行。右边为任务执行后得到的计算结果。

2.3 第一代Hadoop系统的特点

由上面对HDFS和MapReduce的介绍可以看出，第一代Hadoop系统主要是为了实现在廉价集群上运行大规模的MapReduce数据密集型计算任务。它在可扩展性和容错性上的优势，使得它在短短几年里就获得业界的广泛支持和认可。在某些大型的互联网公司中，一个Hadoop集群可以扩展到4000多台服务器。

Hadoop不仅在网页搜索中得到广泛应用，还被各种类型的企业用于大数据的存储、分析和挖掘。在很多企业中，Hadoop集群已经成为全公司多个部门共享数据和计算资源的基础设施。人们在Hadoop集群上运行的任务越来越多，任务的类型也不再局限于MapReduce编程框架。人们对Hadoop系统的广泛使用，已经超出了Hadoop系统的最初设计目标，暴露出第一代Hadoop系统的两个缺点：

（1）资源管理跟特定编程框架MapReduce强绑定，使得用户开始抱怨MapReduce模型的局限性；

（2）对资源管理和任务调度的集中控制，使得JobTracker成为系统的瓶颈，限制了系统的进一步扩展。

另外，资源无法动态分配，有时使得hadoop集群的利用率很低。

第一代Hadoop系统的局限性早已成为学术界和开源社区的共识。从Hadoop 0.23版本开始，一个全新的Hadoop系统就开始开发，并在2013年发布。这就是第二代Hadoop系统YARN。

3 第二代Hadoop系统YARN

第一代Hadoop系统中，资源管理和任务调度都是主从结构。这使得NameNode成为系统的单点故障节点，而JobTracker也很容易成为系统的性能瓶颈。为了克服这些缺点，第二代Hadoop系统将JobTracker中的资源管理和任务调度分离。资源管理主要由运行在NameNode上的资源管理器（RM：Resource Manager）负责；而每一个应用都有自己独立的ApplicationMaster（AM），用于向RM申请资源，并负责任务的加载和容错处理。另外，在每个工作节点上都有一个NodeManager（NM），负责监控本地的资源占用和任务运行情况，并通过心跳协议上报给RM。

另外，在YARN中，每个AM可以根据自己的运行情况和当前的资源占用状态动态地调整资源申请，从而避免了在第一代Hadoop系统中slot静态分配，且map任务无法使用reduce slot（或者相反）所带来的资源浪费问题。

3.1 总体架构

图表 4 4第二代Hadoop系统

YARN的架构如图4所示。RM是一个运行在特定节点上的守护进程，负责资源的集中调度。它可以根据资源的全局视图实施基于容量、公平或者局部性的调度策略。RM根据应用程序的需求、调度的优先级和资源的空闲状态动态地为各个应用创建容器，或者叫做资源契约。一个容器是跟某个工作节点对应的资源集合的抽象描述，类似于操作系统中的进程。为了分配和监控资源，RM需要跟运行在每个工作节点上的NM守护进程进行交互。为了节省网络资源，RM和各个NM之间通过心跳协议进行通信。NM负责本地节点的资源占用监控，报告错误信息、并管理容器运行的生命周期。RM通过收集各个NM的快照信息构建集群的全局视图。

用户通过一个公共提交协议把job提交给RM。一个job要经过一系列的准入检查（如安全证书、访问权限等）才能提交给调度器，并进入就绪状态。当调度器发现有足够的资源时，就加载该job，使其进入运行态。RM中的AMService组件负责为每个AM分配一个容器，并在一个工作节点上启动它。

AM是一个job的控制中心，负责管理程序运行生命周期中的方方面面，包括动态地资源申请、程序的执行流程、错误处理和局部性优化等等。为了完成相应的job，AM需要申请并获取位于多个节点上的资源。首先，AM向RM提交资源申请（包括不同资源的比例、资源所在的位置等）。RM为AM分配资源后会创建一个契约，用于描述AM可以使用的资源。然后，AM通过一种基于令牌的安全机制向NM出示契约，并得到相应的资源。

RM对AM的语义基本不做限定，AM可以运行任意的、用任何语言编写的用户代码。AM也可以直接跟自己的容器进行通信，就象第一代Hadoop系统中JobTracker跟TaskTracker交换程序执行信息一样。

在图4中，两个Client各加载了一个job。橙色Client加载的是一个MPI应用，而粉色Client加载的是一个MapReduce应用。RM为每个job都启动了一个AM。MPI AM和它的唯一的容器都运行在左边第一个节点上；MapReduce AM运行在左起第二个节点上，它有多个容器在左边第一个节点和右边第一个节点上运行。

3.2 Resource Manager(RM)

RM有两个外部接口，分别用于job提交和跟AM动态地进行资源访问协商。它还有一个跟NM通信的内部接口，用于集群运行状态监控和资源访问管理。RM负责处理AM的资源请求，并为AM创建容器契约和允许访问资源的令牌。另外，RM还从各个NM得到资源的空闲状态和容器的运行状态。一旦有容器运行结束，它就把信息发送给相应的AM。当有新的NM加入时（比如集群中增加了新的服务器），它也会把信息告诉各个AM。AM可以根据新的资源信息调整自己的资源申请。

RM也可以向AM申请回收资源。这一般发生在资源比较紧张的时候或者调度器为了维持既定的调度策略需要对资源进行重新调度。AM收到这种资源回收申请后，可以采取一些灵活的策略，如释放一些不重要的容器、为正在运行的任务创建检查点等。也就是说，这种处理允许应用程序采取一些保护措施，而不是简单地通过杀死应用程序的容器而抢占资源。

需要特别指出的是，RM并不负责协调应用程序的执行和容错处理。它既不提供运行程序的状态和度量信息，也不提供跟应用程序框架（如MapReduce）相关的统计信息。由于RM仅仅负责资源的调度，这使得YARN在扩展性方面比第一代Hadoop更好。

3.3 Application Master(AM)

AM负责协调集群中应用程序的执行。跟应用程序中运行在工作节点上的容器一样，AM本身也是容器。RM中的AMService负责为AM分配容器，并启动相应的进程。

AM通过心跳协议周期地跟RM进行通信，发送心跳报文，并更新资源请求。AM在资源请求中描述自己的“期望”和“约束”，并通过心跳报文发送给RM。在接下来从RM返回的心跳报文中，AM得到一个容器契约，描述AM可以使用哪个节点中的资源。AM可以根据收到的信息更新自己的执行计划，以适应资源的忙闲状态。

由于RM并不解释容器的状态，它只是简单地把从NM收到的容器信息转发给AM。只有AM自己知道某个容器的退出状态是成功还是失败。

AM本身也是在工作节点上运行的容器，它本身也可能因为硬件故障而异常退出。在这种情况下，AM最好能够自己从异常退出中恢复。虽然YARN对异常退出的恢复也有一些支持，但由于RM并不了解每个AM的语义，所以这种恢复功能主要还得靠AM自己完成。

3.4 Node Manager(NM)

NM是在工作节点上运行的守护进程。它负责验证容器契约的真实性、管理容器运行所依赖的资源、监测容器的执行并为容器提供一系列的服务。NM向RM注册之后，则通过心跳报文报告自己的状态，并从RM接受指令。用户可以通过配置来控制NM需要向RM报告哪些信息，如内存和CPU。

YARN中的所有容器，包括AM，都由一个容器加载上下文（CLC：Container Launch Context）描述。CLC包括环境变量信息、程序执行依赖、安全令牌、NM服务载荷和创建进程的命令。一旦契约的真实性得到验证，NM就会为容器配置环境变量，将程序执行依赖的文件、执行代码拷贝到本地，然后加载相应的进程。NM也会根据从RM或者AM得到的指令杀死某个容器。

NM还要周期性地监视物理节点的状态。通过运行脚本检查硬件/软件中可能存在的问题。当NM发现有问题的时候，它就把自己的状态置成unhealth，并向RM报告。RM会根据报告下发杀死容器的指令，或者不会再将新的任务加载在该节点上。

另外，NM也可以为本地运行的容器提供一些服务，比如日志聚合并持久化。而且管理员可以通过配置添加一些可插拔的辅助服务，比如，在MapReduce程序中，使用辅助服务传递从map到reduce的中间数据。

综上所述，第二代Hadoop系统YARN通过将资源管理和任务调度分离，大大减轻了master节点的运行负载，使可扩展性得到大大提高。另外，通过动态的资源调度，使资源的利用率得到大大提升。另外，YARN不再跟某个编程框架绑定，从而可以支持更多的编程模型。它是向后兼容的，原来的MapReduce应用无须修改就可以在YARN上运行。

根据Yahoo!测试的结果，通过在一个2500节点的集群上部署YARN，使得运行效率比使用Hadoop1.x提高40%左右。这相当于增加1000个新的节点所带来的性能收益。

但是，YARN依然有它的局限性。首先，RM是一个集中控制节点，仍然存在单点故障问题，影响系统的可扩展性。而且一旦该节点出现问题，往往很难恢复正在运行的应用程序。随着人们处理的数据量越来越大，可扩展性问题仍然会再次浮出水面。另外，资源调度的灵活性也带来了调度算法的复杂性。在文献[2]中，作者发现YARN自带的调度算法有时会导致JOB饿死，或者某些计算资源得不到分配的情况。所以对于YARN，可扩展性、可靠性依然是很大的挑战。

4 相关工作

除了YARN，人们还开发了一些其它的系统，也是旨在解决第一代Hadoop中所存在的问题。在这些系统中，跟YARN最接近的是Mesos、Omega、Corona 和Cosmos。它们分别由Twitter、Google、Facebook、Microsoft维护和使用。这些系统的目标都是要提高系统的可扩展性、改进性能和适应更多的编程模型。

Omega的设计趋向于通过分布式多级调度提高可扩展性。但是可扩展性的提高所带来的副作用是很难根据全局属性进行基于容量或者公平的调度。Corona采用一种基于推送的通信方式。Mesos跟YARN一样采用两级调度，但它是通过主动提供，而不是申请的方式分配资源。Cosmos在存储和计算配置上跟YARN的架构最相似，但它主要用于一类特定的应用程序：scope。

5 总结

本文介绍了第一代和第二代Hadoop系统的架构，分析了它们的优缺点。Hadoop已经成为最热门的大数据解决方案。通过分析它的架构，我们也可以看到大数据处理对存储能力、计算能力的需求，对我们进一步了解大数据技术有很大的帮助。大数据技术才刚刚出现不久，而人类产生的数据量还在成指数增长。大数据技术还远没有达到成熟的地步，还需要更多人通过坚持不懈地努力，不断提高和优化大数据相关技术，来应对大数据带给我们的挑战。

参考文献

[1] Vinod K. Vavilapalli etc. Apache Hadoop YARN:Yet Another Resource Negotiator. SoCC`13, Santa Clara, California, USA, 2013.

[2] Arka A. Bhattacharya etc. HierarchicalScheduling for Diverse Datacenter Workloads. SoCC`13, Santa Clara, California, USA, 2013.

[3] http://hadoop.apache.org/docs/r2.2.0/hadoop-yarn/hadoop-yarn-site/YARN.html

[4] http://en.wikipedia.org/wiki/Apache_Hadoop.

[5] http://www.cnblogs.com/bester/p/3255307.html

[6] http://hortonworks.com/wp-content/uploads/2013/12/Apache.Hadoop.YARN_.Sample.pdf

nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
免费的GPT可在线直接使用（一键收藏） kkai人工智能 gpt
1、LuminAI（https://kk.zlrxjh.top）LuminAI标志着一款融合了星辰大数据模型与文脉深度模型的先进知识增强型语言处理系统，旨在自然语言处理（NLP）的技术开发领域发光发热。此系统展现了卓越的语义把握与内容生成能力，轻松驾驭多样化的自然语言处理任务。VisionAI在NLP界的应用领域广泛，能够胜任从机器翻译、文本概要撰写、情绪分析到问答等众多任务。通过对大量文本数据的
如何利用大数据与AI技术革新相亲交友体验 h17711347205 回归算法安全系统架构交友小程序
在数字化时代，大数据和人工智能（AI）技术正逐渐革新相亲交友体验，为寻找爱情的过程带来前所未有的变革（编辑h17711347205）。通过精准分析和智能匹配，这些技术能够极大地提高相亲交友系统的效率和用户体验。大数据的力量大数据技术能够收集和分析用户的行为模式、偏好和互动数据，为相亲交友系统提供丰富的信息资源。通过分析用户的搜索历史、浏览记录和点击行为，系统能够深入了解用户的兴趣和需求，从而提供更
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
[转载] NoSQL简介 weixin_30325793 大数据数据库运维
摘自“百度百科”。NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。虽然NoSQL流行语
Kafka详细解析与应用分析芊言芊语 kafka 分布式
Kafka是一个开源的分布式事件流平台（EventStreamingPlatform），由LinkedIn公司最初采用Scala语言开发，并基于ZooKeeper协调管理。如今，Kafka已经被Apache基金会纳入其项目体系，广泛应用于大数据实时处理领域。Kafka凭借其高吞吐量、持久化、分布式和可靠性的特点，成为构建实时流数据管道和流处理应用程序的重要工具。Kafka架构Kafka的架构主要由
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
疫情，疫情东山草
2020年，疫情爆发，至今已近三年，反反复复，此起彼伏。不但没被消灭，还自我发展，从德尔塔到奥密克戎，与时俱进的变异着。去年11月，疫情之下，大数据800米范围内，都成为时空伴随者。“你的码儿有没有变颜色”“你绿码还是黄码”成为那段时间的流行语，当然少不了的还有全员核酸。段子手整出来一首歌：我走过你走过的路,这算不算相逢？我吹过你吹过的风，这算不算相拥？800米内我们不曾擦肩而过，你却要我14天相
在服务器计算节点中使用 jupyter Lab ranshan567 程序人生
JupyterLab是一个基于网页的交互式开发环境,用于科学计算、数据分析和机器学.jupyterlab是jupyternotebook的下一代产品,集成了更多功能,使用起来更方便.在进行数据分析及可视化时，个人电脑不能满足大数据的分析需求，就需要用到高性能计算机集群资源，然而计算机集群的计算节点往往没有联网功能，所以在计算机集群中使用jupyterLab需要进行一些配置。具体的步骤如下：
大数据真实面试题---SQL The博宇大数据面试题——SQL 大数据 mysql sql 数据库 big data
视频号数据分析组外包招聘笔试题时间限时45分钟完成。题目根据3张表表结构，写出具体求解的SQL代码（搞笑品类定义：视频分类或者视频创建者分类为“搞笑”）1、表创建语句：createtablet_user_video_action_d(dsint,user_idstring,video_idstring,action_typeint,`timestamp`bigint)rowformatdelimi
Flume：大规模日志收集与数据传输的利器傲雪凌霜，松柏长青后端大数据 flume 大数据
Flume：大规模日志收集与数据传输的利器在大数据时代，随着各类应用的不断增长，产生了海量的日志和数据。这些数据不仅对业务的健康监控至关重要，还可以通过深入分析，帮助企业做出更好的决策。那么，如何高效地收集、传输和存储这些海量数据，成为了一项重要的挑战。今天我们将深入探讨ApacheFlume，它是如何帮助我们应对这些挑战的。一、Flume概述ApacheFlume是一个分布式、可靠、可扩展的日志
云服务业界动态简报-20180128 Captain7
一、青云青云QingCloud推出深度学习平台DeepLearningonQingCloud，包含了主流的深度学习框架及数据科学工具包，通过QingCloudAppCenter一键部署交付，可以让算法工程师和数据科学家快速构建深度学习开发环境，将更多的精力放在模型和算法调优。二、腾讯云1.腾讯云正式发布腾讯专有云TCE(TencentCloudEnterprise)矩阵，涵盖企业版、大数据版、AI
大数据毕业设计hadoop+spark+hive知识图谱租房数据分析可视化大屏租房推荐系统 58同城租房爬虫房源推荐系统房价预测系统计算机毕业设计机器学习深度学习人工智能 2401_84572577 程序员大数据 hadoop 人工智能
做了那么多年开发，自学了很多门编程语言，我很明白学习资源对于学一门新语言的重要性，这些年也收藏了不少的Python干货，对我来说这些东西确实已经用不到了，但对于准备自学Python的人来说，或许它就是一个宝藏，可以给你省去很多的时间和精力。别在网上瞎学了，我最近也做了一些资源的更新，只要你是我的粉丝，这期福利你都可拿走。我先来介绍一下这些东西怎么用，文末抱走。（1）Python所有方向的学习路线（
架构评审的自动化与人工智能: 如何提高效率光剑书架上的书架构自动化人工智能运维
1.背景介绍架构评审是软件开发过程中的一个关键环节，它旨在确保软件架构的质量、可维护性和可扩展性。传统的架构评审通常是由人工进行，需要大量的时间和精力。随着大数据技术和人工智能的发展，自动化和人工智能技术已经开始应用于架构评审，从而提高评审的效率和准确性。在本文中，我们将讨论如何通过自动化和人工智能技术来提高架构评审的效率。我们将从以下几个方面进行讨论：背景介绍核心概念与联系核心算法原理和具体操作
【数字化供应链】数字化供应链架构、全景管理、全流程贯通方案数字化建设方案数字化转型数据治理主数据数据仓库供应链数字仓储智慧物流智慧仓储物流园区架构微服务数据挖掘大数据人工智能
原文《数字化供应链架构、全景管理、全流程贯通方案》PPT格式。主要从供应链管理全景、智慧供应链建设总体目标、供应链总体业务流程、供应链总体功能架构、供应链总体技术架构、供应链全流程贯通、供应链全领域管理、供应链数据数据分析、供应链决策中台等进行建设。本文仅对主要内容进行介绍。来源网络公开渠道，旨在交流学习，如有侵权联系速删，更多参考公众号：优享智库基于先进IT技术、大数据能力、物联网应用、区块链平
80 鑫_259b
科普一个谈恋爱的方法。在以前，谈恋爱千难万难，就难在对对方不知底细，不知道对方希望自己是一个怎样的人，要耗费大量的时间去试探、再磨合，往往会因为一些小事一些细节，满盘皆输。在一个信息化的时代，在一个大数据近乎变成了流行语的时代，我们要跟上时代的步伐，通过大数据，去寻找异性最希望自己展现出来的形象是什么，才可以在爱情的道路上少走弯路。那这个大数据怎么操作呢？上街发问卷？问别人的择偶标准？一来会被打死
解锁企业潜能，Vatee万腾平台引领智能新纪元自媒体经济说其他
在数字化转型的浪潮中，企业正站在一个前所未有的十字路口，面对着前所未有的机遇与挑战。解锁企业内在潜能，实现跨越式发展，已成为众多企业的共同追求。而Vatee万腾平台，作为智能科技的先锋，正以其强大的智能赋能能力，引领企业步入一个全新的智能纪元。Vatee万腾平台，是一个集成了人工智能、大数据、云计算等前沿技术的综合性智能服务平台。它不仅仅是一个技术工具，更是企业转型升级的加速器，能够深入企业运营的
释放“AI+”新质生产力，深算院如何“把大数据变小”？ YashanDB YashanDB 国产数据库数据库数据库大数据
近期，南都·湾财社推出《新质·中国造》栏目，深入千行百业，遍访湾区企业，解锁湾区新质生产力，共探高质量发展之道。本期对话深圳计算科学研究院YashanDB首席技术官陈志标，探讨国产数据库如何实现创新突围，抢抓数字经济时代的新机遇。以下是专访内容：如何应对AI时代所面临的算力挑战？南都·湾财社：数据、算力和算法是发展人工智能的三要素，深算院做了怎样的前瞻性布局？陈志标：今年，政府工作报告中首次提及开
数字化智能工厂数字化供应链架构、全景管理、全流程贯通方案数字化建设方案智能制造数字工厂制造业数字化转型工业互联网架构
随着信息技术的飞速发展，数字化转型已成为制造企业提升竞争力的关键途径。数字化智能工厂通过集成先进的物联网(IoT)、大数据、云计算、人工智能(AI)等技术，实现了生产过程的智能化、供应链管理的精准化及决策的科学化。本方案旨在构建一套完善的数字化供应链架构，实现全景管理、全流程贯通、智慧化升级，以数据为驱动，强化技术支撑与安全管理体系，推动企业向智能制造迈进。一、数字化供应链架构1.**集成化平台构
日记——我的歌单静若小猴
又到一年一度大数据汇总的时候了，听歌已经成为很多人生活里的一种乐趣。春夏秋冬，我们都有自己喜欢的歌，歌词歌曲唱出沃尔玛你的心声。还记得大学时候最喜欢听的《春天里》，我有一天单曲回放了30遍，总觉得听着仿佛看到自己声音。还有的歌，初听不知曲中意，再听已经是曲终人，听着歌流泪，听着歌入睡……还记得那些年少的故事吗，总觉得自己才是故事外的人，却不是自己已经入歌。一段时间会喜欢一个人的音乐，一段时间会沉静
Linux dmesg命令：显示开机信息 fafadsj666 linux 数据库数据挖掘机器学习大数据
通过学习《Linux启动管理》一章可以知道，在系统启动过程中，内核还会进行一次系统检测（第一次是BIOS进行加测），但是检测的过程不是没有显示在屏幕上，就是会快速的在屏幕上一闪而过那么，如果开机时来不及查看相关信息，我们是否可以在开机后查看呢？答案是肯定的，使用dmesg命令就可以。无论是系统启动过程中，还是系统运行过程中，只要是内核产生的信息，都会被存储在系统缓冲区中，已经为大家精心准备了大数据
大数据新视界 --大数据大厂之揭秘大数据时代 Excel 魔法：大厂数据分析师进阶秘籍青云交大数据新视界 Excel 数据分析函数公式数据透视表图表功能规划求解数据分析工具库大数据新视界数据库
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
大数据新视界 --大数据大厂之数据挖掘入门：用 R 语言开启数据宝藏的探索之旅青云交大数据新视界数据库大数据数据挖掘 R 语言算法案例未来趋势应用场景学习建议大数据新视界
亲爱的朋友们，热烈欢迎你们来到青云交的博客！能与你们在此邂逅，我满心欢喜，深感无比荣幸。在这个瞬息万变的时代，我们每个人都在苦苦追寻一处能让心灵安然栖息的港湾。而我的博客，正是这样一个温暖美好的所在。在这里，你们不仅能够收获既富有趣味又极为实用的内容知识，还可以毫无拘束地畅所欲言，尽情分享自己独特的见解。我真诚地期待着你们的到来，愿我们能在这片小小的天地里共同成长，共同进步。本博客的精华专栏：Ja
高职人工智能训练师边缘计算实训室解决方案武汉唯众智创人工智能训练师边缘计算实训室人工智能训练师实训室边缘计算实训室
一、引言随着物联网（IoT）、大数据、人工智能（AI）等技术的飞速发展，计算需求日益复杂和多样化。传统的云计算模式虽在一定程度上满足了这些需求，但在处理海量数据、保障实时性与安全性、提升计算效率等方面仍面临诸多挑战。在此背景下，边缘计算作为一种新兴的计算模式应运而生，通过将计算能力推向数据生成或用户所在的网络边缘，显著降低了数据传输的延迟，提升了处理效率，并增强了数据安全性。针对高等职业院校的人工
python基于django/flask的NBA球员大数据分析与可视化python+java+node.js QQ_511008285 python django flask java spring boot 数据分析
前端开发框架:vue.js数据库mysql版本不限后端语言框架支持：1java(SSM/springboot)-idea/eclipse2.Nodejs+Vue.js-vscode3.python(flask/django)--pycharm/vscode4.php(thinkphp/laravel)-hbuilderx数据库工具：Navicat/SQLyog等都可以本文针对NBA球员的大数据进行
Java基于spring boot的国产电影数据分析与可视化python+java+node.js QQ_511008285 java spring boot 数据分析 python django vue.js flask
前端开发框架:vue.js数据库mysql版本不限后端语言框架支持：1java(SSM/springboot)-idea/eclipse2.Nodejs+Vue.js-vscode3.python(flask/django)--pycharm/vscode4.php(thinkphp/laravel)-hbuilderx数据库工具：Navicat/SQLyog等都可以该系统使用进行大数据处理和
数字化（电子化）招标采购平台系统核心功能详细介绍 xinyuan_123456 oracle
数智化招标采购平台覆盖全业务类型、全采购流程、全采购方式，是郑州信源公司运用“互联网+”、大数据、人工智能、区块链、物联网等新兴技术，结合供应链管理理念，以招标采购为核心，提供交易、管理、数据、服务、监管为一体的高标准采购管理平台，赋能政企用户实现采购业务全流程的电子化、数字化、智慧化。根据产品功能及应用领域，产品包括：企业数智化招采供应链平台、金融数智化招采平台、政府数智化采购平台、公共资源数智
jquery实现的jsonp掉java后台知了ing java jsonp jquery
什么是JSONP？先说说JSONP是怎么产生的：其实网上关于JSONP的讲解有很多，但却千篇一律，而且云里雾里，对于很多刚接触的人来讲理解起来有些困难，小可不才，试着用自己的方式来阐释一下这个问题，看看是否有帮助。 1、一个众所周知的问题，Ajax直接请求普通文件存在跨域无权限访问的问题，甭管你是静态页面、动态网页、web服务、WCF，只要是跨域请求，一律不准； 2、
Struts2学习笔记 caoyong struts2
SSH : Spring + Struts2 + Hibernate 三层架构(表示层,业务逻辑层,数据访问层) MVC模式 (Model View Controller) 分层原则:单向依赖，接口耦合 1、Struts2 = Struts + Webwork 2、搭建struts2开发环境 a>、到www.apac
SpringMVC学习之后台往前台传值方法满城风雨近重阳 springMVC
springMVC控制器往前台传值的方法有以下几种： 1.ModelAndView 通过往ModelAndView中存放viewName：目标地址和attribute参数来实现传参： ModelAndView mv=new ModelAndView(); mv.setViewName="success
WebService存在的必要性？一炮送你回车库 webservice
做Java的经常在选择Webservice框架上徘徊很久，Axis Xfire Axis2 CXF ，他们只有一个功能，发布HTTP服务然后用XML做数据传输。是的，他们就做了两个功能，发布一个http服务让客户端或者浏览器连接，接收xml参数并发送xml结果。当在不同的平台间传输数据时，就需要一个都能解析的数据格式。但是为什么要使用xml呢？不能使json或者其他通用数据
js年份下拉框 3213213333332132 java web ee
<div id="divValue">test...</div>测试 //年份 <select id="year"></select> <script type="text/javascript"> window.onload =
简单链式调用的实现技术归来朝歌方法调用链式反应编程思想
在编程中，我们可以经常遇到这样一种场景：一个实例不断调用它自身的方法，像一条链条一样进行调用这样的调用你可能在Ajax中，在页面中添加标签： $("<p>").append($("<span>").text(list[i].name)).appendTo("#result"); 也可能在HQ
JAVA调用.net 发布的webservice 接口 darkranger webservice
/** * @Title: callInvoke * @Description: TODO(调用接口公共方法) * @param @param url 地址 * @param @param method 方法 * @param @param pama 参数 * @param @return * @param @throws BusinessException
Javascript模糊查找 | 第一章循环不能不重视。 aijuans Way
最近受我的朋友委托用js+HTML做一个像手册一样的程序，里面要有可展开的大纲，模糊查找等功能。我这个人说实在的懒，本来是不愿意的，但想起了父亲以前教我要给朋友搞好关系，再加上这也可以巩固自己的js技术，于是就开始开发这个程序，没想到却出了点小问题，我做的查找只能绝对查找。具体的js代码如下： function search(){ var arr=new Array("my
狼和羊，该怎么抉择 atongyeye 工作
狼和羊，该怎么抉择在做一个链家的小项目，只有我和另外一个同事两个人负责，各负责一部分接口，我的接口写完，并全部测联调试通过。所以工作就剩下一下细枝末节的，工作就轻松很多。每天会帮另一个同事测试一些功能点，协助他完成一些业务型不强的工作。今天早上到公司没多久，领导就在QQ上给我发信息，让我多协助同事测试，让我积极主动些，有点责任心等等，我听了这话，心里面立马凉半截，首先一个领导轻易说
读取android系统的联系人拨号百合不是茶 android sqlite数据库内容提供者系统服务的使用
联系人的姓名和号码是保存在不同的表中,不要一下子把号码查询来,我开始就是把姓名和电话同时查询出来的,导致系统非常的慢关键代码: 1, 使用javabean操作存储读取到的数据 package com.example.bean; /** * * @author Admini
ORACLE自定义异常 bijian1013 数据库自定义异常
实例： CREATE OR REPLACE PROCEDURE test_Exception ( ParameterA IN varchar2, ParameterB IN varchar2, ErrorCode OUT varchar2 --返回值,错误编码 ) AS /*以下是一些变量的定义*/ V1 NUMBER; V2 nvarc
查看端号使用情况征客丶 windows
一、查看端口在windows命令行窗口下执行： >netstat -aon|findstr "8080" 显示结果： TCP 127.0.0.1:80 0.0.0.0:0 &
【Spark二十】运行Spark Streaming的NetworkWordCount实例 bit1129 wordcount
Spark Streaming简介 NetworkWordCount代码 /* * Licensed to the Apache Software Foundation (ASF) under one or more * contributor license agreements. See the NOTICE file distributed with
Struts2 与 SpringMVC的比较 BlueSkator struts2 spring mvc
1. 机制：spring mvc的入口是servlet，而struts2是filter，这样就导致了二者的机制不同。 2. 性能：spring会稍微比struts快。spring mvc是基于方法的设计，而sturts是基于类，每次发一次请求都会实例一个action，每个action都会被注入属性，而spring基于方法，粒度更细，但要小心把握像在servlet控制数据一样。spring
Hibernate在更新时，是可以不用session的update方法的(转帖） BreakingBad Hibernate update
地址：http://blog.csdn.net/plpblue/article/details/9304459 public void synDevNameWithItil() {Session session = null;Transaction tr = null;try{session = HibernateUtil.getSession();tr = session.beginTran
读《研磨设计模式》-代码笔记-观察者模式 bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ import java.util.ArrayList; import java.util.List; import java.util.Observable; import java.util.Observer; /** * “观
重置MySQL密码 chenhbc mysql 重置密码忘记密码
如果你也像我这么健忘，把MySQL的密码搞忘记了，经过下面几个步骤就可以重置了（以Windows为例，Linux/Unix类似）： 1、关闭MySQL服务 2、打开CMD，进入MySQL安装目录的bin目录下，以跳过权限检查的方式启动MySQL mysqld --skip-grant-tables 3、新开一个CMD窗口，进入MySQL mysql -uroot
再谈系统论，控制论和信息论 comsci 设计模式生物能源企业应用领域模型
再谈系统论，控制论和信息论偶然看
oracle moving window size与 AWR retention period关系 daizj oracle
转自： http://tomszrp.itpub.net/post/11835/494147 晚上在做11gR1的一个awrrpt报告时,顺便想调整一下AWR snapshot的保留时间,结果遇到了ORA-13541这样的错误.下面是这个问题的发生和解决过程. SQL> select * from v$version; BANNER -------------------
Python版B树 dieslrae python
话说以前的树都用java写的,最近发现python有点生疏了,于是用python写了个B树实现,B树在索引领域用得还是蛮多了,如果没记错mysql的默认索引好像就是B树... 首先是数据实体对象,很简单,只存放key,value class Entity(object): '''数据实体''' def __init__(self,key,value)
C语言冒泡排序 dcj3sjt126com 算法
代码示例： # include <stdio.h> //冒泡排序 void sort(int * a, int len) { int i, j, t; for (i=0; i<len-1; i++) { for (j=0; j<len-1-i; j++) { if (a[j] > a[j+1]) // >表示升序
自定义导航栏样式 dcj3sjt126com 自定义
-(void)setupAppAppearance { [[UILabel appearance] setFont:[UIFont fontWithName:@"FZLTHK—GBK1-0" size:20]]; [UIButton appearance].titleLabel.font =[UIFont fontWithName:@"FZLTH
11.性能优化-优化-JVM参数总结 frank1234 jvm参数性能优化
1.堆 -Xms --初始堆大小 -Xmx --最大堆大小 -Xmn --新生代大小 -Xss --线程栈大小 -XX:PermSize --永久代初始大小 -XX:MaxPermSize --永久代最大值 -XX:SurvivorRatio --新生代和suvivor比例,默认为8 -XX:TargetSurvivorRatio --survivor可使用
nginx日志分割 for linux HarborChung nginx linux 脚本
nginx日志分割 for linux 默认情况下，nginx是不分割访问日志的，久而久之，网站的日志文件将会越来越大，占用空间不说，如果有问题要查看网站的日志的话，庞大的文件也将很难打开，于是便有了下面的脚本使用方法，先将以下脚本保存为 cutlog.sh，放在/root 目录下，然后给予此脚本执行的权限复制代码代码如下: chmo
Spring4新特性——泛型限定式依赖注入 jinnianshilongnian spring spring4 泛型式依赖注入
Spring4新特性——泛型限定式依赖注入 Spring4新特性——核心容器的其他改进 Spring4新特性——Web开发的增强 Spring4新特性——集成Bean Validation 1.1(JSR-349)到SpringMVC Spring4新特性——Groovy Bean定义DSL Spring4新特性——更好的Java泛型操作API Spring4新
centOS安装GCC和G++ liuxihope centos gcc
Centos支持yum安装，安装软件一般格式为yum install .......，注意安装时要先成为root用户。按照这个思路，我想安装过程如下：安装gcc：yum install gcc 安装g++： yum install g++ 实际操作过程发现，只能有gcc安装成功，而g++安装失败，提示g++ command not found。上网查了一下，正确安装应该
第13章 Ajax进阶（上） onestopweb Ajax
index.html <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/
How to determine BusinessObjects service pack and fix pack blueoxygen BO
http://bukhantsov.org/2011/08/how-to-determine-businessobjects-service-pack-and-fix-pack/ The table below is helpful. Reference BOE XI 3.x 12.0.0. y BOE XI 3.0 12.0. x. y BO
Oracle里的自增字段设置 tomcat_oracle oracle
　大家都知道吧，这很坑，尤其是用惯了mysql里的自增字段设置，结果oracle里面没有的。oh，no 　　我用的是12c版本的，它有一个新特性，可以这样设置自增序列，在创建表是，把id设置为自增序列 create table t ( id 　　　　 number generated by default as identity (start with 1 increment b
Spring Security（01）——初体验 yang_winnie spring Security
Spring Security（01）——初体验博客分类： spring Security Spring Security入门安全认证首先我们为Spring Security专门建立一个Spring的配置文件，该文件就专门用来作为Spring Security的配置