晓之以理的喵~~

Kafka生产者详解

一，Kafka生产者的执行过程

生产者客户端由两个线程协调运行，这两个线程分别为主线程和Sender线程（发送线程）：
（1）在主线程中由KafkaProducer创建消息，然后通过可能的拦截器、序列化器和分区器的作用之后缓存到消息累加器（RecordAccumulator，也称消息收集器）中。
（2） Sender线程负责从RecordAccumulator中获取消息并将其发送到Kafka中。

我们从创建一个KafkaProducer对象开始，它将创建一个ProducerRecord对象。这个对象是Kafka中的一个核心类，它代表生产者发送到Kafka服务器端的一个消息对象，即一个Key-Value的键值对。
在ProducerRecord对象中，包含如下信息：
（1）Kafka服务器端的主题名称（Topic Name）。
（2）Topic中可选的分区号。
（3）时间戳。
（4）其他Key-Value键值对。

ProducerRecord创建成功后，需要经过拦截器、序列化器将其转换为字节数组，这样它们才能够在网络上传输，然后消息到达分区器。分区器的作用是根据发送过程中指定的有效的分区号，将ProducerRecord发送到该分区；如果没有指定Topic中的分区号，则会根据Key进行Hash运算，将ProducerRecord映射到一个对应的分区。
ProducerRecord默认采用当前的时间，用户也在创建ProducerRecord的时候提供一个时间戳。

Kafka最终使用的时间戳取决于Topic的配置，而Topic时间戳的配置主要有以下两种：
（1）CreateTime表示使用生产者产生的时间戳作为Kafka最终的时间戳。
（2） LogAppendTime表示生产者记录中的时间戳在将消息添加到其日志中时，将由Kafka Broker重写。
ProducerRecord在经过主线程后，最终由发送线程发送到Kafka服务器端。Kafka Broker在收到消息时会返回一个响应，如果写入成功，则返回一个RecordMetaData对象，它包含主题和分区信息，以及记录在分区里的偏移量，上面两种时间戳类型也会返回给用户。如果写入失败，则返回一个错误。生产者在收到错误之后会尝试重新发送消息，几次之后如果还是写入失败，就返回错误消息。

二、创建基本的消息生产者

要在Kafka消息集群中写入消息，首先需要创建一个生产者对象。Kafka生产者有三个必选的属性：

1，bootstrap.servers

该属性指定Kafka集群中Broker的地址列表，其地址的格式为host:port，如果有多个Broker地址，可以用逗号进行分隔。当然，该地址列表中不需要包含所有Broker，因为Kafka会将整个集群的元信息和配置信息存储在ZooKeeper中，生产者会从给定的Broker中，通过ZooKeeper查找到其他Kafka Broker地址信息。在生产环境中，建议至少要提供两个Broker地址信息，这样做的目的是支持容错。一旦其中一个Broker出现了宕机，生产者仍然能够通过另一个Broker连接到Kafka集群上。

2，key.serializer

发送到Kafka的消息需要经过序列化后，才能实现正常发送与转发。生产者将要发送的消息通过序列化器进行序列化后，生成一个key/value的值，并发送到Broker。当创建Kafka生产者的时候，生产者需要知道采用何种方式把消息（即Java对象）转换为字节数组。因此通过生产者端的参数key.serializer就是这一项配置的工作。它必须实现org.apache.kafka.common.serialization.Serializer接口，然后生产者会使用这个类把键对象序列化为字节数组。

3，value.serializer

value.serializer与key.serializer一样，用于指定的类会将值序列化。

示例代码：

01  Properties props = new Properties();
02  props.put("bootstrap.servers", "kafka101:9092");
03  props.put("acks", "all");
04
05  props.put("retries", 0);
06  props.put("batch.size", 16384);
07  props.put("linger.ms", 1);
08  props.put("buffer.memory", 33554432);
09
10  props.put("key.serializer",
11            "org.apache.kafka.common.serialization.StringSerializer");
12  props.put("value.serializer",
13            "org.apache.kafka.common.serialization.StringSerializer");
14
15  Producer<String, String> producer = new KafkaProducer<String, String>(props)

第05行～第08行代码不是必需的，如果没有配置这些参数，将会采用默认的参数值

三、发送自定义消息对象

Kafka生产者发送的消息必须经过序列化。实现序列化可以简单地总结为两步，第一步继承序列化Serializer接口；第二步实现接口方法，将指定类型序列化成byte[]，或者将byte[]反序列化成指定数据类型。接下来，我们来实现序列化/反序列化方式。
实现Java对象的序列化有很多不同的方式。这里我们介绍基于FastJson的序列化方式。Fastjson是一个Java库，可以将Java对象转换为JSON格式，当然它也可以将JSON字符串转换为Java对象，加入以下依赖。

01  
02      com.alibaba</groupId>
03      fastjson</artifactId>
04      1.2.68</version>
05  </dependency>

四、生产者的消息发送模式

Kafka生产者的消息发送主要有三种模式：发后即忘（fire-and-forget）、同步模式（sync）及异步模式（async）。

1，发后即忘：

只管向Kafka中发送消息而并不用关心消息是否正确到达。在大多数情况下，这种发送方式没有什么问题，不过在某些时候（比如发生不可重试异常时）会造成消息的丢失。这种发送方式的性能最高，可靠性也最差。EmployeeProducer就是采用的这种模式。

2，同步模式：

要实现同步的发送方式，可以利用返回的Future对象的阻塞等待Kafka的响应即可实现，直到消息发送成功。如果发生异常，就需要捕获异常并交由外层逻辑处理。改造一下之前的EmployeeProducer代码，使用同步模式将消息发送到Kafka服务器端。

3，异步模式：

为了在异步发送消息的同时能够对异常情况进行处理，生产者提供了回调支持。一般在send()方法中指定一个Callback的回调函数，Kafka在返回响应时调用该函数来实现异步的发送确认。改造一下之前的EmployeeProducer生产者代码，使用异步模式将消息发送到Kafka服务器端。

五、生产者分区机制

Kafka消息系统为什么要进行Topic的分区呢？我们都知道Kafka的主题Topic是由分区组成的，而将Topic进行分区的主要目的就是提供负载均衡和容错的能力，以及实现系统的高伸缩性和高可用性。Kafka的消息组织方式实际上是三层结构：主题—分区—消息。主题下的每条消息只会保存在某一个分区中，而不会在多个分区中保存多份。在创建Topic的时候可以指定每个分区的副本数，用于支持分区中消息的容错。
不同的分区能够放置在Kafka集群中不同的节点上，而生产者和消费者在产生消息和消费消息的时候，也都是针对分区进行的，这样每个节点的机器都能独立执行各自分区的读写请求处理，并且还可以通过添加新的Kafka节点来增加整体系统的吞吐量。

常见的分区策略：
（1）默认分区策略（org.apache.kafka.clients.producer.internals.DefaultPartitioner）。
（2）轮询分区策略（org.apache.kafka.clients.producer.RoundRobinPartitioner）。
如果key值为null，并且使用了默认的分区器，Kafka会根据轮询（Random Robin）策略将消息均匀地分布到各个分区上。
（3）黏性分区策略（org.apache.kafka.clients.producer.UniformStickyPartitioner）。
黏性分区策略就像黏住这个分区一样，只要这个分区没有被填满，就会尽可能地坚持使用该分区。这种策略首先会选择单个分区发送所有无key的消息，一旦这个分区已填满，黏性分区策略就会随机选择另一个分区。通过查看源码，可以得到黏性分区策略是通过org.apache.kafka.clients.producer. internals.StickyPartitionCache来实现的。
（4）散列分区策略。
如果键值不为null，并且使用了默认的分区器，Kafka会对键进行散列，然后根据散列值把消息映射到对应的分区上。
（5）自定义分区策略。前面提到Kafka生产者的分区策略都实现了接口org.apache.kafka.clients. producer.Partitioner，用户可以根据需要对数据使用不一样的分区策略，只需要实现该接口即可。用户创建了自定义分区策略后，只需要在生产者的Properties中指定ProducerConfig.PARTITIONER_CLASS_CONFIG参数即可。

六、生产者压缩机制

Kafka发送消息的时候，可以在生产者端和Broker端进行消息的压缩。在一般情况下，建议采用的压缩机制是：生产者端负责压缩；Broker端负责保持；消费者端负责解压。Kafka采用这样的压缩机制，主要是节约CPU的时间去换磁盘存储的空间，以及网络I/O的传输量。这样的做法可以以较小的CPU开销带来更少的磁盘占用或更少的网络I/O传输。

七、生产者拦截器

在KafkaProducer的主线程中可以创建一个或多个ProducerInterceptors（拦截器）。拦截器是从Kafka 0.10版本中引入的，在生产者端和消费者端均可设置，拦截器主要用于实现生产者端和消费者端的定制化控制逻辑。对生产者而言，拦截器需要实现org.apache.kafka.clients.producer.ProducerInterceptor接口。

ProducerInterceptor中的方法：

01   package org.apache.kafka.clients.producer;
02
03   import org.apache.kafka.common.Configurable;
04
05   public interface ProducerInterceptor<K, V> extends Configurable {
06
07       public ProducerRecord<K, V> onSend(ProducerRecord<K, V> record);
08
09       public void onAcknowledgement(RecordMetadata metadata, Exceptionexception);
10
11       public void close();
12   }

接口中的三个方法：
（1）onSend。
该方法将在KafkaProducer.send方法的主线程中执行。KafkaProducer确保在消息被序列化以前，调用ProducerInterceptor.onSend方法。用户可以在该方法中对消息进行操作，但最好不要修改消息所属的Topic和分区，否则会影响目标分区的计算。
（2）onAcknowledgement。
该方法会在消息被确认应答之前或消息发送失败时调用。如果生产者采用的是异步发送机制，该方法通常是在生产者回调逻辑触发之前被调用的。需要注意的是，该方法运行在生产者的I/O线程中，因此不要在该方法中放入很重的逻辑，否则会影响生产者的消息发送性能。
（3）close。
关闭拦截器之前，可以将一些资源清理工作放在close方法中。
需要注意的是，如果指定了多个连接器，生产者将按照指定顺序调用它们。如果拦截器中出现了异常，生产者会将异常的错误信息记录到错误日志中，而不是向上传递。

八、生产者的参数配置

1，acks

这个参数控制了发送消息的耐用性，用于指定分区中必须有多少个副本成功接收到消息，之后生产者才会认为这条消息写入是成功的，即生产者需要leader确认请求完成之前接收的应答数。通过查看ProducerConfig的源码可以看出acks参数的本质其实就是一个字符串。

acks参数有三种类型的值。
1）acks=1。
这是acks参数的默认值。Kafka的生产者将消息发送到Kafka的Broker服务器端。只要Topic分区中的Leader成功写入消息，就算该消息成功发送。这时候，生产者就会收到Kafka服务器端Broker的成功确认信息，说明发送成功。
如果在生产者写入消息的过程中，Leader分区所在的Broker出现了宕机，将会造成消息无法正常写入。在重新选举Leader的过程中，生产者Producer会受到一个服务器端返回的错误信息。生产者为了支持容错，避免消息的丢失，会尝试重新发送该消息。直至消息成功写入Leader分区。
这里需要注意的是，如果消息已经成功写入Leader所在的分区，但还未同步至其他Follower分区的时候，如果Leader分区所在的Broker出现了宕机，这时候会造成写入Leader分区的消息丢失。所以在这种参数值的设置下，消息是可能丢失的。
2）acks=0。
在这种参数设置下，Kafka的生产者不需要等待任何服务器端的响应，所以这时Kafka集群可以达到最大的吞吐量。如果消息从生产者发送到写入Kafka消息系统的过程中出现异常，比如Broker宕机，生产者将不会得到任何反馈信息，也不会重发消息，导致消息丢失。
3）acks=-1或acks=all。
在这种参数设置下，Kafka集群将达到最高的可靠性。生产者发送完消息后，需要等待Leader分区和所有Follower分区都成功写入消息后，才返回给生产者一个成功写入消息的应答响应。

2，buffer.memory

Kafka生产者的Sender线程在将消息发送到Kafka服务器端之前，会把消息缓存到内存中，这个参数就决定了消息缓存的内存大小，其默认值是32MB。如果生产者产生消息的速度大于将消息发送到服务器端的速度，那么生产者将会被阻塞，并最终导致生产者抛出一个RecordTooLargeException的异常。
在实际的生产环境下，应该根据实际情况进行测试最终决定buffer.memory参数值的大小。

（1） batch.size。

当Kafka客户端将多个消息发送到同一个分区的时候，生产者为了减少客户端与服务器端的请求交互，会尝试将消息批量打包在一起，进行统一发送，这样有助于提升客户端和服务器端的性能。该配置的默认批次大小（以字节为单位）是16 384字节。如果消息的内存大小大于该参数的配置，将不会进行批量打包的过程。
通过提升batch.size的大小，可以允许更多数据缓冲在分区中，那么一次请求服务器端所发送出去的数据量就更多了，这样吞吐量可能会有所提升。但是这样会造成大量内存的浪费。反过来如果减小batch.size的大小，则会系统地降低吞吐量。如果将batch.size设置为0，则批处理机制被禁用。所以需要在这里按照生产环境的发消息速率，调节不同的batch.size大小，从而设置一个最合理的参数。

（2）compression.type。

该参数指定给到Topic中数据的压缩类型，其有效值的设置可以是标准的压缩方式，例如，‘gzip’、‘snappy’、‘lz4’、‘zstd’，同时该参数也可以是’uncompressed’，在这种设置下，消息数将不会被压缩。

（3）client.id。

当生产者向服务器端发送请求时，传递给服务器端ID字符串。通过这个ID字符串，Kafka服务器端就可以追踪请求的资源，其本质就是将生产者及其请求的资源进行逻辑上的隔离。

（4）connections.max.idle.ms。

当生产者不再往服务器端发送消息时，这个参数用来决定关闭生产者连接的时间阈值，其默认值是9min。

（5） linger.ms。

该参数决定消息在由生产者发送到服务器端之前，在客户端延长发送的时间。通过这样的延时发送机制，可以将多个消息组合成一个批处理进行统一发送。从本质上讲，该参数与之前提到过的batch.size参数类似。合理设置batch.size参数和linger.ms参数，将很好地利用Kafka批处理机制。把linger.ms设置得太小了，比如默认就是0ms，或者设置为5ms，那可能导致Batch虽然设置了32KB，但是经常是还没凑够32KB的数据，5ms之后就直接强制Batch将数据发送出去，这会导致你的Batch形同虚设，一直凑不满数据。

（6）max.block.ms。

该配置控制KafkaProducer.send()和KafkaProducer.partitionsFor()将消息阻塞多长时间。此外也可能是因为缓冲区已满或元数据不可用，导致这些方法被阻止。在用户提供的序列化程序或分区器中的锁定不会计入此超时，其默认值为60 000ms。

（7） max.request.size。

Kafka生产者能发送消息的最大值，默认值为1MB。此设置将限制生产者的单个请求中发送的消息批次数，以避免发送过大的请求。这个参数涉及其他一些相关参数，比如服务器Broker端的message.max.bytes参数，如果message.max.bytes参数设置为10，而max. request.size设置为20，这时候就可以造成生产者报错。

（8） retries和retry.backoff.ms。

如果生产者出现了异常，或者消息没有成功写入Kafka的服务器端，生产者可以配置重试的参数值，通过生产者端的内部重试机制来执行恢复，并不是直接将异常抛出。如果重试达到设定次数，生产者才会放弃重试并抛出异常。retries参数的默认值是0。同时，生产者的重试还与retry.backoff.ms参数有关，该参数用来设定两次重试之间的时间间隔，其默认值是100ms，从而避免无效的频繁重试。在配置retries参数和retry.backoff.ms参数之前，可以设定总重试时间要大于异常恢复时间，最好先估算一下异常恢复时间，避免生产者过早放弃重试。

（9）receive.buffer.bytes。

这个参数用来设置socket接收消息缓冲区的大小，该缓存区大小的默认值32KB。如果将其值设置为-1，则使用操作系统的默认值。

（10）send.buffer.bytes。

这个参数用来设置socket发送消息缓冲区的大小，默认值为128KB。与receive.buffer.bytes参数一样，如果将其值设置为-1，则使用操作系统的默认值。

（11）request.timeout.ms。

消息由生产者发出后，该参数用于决定生产者等待请求响应的最长时间，其默认值为40s。如果响应的时间超过了该参数的设置，客户端将按照重试策略进行重试。注意，这个参数值需要比Broker端的参数replica.lag.time.max.ms值要大，这样可以减少因客户端重试引起的消息重复的概率。

（12） reconnect.backoff.max.ms。

该参数表示Kafka客户端重连的最大时间。每次连接失败，重连时间都会成指数级增加，每次增加的时间会存在20%的随机浮动，以避免连接风暴。

（13）reconnect.backoff.ms。

该参数表示Kafka客户端每次重连时候的间隔时间。

（14）delivery.timeout.ms。

当生产者调用send方法后，该参数用于指定客户端等待发送成功或失败报告时，客户端等待时间的上限。时间上限包括：
　1）一条消息在发送前的延时时间。
　2）生产者等待服务器端Broker确认信息的等待时间。
　3）失败时的重试时间。

（15）partitioner.class。

该参数表示一个实现了org.apache.kafka.clients.producer.Partitioner接口的类。Kafka将使用这个类进行分区操作，其默认值是org.apache.kafka.clients.producer.internals.DefaultPartitioner。通过实现这个接口，可以实现自定义分区。

（16） transaction.timeout.ms。

该参数表示生产者主动终止当前正在进行的操作之前，Kafka等待操作状态更新的最大时间，其默认值是1min。如果该值大于Broker中max.transaction.timeout.ms的设置，则请求失败，并报"InvalidTransactionTimeout"错误。

（17） transactional.id。

在事务传递过程中该参数用于表示某个事务的ID。这样可以保证跨多个生产者会话时语义的可靠性。因为它允许客户端保证在开始任何新事务之前使用相同的Transactional Id的事务来完成。

（18） max.in.flight.requests.per.connection。

该参数表示在消息被阻塞前，每个客户端上发送的未应答请求的最大数量，其默认值是5。注意，如果该参数值设置大于1，并且消息发送失败，则由于客户端的重试增加消息重新排序的风险。

（19） metadata.max.age.ms。

该参数表示当超过这个时间间隔时，系统就会更新元信息，其默认值5min。Kafka的元数据信息由ZooKeeper维护，包含Topic信息、副本信息、分区信息、Broker信息。

（20）metadata.max.idle.ms。

当Topic处于空闲状态时，该参数用于控制生产者抓取Topic元信息的时间。

文章来源：《Kafka进阶》作者：赵渝强

文章内容仅供学习交流，如有侵犯，联系删除哦！

GitHub上克隆项目 bigbig猩猩 github
从GitHub上克隆项目是一个简单且直接的过程，它允许你将远程仓库中的项目复制到你的本地计算机上，以便进行进一步的开发、测试或学习。以下是一个详细的步骤指南，帮助你从GitHub上克隆项目。一、准备工作1.安装Git在克隆GitHub项目之前，你需要在你的计算机上安装Git工具。Git是一个开源的分布式版本控制系统，用于跟踪和管理代码变更。你可以从Git的官方网站（https://git-scm.
Kafka 消息丢失如何处理？架构文摘JGWZ 学习
今天给大家分享一个在面试中经常遇到的问题：Kafka消息丢失该如何处理？这个问题啊，看似简单，其实里面藏着很多“套路”。来，咱们先讲一个面试的“真实”案例。面试官问：“Kafka消息丢失如何处理？”小明一听，反问：“你是怎么发现消息丢失了？”面试官顿时一愣，沉默了片刻后，可能有点不耐烦，说道：“这个你不用管，反正现在发现消息丢失了，你就说如何处理。”小明一头雾水：“问题是都不知道怎么丢的，处理起来
01-Git初识 Meereen Git git
01-Git初识概念：一个免费开源，分布式的代码版本控制系统，帮助开发团队维护代码作用：记录代码内容。切换代码版本，多人开发时高效合并代码内容如何学：个人本机使用：Git基础命令和概念多人共享使用：团队开发同一个项目的代码版本管理Git配置用户信息配置：用户名和邮箱，应用在每次提交代码版本时表明自己的身份命令：查看git版本号git-v配置用户名gitconfig--globaluser.name
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
【六】阿伟开始搭建Kafka学习环境能源恒观中间件学习 kafka spring
阿伟开始搭建Kafka学习环境概述上一篇文章阿伟学习了Kafka的核心概念，并且把市面上流行的消息中间件特性进行了梳理和对比，方便大家在学习过程中进行对比学习，最后梳理了一些Kafka使用中经常遇到的Kafka难题以及解决思路，经过上一篇的学习我相信大家对Kafka有了初步的认识，本篇将继续学习Kafka。一、安装和配置学习一项技术首先要搭建一套服务，而Kafka的运行主要需要部署jdk、zook
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
Java面试题精选：消息队列(二) 芒果不是芒 Java面试题精选 java kafka
一、Kafka的特性1.消息持久化：消息存储在磁盘，所以消息不会丢失2.高吞吐量：可以轻松实现单机百万级别的并发3.扩展性：扩展性强，还是动态扩展4.多客户端支持：支持多种语言（Java、C、C++、GO、）5.KafkaStreams（一个天生的流处理）:在双十一或者销售大屏就会用到这种流处理。使用KafkaStreams可以快速的把销售额统计出来6.安全机制：Kafka进行生产或者消费的时候会
Kafka是如何保证数据的安全性、可靠性和分区的喜欢猪猪 kafka 分布式
Kafka作为一个高性能、可扩展的分布式流处理平台，通过多种机制来确保数据的安全性、可靠性和分区的有效管理。以下是关于Kafka如何保证数据安全性、可靠性和分区的详细解析：一、数据安全性SSL/TLS加密：Kafka支持SSL/TLS协议，通过配置SSL证书和密钥来加密数据传输，确保数据在传输过程中不会被窃取或篡改。这一机制有效防止了中间人攻击，保护了数据的安全性。SASL认证：Kafka支持多种
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
免费的GPT可在线直接使用（一键收藏） kkai人工智能 gpt
1、LuminAI（https://kk.zlrxjh.top）LuminAI标志着一款融合了星辰大数据模型与文脉深度模型的先进知识增强型语言处理系统，旨在自然语言处理（NLP）的技术开发领域发光发热。此系统展现了卓越的语义把握与内容生成能力，轻松驾驭多样化的自然语言处理任务。VisionAI在NLP界的应用领域广泛，能够胜任从机器翻译、文本概要撰写、情绪分析到问答等众多任务。通过对大量文本数据的
华为云分布式缓存服务DCS 8月新特性发布华为云PaaS服务小智华为云分布式缓存
分布式缓存服务（DistributedCacheService，简称DCS）是华为云提供的一款兼容Redis的高速内存数据处理引擎，为您提供即开即用、安全可靠、弹性扩容、便捷管理的在线分布式缓存能力，满足用户高并发及数据快速访问的业务诉求。此次为大家带来DCS8月的特性更新内容，一起来看看吧！
如何利用大数据与AI技术革新相亲交友体验 h17711347205 回归算法安全系统架构交友小程序
在数字化时代，大数据和人工智能（AI）技术正逐渐革新相亲交友体验，为寻找爱情的过程带来前所未有的变革（编辑h17711347205）。通过精准分析和智能匹配，这些技术能够极大地提高相亲交友系统的效率和用户体验。大数据的力量大数据技术能够收集和分析用户的行为模式、偏好和互动数据，为相亲交友系统提供丰富的信息资源。通过分析用户的搜索历史、浏览记录和点击行为，系统能够深入了解用户的兴趣和需求，从而提供更
浅谈MapReduce Android路上的人 Hadoop 分布式计算 mapreduce 分布式框架 hadoop
从今天开始，本人将会开始对另一项技术的学习，就是当下炙手可热的Hadoop分布式就算技术。目前国内外的诸多公司因为业务发展的需要，都纷纷用了此平台。国内的比如BAT啦，国外的在这方面走的更加的前面，就不一一列举了。但是Hadoop作为Apache的一个开源项目，在下面有非常多的子项目，比如HDFS，HBase,Hive，Pig,等等，要先彻底学习整个Hadoop，仅仅凭借一个的力量，是远远不够的。
未来软件市场是怎么样的？做开发的生存空间如何？ cesske 软件需求
目录前言一、未来软件市场的发展趋势二、软件开发人员的生存空间前言未来软件市场是怎么样的？做开发的生存空间如何？一、未来软件市场的发展趋势技术趋势：人工智能与机器学习：随着技术的不断成熟，人工智能将在更多领域得到应用，如智能客服、自动驾驶、智能制造等，这将极大地推动软件市场的增长。云计算与大数据：云计算服务将继续普及，大数据技术的应用也将更加广泛。企业将更加依赖云计算和大数据来优化运营、提升效率，并
KVM+GFS分布式存储系统构建KVM高可用 henan程序媛分布式 GFS 高可用 KVM
一、案列分析1.1案列概述本章案例主要使用之前章节所学的KVM及GlusterFs技术,结合起来从而实现KVM高可用。利用GlusterFs分布式复制卷，对KVM虚拟机文件进行分布存储和冗余。分布式复制卷主要用于需要冗余的情况下把一个文件存放在两个或两个以上的节点,当其中一个节点数据丢失或者损坏之后，KVM仍然能够通过卷组找到另一节点上存储的虚拟机文件，以保证虚拟机正常运行。当节点修复之后，Glu
Hadoop 傲雪凌霜，松柏长青后端大数据 hadoop 大数据分布式
ApacheHadoop是一个开源的分布式计算框架，主要用于处理海量数据集。它具有高度的可扩展性、容错性和高效的分布式存储与计算能力。Hadoop核心由四个主要模块组成，分别是HDFS（分布式文件系统）、MapReduce（分布式计算框架）、YARN（资源管理）和HadoopCommon（公共工具和库）。1.HDFS（HadoopDistributedFileSystem）HDFS是Hadoop生
Hadoop架构 henan程序媛 hadoop 大数据分布式
一、案列分析1.1案例概述现在已经进入了大数据(BigData)时代，数以万计用户的互联网服务时时刻刻都在产生大量的交互，要处理的数据量实在是太大了，以传统的数据库技术等其他手段根本无法应对数据处理的实时性、有效性的需求。HDFS顺应时代出现，在解决大数据存储和计算方面有很多的优势。1.2案列前置知识点1.什么是大数据大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的大量数据集合，
[转载] NoSQL简介 weixin_30325793 大数据数据库运维
摘自“百度百科”。NoSQL，泛指非关系型的数据库。随着互联网web2.0网站的兴起，传统的关系数据库在应付web2.0网站，特别是超大规模和高并发的SNS类型的web2.0纯动态网站已经显得力不从心，暴露了很多难以克服的问题，而非关系型的数据库则由于其本身的特点得到了非常迅速的发展。NoSQL数据库的产生就是为了解决大规模数据集合多重数据种类带来的挑战，尤其是大数据应用难题。虽然NoSQL流行语
大模型训练数据库Common Crawl WindyChanChan 数据集语言模型数据库
CommonCrawl介绍‌‌CommonCrawl是一个非营利组织，致力于通过大规模分布式爬虫系统定期抓取整个Web并将其存储在一个可公开访问的数据库中。CommonCrawl的数据收集和处理过程包括使用Python开源爬虫工具收集全球范围内的网站数据，并将其上传到‌CommonCrawl基金会的数据仓库中。该项目从2008年开始，至今已经积累了大量的原始网页数据、元数据和文本提取数据。这些数据
慢速连接攻击是什么？慢速连接攻击怎么防护？快快小毛毛网络 ddos 服务器
慢速连接攻击（SlowConnectionAttack），又称慢速攻击（SlowlorisAttack），是一种网络攻击技术，旨在通过占用服务器上的所有可用连接资源来使其无法响应正常请求。与传统的拒绝服务（DoS）和分布式拒绝服务（DDoS）攻击不同，慢速攻击并不依赖于发送大量数据包来消耗带宽，而是利用HTTP、TCP或SSL等协议的特性，通过发送大量不完整的请求或缓慢发送数据来占用服务器资源，使
分布式锁和spring事务管理暴躁的鱼锁及事务分布式 spring java
最近开发一个小程序遇到一个需求需要实现分布式事务管理业务需求用户在使用小程序的过程中可以查看景点，对景点地区或者城市标记是否想去，那么需要统计一个地点被标记的人数，以及记录某个用户对某个地点是否标记为想去，用两个表存储数据，一个地点表记录改地点被标记的次数，一个用户意向表记录某个用户对某个地点是否标记为想去。由于可能有多个用户同时标记一个地点，每个用户在前端点击想去按钮之后，后台接收到请求，从数据
Gobelieve 架构 weixin_34099526 数据库 golang json
Gobelievegithub地址声明:转简书JackieF的文章,为了自己方便copy了一份,加一些自己的东西.链接：https://www.jianshu.com/p/8121d6e85282IMCore主要分三大块:im客户连接服务器（可分布式部署，暂无负载均衡模块)imr路由查询服务器（主要解决im分布式部署的问题）ims存储服务器(主从部署)基础模块1.数据包协议包：header(12)
Kafka详细解析与应用分析芊言芊语 kafka 分布式
Kafka是一个开源的分布式事件流平台（EventStreamingPlatform），由LinkedIn公司最初采用Scala语言开发，并基于ZooKeeper协调管理。如今，Kafka已经被Apache基金会纳入其项目体系，广泛应用于大数据实时处理领域。Kafka凭借其高吞吐量、持久化、分布式和可靠性的特点，成为构建实时流数据管道和流处理应用程序的重要工具。Kafka架构Kafka的架构主要由
分享一个基于python的电子书数据采集与可视化分析 hadoop电子书数据分析与推荐系统 spark大数据毕设项目（源码、调试、LW、开题、PPT) 计算机源码社 Python项目大数据大数据 python hadoop 计算机毕业设计选题计算机毕业设计源码数据分析 spark毕设
作者：计算机源码社个人简介：本人八年开发经验，擅长Java、Python、PHP、.NET、Node.js、Android、微信小程序、爬虫、大数据、机器学习等，大家有这一块的问题可以一起交流！学习资料、程序开发、技术解答、文档报告如需要源码，可以扫取文章下方二维码联系咨询Java项目微信小程序项目Android项目Python项目PHP项目ASP.NET项目Node.js项目选题推荐项目实战|p
疫情，疫情东山草
2020年，疫情爆发，至今已近三年，反反复复，此起彼伏。不但没被消灭，还自我发展，从德尔塔到奥密克戎，与时俱进的变异着。去年11月，疫情之下，大数据800米范围内，都成为时空伴随者。“你的码儿有没有变颜色”“你绿码还是黄码”成为那段时间的流行语，当然少不了的还有全员核酸。段子手整出来一首歌：我走过你走过的路,这算不算相逢？我吹过你吹过的风，这算不算相拥？800米内我们不曾擦肩而过，你却要我14天相
linux挂载文件夹小码快撩 linux
1.使用NFS（NetworkFileSystem）NFS是一种分布式文件系统协议，允许一个系统将其文件系统的一部分共享给其他系统。检查是否安装NFSrpm-qa|grepnfs2.启动和启用NFS服务假设服务名称为nfs-server.service，你可以使用以下命令启动和启用它：sudosystemctlstartnfs-server.servicesudosystemctlenablenf
Kafka 基础与架构理解 StaticKing KAFKA kafka
目录前言Kafka基础概念消息队列简介：Kafka与传统消息队列（如RabbitMQ、ActiveMQ）的对比Kafka的组件Kafka的工作原理：消息的生产、分发、消费流程Kafka系统架构Kafka的分布式架构设计Leader-Follower机制与数据复制Log-basedStorage和持久化Broker间通信协议Zookeeper在Kafka中的角色总结前言Kafka是一个分布式的消息系
Rides实现分布式锁，保障数据一致性,Redisson分布式事务处理朱杰jjj 缓存分布式
分布式环境下分布式锁有三种方式：基于数据库分布式锁基于Redis分布式锁基于zk分布式锁本帖只介绍Redis分布式锁为什么需要用到分布式锁？在单机环境下一个服务中多个线程对同一个事物或数据资源进行操作时，可以通过添加加锁方式（synchronized和lock）来解决数据一致性的问题。但是如果出现多个服务的情况下，这时候我们在通过synchronized和lock的方式来加锁会出现问题，因为多个服
机电综合管理系统架构小熊coder 机载系统系统架构
文章目录一、机电综合管理系统架构1.系统概述2.架构层次3.核心组件二、余度管理1.余度概述2.硬件冗余3.软件冗余4.通信冗余三、总线架构1.MIL-STD-1553B总线2.ARINC429总线3.ARINC629总线4.AFDX/ARINC664总线四、未来发展趋势1.分布式架构2.高速网络3.智能化与自动化结语机电综合管理系统（ElectromechanicalManagementSyst
华为云分布式缓存服务DCS与开源服务差异对比 hcinfo_18 redis使用华为云 Redis5.0 分布式缓存服务 Redis客户端
分布式缓存服务DCS提供单机、主备、集群等丰富的实例类型，满足用户高读写性能及快速数据访问的业务诉求。支持丰富的实例管理操作，帮助用户省去运维烦恼。用户可以聚焦于业务逻辑本身，而无需过多考虑部署、监控、扩容、安全、故障恢复等方面的问题。DCS基于开源Redis、Memcached向用户提供一定程度定制化的缓存服务，因此，除了拥有开源服务缓存数据库的优秀特性，DCS提供更多实用功能。一、与开源Red
jQuery 键盘事件keydown ,keypress ,keyup介绍 107x js jquery keydown keypress keyup
本文章总结了下些关于jQuery 键盘事件keydown ,keypress ,keyup介绍，有需要了解的朋友可参考。一、首先需要知道的是： 1、keydown() keydown事件会在键盘按下时触发. 2、keyup() 代码如下复制代码 $('input').keyup(funciton(){
AngularJS中的Promise bijian1013 JavaScript AngularJS Promise
一.Promise Promise是一个接口，它用来处理的对象具有这样的特点：在未来某一时刻（主要是异步调用）会从服务端返回或者被填充属性。其核心是，promise是一个带有then()函数的对象。为了展示它的优点，下面来看一个例子，其中需要获取用户当前的配置文件： var cu
c++ 用数组实现栈类 CrazyMizzz 数据结构 C++
#include<iostream> #include<cassert> using namespace std; template<class T, int SIZE = 50> class Stack{ private: T list[SIZE];//数组存放栈的元素 int top;//栈顶位置 public: Stack(
java和c语言的雷同麦田的设计者 java 递归 scaner
软件启动时的初始化代码，加载用户信息2015年5月27号从头学java二 1、语言的三种基本结构：顺序、选择、循环。废话不多说，需要指出一下几点： a、return语句的功能除了作为函数返回值以外，还起到结束本函数的功能，return后的语句不会再继续执行。 b、for循环相比于whi
LINUX环境并发服务器的三种实现模型被触发 linux
服务器设计技术有很多，按使用的协议来分有TCP服务器和UDP服务器。按处理方式来分有循环服务器和并发服务器。 1 循环服务器与并发服务器模型在网络程序里面，一般来说都是许多客户对应一个服务器，为了处理客户的请求，对服务端的程序就提出了特殊的要求。目前最常用的服务器模型有： ·循环服务器：服务器在同一时刻只能响应一个客户端的请求 ·并发服务器：服
Oracle数据库查询指令肆无忌惮_ oracle数据库
20140920 单表查询 -- 查询************************************************************************************************************ -- 使用scott用户登录 -- 查看emp表 desc emp
ext右下角浮动窗口知了ing JavaScript ext
第一种 <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/
浅谈REDIS数据库的键值设计矮蛋蛋 redis
http://www.cnblogs.com/aidandan/ 原文地址：http://www.hoterran.info/redis_kv_design 丰富的数据结构使得redis的设计非常的有趣。不像关系型数据库那样，DEV和DBA需要深度沟通，review每行sql语句，也不像memcached那样，不需要DBA的参与。redis的DBA需要熟悉数据结构，并能了解使用场景。
maven编译可执行jar包 alleni123 maven
http://stackoverflow.com/questions/574594/how-can-i-create-an-executable-jar-with-dependencies-using-maven <build> <plugins> <plugin> <artifactId>maven-asse
人力资源在现代企业中的作用百合不是茶 HR 企业管理
//人力资源在在企业中的作用人力资源为什么会存在，人力资源究竟是干什么的人力资源管理是对管理模式一次大的创新，人力资源兴起的原因有以下点：工业时代的国际化竞争，现代市场的风险管控等等。所以人力资源在现代经济竞争中的优势明显的存在，人力资源在集团类公司中存在着明显的优势(鸿海集团)，有一次笔者亲自去体验过红海集团的招聘，只知道人力资源是管理企业招聘的当时我被招聘上了，当时给我们培训的人
Linux自启动设置详解 bijian1013 linux
linux有自己一套完整的启动体系，抓住了linux启动的脉络，linux的启动过程将不再神秘。阅读之前建议先看一下附图。本文中假设inittab中设置的init tree为： /etc/rc.d/rc0.d /etc/rc.d/rc1.d /etc/rc.d/rc2.d /etc/rc.d/rc3.d /etc/rc.d/rc4.d /etc/rc.d/rc5.d /etc
Spring Aop Schema实现 bijian1013 java spring AOP
本例使用的是Spring2.5 1.Aop配置文件spring-aop.xml <?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.springframework.org/schema/beans" xmln
【Gson七】Gson预定义类型适配器 bit1129 gson
Gson提供了丰富的预定义类型适配器，在对象和JSON串之间进行序列化和反序列化时，指定对象和字符串之间的转换方式， DateTypeAdapter public final class DateTypeAdapter extends TypeAdapter<Date> { public static final TypeAdapterFacto
【Spark八十八】Spark Streaming累加器操作（updateStateByKey) bit1129 update
在实时计算的实际应用中，有时除了需要关心一个时间间隔内的数据，有时还可能会对整个实时计算的所有时间间隔内产生的相关数据进行统计。比如：对Nginx的access.log实时监控请求404时，有时除了需要统计某个时间间隔内出现的次数，有时还需要统计一整天出现了多少次404，也就是说404监控横跨多个时间间隔。 Spark Streaming的解决方案是累加器，工作原理是，定义
linux系统下通过shell脚本快速找到哪个进程在写文件 ronin47
一个文件正在被进程写我想查看这个进程文件一直在增大找不到谁在写使用lsof也没找到这个问题挺有普遍性的，解决方法应该很多，这里我给大家提个比较直观的方法。 linux下每个文件都会在某个块设备上存放，当然也都有相应的inode, 那么透过vfs.write我们就可以知道谁在不停的写入特定的设备上的inode。幸运的是systemtap的安装包里带了inodewatch.stp，位
java-两种方法求第一个最长的可重复子串 bylijinnan java 算法
import java.util.Arrays; import java.util.Collections; import java.util.List; public class MaxPrefix { public static void main(String[] args) { String str="abbdabcdabcx";
Netty源码学习-ServerBootstrap启动及事件处理过程 bylijinnan java netty
Netty是采用了Reactor模式的多线程版本，建议先看下面这篇文章了解一下Reactor模式： http://bylijinnan.iteye.com/blog/1992325 Netty的启动及事件处理的流程，基本上是按照上面这篇文章来走的文章里面提到的操作，每一步都能在Netty里面找到对应的代码其中Reactor里面的Acceptor就对应Netty的ServerBo
servelt filter listener 的生命周期 cngolon filter listener servelt 生命周期
1. servlet 当第一次请求一个servlet资源时，servlet容器创建这个servlet实例，并调用他的 init(ServletConfig config)做一些初始化的工作，然后调用它的service方法处理请求。当第二次请求这个servlet资源时，servlet容器就不在创建实例，而是直接调用它的service方法处理请求，也就是说
jmpopups获取input元素值 ctrain JavaScript
jmpopups 获取弹出层form表单首先，我有一个div，里面包含了一个表单，默认是隐藏的，使用jmpopups时，会弹出这个隐藏的div，其实jmpopups是将我们的代码生成一份拷贝。当我直接获取这个form表单中的文本框时，使用方法：$('#form input[name=test1]').val()；这样是获取不到的。我们必须到jmpopups生成的代码中去查找这个值，$(
vi查找替换命令详解 daizj linux 正则表达式替换查找 vim
一、查找查找命令 /pattern<Enter> ：向下查找pattern匹配字符串 ?pattern<Enter>：向上查找pattern匹配字符串使用了查找命令之后，使用如下两个键快速查找： n：按照同一方向继续查找 N：按照反方向查找字符串匹配 pattern是需要匹配的字符串，例如： 1: /abc<En
对网站中的js,css文件进行打包 dcj3sjt126com PHP 打包
一，为什么要用smarty进行打包 apache中也有给js,css这样的静态文件进行打包压缩的模块，但是本文所说的不是以这种方式进行的打包，而是和smarty结合的方式来把网站中的js,css文件进行打包。为什么要进行打包呢，主要目的是为了合理的管理自己的代码。现在有好多网站，你查看一下网站的源码的话，你会发现网站的头部有大量的JS文件和CSS文件，网站的尾部也有可能有大量的J
php Yii: 出现undefined offset 或者 undefined index解决方案 dcj3sjt126com undefined
在开发Yii 时，在程序中定义了如下方式： if($this->menuoption[2] === 'test')，那么在运行程序时会报：undefined offset:2，这样的错误主要是由于php.ini 里的错误等级太高了，在windows下错误等级
linux 文件格式（1） sed工具 eksliang linux linux sed工具 sed工具 linux sed详解
转载请出自出处： http://eksliang.iteye.com/blog/2106082 简介 sed 是一种在线编辑器，它一次处理一行内容。处理时，把当前处理的行存储在临时缓冲区中，称为“模式空间”（pattern space），接着用sed命令处理缓冲区中的内容，处理完成后，把缓冲区的内容送往屏幕。接着处理下一行，这样不断重复，直到文件末尾
Android应用程序获取系统权限 gqdy365 android
引用如何使Android应用程序获取系统权限第一个方法简单点，不过需要在Android系统源码的环境下用make来编译： 1. 在应用程序的AndroidManifest.xml中的manifest节点
HoverTree开发日志之验证码 hvt .net C#asp.net hovertree webform
HoverTree是一个ASP.NET的开源CMS，目前包含文章系统，图库和留言板功能。代码完全开放，文章内容页生成了静态的HTM页面，留言板提供留言审核功能，文章可以发布HTML源代码，图片上传同时生成高品质缩略图。推出之后得到许多网友的支持，再此表示感谢！留言板不断收到许多有益留言，但同时也有不少广告，因此决定在提交留言页面增加验证码功能。ASP.NET验证码在网上找，如果不是很多，就是特别多
JSON API：用 JSON 构建 API 的标准指南中文版 justjavac json
译文地址：https://github.com/justjavac/json-api-zh_CN 如果你和你的团队曾经争论过使用什么方式构建合理 JSON 响应格式，那么 JSON API 就是你的 anti-bikeshedding 武器。通过遵循共同的约定，可以提高开发效率，利用更普遍的工具，可以是你更加专注于开发重点：你的程序。基于 JSON API 的客户端还能够充分利用缓存，
数据结构随记_2 lx.asymmetric 数据结构笔记
第三章栈与队列一．简答题 1. 在一个循环队列中，队首指针指向队首元素的前一个位置。 2.在具有n个单元的循环队列中，队满时共有 n-1 个元素。 3. 向栈中压入元素的操作是先移动栈顶指针&n
Linux下的监控工具dstat 网络接口 linux
1) 工具说明dstat是一个用来替换 vmstat,iostat netstat,nfsstat和ifstat这些命令的工具, 是一个全能系统信息统计工具. 与sysstat相比, dstat拥有一个彩色的界面, 在手动观察性能状况时, 数据比较显眼容易观察; 而且dstat支持即时刷新, 譬如输入dstat 3, 即每三秒收集一次, 但最新的数据都会每秒刷新显示. 和sysstat相同的是,
C 语言初级入门--二维数组和指针 1140566087 二维数组 c/c++指针
/* 二维数组的定义和二维数组元素的引用二维数组的定义：当数组中的每个元素带有两个下标时，称这样的数组为二维数组； (逻辑上把数组看成一个具有行和列的表格或一个矩阵); 语法：类型名数组名[常量表达式1][常量表达式2] 二维数组的引用：引用二维数组元素时必须带有两个下标，引用形式如下：例如： int a[3][4]; 引用：
10点睛Spring4.1-Application Event wiselyman application
10.1 Application Event Spring使用Application Event给bean之间的消息通讯提供了手段应按照如下部分实现bean之间的消息通讯继承ApplicationEvent类实现自己的事件实现继承ApplicationListener接口实现监听事件使用ApplicationContext发布消息