Sunshine_Moon

ElasticSearch学习随记-整合Springboot版

ElasticSearch学习随记

前言
- 一、ElasticSearch的安装
- 二、ElasticSearch的好伙伴-Kibana
- 三、ElasticSearch常用语法
- - 1.核心概念
  - - a)索引 index
    - b)类型 type
    - c)映射 mapping
    - d)字段 field
    - e)文档 document
    - f)路由 routing
- 四、常用语法规则
- - 1.创建index
  - 2.新增/修改document
  - 3.删除document
  - 4.删除index
  - 5.查询
  - - 分词器
    - 分词 analyze
    - 查询 term
    - 查询 terms
    - 查询 match
    - 查询 match_all
    - 查询 multi_match
    - 查询 match_phrase
    - 布尔查询 bool
    - 子句 must
    - 子句 must_not
    - 子句 should
    - 子句 filter
    - sort
- 五、特殊案例
- - IK分词器
  - 首字母匹配(适用于英文检索)
  - 距离排序
- 五、如何在Springboot里使用ElasticSearch

前言

本随记内容不足以完全应对ElasticSearch开发环境各种突发情况，只是根据自己的学习进度对日常工作可能遇到的问题的总结与归纳，仅供参考。
PS:以下所提供的各种文档或问题解决思路其实官方文档都有，所以有困难检索官方文档绝对没问题，前提是看得懂英文。

一、ElasticSearch的安装

ElasticSearch的安装网上教程千篇一律，这里就不再进行过多的阐述了。推荐官方民间翻译文档以供参考：

Elasticsearch中文文档 -安装 Elasticsearch

Linux系统里面推荐使用docker进行安装，方便后续维护。在进行docker安装时需要将elasticsearch目录下的config文件夹，data文件夹，plugins文件夹映射到服务器的外部目录下，方便后续的维护和修改。

二、ElasticSearch的好伙伴-Kibana

Kibana是 Elastic 产品集的窗口，可以更方便直观操作命令。你可以把它理解成数据库管理工具Navicat。

Kibana的安装也不进行详细说明，同样贴个几个文档以供参考：

官方文档-安装Kibana
Kibana配置参数概述

三、ElasticSearch常用语法

1.核心概念

a)索引 index

index 类似于传统关系数据库中的一个数据库，是一个存储关系型文档的地方。

b)类型 type

每个 index 可以包含多个 type，这里的 type 类似于传统关系数据库中的表。

c)映射 mapping

mapping 是处理数据的方式和规则方面做一些限制，如某个字段的数据类型、默认值、分析器、是否被索引等等。所以一个根据实际情况进行合理设计的 mapping 会大大提高查询效率和性能。

d)字段 field

field 相当于是数据表的字段，用于标记区分文档数据不同的属性。

e)文档 document

不同的 type 存储着各自的多个 document，document 类似于传统关系数据库中的数据。document 的字段受 mapping 和 field 的规则限制。

如果新增一个 document 包含了 mapping 不曾定义的一个新的 field ，ElasticSearch会默认在mapping 添加当前属性的 field 信息。虽然这种操作很方便，但是还是建议根据实际情况进行合理的 mapping 构建

f)路由 routing

routing 是一个可变值，默认是 document 的_id，也可以是自定义的值。通过公式 shard = hash(routing) % number_of_primary_shards 可以计算出当前 document 储存在哪个分片上。

四、常用语法规则

ElasticSearch的操作遵循Restful风格，并且数据都是以json格式表示

1.创建index

创建一个名字叫 test_index 的索引

index json下有3种属性：

aliases: 索引别名
过滤器和路由
elasticsearch Routing 路由详解

{
  "aliases": {
    "test_index_ali1": {},
    "test_index_ali2": {
    	//过滤器，匹配字段过滤，查询当前别名的文档时，只有匹配的字段才可以查询出来
    	"filter": {},
    	//分配索引储存的路由，保存文档的时候会默认储存在当前分片下
    	"index_routing": "1",
    	//分配索引查询的路由，查询的时候只能查询到当前分片下的文档
    	"search_routing": "1,2",
    	//综合index_routing 和 search_routing的共同用法
    	"routing": "1"
	}
  }
}

mapping: 映射，类似于表结构设计
Elasticsearch 评分score计算中的Boost 和 queryNorm

{
  "mappings": {
    "properties": {
      //字段名
      "title": {
        //字段类型
        "type": "text",
        //分析器
        "analyzer": "ik_smart",
        //评分系数
        "boost": 1
      }
    }
  }
}

setting: 当前索引的配置包括:分片数,副本数,刷新间隔,分析器

{
  "settings":{
   	// 设置索引分片数,默认为1,只能在创建索引时设置,之后任何时候都不能修改
    "number_of_shards": 1,
    // 设置索引分片副本数,默认为1,之后可以任意修改
    "number_of_replicas": 1,
    // 刷新间隔,默认1s
    "refresh_interval": "1s",
    // 分析器
    "analysis":{
    	//分析器
   		"analyzer": {
        	"ngram_analyzer": {
            	"tokenizer": "ngram_tokenizer"
           	}
         },
		 //三者顺序：Character Filters--->Tokenizer--->Token Filter
		 //三者个数：analyzer = CharFilters（0个或多个） + Tokenizer(恰好一个) + TokenFilters(0个或多个)
         //字符过滤器
         "char_filter": {},
         //Token过滤器，将切分的单词进行加工
         "filter": {}, 
         //分词器
         "tokenizer": {}
    }
  }
}

2.新增/修改document

3.删除document

4.删除index

5.查询

使用ElasticSearch进行数据查询时需要注意以下几点：

受字段类型和分析器的影响，不一定所有的数据都可以查询出来
es是适用于一次索引多次查询的场景，如果涉及频繁读写可以根据实际情况提升性能或更换其他技术

分词器

es内置了许多分词器，常用的有：

Standard Analyzer - 默认分词器，按词切分，小写处理
Simple Analyzer - 按照非字母切分(符号被过滤), 小写处理
Stop Analyzer - 小写处理，停用词过滤(the,a,is)
Whitespace Analyzer - 按照空格切分，不转小写
Keyword Analyzer - 不分词，直接将输入当作输出
Patter Analyzer - 正则表达式，默认\W+(非字符分割)
Language - 提供了30多种常见语言的分词器
Customer Analyzer 自定义分词器
分词器概念

除此之外，推荐一个第三方的分词器 IK分词器，可以用来切分中文信息。但是除了它配置里面内置的一些词库，有些生僻字或者非常用词语需要自行学习添加，不一定适用所有关键字查询

分词 analyze

如何知道所使用的分词器对需要查询的关键字怎么进行分词的？是否是你想要的结果？可以使用如下查询

GET _analyze
{
 "analyzer": "ik_max_word",
 "text" : "Beauty & Healthy"
}

查询 term

查询某个字段里含有某个关键词的文档，它并不知道分词器的存在，这种查询适合keyword、numeric、date等明确值的

查询 terms

查询某个字段里含有多个关键词的文档

查询 match

知道分词器的存在，会对field进行分词操作，然后再查询

查询 match_all

查询所有文档

查询 multi_match

可以指定多个字段

查询 match_phrase

ES引擎首先分析查询字符串，从分析后的文本中构建短语查询，这意味着必须匹配短语中的所有分词，并且保证各个分词的相对位置不变

布尔查询 bool

Bool查询对应Lucene中的BooleanQuery，它由一个或者多个子句组成，每个子句都有特定的类型。

子句 must

返回的文档必须满足must子句的条件，并且参与计算分值

子句 must_not

返回的文档必须不满足must_not定义的条件。

子句 should

返回的文档可能满足should子句的条件。在一个Bool查询中，如果没有must或者filter，有一个或者多个should子句，那么只要满足一个就可以返回。minimum_should_match参数定义了至少满足几个子句。

子句 filter

返回的文档必须满足filter子句的条件。但是不会像Must一样，参与计算分值

sort

默认排序规则是用es评分倒序排序的，可以自定义其他排序规则。

五、特殊案例

IK分词器

IK分词器属于第三方插件，需要自行安装。下载安装包，解压到plugins目录下，重启es即可使用。
IK分词器是根据其内部词库分词的，其内置的词库不一定能完全匹配日常用语，所以可以通过配置文件IKAnalyzer.cfg自行丰富其词库：

本地扩展词库修改后需要重启es才能生效；远程词库可以进行热更新。
IK中文分词器远程字典设置+热更新

首字母匹配(适用于英文检索)

中文分词可以用ik分词器解决，但是当查询英文文本进行分词的时候并不能很好命中关键字。举个例子：
现在有个文档name属性的值为Beauty & Healthy，用常规分词器或者ik分词器使用analyze分析下



可以发现，只有你搜索beauty 或者 healthy 的时候才可以将这条数据查询出来。但有时需要做搜索推荐的时候，可能我们只希望搜索be 或这 b 或者 eau 这种关键字的就能将这条数据带出来，那么已知的常规分词器暂时无法实现这种功能，这个时候就推荐使用edge_ngram 或者 ngram分词器。

这两个分词器需要在创建index的时候去自定义一些常规参数才能正常使用。下面以ngram分词器举例

PUT test_index
{
    "settings": {
    	//NGramTokenizer和NGramTokenFilter的min_gram和max_gram之间允许的最大差异。默认为1。，必须要加，不然会报错
   		"index.max_ngram_diff": 4,
        "analysis": {
          "analyzer": {
          	//声明分词器
            "ngram_analyzer": {
              "tokenizer": "ngram_tokenizer"
            }
          },
          "tokenizer": {
            //定义ngram的参数
            "ngram_tokenizer": {
              "type": "ngram",
              //分词后词语的最小长度
              "min_gram": 1,
              //分词后词语的最大长度
              "max_gram": 4,
              //设置分词的形式，例如，是数字还是文字。elasticsearch将根据分词的形式对文本进行分词。
              "token_chars": [
                "letter",
                "digit"
              ]
            }
          }
        }
      }
}

返回结果

{
  "tokens" : [
    {
      "token" : "B",
      "start_offset" : 0,
      "end_offset" : 1,
      "type" : "word",
      "position" : 0
    },
    {
      "token" : "Be",
      "start_offset" : 0,
      "end_offset" : 2,
      "type" : "word",
      "position" : 1
    },
    {
      "token" : "Bea",
      "start_offset" : 0,
      "end_offset" : 3,
      "type" : "word",
      "position" : 2
    },
    {
      "token" : "Beau",
      "start_offset" : 0,
      "end_offset" : 4,
      "type" : "word",
      "position" : 3
    },
    {
      "token" : "e",
      "start_offset" : 1,
      "end_offset" : 2,
      "type" : "word",
      "position" : 4
    },
    {
      "token" : "ea",
      "start_offset" : 1,
      "end_offset" : 3,
      "type" : "word",
      "position" : 5
    },
    {
      "token" : "eau",
      "start_offset" : 1,
      "end_offset" : 4,
      "type" : "word",
      "position" : 6
    },
    {
      "token" : "eaut",
      "start_offset" : 1,
      "end_offset" : 5,
      "type" : "word",
      "position" : 7
    },
    {
      "token" : "a",
      "start_offset" : 2,
      "end_offset" : 3,
      "type" : "word",
      "position" : 8
    },
    {
      "token" : "au",
      "start_offset" : 2,
      "end_offset" : 4,
      "type" : "word",
      "position" : 9
    },
    {
      "token" : "aut",
      "start_offset" : 2,
      "end_offset" : 5,
      "type" : "word",
      "position" : 10
    },
    {
      "token" : "auty",
      "start_offset" : 2,
      "end_offset" : 6,
      "type" : "word",
      "position" : 11
    },
    {
      "token" : "u",
      "start_offset" : 3,
      "end_offset" : 4,
      "type" : "word",
      "position" : 12
    },
    {
      "token" : "ut",
      "start_offset" : 3,
      "end_offset" : 5,
      "type" : "word",
      "position" : 13
    },
    {
      "token" : "uty",
      "start_offset" : 3,
      "end_offset" : 6,
      "type" : "word",
      "position" : 14
    },
    {
      "token" : "t",
      "start_offset" : 4,
      "end_offset" : 5,
      "type" : "word",
      "position" : 15
    },
    {
      "token" : "ty",
      "start_offset" : 4,
      "end_offset" : 6,
      "type" : "word",
      "position" : 16
    },
    {
      "token" : "y",
      "start_offset" : 5,
      "end_offset" : 6,
      "type" : "word",
      "position" : 17
    },
    {
      "token" : "H",
      "start_offset" : 9,
      "end_offset" : 10,
      "type" : "word",
      "position" : 18
    },
    {
      "token" : "He",
      "start_offset" : 9,
      "end_offset" : 11,
      "type" : "word",
      "position" : 19
    },
    {
      "token" : "Hea",
      "start_offset" : 9,
      "end_offset" : 12,
      "type" : "word",
      "position" : 20
    },
    {
      "token" : "Heal",
      "start_offset" : 9,
      "end_offset" : 13,
      "type" : "word",
      "position" : 21
    },
    {
      "token" : "e",
      "start_offset" : 10,
      "end_offset" : 11,
      "type" : "word",
      "position" : 22
    },
    {
      "token" : "ea",
      "start_offset" : 10,
      "end_offset" : 12,
      "type" : "word",
      "position" : 23
    },
    {
      "token" : "eal",
      "start_offset" : 10,
      "end_offset" : 13,
      "type" : "word",
      "position" : 24
    },
    {
      "token" : "ealt",
      "start_offset" : 10,
      "end_offset" : 14,
      "type" : "word",
      "position" : 25
    },
    {
      "token" : "a",
      "start_offset" : 11,
      "end_offset" : 12,
      "type" : "word",
      "position" : 26
    },
    {
      "token" : "al",
      "start_offset" : 11,
      "end_offset" : 13,
      "type" : "word",
      "position" : 27
    },
    {
      "token" : "alt",
      "start_offset" : 11,
      "end_offset" : 14,
      "type" : "word",
      "position" : 28
    },
    {
      "token" : "alth",
      "start_offset" : 11,
      "end_offset" : 15,
      "type" : "word",
      "position" : 29
    },
    {
      "token" : "l",
      "start_offset" : 12,
      "end_offset" : 13,
      "type" : "word",
      "position" : 30
    },
    {
      "token" : "lt",
      "start_offset" : 12,
      "end_offset" : 14,
      "type" : "word",
      "position" : 31
    },
    {
      "token" : "lth",
      "start_offset" : 12,
      "end_offset" : 15,
      "type" : "word",
      "position" : 32
    },
    {
      "token" : "lthy",
      "start_offset" : 12,
      "end_offset" : 16,
      "type" : "word",
      "position" : 33
    },
    {
      "token" : "t",
      "start_offset" : 13,
      "end_offset" : 14,
      "type" : "word",
      "position" : 34
    },
    {
      "token" : "th",
      "start_offset" : 13,
      "end_offset" : 15,
      "type" : "word",
      "position" : 35
    },
    {
      "token" : "thy",
      "start_offset" : 13,
      "end_offset" : 16,
      "type" : "word",
      "position" : 36
    },
    {
      "token" : "h",
      "start_offset" : 14,
      "end_offset" : 15,
      "type" : "word",
      "position" : 37
    },
    {
      "token" : "hy",
      "start_offset" : 14,
      "end_offset" : 16,
      "type" : "word",
      "position" : 38
    },
    {
      "token" : "y",
      "start_offset" : 15,
      "end_offset" : 16,
      "type" : "word",
      "position" : 39
    }
  ]
}

Tokenizer常用用法
自定义ngram分词器
edge_ngram 和 ngram的区别

距离排序

常规排序里距离排序占了很大的分量，这里参考官方文档即可。
按距离排序

五、如何在Springboot里使用ElasticSearch

springboot中使用ElasticSearch的详细教程

Long类型前后端数据不一致 igotyback 前端
响应给前端的数据浏览器控制台中response中看到的Long类型的数据是正常的到前端数据不一致前后端数据类型不匹配是一个常见问题，尤其是当后端使用Java的Long类型（64位）与前端JavaScript的Number类型（最大安全整数为2^53-1，即16位）进行数据交互时，很容易出现精度丢失的问题。这是因为JavaScript中的Number类型无法安全地表示超过16位的整数。为了解决这个问
LocalDateTime 转 String igotyback java 开发语言
importjava.time.LocalDateTime;importjava.time.format.DateTimeFormatter;publicclassMain{publicstaticvoidmain(String[]args){//获取当前时间LocalDateTimenow=LocalDateTime.now();//定义日期格式化器DateTimeFormatterformat
Linux下QT开发的动态库界面弹出操作（SDL2） 13jjyao QT类 qt 开发语言 sdl2 linux
需求：操作系统为linux，开发框架为qt，做成需带界面的qt动态库，调用方为java等非qt程序难点：调用方为java等非qt程序，也就是说调用方肯定不带QApplication::exec()，缺少了这个，QTimer等事件和QT创建的窗口将不能弹出(包括opencv也是不能弹出)；这与qt调用本身qt库是有本质的区别的思路：1.调用方缺QApplication::exec()，那么我们在接口
DIV+CSS+JavaScript技术制作网页（旅游主题网页设计与制作）云南大理 STU学生网页设计网页设计期末网页作业 html静态网页 html5期末大作业网页设计 web大作业
️精彩专栏推荐作者主页:【进入主页—获取更多源码】web前端期末大作业：【HTML5网页期末作业(1000套)】程序员有趣的告白方式：【HTML七夕情人节表白网页制作(110套)】文章目录二、网站介绍三、网站效果▶️1.视频演示2.图片演示四、网站代码HTML结构代码CSS样式代码五、更多源码二、网站介绍网站布局方面：计划采用目前主流的、能兼容各大主流浏览器、显示效果稳定的浮动网页布局结构。网站程
【华为OD机试真题2023B卷 JAVA&JS】We Are A Team 若博豆 java 算法华为 javascript
华为OD2023（B卷）机试题库全覆盖，刷题指南点这里WeAreATeam时间限制：1秒|内存限制：32768K|语言限制：不限题目描述：总共有n个人在机房，每个人有一个标号（1<=标号<=n），他们分成了多个团队，需要你根据收到的m条消息判定指定的两个人是否在一个团队中，具体的：1、消息构成为：abc，整数a、b分别代
关于城市旅游的HTML网页设计——(旅游风景云南 5页)HTML+CSS+JavaScript 二挡起步 web前端期末大作业 javascript html css 旅游风景
⛵源码获取文末联系✈Web前端开发技术描述网页设计题材，DIV+CSS布局制作,HTML+CSS网页设计期末课程大作业|游景点介绍|旅游风景区|家乡介绍|等网站的设计与制作|HTML期末大学生网页设计作业，Web大学生网页HTML：结构CSS：样式在操作方面上运用了html5和css3，采用了div+css结构、表单、超链接、浮动、绝对定位、相对定位、字体样式、引用视频等基础知识JavaScrip
HTML网页设计制作大作业（div+css）云南我的家乡旅游景点带文字滚动二挡起步 web前端期末大作业 web设计网页规划与设计 html css javascript dreamweaver 前端
Web前端开发技术描述网页设计题材，DIV+CSS布局制作,HTML+CSS网页设计期末课程大作业游景点介绍|旅游风景区|家乡介绍|等网站的设计与制作HTML期末大学生网页设计作业HTML：结构CSS：样式在操作方面上运用了html5和css3，采用了div+css结构、表单、超链接、浮动、绝对定位、相对定位、字体样式、引用视频等基础知识JavaScript：做与用户的交互行为文章目录前端学习路线
node.js学习小猿L node.js node.js 学习 vim
node.js学习实操及笔记温故node.js，node.js学习实操过程及笔记~node.js学习视频node.js官网node.js中文网实操笔记githubcsdn笔记为什么学node.js可以让别人访问我们编写的网页为后续的框架学习打下基础，三大框架vuereactangular离不开node.jsnode.js是什么官网：node.js是一个开源的、跨平台的运行JavaScript的运行
ES聚合分析原理与代码实例讲解光剑书架上的书大厂Offer收割机面试题简历程序员读书硅基计算碳基计算认知计算生物计算深度学习神经网络大数据 AIGC AGI LLM Java Python 架构设计 Agent 程序员实现财富自由
ES聚合分析原理与代码实例讲解1.背景介绍1.1问题的由来在大规模数据分析场景中，特别是在使用Elasticsearch（ES）进行数据存储和检索时，聚合分析成为了一个至关重要的功能。聚合分析允许用户对数据集进行细分和分组，以便深入探索数据的结构和模式。这在诸如实时监控、日志分析、业务洞察等领域具有广泛的应用。1.2研究现状目前，ES聚合分析已经成为现代大数据平台的核心组件之一。它支持多种类型的聚
Java 重写(Override)与重载(Overload) 叨唧唧的
Java重写(Override)与重载(Overload)重写(Override)重写是子类对父类的允许访问的方法的实现过程进行重新编写,返回值和形参都不能改变。即外壳不变，核心重写！重写的好处在于子类可以根据需要，定义特定于自己的行为。也就是说子类能够根据需要实现父类的方法。重写方法不能抛出新的检查异常或者比被重写方法申明更加宽泛的异常。例如：父类的一个方法申明了一个检查异常IOExceptio
简单了解 JVM 记得开心一点啊 jvm
目录♫什么是JVM♫JVM的运行流程♫JVM运行时数据区♪虚拟机栈♪本地方法栈♪堆♪程序计数器♪方法区/元数据区♫类加载的过程♫双亲委派模型♫垃圾回收机制♫什么是JVMJVM是JavaVirtualMachine的简称，意为Java虚拟机。虚拟机是指通过软件模拟的具有完整硬件功能的、运行在一个完全隔离的环境中的完整计算机系统（如：JVM、VMwave、VirtualBox）。JVM和其他两个虚拟机
1分钟解决 -bash: mvn: command not found，在Centos 7中安装Maven Energet!c 开发语言
1分钟解决-bash:mvn:commandnotfound，在Centos7中安装Maven检查Java环境1下载Maven2解压Maven3配置环境变量4验证安装5常见问题与注意事项6总结检查Java环境Maven依赖Java环境，请确保系统已经安装了Java并配置了环境变量。可以通过以下命令检查：java-version如果未安装，请先安装Java。1下载Maven从官网下载：前往Apach
Java企业面试题3 马龙强_ java
1.break和continue的作用(智*图)break：用于完全退出一个循环（如for,while）或一个switch语句。当在循环体内遇到break语句时，程序会立即跳出当前循环体，继续执行循环之后的代码。continue：用于跳过当前循环体中剩余的部分，并开始下一次循环。如果是在for循环中使用continue，则会直接进行条件判断以决定是否执行下一轮循环。2.if分支语句和switch分
JVM、JRE和 JDK：理解Java开发的三大核心组件 Y雨何时停T Java java
Java是一门跨平台的编程语言，它的成功离不开背后强大的运行环境与开发工具的支持。在Java的生态中，JVM（Java虚拟机）、JRE（Java运行时环境）和JDK（Java开发工具包）是三个至关重要的核心组件。本文将探讨JVM、JDK和JRE的区别，帮助你更好地理解Java的运行机制。1.JVM：Java虚拟机（JavaVirtualMachine）什么是JVM？JVM，即Java虚拟机，是Ja
Java面试题精选：消息队列(二) 芒果不是芒 Java面试题精选 java kafka
一、Kafka的特性1.消息持久化：消息存储在磁盘，所以消息不会丢失2.高吞吐量：可以轻松实现单机百万级别的并发3.扩展性：扩展性强，还是动态扩展4.多客户端支持：支持多种语言（Java、C、C++、GO、）5.KafkaStreams（一个天生的流处理）:在双十一或者销售大屏就会用到这种流处理。使用KafkaStreams可以快速的把销售额统计出来6.安全机制：Kafka进行生产或者消费的时候会
白骑士的Java教学基础篇 2.5 控制流语句白骑士所长 Java 教学 java 开发语言
欢迎继续学习Java编程的基础篇！在前面的章节中，我们了解了Java的变量、数据类型和运算符。接下来，我们将探讨Java中的控制流语句。控制流语句用于控制程序的执行顺序，使我们能够根据特定条件执行不同的代码块，或重复执行某段代码。这是编写复杂程序的基础。通过学习这一节内容，你将掌握如何使用条件语句和循环语句来编写更加灵活和高效的代码。条件语句条件语句用于根据条件的真假来执行不同的代码块。if语句‘
python语法——三目运算符 HappyRocking python python 三目运算符
在java中，有三目运算符，如：intc=(a>b)?a:b表示c取两者中的较大值。但是在python，不能直接这样使用，估计是因为冒号在python有分行的关键作用。那么在python中，如何实现类似功能呢？可以使用ifelse语句，也是一行可以完成，格式为：aifbelsec表示如果b为True，则表达式等于a，否则等于c。如：c=(aif(a>b)elseb)同样是完成了取最大值的功能。
ArrayList 源码解析程序猿进阶 Java基础 ArrayList List java 面试性能优化架构设计 idea
ArrayList是Java集合框架中的一个动态数组实现，提供了可变大小的数组功能。它继承自AbstractList并实现了List接口，是顺序容器，即元素存放的数据与放进去的顺序相同，允许放入null元素，底层通过数组实现。除该类未实现同步外，其余跟Vector大致相同。每个ArrayList都有一个容量capacity，表示底层数组的实际大小，容器内存储元素的个数不能多于当前容量。当向容器中添
Java爬虫框架（一）--架构设计狼图腾-狼之传说 java 框架 java 任务 html解析器存储电子商务
一、架构图那里搜网络爬虫框架主要针对电子商务网站进行数据爬取，分析，存储，索引。爬虫：爬虫负责爬取，解析，处理电子商务网站的网页的内容数据库：存储商品信息索引：商品的全文搜索索引Task队列：需要爬取的网页列表Visited表：已经爬取过的网页列表爬虫监控平台：web平台可以启动，停止爬虫，管理爬虫，task队列，visited表。二、爬虫1.流程1)Scheduler启动爬虫器，TaskMast
Java：爬虫框架 dingcho Java java 爬虫
一、ApacheNutch2【参考地址】Nutch是一个开源Java实现的搜索引擎。它提供了我们运行自己的搜索引擎所需的全部工具。包括全文搜索和Web爬虫。Nutch致力于让每个人能很容易,同时花费很少就可以配置世界一流的Web搜索引擎.为了完成这一宏伟的目标,Nutch必须能够做到:每个月取几十亿网页为这些网页维护一个索引对索引文件进行每秒上千次的搜索提供高质量的搜索结果简单来说Nutch支持分
python怎么将png转为tif_png转tif weixin_39977276
发国外的文章要求图片是tif，cmyk色彩空间的。大小尺寸还有要求。比如网上大神多，找到了一段代码，感谢！https://www.jianshu.com/p/ec2af4311f56https://github.com/KevinZc007/image2Tifimportjava.awt.image.BufferedImage;importjava.io.File;importjava.io.Fi
springboot+vue项目实战一-创建SpringBoot简单项目苹果酱0567 面试题汇总与解析 spring boot 后端 java 中间件开发语言
这段时间抽空给女朋友搭建一个个人博客，想着记录一下建站的过程，就当做笔记吧。虽然复制zjblog只要一个小时就可以搞定一个网站，或者用cms系统，三四个小时就可以做出一个前后台都有的网站，而且想做成啥样也都行。但是就是要从新做，自己做的意义不一样，更何况，俺就是专门干这个的，嘿嘿嘿要做一个网站，而且从零开始，首先呢就是技术选型了，经过一番思量决定选择-SpringBoot做后端，前端使用Vue做一
JavaScript 中，深拷贝（Deep Copy）和浅拷贝（Shallow Copy）跳房子的前端前端面试 javascript 开发语言 ecmascript
在JavaScript中，深拷贝（DeepCopy）和浅拷贝（ShallowCopy）是用于复制对象或数组的两种不同方法。了解它们的区别和应用场景对于避免潜在的bugs和高效地处理数据非常重要。以下是对深拷贝和浅拷贝的详细解释，包括它们的概念、用途、优缺点以及实现方式。1.浅拷贝（ShallowCopy）概念定义：浅拷贝是指创建一个新的对象或数组，其中包含了原对象或数组的基本数据类型的值和对引用数
JAVA·一个简单的登录窗口 MortalTom java 开发语言学习
文章目录概要整体架构流程技术名词解释技术细节资源概要JavaSwing是Java基础类库的一部分，主要用于开发图形用户界面（GUI）程序整体架构流程新建项目，导入sql.jar包（链接放在了文末），编译项目并运行技术名词解释一、特点丰富的组件提供了多种可视化组件，如按钮（JButton）、文本框（JTextField）、标签（JLabel）、下拉列表（JComboBox）等，可以满足不同的界面设计
Spring Boot中实现跨域请求 BABA8891 spring boot 后端 java
在SpringBoot中实现跨域请求（CORS，Cross-OriginResourceSharing）可以通过多种方式，以下是几种常见的方法：1.使用@CrossOrigin注解在SpringBoot中，你可以在控制器或者具体的请求处理方法上使用@CrossOrigin注解来允许跨域请求。在控制器上应用：importorg.springframework.web.bind.annotation.
WebMagic：强大的Java爬虫框架解析与实战 Aaron_945 Java java 爬虫开发语言
文章目录引言官网链接WebMagic原理概述基础使用1.添加依赖2.编写PageProcessor高级使用1.自定义Pipeline2.分布式抓取优点结论引言在大数据时代，网络爬虫作为数据收集的重要工具，扮演着不可或缺的角色。Java作为一门广泛使用的编程语言，在爬虫开发领域也有其独特的优势。WebMagic是一个开源的Java爬虫框架，它提供了简单灵活的API，支持多线程、分布式抓取，以及丰富的
博客网站制作教程 2401_85194651 java maven
首先就是技术框架：后端：Java+SpringBoot数据库：MySQL前端：Vue.js数据库连接：JPA(JavaPersistenceAPI)1.项目结构blog-app/├──backend/│├──src/main/java/com/example/blogapp/││├──BlogApplication.java││├──config/│││└──DatabaseConfig.java
00. 这里整理了最全的爬虫框架（Java + Python）有一只柴犬爬虫系列爬虫 java python
目录1、前言2、什么是网络爬虫3、常见的爬虫框架3.1、java框架3.1.1、WebMagic3.1.2、Jsoup3.1.3、HttpClient3.1.4、Crawler4j3.1.5、HtmlUnit3.1.6、Selenium3.2、Python框架3.2.1、Scrapy3.2.2、BeautifulSoup+Requests3.2.3、Selenium3.2.4、PyQuery3.2
JAVA学习笔记之23种设计模式学习 victorfreedom Java技术设计模式 android java 常用设计模式
博主最近买了《设计模式》这本书来学习，无奈这本书是以C++语言为基础进行说明，整个学习流程下来效率不是很高，虽然有的设计模式通俗易懂，但感觉还是没有充分的掌握了所有的设计模式。于是博主百度了一番，发现有大神写过了这方面的问题，于是博主迅速拿来学习。一、设计模式的分类总体来说设计模式分为三大类：创建型模式，共五种：工厂方法模式、抽象工厂模式、单例模式、建造者模式、原型模式。结构型模式，共七种：适配器
JavaScript `Map` 和 `WeakMap`详细解释跳房子的前端 JavaScript 原生方法 javascript 前端开发语言
在JavaScript中，Map和WeakMap都是用于存储键值对的数据结构，但它们有一些关键的不同之处。MapMap是一种可以存储任意类型的键值对的集合。它保持了键值对的插入顺序，并且可以通过键快速查找对应的值。Map提供了一些非常有用的方法和属性来操作这些数据对：set(key,value):将一个键值对添加到Map中。如果键已经存在，则更新其对应的值。get(key):获取指定键的值。如果键
mondb入手木zi_鸣 mongodb
windows 启动mongodb 编写bat文件， mongod --dbpath D:\software\MongoDBDATA mongod --help 查询各种配置配置在mongob 打开批处理，即可启动，27017原生端口，shell操作监控端口扩展28017，web端操作端口启动配置文件配置，数据更灵活
大型高并发高负载网站的系统架构 bijian1013 高并发负载均衡
扩展Web应用程序一.概念简单的来说，如果一个系统可扩展，那么你可以通过扩展来提供系统的性能。这代表着系统能够容纳更高的负载、更大的数据集，并且系统是可维护的。扩展和语言、某项具体的技术都是无关的。扩展可以分为两种： 1.
DISPLAY变量和xhost(原创) czmmiao display
DISPLAY 在Linux/Unix类操作系统上, DISPLAY用来设置将图形显示到何处. 直接登陆图形界面或者登陆命令行界面后使用startx启动图形, DISPLAY环境变量将自动设置为:0:0, 此时可以打开终端, 输出图形程序的名称(比如xclock)来启动程序, 图形将显示在本地窗口上, 在终端上输入printenv查看当前环境变量, 输出结果中有如下内容:DISPLAY=:0.0
获取B/S客户端IP 周凡杨 java 编程 jsp Web 浏览器
最近想写个B/S架构的聊天系统，因为以前做过C/S架构的QQ聊天系统，所以对于Socket通信编程只是一个巩固。对于C/S架构的聊天系统，由于存在客户端Java应用，所以直接在代码中获取客户端的IP，应用的方法为： String ip = InetAddress.getLocalHost().getHostAddress(); 然而对于WEB
浅谈类和对象朱辉辉33 编程
类是对一类事物的总称，对象是描述一个物体的特征，类是对象的抽象。简单来说，类是抽象的，不占用内存，对象是具体的，占用存储空间。类是由属性和方法构成的，基本格式是public class 类名{ //定义属性 private/public 数据类型属性名； //定义方法 publ
android activity与viewpager+fragment的生命周期问题肆无忌惮_ viewpager
有一个Activity里面是ViewPager，ViewPager里面放了两个Fragment。第一次进入这个Activity。开启了服务，并在onResume方法中绑定服务后，对Service进行了一定的初始化，其中调用了Fragment中的一个属性。 super.onResume(); bindService(intent, conn, BIND_AUTO_CREATE);
base64Encode对图片进行编码 843977358 base64 图片 encoder
/** * 对图片进行base64encoder编码 * * @author mrZhang * @param path * @return */ public static String encodeImage(String path) { BASE64Encoder encoder = null; byte[] b = null; I
Request Header简介 aigo servlet
当一个客户端(通常是浏览器)向Web服务器发送一个请求是，它要发送一个请求的命令行，一般是GET或POST命令，当发送POST命令时，它还必须向服务器发送一个叫“Content-Length”的请求头(Request Header) 用以指明请求数据的长度，除了Content-Length之外，它还可以向服务器发送其它一些Headers，如：
HttpClient4.3 创建SSL协议的HttpClient对象 alleni123 httpclient 爬虫 ssl
public class HttpClientUtils { public static CloseableHttpClient createSSLClientDefault(CookieStore cookies){ SSLContext sslContext=null; try { sslContext=new SSLContextBuilder().l
java取反 -右移-左移-无符号右移的探讨百合不是茶位运算符位移
取反：在二进制中第一位，1表示符数，0表示正数 byte a = -1; 原码：10000001 反码：11111110 补码：11111111 //异或: 00000000 byte b = -2; 原码：10000010 反码：11111101 补码：11111110 //异或: 00000001
java多线程join的作用与用法 bijian1013 java 多线程
对于JAVA的join，JDK 是这样说的：join public final void join （long millis ）throws InterruptedException Waits at most millis milliseconds for this thread to die. A timeout of 0 means t
Java发送http请求(get 与post方法请求) bijian1013 java spring
PostRequest.java package com.bijian.study; import java.io.BufferedReader; import java.io.DataOutputStream; import java.io.IOException; import java.io.InputStreamReader; import java.net.HttpURL
【Struts2二】struts.xml中package下的action配置项默认值 bit1129 struts.xml
在第一部份，定义了struts.xml文件，如下所示： <!DOCTYPE struts PUBLIC "-//Apache Software Foundation//DTD Struts Configuration 2.3//EN" "http://struts.apache.org/dtds/struts
【Kafka十三】Kafka Simple Consumer bit1129 simple
代码中关于Host和Port是割裂开的，这会导致单机环境下的伪分布式Kafka集群环境下，这个例子没法运行。实际情况是需要将host和port绑定到一起， package kafka.examples.lowlevel; import kafka.api.FetchRequest; import kafka.api.FetchRequestBuilder; impo
nodejs学习api ronin47 nodejs api
NodeJS基础什么是NodeJS JS是脚本语言，脚本语言都需要一个解析器才能运行。对于写在HTML页面里的JS，浏览器充当了解析器的角色。而对于需要独立运行的JS，NodeJS就是一个解析器。每一种解析器都是一个运行环境，不但允许JS定义各种数据结构，进行各种计算，还允许JS使用运行环境提供的内置对象和方法做一些事情。例如运行在浏览器中的JS的用途是操作DOM，浏览器就提供了docum
java-64.寻找第N个丑数 bylijinnan java
public class UglyNumber { /** * 64.查找第N个丑数具体思路可参考 [url] http://zhedahht.blog.163.com/blog/static/2541117420094245366965/[/url] * 题目：我们把只包含因子 2、3和5的数称作丑数（Ugly Number）。例如6、8都是丑数，但14
二维数组（矩阵）对角线输出 bylijinnan 二维数组
/** 二维数组对角线输出两个方向例如对于数组： { 1, 2, 3, 4 }, { 5, 6, 7, 8 }, { 9, 10, 11, 12 }, { 13, 14, 15, 16 }, slash方向输出： 1 5 2 9 6 3 13 10 7 4 14 11 8 15 12 16 backslash输出： 4 3
[JWFD开源工作流设计]工作流跳跃模式开发关键点(今日更新) comsci 工作流
既然是做开源软件的,我们的宗旨就是给大家分享设计和代码,那么现在我就用很简单扼要的语言来透露这个跳跃模式的设计原理大家如果用过JWFD的ARC-自动运行控制器,或者看过代码,应该知道在ARC算法模块中有一个函数叫做SAN(),这个函数就是ARC的核心控制器,要实现跳跃模式,在SAN函数中一定要对LN链表数据结构进行操作,首先写一段代码,把
redis常见使用 cuityang redis 常见使用
redis 通常被认为是一个数据结构服务器，主要是因为其有着丰富的数据结构 strings、map、 list、sets、 sorted sets 引入jar包 jedis-2.1.0.jar (本文下方提供下载) package redistest; import redis.clients.jedis.Jedis; public class Listtest
配置多个redis dalan_123 redis
配置多个redis客户端 <?xml version="1.0" encoding="UTF-8"?><beans xmlns="http://www.springframework.org/schema/beans" xmlns:xsi=&quo
attrib命令 dcj3sjt126com attr
attrib指令用于修改文件的属性.文件的常见属性有:只读.存档.隐藏和系统. 只读属性是指文件只可以做读的操作.不能对文件进行写的操作.就是文件的写保护. 存档属性是用来标记文件改动的.即在上一次备份后文件有所改动.一些备份软件在备份的时候会只去备份带有存档属性的文件.
Yii使用公共函数 dcj3sjt126com yii
在网站项目中，没必要把公用的函数写成一个工具类，有时候面向过程其实更方便。在入口文件index.php里添加 require_once('protected/function.php'); 即可对其引用，成为公用的函数集合。 function.php如下： <?php /** * This is the shortcut to D
linux 系统资源的查看（free、uname、uptime、netstat） eksliang netstat linux uname linux uptime linux free
linux 系统资源的查看转载请出自出处：http://eksliang.iteye.com/blog/2167081 http://eksliang.iteye.com 一、free查看内存的使用情况语法如下： free [-b][-k][-m][-g] [-t] 参数含义 -b:直接输入free时，显示的单位是kb我们可以使用b(bytes),m
JAVA的位操作符 greemranqq 位运算 JAVA位移 <<>>>
最近几种进制，加上各种位操作符，发现都比较模糊，不能完全掌握，这里就再熟悉熟悉。 1.按位操作符：按位操作符是用来操作基本数据类型中的单个bit,即二进制位，会对两个参数执行布尔代数运算，获得结果。与（&）运算： 1&1 = 1, 1&0 = 0, 0&0 &
Web前段学习网站 ihuning Web
Web前段学习网站菜鸟学习：http://www.w3cschool.cc/ JQuery中文网：http://www.jquerycn.cn/ 内存溢出：http://outofmemory.cn/#csdn.blog http://www.icoolxue.com/ http://www.jikexue
强强联合：FluxBB 作者加盟 Flarum justjavac r
原文：FluxBB Joins Forces With Flarum作者：Toby Zerner译文：强强联合：FluxBB 作者加盟 Flarum译者：justjavac FluxBB 是一个快速、轻量级论坛软件，它的开发者是一名德国的 PHP 天才 Franz Liedke。FluxBB 的下一个版本(2.0)将被完全重写，并已经开发了一段时间。FluxBB 看起来非常有前途的，
java统计在线人数（session存储信息的） macroli java Web
这篇日志是我写的第三次了前两次都发布失败！郁闷极了！由于在web开发中常常用到这一部分所以在此记录一下，呵呵，就到备忘录了！我对于登录信息时使用session存储的，所以我这里是通过实现HttpSessionAttributeListener这个接口完成的。 1、实现接口类，在web.xml文件中配置监听类，从而可以使该类完成其工作。 public class Ses
bootstrp carousel初体验快速构建图片播放 qiaolevip 每天进步一点点学习永无止境 bootstrap 纵观千象
img{ border: 1px solid white; box-shadow: 2px 2px 12px #333; _width: expression(this.width > 600 ? "600px" : this.width + "px"); _height: expression(this.width &
SparkSQL读取HBase数据，通过自定义外部数据源 superlxw1234 spark sparksql sparksql读取hbase sparksql外部数据源
关键字：SparkSQL读取HBase、SparkSQL自定义外部数据源前面文章介绍了SparSQL通过Hive操作HBase表。 SparkSQL从1.2开始支持自定义外部数据源(External DataSource)，这样就可以通过API接口来实现自己的外部数据源。这里基于Spark1.4.0，简单介绍SparkSQL自定义外部数据源，访
Spring Boot 1.3.0.M1发布 wiselyman spring boot
Spring Boot 1.3.0.M1于6.12日发布，现在可以从Spring milestone repository下载。这个版本是基于Spring Framework 4.2.0.RC1,并在Spring Boot 1.2之上提供了大量的新特性improvements and new features。主要包含以下： 1.提供一个新的sprin