weixin_30642267

爬虫——网页解析利器--re & xpath

正则解析模块re

re模块使用流程

方法一

r_list=re.findall('正则表达式',html,re.S)

方法二创建正则编译对象

pattern = re.compile('正则表达式',re.S)
r_list = pattern.findall(html)

正则表达式元字符：https://www.cnblogs.com/LXP-Never/p/9522475.html

类别	元字符
匹配字符	. [...] [^...] \d \D \w \W \s \S
匹配重复	* + ? {n} {m,n}
匹配位置	^ $ \A \Z \b \B
其他	\| () \

匹配任意一个字符的正则表达式

import re

pattern = re.compile('.',re.S)        # 方法一
pattern = re.compile('[\s\S]')        # 方法二

贪婪匹配和非贪婪匹配

贪婪匹配（默认）

在整个表达式匹配成功的前提下,尽可能多的匹配 * + ?
表示方式： .* .+ .?

非贪婪匹配

在整个表达式匹配成功的前提下,尽可能少的匹配 * + ?
表示方式： .*? .+? .??

正则表达式分组

作用：在完整的模式中定义子模式，将每个圆括号中子模式匹配出来。

import re

s = 'A B C D'
p1 = re.compile('\w+\s+\w+')
print(p1.findall(s))        # # ['A B','C D']

p2 = re.compile('(\w+)\s+\w+')
print(p2.findall(s))        # # ['A','C']

p3 = re.compile('(\w+)\s+(\w+)')
print(p3.findall(s))        # # [('A','B'),('C','D')]

import re

html = '''
    
        
    
    
        Two tigers two tigers run fast
    



    
        
    

    
        Small white rabbit white and white
    
'''

pattern = re.compile(
    '.*?title="(.*?)".*?'
    'class="content">(.*?)',
    re.S)
r_list = pattern.findall(html)
print(r_list)

View Code

分组总结

在网页中,想要什么内容,就加 ( )
先按整体正则匹配，然后再提取分组()中的内容
如果有2个及以上分组(),则结果中以元组形式显示 [(),(),()]

xpath解析

XPath即为XML路径语言，它是一种用来确定XML文档中某部分位置的语言，同样适用于HTML文档的检索，我们来利用xpath对HTML代码进行检索试试，以下是HTML示例代码。

<ul class="book_list">
    <li>
        <title class="book_001">Harry Pottertitle>
        <author>J K. Rowlingauthor>
        <year>2005year>
        <price>69.99price>
    li>

    <li>
        <title class="book_002">Spidertitle>
        <author>Foreverauthor>
        <year>2019year>
        <price>49.99price>
    li>
ul>

匹配演示

1、查找所有的li节点

//li

2、查找li节点下的title子节点中,class属性值为'book_001'的节点

//li/title[@class="book_001"]

3、查找li节点下所有title节点的,class属性的值

//li//title/@class

只要涉及到条件，加 []
只要获取属性值，加 @

选取节点

// ：从所有节点中查找（包括子节点和后代节点）

@ ：获取属性值

# 使用场景1（属性值作为条件）　　
//div[@class="movie"]

# 使用场景2（直接获取属性值）　　
//div/a/@src

匹配多路径（或）

xpath表达式1 | xpath表达式2 | xpath表达式3

contains() ：匹配属性值中包含某些字符串节点

# 查找class属性值中包含"book_"的title节点
//title[contains(@class,"book_")]

# 匹配ID名含qiushi_tag_字符串的div节点
//div[contains(@id,"qiushi_tag_")]

text() ：获取节点的文本内容

# 查找所有书籍的名称
//ul[@class="book_list"]/li/title
# 结果:
//ul[@class="book_list"]/li/title/text()
# 结果:'Harry Potter'

练习猫眼电影xpath信息检索：https://maoyan.com/board/4?offset=1

1、获取猫眼电影中电影信息的 dd 节点

//dl[@class="board-wrapper"]/dd

2、获取电影名称

//dl[@class="board-wrapper"]/dd//p[@class="name"]/a/text()

3、获取电影主演的

//dl[@class="board-wrapper"]/dd//p[@class="star"]/text()

4、获取上映商检的xpath

//dl[@class="board-wrapper"]/dd//p[@class="releasetime"]/text()

xpath解析库lxml

导模块　　from lxml import etree
创建解析对象　　parse_html = etree.HTML(html)
解析对象调用xpath，只要调用xpath，结果一定为列表　　r_list = parse_html.xpath('xpath表达式')

from lxml import etree

html = """

    
    新浪社会
    
        国内
        国际
        军事
        图片
        社会
        娱乐
        科技
        体育
        财经
        汽车
    
    
"""

# 问题1：获取所有 a 节点的文本内容
parse_html = etree.HTML(html)
r_list = parse_html.xpath('//a/text()')
print(r_list)
# ['新浪社会', '国内', '国际',.....]

# 问题2：获取所有 a 节点的 href 的属性值
parse_html = etree.HTML(html)
r_list = parse_html.xpath('//a/@href')
print(r_list)
# ['/', 'http://domestic.firefox.sina.com/', 'http://world.firefox.sina.com/'...]

# 问题3： 获取所有 a 节点的href的属性值, 但是不包括 /
parse_html = etree.HTML(html)
r_list = parse_html.xpath('//ul[@id="nav"]/li/a/@href')
print(r_list)
# ['http://domestic.firefox.sina.com/', 'http://world.firefox.sina.com/'...]

# 问题4： 获取 图片、军事、...,不包括新浪社会
parse_html = etree.HTML(html)
r_list = parse_html.xpath('//ul[@id="nav"]/li/a/text()')
print(r_list)
# ['国内', '国际',.....]

猫眼电影（xpath）

地址: 猫眼电影 - 榜单 - top100榜 https://maoyan.com/board/4

目标: 电影名称、主演、上映时间

步骤：

确定是否为静态页面（右键-查看网页源代码，搜索关键字确认）
写xpath表达式
写程序框架

xpath表达式

1、基准xpath: 匹配所有电影信息的节点对象列表

//dl[@class="board-wrapper"]/dd

2、遍历对象列表，依次获取每个电影信息
for dd in dd_list:

　　　　遍历后继续xpath一定要以: . 开头，代表当前节点

电影名称：

dd.xpath('./a/@title')[0].strip()

电影主演：

dd.xpath('.//p[@class="star"]/text()')[0].strip()

上映时间：

dd.xpath('.//p[@class="releasetime"]/text()')[0].strip()

完整代码：

import requests
from lxml import etree
import time
import random


class MaoyanSpider(object):
    def __init__(self):
        self.page = 1  # 用于记录页数
        self.url = 'https://maoyan.com/board/4?offset={}'
        self.ua_list = [
            'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/535.1 (KHTML, like Gecko) Chrome/14.0.835.\
            163 Safari/535.1',
            'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:6.0) Gecko/20100101 Firefox/6.0',
            'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.1; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; \
            .NET CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; InfoPath.3)']

    # 获取页面
    def get_page(self, url):
        # 每次使用随机的user-agent
        try:
            # 每次使用随机的user-agent
            headers = {'User-Agent': random.choice(self.ua_list)}
            res = requests.get(url, headers=headers, timeout=5)
            res.encoding = 'utf-8'
            html = res.text
            self.parse_page(html)
        except Exception as e:
            print('Error')
            self.get_page(url)

    # 解析页面
    def parse_page(self, html):
        parse_html = etree.HTML(html)       # 创建解析对象
        # 基准xpath节点对象列表
        dd_list = parse_html.xpath('//dl[@class="board-wrapper"]/dd')
        item = {}
        # 依次遍历每个节点对象,提取数据
        if dd_list:
            for dd in dd_list:
                # ['喜剧之王'] 因为返回的是列表，所以取第0个值，得到的是字符串
                name_list = dd.xpath('.//p/a/@title')       # 电影名称
                item['name'] = [name_list[0].strip() if name_list else None][0]
                star_list = dd.xpath('.//p[@class="star"]/text()')  # 电影主演
                item['star'] = [star_list[0].strip() if star_list else None][0]
                time_list = dd.xpath('.//p[@class="releasetime"]/text()')   # 上映时间
                item['time'] = [time_list[0].strip() if time_list else None]

                print(item)
        else:
            print('No Data')

    # 主函数
    def main(self):
        for offset in range(0, 31, 10):
            url = self.url.format(str(offset))
            self.get_page(url)
            print('第%d页完成' % self.page)
            time.sleep(random.randint(1, 3))
            self.page += 1


if __name__ == '__main__':
    start = time.time()
    spider = MaoyanSpider()
    spider.main()
    end = time.time()
    print('执行时间: %.2f' % (end - start))

链家二手房案例（xpath）

确定是否为静态

　　打开二手房页面 -> 查看网页源码 -> 搜索关键字，能够搜索到就说明，是静态页面。

xpath表达式

1、基准xpath表达式(匹配每个房源信息节点列表)

//ul[@class="sellListContent"]/li[@class="clear LOGCLICKDATA"] | //ul[@class="sellListContent"]/li[@class="clear LOGVIEWDATA LOGCLICKDATA"]

2、依次遍历后每个房源信息xpath表达式

名称: .//a[@data-el="region"]/text()
户型+面积+方位+是否精装：info_list = './/div[@class="houseInfo"]/text()' [0].strip().split('|')
户型: info_list[1]
面积: info_list[2]
方位: info_list[3]
精装: info_list[4]
楼层: './/div[@class="positionInfo"]/text()'
区域: './/div[@class="positionInfo"]/a/text()'
总价: './/div[@class="totalPrice"]/span/text()'
单价: './/div[@class="unitPrice"]/span/text()'

代码实现

import requests
from lxml import etree
import time
import random


class LianjiaSpider(object):
    def __init__(self):
        self.url = 'https://bj.lianjia.com/ershoufang/pg{}/'
        self.blog = 1
        self.ua_list = [
            'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/535.1 (KHTML, like Gecko) Chrome/14.0.835.163 Safari/535.1',
            'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:6.0) Gecko/20100101 Firefox/6.0',
            'Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 6.1; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET \
            CLR 3.5.30729; .NET CLR 3.0.30729; Media Center PC 6.0; .NET4.0C; InfoPath.3)', ]

    def get_html(self, url):
        headers = {'User-Agent': random.choice(self.ua_list)}
        # 尝试3次,否则换下一页地址
        if self.blog <= 3:
            try:
                # 设定超时时间,超时后抛出异常,被except捕捉,继续执行此函数再次请求
                res = requests.get(url=url, headers=headers, timeout=5)
                res.encoding = 'utf-8'
                html = res.text
                self.parse_page(html)       # 直接调用解析函数
            except Exception as e:
                print('再次尝试')
                self.blog += 1
                self.get_html(url)

    def parse_page(self, html):
        parse_html = etree.HTML(html)
        # li_list: [,]
        li_list = parse_html.xpath('//ul[@class="sellListContent"]/li[@class="clear LOGVIEWDATA LOGCLICKDATA"]')
        item = {}
        for li in li_list:
            name_list = li.xpath('.//a[@data-el="region"]/text()')  # 名称
            item['name'] = [name_list[0].strip() if name_list else None][0]
            info_list = li.xpath('.//div[@class="houseInfo"]/text()')   # 户型+面积+方位+是否精装
            if info_list:
                info_list = info_list[0].strip().split('|')
                if len(info_list) == 5:
                    item['model'] = info_list[1].strip()
                    item['area'] = info_list[2].strip()
                    item['direction'] = info_list[3].strip()
                    item['perfect'] = info_list[4].strip()
                else:
                    item['model'] = item['area'] = item['direction'] = item['perfect'] = None
            else:
                item['model'] = item['area'] = item['direction'] = item['perfect'] = None

            floor_list = li.xpath('.//div[@class="positionInfo"]/text()')   # 楼层
            item['floor'] = [floor_list[0].strip().split()[0] if floor_list else None][0]
            address_list = li.xpath('.//div[@class="positionInfo"]/a/text()')   # 地区
            item['address'] = [address_list[0].strip() if address_list else None][0]
            total_list = li.xpath('.//div[@class="totalPrice"]/span/text()')    # 总价
            item['total_price'] = [total_list[0].strip() if total_list else None][0]
            unit_list = li.xpath('.//div[@class="unitPrice"]/span/text()')      # 单价
            item['unit_price'] = [unit_list[0].strip() if unit_list else None][0]

            print(item)

    def main(self):
        for pg in range(1, 11):
            url = self.url.format(pg)
            self.get_html(url)
            time.sleep(random.randint(1, 3))
            # 对self.blog进行一下初始化
            self.blog = 1


if __name__ == '__main__':
    start = time.time()
    spider = LianjiaSpider()
    spider.main()
    end = time.time()
    print('执行时间:%.2f' % (end - start))

Chrome浏览器安装插件

安装方法

把下载的相关插件（对应操作系统浏览器）后缀改为 .zip
打开Chrome浏览器 -> 右上角设置 -> 更多工具 -> 扩展程序 -> 点开开发者模式
把相关插件拖拽到浏览器中，释放鼠标即可安装
重启浏览器

需要安装插件

Xpath Helper: 轻松获取HTML元素的xPath路径；打开/关闭: Ctrl+Shift+x
Proxy SwitchyOmega: Chrome浏览器中的代理管理扩展程序
JsonView: 格式化输出json格式数据

转载于:https://www.cnblogs.com/LXP-Never/p/11382202.html

redis的zset命令总结脱氨垃圾 Redis redis 数据库 database
redis的zset命令总结文章目录redis的zset命令总结1.zadd2.zrem3.zcard4.zrange5.zrevrange6.zrangebyscore7.zrevrangebyscore8.zcount9.zrank10.zscorezset(sortedset：有序集合)Rediszset和set一样也是string类型元素的集合,且不允许重复的成员。不同的是每个元素都会关联
Django 分页操作详解 jay丿 django sqlite 数据库
Django分页操作详解在Django项目中，当处理大量数据时，分页是一项非常关键的功能。它不仅可以提高用户体验，还能减少服务器的负担。Django提供了一个强大的分页工具——django.core.paginator.Paginator，可以很方便地实现数据的分页显示。本文将详细介绍如何使用Django的分页插件来实现分页功能。一、引入分页器首先，需要在你的视图文件中引入Django的分页器模块
【贪心算法5】 m0_46150269 贪心算法算法
力扣738.单调递增的数字链接:link思路遇到c[i]>c[i+1]则c[i]–,然后就是给c[i+1]赋值‘9’；需要注意的是star初值问题，可见注释部分。classSolution{publicintmonotoneIncreasingDigits(intn){Strings=String.valueOf(n);char[]c=s.toCharArray();intstar=c.lengt
QT+FFmpeg+Windows开发环境搭建（加薪点） Qt历险记 Qt 高级开发工程师 qt ffmpeg windows
01、Windows环境搭建FFMPEG官网：http://ffmpeg.org/02、下载4.2.1版本源码源码：https://ffmpeg.org/releases/ffmpeg-4.2.1.tar.bz203、下载4.2.1编译好的文件下载已经编译好的FFMPEG）（迅雷下载很快）网址：https://ffmpeg.zeranoe.com/builds/32位下载地址：
Qt | Windows环境搭建ffmpeg Qt历险记 Qt 高级开发工程师 qt windows ffmpeg
点击上方"蓝字"关注我们FFMPEG官网>>>http://ffmpeg.org/【下载4.2.1版本源码】源码：https://ffmpeg.org/releases/ffmpeg-4.2.1.tar.bz2【下载4.2.1编译好的文件】下载已经编译好的FFMPEG网址：https://ffmpeg.zeranoe.com/builds/
用Python写一个天气预报小程序穿梭的编织者 Python脚本 python 小程序
一、界面效果二、完整代码importtkinterastkfromtkinterimportttkimportrequestsimportjsonfromdatetimeimportdatetimefromPILimportImage,ImageTkimportiofromttkbootstrapimportStyleclassWeatherApp:def__init__(self,root):s
Python写一个脚本——30行代码——1秒实现PDF任意页码拆分穿梭的编织者 Python精选 pdf python
一、引入库importosfromPyPDF2importPdfReader,PdfWriter二、定义拆分方法defsplit_pdf(input_path,output_dir,ranges):ifnotos.path.exists(output_dir):os.makedirs(output_dir)withopen(input_path,'rb')asfile:pdf=PdfReader(
python手写kmeans算法菜鸟懿机器学习聚类算法 python
kmean聚类是最基础和常见的算法，工程上使用比较常见，spark,sklearn都有实现，本文手写实现kmeans#!/usr/bin/pythonimportsysimportrandomimportmathdefcreate_rand_points(max_x,max_y,count):"""Createcountpoints(0-x),(0-y)."""points=[]foriinran
redis操作zset类型的基本命令 JavaWeb学起来 redis redis 数据结构
zset是有序存储的数据结构，它和set一样，不允许重复的值，下面我们总结一些常用的命令。zaddkey排序的数值值(这里为了zset可以有序的存储，需要设定数值)127.0.0.1:6379>zaddz15java3redis1mysql2nginx4oracle(integer)5zcardkey(返回key中的成员数)127.0.0.1:6379>zcardz1(integer)5zrang
Java 入门指南：Java 8 新特性 —— Stream 流热带鱼Tech Java java 后端个人开发 java-ee
文章目录JavaStream操作类型操作过程创建流操作流遍历forEach过滤filter映射map匹配match归约reduce排序sorted去重distinct限制limit跳过skip转换流流操作的特性JavaStreamJavaStream是Java8引入的一个新的API，它提供了一种函数式编程的方式来处理集合数据。Stream可以看作是一系列支持高效的、函数式操作的元素序列。通过使用S
Redis_Zset数据类型基本命令 Mudrock__ Redis java redis
命令说明zaddkeyscorevalue[scorevalue...]向集合中添加元素，若集合不存在则创建集合，批量添加时scorevalue之间以空格分隔zremkeyvalue[value...]移除集合中的指定元素，批量移除时value之间以空格分隔zrangekeyindex1index2withscores查看集合中下标处于index1-index2的元素（withscores用于将s
5.PE——使用代码在任意节空白区添加shellcode 蓝屏达人 PE文件结构 windows
继上一篇手动添加shellcode，这篇以代码来实现，要思路的话还请去上一篇看，这篇为纯代码main代码：#pragmaonce#include"FileUtil.h"#include"ImageUtil.h"intmain(){unsignedintsize;char*buf=ReadFile("D:\\project\\cpp\\test.exe",&size);//检查是否读取成功if(bu
贪心算法简介（greed）神里流~霜灭贪心算法精讲贪心算法 c++c语言数据结构顺序表链表动态规划
前言：贪心算法（GreedyAlgorithm）是一种在每个决策阶段都选择当前最优解的算法策略，通过局部最优的累积来寻求全局最优解。其本质是"短视"策略，不回溯已做选择。什么是贪心、如何来理解贪心(个人对贪心的理解)前言对贪心是一种概念的回答。接下来就了解一下自己对贪心的理解，如果学习算法的化建议优先学习动态规划，动态规划相对于其他算法来说很简单。但是，贪心算法跟动态规划不同，非常难，贪心讲究策略
Java Stream 流从零到一全指南秋‍. JAVA windows java 开发语言流 strem
1.什么是JavaStream？JavaStream是Java8引入的一种用于处理数据集合的API，提供了声明式的方式进行数据处理。它能够支持函数式编程风格，极大地简化了集合操作，提高了代码的可读性和可维护性。Stream的核心特性链式操作：流操作可以串联在一起，避免了传统迭代方式的冗余代码。惰性求值：只有在终端操作时，流的计算才会执行。内部迭代：相比于for循环的外部迭代，Stream采用内部迭
vue中el-tree的懒加载 zhz5214 vue vue.js elementui javascript 前端
el-tree是ElementUI中的一种树形控件，它可以在页面中显示树形数据结构，同时支持懒加载。懒加载是指在Vue组件渲染的过程中，只加载当前可见的部分数据，而不是一次性加载整个数据。这种方法可以显著提高页面的加载速度和响应性能，特别是在大型数据集上。要使用el-tree的懒加载功能，需要在树形控件组件中提供一个load方法。load方法会在展开一个父节点时触发，它的参数包含了父节点的数据和一
实时时钟（RTC）/日历芯片PCF8563的I2C读写驱动（4）：基于HAL库实现硬件I2C读写接口 NW嵌入式开发驱动开发单片机开发 Linux开发 RTC PCF8563 实时时钟 I2C 驱动
0参考资料PCF8563数据手册（第11版——2015年10月26日）.pdf1基于HAL库实现硬件I2C读写接口1.1初始化硬件I2C引脚/***@brief硬件I2C1初始化*配置为350KHz*@returnint0：成功-1：失败*/intbsp_hw_i2c1_init(void){/*速度配置为350KHzI2C1总线挂载器件：1.PCF8563（RTC器件，最高支持400KHz，实测
Python 爬虫实战：艺术品市场趋势分析与交易平台数据抓取西攻城狮北 python 爬虫开发语言
一、引言在当今数字化时代，艺术品市场正经历着前所未有的变革。随着互联网技术的飞速发展，越来越多的艺术品交易转移到了线上平台，这为我们提供了海量的数据资源。通过Python爬虫技术，我们可以抓取艺术品交易平台上的数据，进而分析艺术品市场的趋势，为投资者、收藏家以及艺术爱好者提供有价值的参考。本文将带领读者深入探索Python爬虫在艺术品市场的应用。从爬虫的基本原理到实际代码实现，再到数据的清洗、分析
贪心算法和回溯算法有什么区别？少林码僧数据结构与算法实战算法贪心算法
贪心算法和回溯算法有什么区别？在算法的世界里，贪心算法和回溯算法是两种常见的解决问题的策略。它们在很多场景下都能发挥重要作用，但又有着明显的区别。本文将详细介绍贪心算法和回溯算法的区别，并通过具体案例进行说明。一、贪心算法（一）定义与特点贪心算法（GreedyAlgorithm）是一种在每一步选择中都采取当前状态下最优决策的算法。它的核心思想是局部最优解能够导致全局最优解。也就是说，贪心算法在每一
Leetcode Hot100 第40题 297.二叉树的序列化和反序列化 onlyzzr 暑期实习刷题记录 leetcode 深度优先算法
/***Definitionforabinarytreenode.*structTreeNode{*intval;*TreeNode*left;*TreeNode*right;*TreeNode(intx):val(x),left(NULL),right(NULL){}*};*/classCodec{public:intindex;//Encodesatreetoasinglestring.str
海量数据查询加速：Presto、Trino、Apache Arrow 晴天彩虹雨 apache 大数据 hive 数据仓库
1.引言在大数据分析场景下，查询速度往往是影响业务决策效率的关键因素。随着数据量的增长，传统的行存储数据库难以满足低延迟的查询需求，因此，基于列式存储、向量化计算等技术的查询引擎应运而生。本篇文章将深入探讨Presto、Trino、ApacheArrow三种主流的查询优化工具，剖析其核心机制，并通过案例分析展示它们在实际业务中的应用。2.Presto：分布式SQL查询引擎2.1Presto介绍Pr
数组总和（leetcode 40 JohnFF leetcode 算法职场和发展
leetcode系列文章目录一、核心操作二、外层配合操作三、核心模式代码总结去重方式和之前三数之和一样，也可以用used数组去重，但本次尝试使用set去重一、核心操作如果count为0了，则证明正好减到了0，就可以收获，并返回建立unordered_set开始循环，如果在set中能够搜寻到当前的数字，说明已经重复了，则直接进行下一次的循环，如果没有找到，则说明这是一个没有重复的新数字，将其加入se
Kubernetes集群版本升级程序员Realeo Java后端 kubernetes 容器云原生
集群升级注意事项升级集群版本建议逐步升级，比如v1.20.1–>v1.21.1–>v1.22.1–>v1.23.1–>v1.24.1，不能跨度过大，否则会报错。升级步骤查看集群版本[root@hadoop102~]#kubectlgetnodesNAMESTATUSROLESAGEVERSIONhadoop102Ready,SchedulingDisabledcontrol-plane,maste
Spring Cache的基本使用奇怪的大象面试学习路线阿里巴巴 spring java 后端
文章目录一、概述二、SpringCache的使用2.1环境搭建2.2缓存的读模式@Cacheable2.3自定义缓存配置[email protected]@CacheEvict删除缓存2.6@Caching多个操作三、SpringCache的不足一、概述常见的缓存的框架有Redis、Memcached、Guava、Caffeine等等，各有各的优势。如果我们的程序想要使用缓存，就要与这些框架耦合。聪明
理解 Retrofit 请求头与 GsonConverterFactory 的自动处理机制居然是阿宋 retrofit
在现代Web开发中，特别是在与RESTfulAPI进行交互时，我们经常会遇到JSON格式的数据交换。为了确保请求的正确解析和响应的准确返回，通常需要通过HTTP请求头明确指定请求体的数据类型。而Content-Type:application/json就是用来告诉服务器，当前请求体中的数据格式是JSON。为什么需要明确指定Content-Type:application/json？数据格式的明确性
内网通改修对话框左侧聊天列表宽度支持未来开源
使用内网通，由于组织要求，大家名称都加了前缀，最后导致大家名字都显示不全。内网通还无法动态调整这个宽度。可以通过改修内网通安装的文件来改修这个长度1，找到内网通安装目录\Nwt\res\ShiYeLine\layout\ChatDialog.xml2，编辑这个文件2-1.ChatListViewLayoutWidth="150"改宽2-2.SkinLineAlignParentLeft="149"
JButton追加事件监听支持未来 JAVA ActionList
画面和按钮生成publicclassmainTestClass{publicstaticJFramemain=newJFrame("テスト画面");//publicstaticJTextAreaResult=newJTextArea("",4,40);//publicstaticJButtonSubmit=newJButton("開始");/***メイン関数**@paramargs*/public
Java通过Apache POI操作Excel IT__learning 数据分析 java apache excel
1、添加依赖org.apache.poipoi3.9org.apache.poipoi-ooxml3.9joda-timejoda-time2.10.12、读EXCELpublicstaticvoidread()throwsException{FileInputStreamstream=newFileInputStream("D:\\Test\\file.xlsx");//1.创建工作簿对象,并指
(学习总结28)Linux 基本命令3 瞌睡不来学习 linux
Linux基本命令3工具使用命令使用vim编辑器命令vim使用nano文本编辑器命令nano使用gcc/g++编译器命令gcc/g++使用gdb/cgdb调试器命令gdb/cgdb使用自动化构建命令make使用版本控制器命令git系统或进程相关命令读取输入并赋值给变量命令read设置或修改shell环境命令set设置环境变量命令export测试网络连接命令ping显示系统登录记录命令last显示失
阿里巴巴发布 R1-Omni：首个基于 RLVR 的全模态大语言模型，用于情感识别新加坡内哥谈技术语言模型人工智能自然语言处理
每周跟踪AI热点新闻动向和震撼发展想要探索生成式人工智能的前沿进展吗？订阅我们的简报，深入解析最新的技术突破、实际应用案例和未来的趋势。与全球数同行一同，从行业内部的深度分析和实用指南中受益。不要错过这个机会，成为AI领域的领跑者。点击订阅，与未来同行！订阅：https://rengongzhineng.io/情感识别一直是AI领域的难题，尤其是视觉与音频信号的融合。单独依赖视觉或音频的模型，往往
简单的网页链接爬虫笑颜218 爬虫 python 简单
fromurllib.requestimporturlopenfromurllib.parseimporturljoinfromhtml.parserimportHTMLParser#自定义HTML解析器classLinkParser(HTMLParser):def__init__(self,base_url):super().__init__()self.base_url=base_url#基础
java Illegal overloaded getter method with ambiguous type for propert的解决 zwllxs java jdk
好久不来iteye,今天又来看看，哈哈,今天碰到在编码时，反射中会抛出 Illegal overloaded getter method with ambiguous type for propert这么个东东，从字面意思看，是反射在获取getter时迷惑了，然后回想起java在boolean值在生成getter时，分别有is和getter，也许我们的反射对象中就有is开头的方法迷惑了jdk，
IT人应当知道的10个行业小内幕 beijingjava 工作互联网
10. 虽然IT业的薪酬比其他很多行业要好，但有公司因此视你为其“佣人”。　　尽管IT人士的薪水没有互联网泡沫之前要好，但和其他行业人士比较，IT人的薪资还算好点。在接下的几十年中，科技在商业和社会发展中所占分量会一直增加，所以我们完全有理由相信，IT专业人才的需求量也不会减少。　　然而，正因为IT人士的薪水普遍较高，所以有些公司认为给了你这么多钱，就把你看成是公司的“佣人”，拥有你的支配
java 实现自定义链表 CrazyMizzz java 数据结构
1.链表结构链表是链式的结构 2.链表的组成链表是由头节点，中间节点和尾节点组成节点是由两个部分组成： 1.数据域 2.引用域 3.链表的实现 &nbs
web项目发布到服务器后图片过一会儿消失麦田的设计者 struts2 上传图片永久保存
作为一名学习了android和j2ee的程序员，我们必须要意识到，客服端和服务器端的交互是很有必要的，比如你用eclipse写了一个web工程，并且发布到了服务器（tomcat）上，这时你在webapps目录下看到了你发布的web工程，你可以打开电脑的浏览器输入http://localhost:8080/工程/路径访问里面的资源。但是，有时你会突然的发现之前用struts2上传的图片
CodeIgniter框架Cart类 name 不能设置中文的解决方法 IT独行者 CodeIgniter Cart 框架　
今天试用了一下CodeIgniter的Cart类时遇到了个小问题，发现当name的值为中文时，就写入不了session。在这里特别提醒一下。在CI手册里也有说明，如下： $data = array( 'id' => 'sku_123ABC', 'qty' => 1, '
linux回收站 _wy_ linux 回收站
今天一不小心在ubuntu下把一个文件移动到了回收站，我并不想删，手误了。我急忙到Nautilus下的回收站中准备恢复它，但是里面居然什么都没有。后来我发现这是由于我删文件的地方不在HOME所在的分区，而是在另一个独立的Linux分区下，这是我专门用于开发的分区。而我删除的东东在分区根目录下的.Trash-1000/file目录下，相关的删除信息（删除时间和文件所在
jquery回到页面顶端知了ing html jquery css
html代码： <h1 id="anchor">页面标题</h1> <div id="container">页面内容</div> <p><a href="#anchor" class="topLink">回到顶端</a><
B树、B-树、B+树、B*树矮蛋蛋 B树
原文地址： http://www.cnblogs.com/oldhorse/archive/2009/11/16/1604009.html B树即二叉搜索树： 1.所有非叶子结点至多拥有两个儿子（Left和Right）； &nb
数据库连接池 alafqq 数据库连接池
http://www.cnblogs.com/xdp-gacl/p/4002804.html @Anthor:孤傲苍狼数据库连接池用MySQLv5版本的数据库驱动没有问题，使用MySQLv6和Oracle的数据库驱动时候报如下错误： java.lang.ClassCastException: $Proxy0 cannot be cast to java.sql.Connec
java泛型百合不是茶 java泛型
泛型在Java SE 1.5之前，没有泛型的情况的下，通过对类型Object的引用来实现参数的“任意化”，任意化的缺点就是要实行强制转换，这种强制转换可能会带来不安全的隐患泛型的特点：消除强制转换确保类型安全向后兼容简单泛型的定义：泛型：就是在类中将其模糊化，在创建对象的时候再具体定义 class fan
javascript闭包[两个小测试例子] bijian1013 JavaScript JavaScript
一.程序一 <script> var name = "The Window"; var Object_a = { 　　name : "My Object", 　　getNameFunc : function(){ var that = this; 　　　　return function(){ 　　　　
探索JUnit4扩展：假设机制（Assumption） bijian1013 java Assumption JUnit 单元测试
一.假设机制（Assumption）概述理想情况下，写测试用例的开发人员可以明确的知道所有导致他们所写的测试用例不通过的地方，但是有的时候，这些导致测试用例不通过的地方并不是很容易的被发现，可能隐藏得很深，从而导致开发人员在写测试用例时很难预测到这些因素，而且往往这些因素并不是开发人员当初设计测试用例时真正目的，
【Gson四】范型POJO的反序列化 bit1129 POJO
在下面这个例子中，POJO(Data类)是一个范型类，在Tests中，指定范型类为PieceData，POJO初始化完成后，通过 String str = new Gson().toJson(data); 得到范型化的POJO序列化得到的JSON串，然后将这个JSON串反序列化为POJO import com.google.gson.Gson; import java.
【Spark八十五】Spark Streaming分析结果落地到MySQL bit1129 Stream
几点总结： 1. DStream.foreachRDD是一个Output Operation，类似于RDD的action，会触发Job的提交。DStream.foreachRDD是数据落地很常用的方法 2. 获取MySQL Connection的操作应该放在foreachRDD的参数（是一个RDD[T]=>Unit的函数类型)，这样，当foreachRDD方法在每个Worker上执行时，
NGINX + LUA实现复杂的控制 ronin47 nginx lua
安装lua_nginx_module 模块 lua_nginx_module 可以一步步的安装，也可以直接用淘宝的OpenResty Centos和debian的安装就简单了。。这里说下freebsd的安装： fetch http://www.lua.org/ftp/lua-5.1.4.tar.gz tar zxvf lua-5.1.4.tar.gz cd lua-5.1.4 ma
java-递归判断数组是否升序 bylijinnan java
public class IsAccendListRecursive { /*递归判断数组是否升序 * if a Integer array is ascending,return true * use recursion */ public static void main(String[] args){ IsAccendListRecursiv
Netty源码学习-DefaultChannelPipeline2 bylijinnan java netty
Netty3的API http://docs.jboss.org/netty/3.2/api/org/jboss/netty/channel/ChannelPipeline.html 里面提到ChannelPipeline的一个“pitfall”：如果ChannelPipeline只有一个handler（假设为handlerA）且希望用另一handler（假设为handlerB）来
Java工具之JPS chinrui java
JPS使用熟悉Linux的朋友们都知道，Linux下有一个常用的命令叫做ps（Process Status)，是用来查看Linux环境下进程信息的。同样的，在Java Virtual Machine里面也提供了类似的工具供广大Java开发人员使用，它就是jps（Java Process Status)，它可以用来
window.print分页打印 ctrain window
function init() { var tt = document.getElementById("tt"); var childNodes = tt.childNodes[0].childNodes; var level = 0; for (var i = 0; i < childNodes.length; i++) {
安装hadoop时执行jps命令Error occurred during initialization of VM daizj jdk hadoop jps
在安装hadoop时，执行JPS出现下面错误 [slave16][email protected]:/tmp/hsperfdata_hdfs# jps Error occurred during initialization of VM java.lang.Error: Properties init: Could not determine current working
PHP开发大型项目的一点经验 dcj3sjt126com PHP 重构
一、变量最好是把所有的变量存储在一个数组中，这样在程序的开发中可以带来很多的方便，特别是当程序很大的时候。变量的命名就当适合自己的习惯，不管是用拼音还是英语，至少应当有一定的意义，以便适合记忆。变量的命名尽量规范化，不要与PHP中的关键字相冲突。二、函数 PHP自带了很多函数，这给我们程序的编写带来了很多的方便。当然，在大型程序中我们往往自己要定义许多个函数，几十
android笔记之--向网络发送GET/POST请求参数 dcj3sjt126com android
使用GET方法发送请求 private static boolean sendGETRequest (String path, Map<String, String> params) throws Exception{ //发送地http://192.168.100.91:8080/videoServi
linux复习笔记之bash shell (3) 通配符 eksliang linux 通配符 linux通配符
转载请出自出处： http://eksliang.iteye.com/blog/2104387 在bash的操作环境中有一个非常有用的功能，那就是通配符。下面列出一些常用的通配符，如下表所示符号意义 * 万用字符，代表0个到无穷个任意字符 ? 万用字符，代表一定有一个任意字符 [] 代表一定有一个在中括号内的字符。例如：[abcd]代表一定有一个字符，可能是a、b、c
Android关于短信加密 gqdy365 android
关于Android短信加密功能，我初步了解的如下（只在Android应用层试验）： 1、因为Android有短信收发接口，可以调用接口完成短信收发；发送过程：APP（基于短信应用修改）接受用户输入号码、内容——>APP对短信内容加密——>调用短信发送方法Sm
asp.net在网站根目录下创建文件夹 hvt .net C#hovertree asp.net Web Forms
假设要在asp.net网站的根目录下建立文件夹hovertree,C#代码如下： string m_keleyiFolderName = Server.MapPath("/hovertree"); if (Directory.Exists(m_keleyiFolderName)) { //文件夹已经存在 return; } else { try { D
一个合格的程序员应该读过哪些书 justjavac 程序员书籍
编者按：2008年8月4日，StackOverflow 网友 Bert F 发帖提问：哪本最具影响力的书，是每个程序员都应该读的？ “如果能时光倒流，回到过去，作为一个开发人员，你可以告诉自己在职业生涯初期应该读一本，你会选择哪本书呢？我希望这个书单列表内容丰富，可以涵盖很多东西。” 很多程序员响应，他们在推荐时也写下自己的评语。以前就有国内网友介绍这个程序员书单，不过都是推荐数
单实例实践跑龙套_az 单例
1、内部类 public class Singleton { private static class SingletonHolder { public static Singleton singleton = new Singleton(); } public Singleton getRes
PO VO BEAN 理解 q137681467 VO DTO po
PO：全称是 persistant object持久对象最形象的理解就是一个PO就是数据库中的一条记录。好处是可以把一条记录作为一个对象处理，可以方便的转为其它对象。 BO：全称是 business object:业务对象主要作用是把业务逻辑封装为一个对象。这个对
战胜惰性，暗自努力金笛子努力
偶然看到一句很贴近生活的话：“别人都在你看不到的地方暗自努力，在你看得到的地方，他们也和你一样显得吊儿郎当，和你一样会抱怨，而只有你自己相信这些都是真的，最后也只有你一人继续不思进取。”很多句子总在不经意中就会戳中一部分人的软肋，我想我们每个人的周围总是有那么些表现得“吊儿郎当”的存在，是否你就真的相信他们如此不思进取，而开始放松了对自己的要求随波逐流呢？我有个朋友是搞技术的，平时嘻嘻哈哈，以
NDK/JNI二维数组多维数组传递 wenzongliang 二维数组 jni NDK
多维数组和对象数组一样处理，例如二维数组里的每个元素还是一个数组用jArray表示，直到数组变为一维的，且里面元素为基本类型，去获得一维数组指针。给大家提供个例子。已经测试通过。 Java_cn_wzl_FiveChessView_checkWin( JNIEnv* env,jobject thiz,jobjectArray qizidata) { jint i,j; int s