僭醴。

python爬虫，python学习，如何用python爬取视频资源

郑重声明：该文章仅供参考学习，他人不得转载，利用非法手段牟利。

这篇文章的由来，是我为了一个月内看的三部电影，充了三个网站的会员之后，痛定思痛，决定再也不干这种傻事了，于是乎，我拿起了python—号称除了生孩子什么都能干的工具。

遗憾的是，在阅遍了CSDN，B站，知乎，博客园之后，并没有任何一个网站可以解决我的问题，尤其是我最依赖的CSDN，要么就是压根不能实践的方法，要么就是很老已经不能用的方法，滥竽充数和浑水摸鱼的文章浪费了大量的时间，于是，此文章应运而生。

由于解析电影的网站不同，衍生出了数种不同的爬虫思路，变化性较大，加之解析网站变动较大，这也是在各大资源网站都找不到有用的获取***（手动和谐掉vip）视频的教程的原因之一。

本文所有用到的接口都不会公布（官方封禁），可以自己找或私我。

First and foremost：

本文文字叙述只是整理思路，辅助理解，真正的灵魂在代码，一定要认真看代码。

影视资源常见解析类型

适用人群：

1.纯小白，就是想白嫖电影的

2.初学者，emmm。。至少要会个requests和基本语法吧

3.较为高级一点的初学者，os，requests，time，基础re，基础concurrent，基础AES

4.大佬（反正除了123就直接统称为大佬。。。鼠？）

一.直接解析，另存为保存到本地（简单暴力下载）

小白食用，极度舒适。

找个接口。

最简单没有之一的一种获取视频的方法

值得一提的是很多接口不能直接抓包。

二.可直接抓包的视频

这个是仅次于（一）的简单，打开检查，选中media（媒体），然后解析播放（切记顺序不要乱），就会刷新出文件，点开文件，进入视频界面，直接下载。大电影用的比较少，不妨一试。

呃，比如某站视频不能直接下载嘛不是，找接口直接抓包就完了。

三.无加密的m3u8格式电影

所用到模块：requests，os，time，concurrent（可不用）

最近在看罗small黑战记（时隔七年终于更新了），然鹅，居然只有某站大会员才能看，本着能白嫖绝不三连，呸，花钱，的思想，自己写代码爬！

此时就可以观看该电影，嗯，用过的应该知道，m3u8格式的视频不在大网站上的话，非常容易卡，十分影响观影体验，于是我们选择下载电影。那么，重点就来了。

对于m3u8格式，简单来说就是将一个大视频（几个小时）切割成上千个小的视频片段，后缀为ts，可以跟正常的MP4一样播放。然后你看视频的时候就一个个片段渲染，更详细的可以直接在CSDN或者百度搜搜，这里不赘述。

所以我们的思路就是：

0.在解析网站中获取m3u8文件（or php）

1.把所有的网址提取出来，剔除‘#’开头的没用数据

2.遍历获取每一个视频片段

3.然后将所有的视频片段合并成一个大的电影文件

4.删除下载的每一个视频片段

#补充

5.编写一个下载ts片段的函数，用于开创线程池，加快速度

6.下载过程可能会失败，所以一定要设置最长get时间，并且限定次数防止由于资源问题程序卡死

第一步，打开右键打开检查，在network（网络）里找到m3u8文件

打开检查，选中XHR，然后解析播放（切记顺序不要乱），就会刷新出许多文件

名称多为index.m3u8，没有的话就找后缀为m3u8的文件双击，就会下载到本地一个文档，打开之后就是这个样子的。

大概有两千多行吧。。。。

嗯，这个文件能看到许多的https（一种协议）网址，就是每一个视频片段，ts格式的。

第二步，编写python代码

ok，思路清晰了以后，就开始编写代码了。话不多说上代码（也不算长）

#导入模块
import requests
import os
import time
from concurrent.futures import ThreadPoolExecutor

start = time.time()
#准备下载路径
m3u8 = []
with open('play.php','r') as file:
    lst = file.readlines()
    for i in lst:
        i = i.strip()
        if i.startswith('#'):
            continue
        else:
            m3u8.append(i)
print(f'目标文件数共{len(m3u8)}个')
#下载一个ts文件的函数
def download_ts(i):
    for _ in range(10):
        try:
            with open(f'{i}.ts','wb') as file:
                  resp = requests.get(m3u8[i]，timeout=15).content
                  file.write(resp)
            print(f'第{i}个ts片段已下载完成!')
            break
        except:
            print(f'第{i}个ts文件下载失败，重新下载！')
            continue
with ThreadPoolExecutor(100) as t:
    for i in range(len(m3u8)):
        t.submit(download_ts,i)
    t.shutdown()
#补录程序
with ThreadPoolExecutor(50) as f:
    for i in range(len(m3u8)):
        with open(f'{i}.ts','rb+') as file:
            if file.read():
                continue
            else:
                f.submit(download_ts,i)
    f.shutdown()
print('ts文件下载完毕')
#ts文件的合并
print('ts文件开始合并....')
with open('罗小黑战记.mp4','wb') as file:
    for i in range(len(m3u8)):
        with open(f'{i}.ts','rb') as f:
            f_view = f.read()
            file.write(f_view)
print('ts文件合并完毕!')
#ts文件的删除操作
print('开始删除ts文件....')
for i in range(len(m3u8)):
    try:
     os.remove(rf'C:\Users\我的电脑\Desktop\python学习\python爬虫项目\vip电影全解\罗小黑战记番剧\{i}.ts')
    except FileNotFoundError:
        continue
print('ts文件删除完毕！')
print('电影完美下载！')
end = time.time()
print('本次下载共耗时长：',end-start,'s')

headers是基本反爬，在这里不加也没有影响。

上面的程序开了线程池（ThreadPoolExecutor），所以一部电影三分钟就能下载下来，不开的话就非常的慢，得个把小时才行。

另外，由于网络爬虫可能存在各种错误，所以在downlaod函数和后续删除ts片段中都用try-except捕获异常，并且开了一个线程池做补录，下载第一次未能顺利下载下来的内容。

time模块用来反馈下载电影所用时间，也可以不用。

在XHR里找m3u8，预览里一般都可以看到上千行的网址，如上图。

四.AES加密的的m3u8文件

所用到的模块：requests，re，AES，os，time，concurrent

比较进阶一点的爬虫的（真的就是一点点）

在（三）中，我们学会了如何下载m3u8格式的视频，但并非所有的m3u8都是那么的纯洁，有些网站非常的狗，对文件设置了加密（我只见过AES加密的），所以这里我们讨论如何解决有AES加密的视频。

1.首先，我们需要判断是否有加密

2.其次，既然是加密，我们就需要秘钥（key），获取他

3.通过秘钥（key)来解析获取ts文件

#其实就是比（二）多了个解密模块嘛

我们这里选取某站会员（最难处理的就它了，傲娇的要死）的罗little黑战记（37-40集），作为范例。

first.我们需要下载每一集的目录（m3u8文件）

按照（三）中的方法下载就完了。

second.上代码


#b站大会员选ok接口

#导入模块
import requests
import os
from Crypto.Cipher import AES     #AES解密模块
import time
from concurrent.futures import ThreadPoolExecutor
import re

start = time.time()
#准备下载路径
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64'
                        'AppleWebKit/537.36 (KHTML, like Gecko) Chrome/92.0.4515.131 Safari/537.36 Edg/92.0.902.73'}


def download_ts(i):
    for _ in range(10):
        try:
            with open(f'{i}.ts', 'wb') as file:
                response = requests.get(m3u8[i], headers=headers, timeout=15).content
                cryptor = AES.new(key, AES.MODE_CBC, key)
                file.write(cryptor.decrypt(response))
                print(f'第{i}个ts片段已下载完成!')
                break
        except:
            print(f'第{i}个ts文件下载失败，重新下载！')
            continue
for _ in range(4):
    m3u8=[]
    with open(f'index ({_+7}).m3u8','r+',encoding='utf-8') as file:
        r = file.read()
        obj = re.compile(r'URI="(?P.*?)"',re.S)
        keyurlx = obj.finditer(r)
        for x in keyurlx:
            keyurl = x.group('url')
        file.seek(0,0)
        lst = file.readlines()
        for i in lst:
            i = i.strip()
            if i.startswith('#'):
                continue
            else:
                m3u8.append(i)
    print(f'目标文件数共{len(m3u8)}个')
    respn = requests.get(keyurl,headers=headers)
    key = respn.text.encode('utf-8')
    with ThreadPoolExecutor(100) as t:
        for i in range(len(m3u8)):
            t.submit(download_ts,i)
        t.shutdown()
    #补录程序
    with ThreadPoolExecutor(50) as f:
        for i in range(len(m3u8)):
            with open(f'{i}.ts','rb+') as file:
                if file.read():
                    continue
                else:
                    f.submit(download_ts,i)
        f.shutdown()
    print('ts文件下载完毕')
    #ts文件的合并
    print('ts文件开始合并....')
    with open(f'实验vip电影{_}.mp4','wb') as file:
        for i in range(len(m3u8)):
            with open(f'{i}.ts','rb') as f:
                f_view = f.read()
                file.write(f_view)
    print('ts文件合并完毕!')
    #ts文件的删除操作
    print('开始删除ts文件....')
    for i in range(len(m3u8)):
        try:
            os.remove(rf'C:\Users\我的电脑\Desktop\python学习\python爬虫项目\vip电影全解\罗小黑战记番剧\{i}.ts')
        except FileNotFoundError:
            continue
    print('ts文件删除完毕！')
    print('电影完美下载！')
    end = time.time()
    print('本次下载共耗时长：',end-start,'s')

很显然，除了一下下载几集之外，唯一的不同点就是解密，直接套用解密模板就行了。

response = requests.get(m3u8[i], headers=headers, timeout=15).content
                cryptor = AES.new(key, AES.MODE_CBC, key)
                file.write(cryptor.decrypt(response))

就像这样。

由于这个是几集，所以key我们选择从下载的m3u8文件里提取，这里就用到了一点点的re（正则表达式）内容，当然也可以手动提取粘贴到代码里，就是对于好几集的剧来说太麻烦了。

key获取之后一定要编码成utf-8的格式，要不然程序会报错（python这个笨逼他读不懂其他编码格式的数据）

综上，哪怕啥都不会，照搬照套就可以爬取网上能看or不能看的电影。

上述的四种方法，一般来讲前三种就能解决大多数视频了，并且都不难，就是遇到那种情况就用对应的方法解决就完了。

本版本修改n次，一直不过审，差点被封号，迄今为止跟原文相差甚远，我太难了。

你可能感兴趣的:(python,爬虫)

【python随手记】——读取文本文件内容转换为json格式番茄番茄君 python json windows
文章目录前言一、TXT文件转换为JSON数组1.txt文件内容2.python代码3.输出结果二、TXT文件转换为JSON对象1.txt文件2.python代码3.输出结果前言场景：用于读取包含空格分隔数据的TXT文件，并将其转换为结构化JSON文件一、TXT文件转换为JSON数组1.txt文件内容地点A116.40528539.90498943.5地标B121.47370131.2304164.
JMeter中使用Python 测试界的飘柔程序员软件测试职场经验 jmeter python 开发语言软件测试功能测试职场经验自动化测试
要在JMeter中使用Python，需要使用JSR223Sampler元素来执行Python脚本。使用JSR223Sampler执行Python脚本时，需要确保已在JMeter中配置了Python解释器，并设置了正确的环境路径。1、确保JMeter已安装Python解释器，并将解释器的路径添加到计算机的环境变量中。2、在JMeter的lib目录中，创建一个新目录，用于存放Python解释器所需的库
JMeter 如何并发执行 Python 脚本朱公子的Note python JMeter执行Python
你是否遇到过这样的场景：需要用Python实现复杂的逻辑处理，同时又想利用JMeter的强大并发能力来模拟大规模用户行为？这篇文章带你快速掌握如何让JMeter并发执行Python脚本，完美结合两者的优势！JMeter如何配置来调用Python脚本？如何实现高效的并发执行？在实践中有哪些需要注意的坑？随着性能测试需求的增加，JMeter的应用场景越来越广泛，而Python的灵活性与强大的第三方库支
【数据挖掘在量化交易中的应用：特征发现与特征提取】调皮的芋头数据挖掘人工智能神经网络
好的，我将撰写一篇关于金融领域数据挖掘的技术博客，重点阐述特征发现和特征提取，特别是在量化交易中的应用。我会提供具体的实操步骤，并结合Python和TensorFlow进行代码示例。完成后，我会通知您进行查看。数据挖掘在量化交易中的应用：特征发现与特征提取1.概述在金融领域的量化交易中，数据挖掘扮演着极其重要的角色。量化交易依赖于对海量金融数据的分析，从中寻找规律和模式，以支撑交易决策。数据挖掘技
利用Java爬虫精准获取商品销量详情：实战案例指南小爬虫程序猿 java 爬虫开发语言
在电商领域，商品销量数据是衡量产品受欢迎程度和市场表现的关键指标。精准获取商品销量详情不仅能帮助商家优化产品策略，还能为市场研究和数据分析提供丰富的数据资源。本文将详细介绍如何利用Java爬虫技术精准获取商品销量详情，并分享关键技术和代码示例。一、前期准备（一）环境搭建确保你的开发环境已安装以下必要的Java库：Jsoup：用于解析HTML页面。HttpClient：用于发送HTTP请求。Log4
如何解析返回的JSON数据？数据小小爬虫 json python 开发语言
解析返回的JSON数据是爬虫和API开发中的常见任务。在Java中，可以使用多种库来解析JSON数据，例如Jackson、Gson或org.json。以下是使用这些库解析JSON数据的详细步骤和示例代码。1.使用Jackson解析JSON数据Jackson是一个高性能的JSON处理库，支持将JSON数据映射到Java对象（反序列化）和将Java对象转换为JSON（序列化）。（1）添加依赖在pom.
利用Java爬虫获取Amazon商品详情：实战案例指南数据小小爬虫 java 爬虫开发语言
在电商领域，Amazon作为全球最大的电商平台之一，其商品详情数据对于市场分析、竞争策略制定以及电商运营优化具有极高的价值。通过Java爬虫技术，我们可以高效地获取这些数据，为电商从业者提供强大的数据支持。本文将详细介绍如何利用Java爬虫技术获取Amazon商品详情数据。一、准备工作（一）环境搭建确保你的开发环境中已经安装了以下必要的Java库：Jsoup：用于解析HTML页面。HttpClie
使用Java爬虫获取淘宝商品详情API返回值说明案例指南数据小小爬虫 java 爬虫开发语言
在电商数据分析和运营中，获取淘宝商品详情是常见的需求。淘宝开放平台提供了丰富的API接口，允许开发者通过合法的方式获取商品信息。本文将详细介绍如何使用Java编写爬虫，通过淘宝API获取商品详情，并解析API返回值的含义和结构。一、准备工作在开始编写爬虫之前，需要准备以下工具和库：Java开发环境：推荐使用IDEA或Eclipse。HttpClient库：用于发送HTTP请求。Jsoup库：用于解
Python 运算符 2401_87587429 python 开发语言
目录前言1.算数运算符2.赋值运算符3.比较运算符4.逻辑运算符5.其他运算符结语前言在编程的世界里，运算符是构建代码逻辑的基础。Python，作为一种功能强大且灵活的编程语言，提供了一套全面的运算符，使得数据处理和操作变得简单高效。本文将带你深入了解Python中的运算符，包括它们的用途、语法和一些实际的例子。1.算数运算符算数运算符用于执行基本的数学运算。以下是Python支持的算数运算符·+
利用Java爬虫精准获取淘宝分类详情：实战案例指南 Jason-河山 java 爬虫开发语言
在电商领域，淘宝作为中国最大的电商平台之一，其分类详情数据对于市场分析、竞争策略制定以及电商运营优化具有极高的价值。通过Java爬虫技术，我们可以高效地获取这些数据，为电商从业者提供强大的数据支持。本文将详细介绍如何利用Java编写爬虫程序，快速获取淘宝分类详情数据。一、准备工作（一）环境搭建确保你的开发环境中已经安装了以下必要的库：HttpClient：用于发送HTTP请求。Jsoup：用于解析
Selenium入门，最近看到的都师一些小白想学测试，今天就分享入门吧~ 程序员-小枫 selenium 自动化测试 Python selenium python 软件测试
Selenium入门（自动右键保存图片到本机上）前言入职测开一段时间，基本就是熟悉需求，熟悉业务，熟悉这熟悉那，再跟着需求做各种各样的测试和联调，趁着业余时间，也是学习了一下Selenium，在之前Selenium是我作为爬虫的工具，不过之后就用来做写一些自动化测试脚本啦~~（这里使用Python中的Selenium库进行Coding~~1、什么是SeleniumSelenium是一个用于Web应
python 爬虫智联招聘风华明远 Python 爬虫 python
本方法使用cookie的方法下载智联招聘的职位。主要就是要先登录智联招聘，然后将对应的cookie作为爬虫访问的header。代码如下：importrequestsimportreimportxlwtdefparse_one_page(html):'''解析HTML代码，提取有用信息并返回'''#正则表达式进行解析pattern=re.compile('(.*?).*?''(.*?).*?''\\
python使用osgeo库_MAC下python2.7的GDAL库配置问题 weixin_39974223 python使用osgeo库
通过三天的不懈努力解决了mac下GDAL配置问题，顺利的运行了一个简单的python代码1、使用了GDAL_Complete-2.1.dmg简单安装，失败告终，(应该没有正确配置路径、导致调用不出gdal)2、下载源码gdal在利用Swig在nmake.opt中编译，失败告终。安装Swig三次才成功，感谢博主LIANGJIANGLI(MacSwig3.0.12安装)，接着就是解译nmake，我是用
智联招聘python岗位_python智联招聘爬虫 weixin_39750854 智联招聘python岗位
博主写了一个智联招聘的爬虫，只要输入职位关键字，就能快速导出智联招聘上的数据，存在excel表里～importrequests,openpyxl#建立excel表joblist=[]wb=openpyxl.Workbook()sheet=wb.activesheet.title='智联招聘数据'sheet['A1']='职位名称'sheet['B1']='薪资'sheet['C1']='工作经验'
数据采集技术：selenium/正则匹配/xpath/beautifulsoup爬虫实例写代码的中青年 3天入门机器学习 selenium beautifulsoup 爬虫 python xpath 正则表达式
专栏介绍1.专栏面向零基础或基础较差的机器学习入门的读者朋友，旨在利用实际代码案例和通俗化文字说明，使读者朋友快速上手机器学习及其相关知识体系。2.专栏内容上包括数据采集、数据读写、数据预处理、分类\回归\聚类算法、可视化等技术。3.需要强调的是，专栏仅介绍主流、初阶知识，每一技术模块都是AI研究的细分领域，同更多技术有所交叠，此处不进行讨论和分享。数据采集技术：selenium/正则匹配/xpa
python：使用gdal和numpy进行遥感时间序列最大值合成 _养乐多_ python处理遥感数据 python numpy 开发语言
作者：CSDN@_养乐多_本文将介绍使用python编程语言，进行遥感数据时间序列最大值合成的代码。代码中使用了numpy和gdal，通过numpy广播机制实现时间序列最大值合成，并以NDVI时间序列数据为例。代码方便易运行，逻辑简单，速度快。只需要输入单波段遥感数据，就可输出最大值合成影像。输入输出如下图所示，文章目录一、完整代码一、完整代码importosimportglobimportnum
YOLOv8实例分割训练自己的数据集 NoContours YOLO python 开发语言
转载https://blog.csdn.net/m0_51530640/article/details/1299752571.利用labelme进行数据标注1.1Labelme安装方法首先安装Anaconda，然后运行下列命令：####################forPython2####################condacreate--name=labelmepython=2.7s
青少年Python趣学编程：用代码开启无限可能【文末好书推荐】一键难忘好书推荐 python pygame 开发语言
文章目录青少年Python趣学编程：用代码开启无限可能1.为什么选择Python？2.从小游戏开始：让编程变得有趣3.学习编程的关键步骤4.提供项目和挑战：激发创造力《青少年Python趣学编程（微课视频版）》【好书推荐】购书链接本书特色✨内容亮点配套资源适用人群青少年Python趣学编程：用代码开启无限可能在当今数字化的时代，编程已成为一种基础技能，尤其对于青少年来说，学习编程不仅能帮助他们理解
智联招聘爬虫 m0_74823878 面试学习路线阿里巴巴爬虫
使用Python和Selenium进行招聘信息爬取在当今数字化时代，数据已成为企业决策的重要依据。对于人力资源部门或求职者而言，获取最新的招聘信息至关重要。然而，手动浏览和收集招聘信息不仅耗时费力，而且效率低下。为了解决这个问题，我们可以使用Python和Selenium库来自动化这一过程，实现从招聘网站上批量爬取招聘信息。准备工作在开始之前，你需要确保已经安装了以下库：Python（建议版本3.
Mac M1安装Python---kalrry kalrry Python python macos 开发语言
MacM1安装Python---kalrry一、准备二、安装三、配置环境变量1、配置环境2、测试3、pip3与pip建立软链接四、参考备份一、准备Python3.9.1发布后开始支持苹果M1和macOS11BigSur也就是我们要下载3.9.1以后的版本，最好选择最新稳定版python官网下载python阿里网盘下载—sa65二、安装双击正常一路next安装即可三、配置环境变量1、配置环境命令行输
记录一次M1芯片Mac折腾安装Python3的过程 Onemud macos python linux
记录一次M1芯片Mac折腾安装Python3的过程前言：是要用python搞一个跟url接口交互的脚本，来配合做服务迁移工作，但在开发和测试脚本是让python环境卡住了脖（电脑装了很多个python，并且多版本间管理的比较混乱）所以想先调试好一个版本能用就好；并且脚本用到requests库，需要给python安装一下。总结两件事：装好python3.9，得能用给python3.9装上reques
python正态检验_Python检验数据是否正态分布 weixin_39748858 python正态检验
在对数据进行处理前，有事需要判断数据是否呈正态分布，比如线性回归，比如使用3-sigma判断数据是否异常。常用的正态分布检测方法：Shapiro-WilktestShapiro-Wilktest是一种在频率上统计检验中检验正态性的方法。该检验的零检验是样本$x_1,\cdots,x_n$来自于一个正态分布的母体。这个检验的统计量是：$$W=\frac{(\sum_{i=1}^{n}a_{i}x_{
python爬取pdf_python爬取在线教程转成pdf weixin_39842237 python爬取pdf
1、网站介绍之前再搜资料的时候经常会跳转到如下图所示的在线教程：01.教程样式包括一些github的项目也纷纷将教程链接指向这个网站。经过一番查找，该网站是一个可以创建、托管和浏览文档的网站，其网址为：https://readthedocs.org。在上面可以找到很多优质的资源。该网站虽然提供了下载功能，但是有些教程并没有提供PDF格式文件的下载，如图：02.下载该教程只提供了HTML格式文件的下
Python常见库的使用浪子西科 Python python 开发语言
文章目录人工智能与机器学习1.NumPy2.Pandas3.Scikit-learn4.TensorFlow5.PyTorch数据可视化1.Matplotlib2.Seaborn网络请求与爬虫1.Requests2.Scrapy自动化测试1.unittest2.pytest自然语言处理1.NLTK2.SpaCy数据库操作1.SQLite32.SQLAlchemy日期和时间处理1.datetime2
python 绘制正态分布图点云侠 CloudCompare python 开发语言算法 3d
目录一、概述二、代码实现三、结果展示一、概述在Python中，可以使用numpy库中的normal()函数或random.normal()方法生成正态分布的随机数，同时也利用scipy库的norm.pdf()函数来计算正态分布的概率密度函数。二、代码实现importnumpyasnpimportmatplotlib.pyplotaspltfromscipy.statsimportnorm#创建
服务器/mac m1配置python环境 LoveSeven.Lin macos python 开发语言
目录服务器配置环境一、安装miniconda二、创建环境三、激活环境四、conda安装Macm1配置环境一、安装Miniforge3二、创建环境三、激活环境四、安装tensorflow五、测试运行服务器配置环境一、安装miniconda#step1:获取安装shell脚本文件wgethttps://repo.continuum.io/miniconda/Miniconda3-latest-Linu
Mac M1芯片通过源码安装Python2.7.x 乌萨奇敲代码 macos python
文章目录MacM1芯片通过源码安装Python2.7.x1.下载源码2.安装依赖3.配置环境4.配置编译选项5.编译6.验证安装MacM1芯片通过源码安装Python2.7.x首先，由于AppleM1芯片使用的是ARM架构，已经不支持Python2.7.x了，所以需要利用Rosetta手动编译Python2.7.x，这里以安装Python2.7.17为例。1.下载源码首先，从Python官方网站下
在Mac M1上安装Python 3并设置环境变量 JieLun_C macos python 开发语言 Python
在MacM1上安装Python3并设置环境变量MacM1是基于AppleSilicon芯片的新一代Mac电脑。如果你是MacM1用户，并且想要安装Python3并设置环境变量，那么你来对地方了。本文将为你提供详细的步骤和相应的源代码。以下是在MacM1上安装Python3并设置环境变量的步骤：步骤1：安装HomebrewHomebrew是一个流行的包管理器，可以帮助我们在Mac上安装各种软件包。打
《白帽子讲Web安全》爬虫对抗：技术演进与攻防博弈予安灵白帽子讲Web安全 web安全爬虫安全网络安全网络攻击模型
《白帽子讲Web安全》一书中，作者吴翰清和叶敏以技术深度与实战视角系统剖析了爬虫技术的演进与反爬虫对抗的核心逻辑。本文结合书中内容，从爬虫发展、行业挑战、反爬方案及对抗策略等维度总结核心观点。一、爬虫技术的发展与行业挑战1.爬虫的演进早期爬虫以简单脚本为主，通过模拟HTTP请求抓取公开数据；随着技术进步，现代爬虫已发展为具备分布式架构、动态渲染（如Headless浏览器）、AI辅助解析等能力的复杂
2024年Scrapy+Selenium项目实战--携程旅游信息爬虫 2401_84563287 程序员 scrapy selenium 旅游
简介携程（you.ctrip.com）是一个提供旅游信息的网站，但它的部分内容可能是动态加载的，难以直接通过Scrapy获取。这时就需要借助Selenium这样的工具，模拟浏览器行为进行数据的获取和处理。工具准备Scrapy：一个用于爬取网站并提取结构化数据的强大框架。Selenium：一个自动化测试工具，可以模拟用户操作浏览器的行为。ChromeDriver：作为SeleniumWebDrive
如何用ruby来写hadoop的mapreduce并生成jar包 wudixiaotie mapreduce
ruby来写hadoop的mapreduce，我用的方法是rubydoop。怎么配置环境呢： 1.安装rvm：不说了网上有 2.安装ruby：由于我以前是做ruby的，所以习惯性的先安装了ruby，起码调试起来比jruby快多了。 3.安装jruby： rvm install jruby然后等待安
java编程思想 -- 访问控制权限百合不是茶 java 访问控制权限单例模式
访问权限是java中一个比较中要的知识点,它规定者什么方法可以访问,什么不可以访问一:包访问权限; 自定义包: package com.wj.control; //包 public class Demo { //定义一个无参的方法 public void DemoPackage(){ System.out.println("调用
[生物与医学]请审慎食用小龙虾 comsci 生物
现在的餐馆里面出售的小龙虾,有一些是在野外捕捉的,这些小龙虾身体里面可能带有某些病毒和细菌,人食用以后可能会导致一些疾病,严重的甚至会死亡..... 所以,参加聚餐的时候,最好不要点小龙虾...就吃养殖的猪肉,牛肉,羊肉和鱼,等动物蛋白质
org.apache.jasper.JasperException: Unable to compile class for JSP: 商人shang maven 2.2 jdk1.8
环境： jdk1.8 maven tomcat7-maven-plugin 2.0 原因： tomcat7-maven-plugin 2.0 不知吃 jdk 1.8，换成 tomcat7-maven-plugin 2.2就行，即 <plugin>
你的垃圾你处理掉了吗?GC oloz GC
前序:本人菜鸟，此文研究学习来自网络，各位牛牛多指教　 1.垃圾收集算法的核心思想　　Java语言建立了垃圾收集机制，用以跟踪正在使用的对象和发现并回收不再使用(引用)的对象。该机制可以有效防范动态内存分配中可能发生的两个危险：因内存垃圾过多而引发的内存耗尽，以及不恰当的内存释放所造成的内存非法引用。　　垃圾收集算法的核心思想是：对虚拟机可用内存空间，即堆空间中的对象进行识别
shiro 和 SESSSION 杨白白 shiro
shiro 在web项目里默认使用的是web容器提供的session，也就是说shiro使用的session是web容器产生的，并不是自己产生的，在用于非web环境时可用其他来源代替。在web工程启动的时候它就和容器绑定在了一起，这是通过web.xml里面的shiroFilter实现的。通过session.getSession()方法会在浏览器cokkice产生JESSIONID，当关闭浏览器，此
移动互联网终端淘宝客如何实现盈利小桔子移動客戶端淘客淘寶App
2012年淘宝联盟平台为站长和淘宝客带来的分成收入突破30亿元，同比增长100%。而来自移动端的分成达1亿元，其中美丽说、蘑菇街、果库、口袋购物等App运营商分成近5000万元。可以看出，虽然目前阶段PC端对于淘客而言仍旧是盈利的大头，但移动端已经呈现出爆发之势。而且这个势头将随着智能终端(手机，平板)的加速普及而更加迅猛
wordpress小工具制作 aichenglong wordpress 小工具
wordpress 使用侧边栏的小工具，很方便调整页面结构小工具的制作过程 1 在自己的主题文件中新建一个文件夹(如widget)，在文件夹中创建一个php(AWP_posts-category.php) 小工具是一个类,想侧边栏一样，还得使用代码注册，他才可以再后台使用，基本的代码一层不变 <?php class AWP_Post_Category extends WP_Wi
JS微信分享 AILIKES js
// 所有功能必须包含在 WeixinApi.ready 中进行 WeixinApi.ready(function(Api) { // 微信分享的数据 var wxData = { &nb
封装探讨百合不是茶 JAVA面向对象封装
//封装属性方法将某些东西包装在一起，通过创建对象或使用静态的方法来调用，称为封装；封装其实就是有选择性地公开或隐藏某些信息，它解决了数据的安全性问题，增加代码的可读性和可维护性在 Aname类中申明三个属性，将其封装在一个类中：通过对象来调用例如 1： //属性将其设为私有姓名 name 可以公开
jquery radio/checkbox change事件不能触发的问题 bijian1013 JavaScript jquery
我想让radio来控制当前我选择的是机动车还是特种车，如下所示： <html> <head> <script src="http://ajax.googleapis.com/ajax/libs/jquery/1.7.1/jquery.min.js" type="text/javascript"><
AngularJS中安全性措施 bijian1013 JavaScript AngularJS 安全性 XSRF JSON漏洞
在使用web应用中，安全性是应该首要考虑的一个问题。AngularJS提供了一些辅助机制，用来防护来自两个常见攻击方向的网络攻击。一.JSON漏洞当使用一个GET请求获取JSON数组信息的时候（尤其是当这一信息非常敏感，
[Maven学习笔记九]Maven发布web项目 bit1129 maven
基于Maven的web项目的标准项目结构 user-project user-core user-service user-web src
【Hive七】Hive用户自定义聚合函数(UDAF) bit1129 hive
用户自定义聚合函数，用户提供的多个入参通过聚合计算(求和、求最大值、求最小值)得到一个聚合计算结果的函数。问题：UDF也可以提供输入多个参数然后输出一个结果的运算，比如加法运算add(3，5)，add这个UDF需要实现UDF的evaluate方法,那么UDF和UDAF的实质分别究竟是什么？ Double evaluate(Double a, Double b)
通过 nginx-lua 给 Nginx 增加 OAuth 支持 ronin47
前言：我们使用Nginx的Lua中间件建立了OAuth2认证和授权层。如果你也有此打算，阅读下面的文档，实现自动化并获得收益。SeatGeek 在过去几年中取得了发展，我们已经积累了不少针对各种任务的不同管理接口。我们通常为新的展示需求创建新模块，比如我们自己的博客、图表等。我们还定期开发内部工具来处理诸如部署、可视化操作及事件处理等事务。在处理这些事务中，我们使用了几个不同的接口来认证： &n
利用tomcat-redis-session-manager做session同步时自定义类对象属性保存不上的解决方法 bsr1983 session
在利用tomcat-redis-session-manager做session同步时，遇到了在session保存一个自定义对象时，修改该对象中的某个属性，session未进行序列化，属性没有被存储到redis中。在 tomcat-redis-session-manager的github上有如下说明： Session Change Tracking As noted in the &qu
《代码大全》表驱动法-Table Driven Approach-1 bylijinnan java 算法
关于Table Driven Approach的一篇非常好的文章： http://www.codeproject.com/Articles/42732/Table-driven-Approach package com.ljn.base; import java.util.Random; public class TableDriven { public
Sybase封锁原理 chicony Sybase
昨天在操作Sybase IQ12.7时意外操作造成了数据库表锁定，不能删除被锁定表数据也不能往其中写入数据。由于着急往该表抽入数据，因此立马着手解决该表的解锁问题。无奈此前没有接触过Sybase IQ12.7这套数据库产品，加之当时已属于下班时间无法求助于支持人员支持，因此只有借助搜索引擎强大的
java异常处理机制 CrazyMizzz java
java异常关键字有以下几个，分别为 try catch final throw throws 他们的定义分别为 try： Opening exception-handling statement. catch： Captures the exception. finally： Runs its code before terminating
hive 数据插入DML语法汇总 daizj hive DML 数据插入
Hive的数据插入DML语法汇总1、Loading files into tables语法：1) LOAD DATA [LOCAL] INPATH 'filepath' [OVERWRITE] INTO TABLE tablename [PARTITION (partcol1=val1, partcol2=val2 ...)]解释：1)、上面命令执行环境为hive客户端环境下： hive>l
工厂设计模式 dcj3sjt126com 设计模式
使用设计模式是促进最佳实践和良好设计的好办法。设计模式可以提供针对常见的编程问题的灵活的解决方案。工厂模式工厂模式（Factory）允许你在代码执行时实例化对象。它之所以被称为工厂模式是因为它负责“生产”对象。工厂方法的参数是你要生成的对象对应的类名称。 Example #1 调用工厂方法（带参数） <?phpclass Example{
mysql字符串查找函数 dcj3sjt126com mysql
FIND_IN_SET(str,strlist) 假如字符串str 在由N 子链组成的字符串列表strlist 中，则返回值的范围在1到 N 之间。一个字符串列表就是一个由一些被‘,’符号分开的自链组成的字符串。如果第一个参数是一个常数字符串，而第二个是type SET列，则 FIND_IN_SET() 函数被优化，使用比特计算。如果str不在strlist 或st
jvm内存管理 easterfly jvm
一、JVM堆内存的划分分为年轻代和年老代。年轻代又分为三部分：一个eden,两个survivor。工作过程是这样的：e区空间满了后，执行minor gc，存活下来的对象放入s0, 对s0仍会进行minor gc，存活下来的的对象放入s1中，对s1同样执行minor gc，依旧存活的对象就放入年老代中；年老代满了之后会执行major gc，这个是stop the word模式，执行
CentOS-6.3安装配置JDK-8 gengzg centos
JAVA_HOME=/usr/java/jdk1.8.0_45 JRE_HOME=/usr/java/jdk1.8.0_45/jre PATH=$PATH:$JAVA_HOME/bin:$JRE_HOME/bin CLASSPATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar:$JRE_HOME/lib export JAVA_HOME
【转】关于web路径的获取方法 huangyc1210 Web 路径
假定你的web application 名称为news,你在浏览器中输入请求路径： http://localhost:8080/news/main/list.jsp 则执行下面向行代码后打印出如下结果： 1、 System.out.println(request.getContextPath()); //可返回站点的根路径。也就是项
php里获取第一个中文首字母并排序远去的渡口数据结构 PHP
很久没来更新博客了，还是觉得工作需要多总结的好。今天来更新一个自己认为比较有成就的问题吧。最近在做储值结算，需求里结算首页需要按门店的首字母A-Z排序。我的数据结构原本是这样的： Array ( [0] => Array ( [sid] => 2885842 [recetcstoredpay] =&g
java内部类 hm4123660 java 内部类匿名内部类成员内部类方法内部类
　在Java中，可以将一个类定义在另一个类里面或者一个方法里面，这样的类称为内部类。内部类仍然是一个独立的类，在编译之后内部类会被编译成独立的.class文件，但是前面冠以外部类的类名和$符号。内部类可以间接解决多继承问题,可以使用内部类继承一个类，外部类继承一个类，实现多继承。 &nb
Caused by: java.lang.IncompatibleClassChangeError: class org.hibernate.cfg.Exten zhb8015
maven pom.xml关于hibernate的配置和异常信息如下，查了好多资料，问题还是没有解决。只知道是包冲突，就是不知道是哪个包....遇到这个问题的分享下是怎么解决的。。 maven pom: <dependency> <groupId>org.hibernate</groupId> <ar
Spark 性能相关参数配置详解－任务调度篇 Stark_Summer spark cache cpu 任务调度 yarn
随着Spark的逐渐成熟完善, 越来越多的可配置参数被添加到Spark中来, 本文试图通过阐述这其中部分参数的工作原理和配置思路, 和大家一起探讨一下如何根据实际场合对Spark进行配置优化。由于篇幅较长，所以在这里分篇组织，如果要看最新完整的网页版内容，可以戳这里：http://spark-config.readthedocs.org/，主要是便
css3滤镜 wangkeheng html css
经常看到一些网站的底部有一些灰色的图标，鼠标移入的时候会变亮，开始以为是js操作src或者bg呢，搜索了一下，发现了一个更好的方法：通过css3的滤镜方法。 html代码： <a href='' class='icon'><img src='utv.jpg' /></a> css代码： .icon{-webkit-filter: graysc

按字母分类： A B C D E F G H I J K L M N O P Q R S T U V W X Y Z 其他