糯米不开花ぴ

爬虫并发及应用

协成asyncio模块

asyncio即Asynchronous I/O是python一个用来处理并发(concurrent)事件的包，是很多python异步架构的基础，多用于处理高并发网络请求方面的问题。

async：异步

sync：同步

io：input、output输入输出事件

简单来说，asyncio解决的是：IO阻塞导致cpu利用率降低的问题

-------------------------------------------------------------------------------------------------------------------------

为了简化并更好地标识异步，从ython 3.5开始引入了新的语法async和await，可以让coroutine的代码更简洁易读.
asyncio 被用作多个提供高性能 Python 异步框架的基础，包括网络和网站服务，数据库连接库，分布式任务队列等等。
asyncio 往往是构建lo 密集型和高层级 结构化 网络代码的最佳选择。

async与await

● async用于声明一个函数为异步函数，即该函数内部可能会使用到异步操作。

在定义异步函数时，需要在函数定义前加上async关键字。

-------->>>>>

● await用于等待一个异步操作完成。当在一个异步函数中使用await关键字时，该函数会暂停执行，直到等待的异步操作完成并返回结果后，才会继续执行后续代码。

● async.run() ：运行协程

=====================================================================

简单示例如下：

import asyncio
import time

async def foo():
    print("开始执行foo")
    await asyncio.sleep(1)  # 模拟异步操作，等待1秒
    print("结束执行foo")

async def main():
    start = time.time()
    print("开始执行main")
    await foo()  # 等待foo函数执行完毕
    print("结束执行main")
    print("cost timer:", time.time() - start)

asyncio.run(main())  # 启动主协成

task

task：任务,对协程对象的进一步封装,包含任务的各个状态;

asyncio.Task是Future的一个子类，用于实现协作式多任务的库，且Task对象不能用户手动实例化，通过函数创建，这里重点介绍asyncio.create_task方法：

● async.create_task()：创建task

● async.gather() ：获取返回值

● asyncio.wait()：获取返回值

=====================================================================

以下为3.11版本中，构建协成任务列表的示例：

import asyncio
import time

#主线程
async def foo(i):
    print(f"任务{i}启动")
    await asyncio.sleep(i)  #主线程阻塞
    print(f"任务{i}结束")
    return i * i  #返回每个任务的平方值

#主协成
async def main():
    start = time.time()

    #显式的创建子协成对象任务，并进行传参
      tasks = [asyncio.create_task(foo(1)),
             asyncio.create_task(foo(2)),
             asyncio.create_task(foo(3))]
    await asyncio.wait(tasks)  #对协成tasks阻塞的结果收集，得到一个对象

    print("cost timer:", time.time() - start) #总耗时

    #获取每个任务对象的结果值
    for task in tasks:
        print(task.done(),task.result())

asyncio.run(main())

上面的栗子中，是等所有协成任务全部结束后，再打印获取每个任务的平方值

如果，我想要在某一个协成任务结束后，就立即获取到该任务的平方值呢？

很简单，只需要使用callback即可，具体代码如下：

import asyncio
import time

#主线程
async def foo(i):
    print(f"任务{i}启动")
    await asyncio.sleep(i)  #主线程阻塞
    print(f"任务{i}结束")
    return i * i  #返回每个任务的平方值

#获取第二个协成对象的返回值
def task2_callback(ret):
    print("异步任务2的结果：",ret.result())

#主协成
async def main():
    #显式的创建子协成对象任务，并进行传参
    tasks = [asyncio.create_task(foo(1)),
             asyncio.create_task(foo(2)),
             asyncio.create_task(foo(3))]

   #获取第二个协成任务之后的回调函数,即平方值
    tasks[1].add_done_callback(task2_callback)
    res = await asyncio.gather(*tasks) #使用gather直接收集协成对象的结果
    print(res)


start = time.time()
asyncio.run(main())
print("cost timer:", time.time() - start)  # 总耗时

`asyncio.gather`和`asyncio.wait`

asyncio.gather和asyncio.wait都是用于并发执行多个协程（coroutine）的函数

但它们之间有一些区别：

参数不同：

asyncio.gather接收一个协程列表作为参数，并返回一个新的协程。当所有传入的协程都完成时，这个新的协程也会完成。

asyncio.wait接收一个或多个协程以及一个超时时间作为参数。它会阻塞主线程，直到至少有一个协程完成或者超时。

返回值不同：

asyncio.gather返回一个新的协程，可以通过调用其result()方法获取所有协程的结果。

asyncio.wait返回一个包含已完成协程对象的集合，可以通过遍历这个集合来获取每个协程的结果。

异常处理不同：

asyncio.gather会等待所有传入的协程都完成，如果其中任何一个协程抛出异常，那么整个asyncio.gather协程都会抛出异常。

asyncio.wait只会等待至少有一个协程完成，如果其中任何一个协程抛出异常，那么asyncio.wait会立即返回已完成的协程对象集合，而不会继续等待其他协程完成。

总结来说，asyncio.gather适用于需要等待所有协程都完成的场景，而asyncio.wait适用于只需要等待至少一个协程完成的场景。

aiohttp包

aiohtpo是一个为Python提供异步HTTP 客户端/服务端编程，基于 asyncio 的异步库。asyncio可以实现单线程并发10操作，其实现了TCP、UDP、SSL等协议，aiohttp就是基于asyncio实现的http框架。

-------->>>>>

我们之前学习过爬虫最重要的模块requests，但它是阻塞式的发起请求，每次请求发起后需阻塞等待其返回响应，不能做其他的事情。

如果需要实现异步爬虫，就不能用requests，可以理解为aiohtpo是requests升级版本。

aiohtpo它是基于 ayncio 的异步模块，可用于实现异步爬虫，优点就是更快于 requests 的同步爬虫。

-------->>>>>
安装方式，pip install aiohttp

一个简单的示例

import aiohttp
import asyncio

async def main():
    #异步爬虫session的写法
    async with aiohttp.ClientSession() as session:
        #url和其他参数正常放在括号里，as response是响应体
        async with session.get("http://httpbin.org/headers") as response:
            print(await response.text()) #await固定写法，挂载异步循环，获取响应体文本内容

asyncio.run(main())

异步爬虫《斗图网》-- 爬取图片

目标url：斗图啦 - 斗图网 - 斗图大会 - 金馆长表情库 - 真正的斗图网站 - doutula.com

import aiohttp
import asyncio
import os
from lxml import etree
import time

headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/119.0.0.0 Safari/537.36"
}

async def get_img_urls():
    url = "https://www.pkdoutu.com/"
    async with aiohttp.ClientSession() as session:
        async with session.get(url, headers=headers, ssl=False) as response:
            selector = etree.HTML(await response.text())
            img_urls = selector.xpath('//li[@class="list-group-item"]/div/div/a//img[@data-backup]/@data-backup')

            return img_urls


async def download_img(url):
    name = os.path.basename(url)
    async with aiohttp.ClientSession() as session:
        async with session.get(url, ssl=False) as response:
            img_name = os.path.basename(url)
            path = os.path.join("imgs",img_name)

            # 将得到的请求保存到文件中
            with open(path, "wb") as f:
                f.write(await response.content.read())

            print(f"{img_name}下载完成！")


#主线程：
async def main():
    img_urls = await get_img_urls()
    tasks = [asyncio.create_task(download_img(url)) for url in img_urls]
    await asyncio.wait(tasks)


#主逻辑：
if __name__ == '__main__':
    start = time.time()
    asyncio.run(main())
    print(f"整体耗时{time.time() - start}秒")

相比于上一篇初识爬虫并发-CSDN博客中的并发下载的速度还要快，非常丝滑：

mu38流视频爬取

m3u8介绍

HLS技术介绍

HLS（HTTP Live Streaming）是一种流媒体传输协议，最初由苹果公司开发并推出。它是一种基于HTTP的流媒体传输协议，旨在提供高质量的实时流媒体传输和适应不同网络条件的能力。HLS技术主要用于在互联网上实时传输音频和视频内容，通常用于直播活动、视频点播等场景。

HLS技术的工作原理如下：

媒体分片（Media Segmentation）：源视频或音频内容首先被分割成短小的媒体分片，通常每个分片持续几秒到十几秒不等。

自适应码率（Adaptive Bitrate）：每个媒体分片都会根据不同的码率进行编码，以便在不同网络条件下进行自适应码率的选择，以确保在不同带宽条件下的播放质量。

播放列表（Playlist）：HLS服务器会生成一个包含媒体分片信息的播放列表文件（通常是M3U8格式），客户端通过该播放列表文件获取媒体分片的URL和其他相关信息。

HTTP传输：客户端通过HTTP协议请求播放列表文件和媒体分片，服务器则会通过HTTP协议响应这些请求，从而实现媒体内容的传输。

实时性和延迟：HLS技术通过调整媒体分片的大小和延迟时间来实现不同的实时性和延迟，通常可以在保证一定延迟的同时提供较好的流畅性和稳定性。

HLS的作用

跨平台兼容性：HLS可以在各种设备和平台上进行播放，包括iOS设备、Android设备、PC和智能电视等。

自适应码率：HLS可以根据网络带宽和设备性能动态调整码率，以提供更好的观看体验。

安全性：HLS可以与数字版权管理系统（DRM）结合使用，以提供内容加密和安全传输。

实时性和延迟控制：HLS可以通过调整媒体分片的大小和延迟时间来实现不同的实时性和延迟。

总之，HLS技术是一种流行的流媒体传输协议，适用于许多实时音视频传输的应用场景

M3U8文件详解

M3U文件：

如果想要爬取HLS技术下的资源数据，首先要对M3U8的数据结构和字段定义非常了解。M3U8是一个扩展文件格式，由M3U扩展而来。那么什么是M3U呢？

-----------------------------------------------

M3U文件：
M3U文件是一种常见的音频或视频播放列表文件格式，它是一种文本文件，其中包含了多个媒体文件的路径或URL。

M3U文件通常用于描述播放列表，可以包含音乐、视频或流媒体的链接，以便播放器可以按照列表中指定的顺序播放这些媒体文件。

以下是一个简单的M3U文件示例：

M3U8文件

M3U8文件是一种基于文本的播放列表文件，通常用于指定HLS（HTTP Live Streaming）流媒体的播放顺序和信息。

M3U8文件中包含了一系列媒体分片（.ts文件）的URL，以及其他相关的信息，如媒体时长、标题等。这些信息可以帮助播放器正确地按顺序播放HLS流。

#EXTM3U:每个M3U文件第一行必须是这个tag标识。

#EXT-X-VERSION:版本，此属性可用可不用。

#EXT-X-TARGETDURATION:目标持续时间，是用来定义每个TS的【最大】duration（持续时间）。
#EXT-X-ALLOW-CACHE是否允许允许高速缓存。
#EXT-X-MEDIA-SEQUENCE定义当前M3U8文件中第一个文件的序列号，每个ts文件在M3U8文件中都有固定唯一的序列号。

#EXT-X-DISCONTINUITY:播放器重新初始化

#EXT-X-KEY定义加密方式，用来加密的密钥文件key的URL，加密方法（例如AES-128），以及IV加密向量。（记住）

#EXTINF:指定每个媒体段(ts文件)的持续时间，这个仅对其后面的TS链接有效，每两个媒体段(ts文件)间被这个tag分隔开。

#EXT-X-ENDLIST表明M3U8文件的结束。

#以上借用他人描述

以下是F12中能看到的一个m3u8的文示例：

可以看到index.m3u8中这个文件中包含多个ts片段的链接地址，这个就是上面描述的真正的视频文件。其中任何一个ts文件都是一小段视频，可以单独播放。我们做视频爬虫的目标就是把这些ts文件都爬取下来。

EXT-X-KEY判断视频文件是否加密（借用他人描述）：

对于大多数的M3U8视频，一般是不加密的。对于一些重要的视频服务商，他们会对其视频做加密处理。M3U8视频目前的标准加密方式是使用AES-128进行加密处理。如果视频是加密的，就会在M3U8文件中出现以下信息。

#EXT-X-KEY:METHOD=AES-128,URI="https://edu.aliyun.com/hls/2452/clef/0VqtrHq9IkTfOsLqy0iC1FP9342VZm1s",IV=0x3f1c20b9dd4459d0adf972eaba85e0a2

其中METHOD为加密方法，标准是AES-128（借用他人描述）。

Key是密钥文件的下载地址（密钥为16字节大小的文件，需要下载）。

IV是加密向量（16个字节大小的16进制数），如果没有IV值则使用b"0000000000000000"填充即可。

注意：Key和IV是AES加密解密的必要信息，这里我们就不用深入讲解。大家只需要知道Key和IV的值会作为解密函数的参数直接调用就可以了。如果文件中没有包含#EXT-X-KEY，则媒体文件将不会被加密。

m3u8实战案例

网站分析详解

在百度上随便找一个在线观看电视剧的网址

我这里用的是新辰剧集网：https://www.tamayaki.com/

很多视频网站是加密的，这里先找到一个不加密的

例如搜索《夏威夷神探第一季》，先下载第一集

打开F12看一下：

可以看到1-1.html是所有加载项的开头，也是第一集电视剧的url

接下来，会一直不断地加载ts

所谓的ts其实就是每一集电视剧的一小个片段，几秒钟的，一集电视机大概几百个ts

天呐，如果按照ts去爬取，这得下载到什么时候？

然后看看标头：会发现每个ts的url中，除了最后的数字编号不一致，其他都是一样的

再往上找，在第一个ts的上面有一个index.m3u8文件：响应里包含了所有ts片段

再往上看，还有一个index.m3u8的文件，并且关联是：

第一个index.m3u8的响应中"20220416/ups43Nzi/"也出现在第一个index.m3u8的响应、以及每个ts片段的url里

也就是说：

找到第一个index.m3u8的文件，就可以找到第二个包含所有ts片段的index.m3u8

然后就能关联到所有的ts片段下载

第一个index.m3u8的响应核心是："2000kb/hls"，与第二个index.m3u8和每个ts的url相对应

总结来说：

● 第一集视频播放的url：https://www.tamayaki.com/vod/xwystdyj1980/1-1.html，可认为是根节点

● 第一个index.m3u8的url：https://vod1.kczybf.com/20220416/ups43Nzi/index.m3u8，它包含在第一集的视频播放元素中，响应信息是“2000kb/hls”。

●第二个index.m3u8的url：https://vod1.kczybf.com/20220416/ups43Nzi/2000kb/hls/index.m3u8

所以它的域名是由第一个index.m3u8请求路径“vod1.kczybf.com/20220416/ups43Nzi”+第一个index.m3u8的响应“2000kb/hls”组成，响应信息包含所有ts片段信息。

● 后续的每个ts的url：https://vod1.kczybf.com/20220416/ups43Nzi/2000kb/hls/FTo5Mboh.ts

每个ts的url中都包含第二个index.m3u8的请求路径“vod1.kczybf.com/20220416/ups43Nzi/2000kb/hls”+ts片段名称，组成一个完整的url

那么现在基本思路就确定了：

1. 爬取第一集的视频播放页面，也就是1-1.html的url

2. 通过第一个播放的url获取到一个index.m3u8，然后关联到第二个index.m3u8

3. 通过第二个index.m3u8，拿到所有的ts文件

4. 下载第一集所有的ts片段

5. 最后将其合并为一个完整的mp4

问题来了：

第一个index.m3u8（url见上一张截图）与这一集视频播放的url是怎么关联上的，它是怎么来的？

下面提供两种方式，快速定位到index.m3u8

方式1：去元素里搜索index.m3u8，定位到一行源码：

但是源码中 JavaScript 的写法把对应第一个index.m3u8的url做了处理，带了一堆乱七八糟的字符

其实字符去掉，完整的url=第一个index.m3u8de 的url：https://vod1.kczybf.com/20220416/ups43Nzi/index.m3u8

只不过提取这个完整的url稍微麻烦一点

方式2：在【源代码/来源】-> 右侧“XHR/提取断点”点击+，在输入框中输入“m3u8”回车

先把源码×掉，重新加载url，进入源码模式直接定位查看

⑴ 协成并发版爬取ts文件

弄清楚了所有我们需要用到的加载项关系之后，就可以开始写代码了~~~

由于串行下载速度较慢，这里直接用协成并发版本

开始写代码：

函数串行版本：

第一版，主要目的是调试，确保能正常下载，但是串行下载速度比较慢

import requests
import os
import re
import time
from bs4 import BeautifulSoup

session = requests.session()
headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/119.0.0.0 Safari/537.36"
}

def get_first_m3u8_link():
    # 爬取第一集视频播放的url:
    url = 'https://www.tamayaki.com/vod/xwystdyj1980/1-1.html'
    res = session.get(url,headers=headers,verify=True)

    #正则解析第一个m3u8的url：
    html_content = res.text
    first_m3u8_link = re.search(r'"url_next":"(https?:\\/\\/[^"]+)', html_content).group(1).replace("\\/", "/")
    print("第一个m3u8:", first_m3u8_link)

    #抓个名字：
    soup = BeautifulSoup(html_content, 'html.parser')
    name = soup.find('h1', string=re.compile(r'夏威夷神探第一季01')).get_text()[:-4]
    print("视频名称:", name)
    return first_m3u8_link,name

def get_second_m3u8_link(first_m3u8_link):
    #获取第二个m3u8：直接字符串的分隔与拼接
    res = session.get(first_m3u8_link)  # 第一个m3u8的url
    second_m3u8_link = first_m3u8_link.split("://")[0] + "://" + first_m3u8_link.split("/")[2] + res.text.split("\n")[2]
    print("第二个m3u8:", second_m3u8_link)
    return second_m3u8_link

def parse_ts(second_m3u8_link):
    '''
    #爬取m3u8具体的ts文件：
    #https://vod1.kczybf.com/20220416/ups43Nzi/2000kb/hls/FTo5Mboh.ts;
    ts域名 = 第二个m3u8的请求路径+ts文件路径 = ts真正的url
    '''
    res = requests.get(second_m3u8_link)
    print(res.text)

    #解析ts文件url：
    ret = re.findall(r"hls/(.*?\.ts)",res.text)
    print(ret)
    return ret

def download_ts(ts,p):
    #下载每一个ts文件：
    with open(ts,"wb") as f:
        path = os.path.join(p,ts)
        res = requests.get(path)
        f.write(res.content)
        print(f"{ts}下载完成！")

#主程序：
def main():
    #(1)爬取播放页面，获取第一个m3u8链接：
    first_m3u8_link,name = get_first_m3u8_link()

    #(2)获取第二个m3u8链接：
    second_m3u8_link = get_second_m3u8_link(first_m3u8_link)

    #(3)解析ts文件：
    ts_list = parse_ts(second_m3u8_link)

    #(4) 下载ts：
    p = os.path.dirname(second_m3u8_link)
    for ts in ts_list:
        download_ts(ts,p)
main()

第二版：在串行的基础上优化为协成版本，提高下载速度

import os
import re
import asyncio
import aiohttp
import time
from bs4 import BeautifulSoup

async def get_first_m3u8_link():
    headers = {
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/119.0.0.0 Safari/537.36"}

    # 第一集视频播放的url:
    url = 'https://www.tamayaki.com/vod/xwystdyj1980/1-1.html'

    # 异步爬虫session的写法
    async with aiohttp.ClientSession() as session:
        # url和其他参数正常放在括号里，as response是响应体
        async with session.get(url,headers=headers,ssl=False) as response:
            html_content = await response.text() # await固定写法，挂载异步循环，获取响应体文本内容
            first_m3u8_link = re.search(r'"url_next":"(https?:\\/\\/[^"]+)', html_content).group(1).replace("\\/", "/")
            print("第一个m3u8:", first_m3u8_link)

            #抓个名字：
            soup = BeautifulSoup(html_content, 'html.parser')
            name = soup.find('h1', string=re.compile(r'夏威夷神探第一季01')).get_text()[:-4]
            print("视频名称:", name)
            return first_m3u8_link,name

async def get_second_m3u8_link(first_m3u8_link):
    async with aiohttp.ClientSession() as session:
        async with session.get(first_m3u8_link) as response:
            text = await response.text()
            #获取第二个m3u8：直接字符串的分隔与拼接:
            second_m3u8_link = first_m3u8_link.split("://")[0] + "://" + first_m3u8_link.split("/")[2] + text.split("\n")[2]
            print("第二个m3u8:", second_m3u8_link)
            return second_m3u8_link

async def parse_ts(second_m3u8_link):
    '''
    #爬取m3u8具体的ts文件：
    #https://vod1.kczybf.com/20220416/ups43Nzi/2000kb/hls/FTo5Mboh.ts;
    ts域名 = 第二个m3u8的请求路径+ts文件路径 = ts真正的url
    '''
    async with aiohttp.ClientSession() as session:
        async with session.get(second_m3u8_link) as response:
            #解析ts文件url：
            text = await response.text()
            ret = re.findall(r"hls/(.*?\.ts)", text)
            
            #将所有的ts文件名写入index.m3u8文件中，为合并做准备
            abs_path = os.path.abspath("ts文件/index.m3u8")
            with open(abs_path,"w") as f:
                for ts in ret:
                    ts_url = "hls/"+ts
                    f.write(ts_url + "\n")
            print(ret)
            return ret

async def download_ts(ts, p, retry=3, delay=1):
    # 下载每一个ts文件：
    for _ in range(retry):
        try:
            async with aiohttp.ClientSession() as session:
                async with session.get(os.path.join(p, ts)) as response:
                    with open(os.path.join("ts文件", ts), 'wb') as f:
                        f.write(await response.read())
                    print(f"{ts} 下载完成！")
                    break  # 如果成功下载，跳出重试循环
        except aiohttp.client_exceptions.ServerDisconnectedError:
            print(f"下载 {ts} 时出现连接错误，正在重试...")
            await asyncio.sleep(delay)  # 添加延迟
        except aiohttp.client_exceptions.ClientOSError as e:
            print(f"下载 {ts} 时出现网络连接错误: {e}")
            await asyncio.sleep(delay)  # 添加延迟
    else:
        print(f"下载 {ts} 失败，达到最大重试次数")

#主程序：
async def main():
    if not os.path.exists("ts文件"):
        os.mkdir("ts文件")

    #(1)爬取播放页面，获取第一个m3u8链接：
    first_m3u8_link,name = await get_first_m3u8_link()

    #(2)获取第二个m3u8链接：
    second_m3u8_link = await get_second_m3u8_link(first_m3u8_link)

    #(3)解析ts文件：
    ts_list = await parse_ts(second_m3u8_link)

    #(4) 下载ts：
    p = os.path.dirname(second_m3u8_link)
    #创建异步tasks任务：
    tasks = [asyncio.create_task(download_ts(ts,p)) for ts in ts_list]
    await asyncio.wait(tasks) #收集所有的tasks任务

start = time.time()
asyncio.run(main())
print(f"耗时{time.time() - start}秒")

就非常优秀哈，效率杠杠的~~

至此，就已经完成了前四步下载任务，但是目前还只是n个ts片段，还剩下最后一个人合并的动作

(2) 基于ffmpeg合并ts文件

ffmpeg的安装步骤（这里以windows为例）：

❶ 去ffmpeg官网下载windows版本：官网：https://www.ffmpeg.org/

❷ 本地解压安装包，解压后的原始文件目录如下：

在bin目录中再创建一个文件夹命名为ffmpeg，里面放入ffmpeg.exe

❸ 进行环境变量配置：

此电脑 -> 高级系统设置 -> 环境变量 -> 系统变量(s)中找到path双击：

在编辑环境变量弹框中点击“新建” -> 在编辑框中黏贴完整的ffmpeg的bin目录路径

最后记得三个弹框的确定都需要点一下，这就完成了环境变量配置。

❹ 启动cmd，在终端执行：ffmpeg -version

安装成功会显示本地ffmpeg的版本信息，如下图：

❺ 在Pycharm中安装ffmpeg，选择ffmpeg-python进行安装

最后，在上面的代码中添加ffmpeg视频合并的方法

在视频合并之前，必须清楚的是，大几百个ts文件，它肯定是有先后顺序的，ffmpeg能够自动识别ts文件的顺序，进行有序合并，但是需要有一个ts文件列表，所以代码中需要添加生成index.m3u8的文件，提取每个ts的文件名写入该文件，f12中返回有ts文件的路径，我们只需要用ts文件名即可，如下右边的截图：

import os
import re
import asyncio
import aiohttp
import time
from bs4 import BeautifulSoup

async def get_first_m3u8_link():
    headers = {
        "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/119.0.0.0 Safari/537.36"}

    # 第一集视频播放的url:
    url = 'https://www.tamayaki.com/vod/xwystdyj1980/1-1.html'

    # 异步爬虫session的写法
    async with aiohttp.ClientSession() as session:
        # url和其他参数正常放在括号里，as response是响应体
        async with session.get(url,headers=headers,ssl=False) as response:
            html_content = await response.text() # await固定写法，挂载异步循环，获取响应体文本内容
            first_m3u8_link = re.search(r'"url_next":"(https?:\\/\\/[^"]+)', html_content).group(1).replace("\\/", "/")
            print("第一个m3u8:", first_m3u8_link)

            #抓个名字：
            soup = BeautifulSoup(html_content, 'html.parser')
            name = soup.find('h1', string=re.compile(r'夏威夷神探第一季01')).get_text()[:-4]
            print("视频名称:", name)
            return first_m3u8_link,name

async def get_second_m3u8_link(first_m3u8_link):
    async with aiohttp.ClientSession() as session:
        async with session.get(first_m3u8_link) as response:
            text = await response.text()
            #获取第二个m3u8：直接字符串的分隔与拼接:
            second_m3u8_link = first_m3u8_link.split("://")[0] + "://" + first_m3u8_link.split("/")[2] + text.split("\n")[2]

            print("第二个m3u8:", second_m3u8_link)
            return second_m3u8_link

async def parse_ts(second_m3u8_link):
    '''
    #爬取m3u8具体的ts文件：
    #https://vod1.kczybf.com/20220416/ups43Nzi/2000kb/hls/FTo5Mboh.ts;
    ts域名 = 第二个m3u8的请求路径+ts文件路径 = ts真正的url
    '''
    async with aiohttp.ClientSession() as session:
        async with session.get(second_m3u8_link) as response:
            #解析ts文件url：
            text = await response.text()
            ret = re.findall(r"hls/(.*?\.ts)", text)

            # 将所有的ts文件名写入index.m3u8文件中，为合并做准备
            abs_path = os.path.abspath("ts文件/index.m3u8")
            with open(abs_path, "w") as f:
                for ts in ret:
                    f.write(ts + "\n")
            print(ret)
            return ret

async def download_ts(ts, p, retry=5, delay=1):
    for _ in range(retry):
        try:
            async with aiohttp.ClientSession() as session:
                async with session.get(p + ts) as response:
                    with open(os.path.join("ts文件", ts), 'wb') as f:
                        f.write(await response.read())
                    print(f"{ts} 下载完成！")
                    return  # 下载成功，直接返回
        except aiohttp.client_exceptions.ServerDisconnectedError:
            print(f"下载 {ts} 时发生了 ServerDisconnectedError 错误，正在重试...")
            await asyncio.sleep(delay)
    print(f"下载 {ts} 失败！")


async def merge_video(filename):
    abs_index_m3u8 = os.path.abspath("ts文件/index.m3u8")

    # os.system('chcp 65001')
    # 修改 index.m3u8 文件的内容，添加 'file ' 前缀
    with open(abs_index_m3u8, "r") as f:
        lines = f.readlines()
    with open(abs_index_m3u8, "w") as f:
        for line in lines:
            if line.strip():  # 确保不是空行
                f.write(f"file '{os.path.join('ts文件', line.strip())}'\n")

    output_file = f"{filename}.mp4"

    # 构建 FFmpeg 命令行，并使用本地安装的 FFmpeg 进行视频合并
    ffmpeg_path = 'D:\\ffmpeg-4.4.1-essentials_build\\bin'
    ffmpeg_executable = 'ffmpeg'  # 实际的可执行文件名称
    ffmpeg_cmd = f'"{ffmpeg_path}\\{ffmpeg_executable}" -f concat -safe 0 -i {abs_index_m3u8} -c copy {output_file}'
    process = await asyncio.create_subprocess_shell(ffmpeg_cmd, stdout=asyncio.subprocess.PIPE, stderr=asyncio.subprocess.PIPE)

    # 等待进程结束
    stdout, stderr = await process.communicate()

    # 检查进程是否成功结束
    if process.returncode == 0:
        print(f"视频合集完成，输出文件：{output_file}")
    else:
        print(f"FFmpeg错误: {stderr.decode()}")

#主程序：
async def main():
    if not os.path.exists("ts文件"):
        os.mkdir("ts文件")

    #(1)爬取播放页面，获取第一个m3u8链接：
    first_m3u8_link,name = await get_first_m3u8_link()

    #(2)获取第二个m3u8链接：
    second_m3u8_link = await get_second_m3u8_link(first_m3u8_link)

    #(3)解析ts文件：
    ts_list = await parse_ts(second_m3u8_link)

    #(4) 下载ts：
    p = os.path.dirname(second_m3u8_link)
    #创建异步tasks任务：
    tasks = [asyncio.create_task(download_ts(ts,p)) for ts in ts_list]
    await asyncio.wait(tasks) #收集所有的tasks任务

    # (5)检查ts文件是否全部下载完成：
    downloaded_files = os.listdir("ts文件")
    expected_files = [os.path.basename(ts) for ts in ts_list]
    if set(expected_files) - set(downloaded_files):
        print("部分ts文件未能成功下载，无法进行视频合集！")
        return

    #(6)视频合集：
    await merge_video("my_video")

if __name__ == '__main__':
    start = time.time()
    asyncio.run(main())
    print(f"耗时{time.time() - start}秒")

但是，一直没能合并成功，还没搞明白哪里出了问题

等小趴菜空了再继续研究之后，再更新代码，并记录上坑点，也欢迎大佬一起交流~

你可能感兴趣的:(python爬虫,python)

理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
Python中深拷贝与浅拷贝的区别 yuxiaoyu.
转自：http://blog.csdn.net/u014745194/article/details/70271868定义：在Python中对象的赋值其实就是对象的引用。当创建一个对象，把它赋值给另一个变量的时候，python并没有拷贝这个对象，只是拷贝了这个对象的引用而已。浅拷贝：拷贝了最外围的对象本身，内部的元素都只是拷贝了一个引用而已。也就是，把对象复制一遍，但是该对象中引用的其他对象我不复
Python开发常用的三方模块如下：换个网名有点难 python 开发语言
Python是一门功能强大的编程语言，拥有丰富的第三方库，这些库为开发者提供了极大的便利。以下是100个常用的Python库，涵盖了多个领域：1、NumPy，用于科学计算的基础库。2、Pandas，提供数据结构和数据分析工具。3、Matplotlib，一个绘图库。4、Scikit-learn，机器学习库。5、SciPy，用于数学、科学和工程的库。6、TensorFlow，由Google开发的开源机
Python编译器鹿鹿~ Python编译器 Python python 开发语言后端
嘿嘿嘿我又来了啊有些小盆友可能不知道Python其实是有编译器的，也就是PyCharm。你们可能会问到这个是干嘛的又不可以吃也不可以穿好像没有什么用，其实你还说对了这个还真的不可以吃也不可以穿，但是它用来干嘛的呢。用来编译你所打出的代码进行运行（可能这里说的有点不对但是只是个人认为）现在我们来说说PyCharm是用来干嘛的。PyCharm是一种PythonIDE，带有一整套可以帮助用户在使用Pyt
一文掌握python面向对象魔术方法（二）程序员neil python python 开发语言
接上篇：一文掌握python面向对象魔术方法（一）-CSDN博客目录六、迭代和序列化：1、__iter__(self):定义迭代器，使得类可以被for循环迭代。2、__getitem__(self,key):定义索引操作，如obj[key]。3、__setitem__(self,key,value):定义赋值操作，如obj[key]=value。4、__delitem__(self,key):定义
一文掌握python常用的list（列表）操作程序员neil python python 开发语言
目录一、创建列表1.直接创建列表：2.使用list()构造器3.使用列表推导式4.创建空列表二、访问列表元素1.列表支持通过索引访问元素，索引从0开始：2.还可以使用切片操作访问列表的一部分：三、修改列表元素四、添加元素1.append()：在末尾添加元素2.insert()：在指定位置插入元素五、删除元素1.del：删除指定位置的元素2.remove()：删除指定值的第一个匹配项3.pop()：
Python实现简单的机器学习算法 master_chenchengg python python 办公效率 python开发 IT
Python实现简单的机器学习算法开篇：初探机器学习的奇妙之旅搭建环境：一切从安装开始必备工具箱第一步：安装Anaconda和JupyterNotebook小贴士：如何配置Python环境变量算法初体验：从零开始的Python机器学习线性回归：让数据说话数据准备：从哪里找数据编码实战：Python实现线性回归模型评估：如何判断模型好坏逻辑回归：从分类开始理论入门：什么是逻辑回归代码实现：使用skl
python中的深拷贝与浅拷贝 anshejd70787 python
深拷贝和浅拷贝浅拷贝的时候，修改原来的对象，浅拷贝的对象不会发生改变。1、对象的赋值对象的赋值实际上是对象之间的引用：当创建一个对象，然后将这个对象赋值给另外一个变量的时候，python并没有拷贝这个对象，而只是拷贝了这个对象的引用。当对对象做赋值或者是参数传递或者作为返回值的时候，总是传递原始对象的引用，而不是一个副本。如下所示：>>>aList=["kel","abc",123]>>>bLis
用Python实现简单的猜数字游戏程序媛了了 python 游戏 java
猜数字游戏代码：importrandomdefpythonit():a=random.randint(1,100)n=int(input("输入你猜想的数字："))whilen!=a:ifn>a:print("很遗憾，猜大了")n=int(input("请再次输入你猜想的数字："))elifna::如果玩家猜的数字n大于随机数字a，则输出"很遗憾，猜大了"，并提示玩家再次输入。elifn
用Python实现读取统计单词个数程序媛了了 python 游戏 java
完整实例代码：fromcollectionsimportCounterdefpythonit():danci={}withopen("pythonit.txt","r",encoding="utf-8")asf:foriinf:words=i.strip().split()forwordinwords:ifwordnotindanci:danci[word]=1else:danci[word]+=
java类加载顺序 3213213333332132 java
package com.demo; /** * @Description 类加载顺序 * @author FuJianyong * 2015-2-6上午11:21:37 */ public class ClassLoaderSequence { String s1 = "成员属性"; static String s2 = "
Hibernate与mybitas的比较 BlueSkator sql Hibernate 框架 ibatis orm
第一章 Hibernate与MyBatis Hibernate 是当前最流行的O/R mapping框架，它出身于sf.net，现在已经成为Jboss的一部分。 Mybatis 是另外一种优秀的O/R mapping框架。目前属于apache的一个子项目。 MyBatis 参考资料官网：http:
php多维数组排序以及实际工作中的应用 dcj3sjt126com PHP usort uasort
自定义排序函数返回false或负数意味着第一个参数应该排在第二个参数的前面, 正数或true反之, 0相等usort不保存键名uasort 键名会保存下来uksort 排序是对键名进行的 <!doctype html> <html lang="en"> <head> <meta charset="utf-8&q
DOM改变字体大小周华华前端
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
c3p0的配置 g21121 c3p0
c3p0是一个开源的JDBC连接池，它实现了数据源和JNDI绑定，支持JDBC3规范和JDBC2的标准扩展。c3p0的下载地址是：http://sourceforge.net/projects/c3p0/这里可以下载到c3p0最新版本。以在spring中配置dataSource为例：  <bean name="prope
Java获取工程路径的几种方法 510888780 java
第一种： File f = new File(this.getClass().getResource("/").getPath()); System.out.println(f); 结果: C:\Documents%20and%20Settings\Administrator\workspace\projectName\bin 获取当前类的所在工程路径; 如果不加“
在类Unix系统下实现SSH免密码登录服务器 Harry642 免密 ssh
1.客户机 (1)执行ssh-keygen -t rsa -C "[email protected]"生成公钥，xxx为自定义大email地址 (2)执行scp ~/.ssh/id_rsa.pub root@xxxxxxxxx:/tmp将公钥拷贝到服务器上，xxx为服务器地址 (3)执行cat
Java新手入门的30个基本概念一 aijuans java java 入门新手
在我们学习Java的过程中,掌握其中的基本概念对我们的学习无论是J2SE,J2EE,J2ME都是很重要的,J2SE是Java的基础,所以有必要对其中的基本概念做以归纳,以便大家在以后的学习过程中更好的理解java的精髓,在此我总结了30条基本的概念。　　Java概述:　　目前Java主要应用于中间件的开发(middleware)---处理客户机于服务器之间的通信技术,早期的实践证明,Java不适合
Memcached for windows 简单介绍 antlove java Web windows cache memcached
1. 安装memcached server a. 下载memcached-1.2.6-win32-bin.zip b. 解压缩，dos 窗口切换到 memcached.exe所在目录，运行memcached.exe -d install c.启动memcached Server,直接在dos窗口键入 net start "memcached Server&quo
数据库对象的视图和索引百合不是茶索引 oeacle数据库视图
视图视图是从一个表或视图导出的表，也可以是从多个表或视图导出的表。视图是一个虚表，数据库不对视图所对应的数据进行实际存储，只存储视图的定义，对视图的数据进行操作时,只能将字段定义为视图,不能将具体的数据定义为视图为什么oracle需要视图; &
Mockito(一) --入门篇 bijian1013 持续集成 mockito 单元测试
Mockito是一个针对Java的mocking框架，它与EasyMock和jMock很相似，但是通过在执行后校验什么已经被调用，它消除了对期望行为（expectations）的需要。其它的mocking库需要你在执行前记录期望行为（expectations），而这导致了丑陋的初始化代码。 &nb
精通Oracle10编程SQL(5)SQL函数 bijian1013 oracle 数据库 plsql
/* * SQL函数 */ --数字函数 --ABS(n):返回数字n的绝对值 declare v_abs number(6,2); begin v_abs:=abs(&no); dbms_output.put_line('绝对值：'||v_abs); end; --ACOS(n):返回数字n的反余弦值，输入值的范围是-1~1，输出值的单位为弧度
【Log4j一】Log4j总体介绍 bit1129 log4j
Log4j组件：Logger、Appender、Layout Log4j核心包含三个组件：logger、appender和layout。这三个组件协作提供日志功能：日志的输出目标日志的输出格式日志的输出级别(是否抑制日志的输出) logger继承特性 A logger is said to be an ancestor of anothe
Java IO笔记白糖_ java
public static void main(String[] args) throws IOException { //输入流 InputStream in = Test.class.getResourceAsStream("/test"); InputStreamReader isr = new InputStreamReader(in); Bu
Docker 监控 ronin47 docker监控
目前项目内部署了docker，于是涉及到关于监控的事情，参考一些经典实例以及一些自己的想法，总结一下思路。 1、关于监控的内容监控宿主机本身监控宿主机本身还是比较简单的，同其他服务器监控类似，对cpu、network、io、disk等做通用的检查，这里不再细说。额外的，因为是docker的
java-顺时针打印图形 bylijinnan java
一个画图程序要求打印出： 1.int i=5; 2.1 2 3 4 5 3.16 17 18 19 6 4.15 24 25 20 7 5.14 23 22 21 8 6.13 12 11 10 9 7. 8.int i=6 9.1 2 3 4 5 6 10.20 21 22 23 24 7 11.19
关于iReport汉化版强制使用英文的配置方法 Kai_Ge iReport汉化英文版
对于那些具有强迫症的工程师来说，软件汉化固然好用，但是汉化不完整却极为头疼，本方法针对iReport汉化不完整的情况，强制使用英文版，方法如下：在 iReport 安装路径下的 etc/ireport.conf 里增加红色部分启动参数，即可变为英文版。 # ${HOME} will be replaced by user home directory accordin
[并行计算]论宇宙的可计算性 comsci 并行计算
现在我们知道,一个涡旋系统具有并行计算能力.按照自然运动理论,这个系统也同时具有存储能力,同时具备计算和存储能力的系统,在某种条件下一般都会产生意识...... 那么,这种概念让我们推论出一个结论 &nb
用OpenGL实现无限循环的coverflow dai_lm android coverflow
网上找了很久，都是用Gallery实现的，效果不是很满意，结果发现这个用OpenGL实现的，稍微修改了一下源码，实现了无限循环功能源码地址： https://github.com/jackfengji/glcoverflow public class CoverFlowOpenGL extends GLSurfaceView implements GLSurfaceV
JAVA数据计算的几个解决方案1 datamachine java Hibernate 计算
老大丢过来的软件跑了10天，摸到点门道，正好跟以前攒的私房有关联，整理存档。 -----------------------------华丽的分割线------------------------------------- 数据计算层是指介于数据存储和应用程序之间，负责计算数据存储层的数据，并将计算结果返回应用程序的层次。J &nbs
简单的用户授权系统,利用给user表添加一个字段标识管理员的方式 dcj3sjt126com yii
怎么创建一个简单的(非 RBAC)用户授权系统通过查看论坛，我发现这是一个常见的问题，所以我决定写这篇文章。本文只包括授权系统.假设你已经知道怎么创建身份验证系统(登录)。数据库首先在 user 表创建一个新的字段(integer 类型),字段名 'accessLevel',它定义了用户的访问权限扩展 CWebUser 类在配置文件(一般为 protecte
未选之路 dcj3sjt126com 诗
作者:罗伯特*费罗斯特黄色的树林里分出两条路, 可惜我不能同时去涉足, 我在那路口久久伫立, 我向着一条路极目望去, 直到它消失在丛林深处. 但我却选了另外一条路, 它荒草萋萋,十分幽寂; 显得更诱人,更美丽, 虽然在这两条小路上, 都很少留下旅人的足迹. 那天清晨落叶满地, 两条路都未见脚印痕迹. 呵,留下一条路等改日再
Java处理15位身份证变18位蕃薯耀 18位身份证变15位 15位身份证变18位身份证转换
15位身份证变18位，18位身份证变15位 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 201
SpringMVC4零配置--应用上下文配置【AppConfig】 hanqunfeng springmvc4
从spring3.0开始，Spring将JavaConfig整合到核心模块，普通的POJO只需要标注@Configuration注解，就可以成为spring配置类，并通过在方法上标注@Bean注解的方式注入bean。 Xml配置和Java类配置对比如下： applicationContext-AppConfig.xml <!-- 激活自动代理功能参看：
Android中webview跟JAVASCRIPT中的交互 jackyrong JavaScript html android 脚本
在android的应用程序中,可以直接调用webview中的javascript代码,而webview中的javascript代码,也可以去调用ANDROID应用程序(也就是JAVA部分的代码).下面举例说明之: 1 JAVASCRIPT脚本调用android程序要在webview中,调用addJavascriptInterface(OBJ,int
8个最佳Web开发资源推荐 lampcy 编程 Web 程序员
Web开发对程序员来说是一项较为复杂的工作，程序员需要快速地满足用户需求。如今很多的在线资源可以给程序员提供帮助，比如指导手册、在线课程和一些参考资料，而且这些资源基本都是免费和适合初学者的。无论你是需要选择一门新的编程语言，或是了解最新的标准，还是需要从其他地方找到一些灵感，我们这里为你整理了一些很好的Web开发资源，帮助你更成功地进行Web开发。这里列出10个最佳Web开发资源，它们都是受
架构师之面试------jdk的hashMap实现 nannan408 HashMap
1.前言。如题。 2.详述。 (1)hashMap算法就是数组链表。数组存放的元素是键值对。jdk通过移位算法（其实也就是简单的加乘算法），如下代码来生成数组下标(生成后indexFor一下就成下标了）。 static int hash(int h) { h ^= (h >>> 20) ^ (h >>>
html禁止清除input文本输入缓存 Rainbow702 html 缓存 input 输入框 change
多数浏览器默认会缓存input的值，只有使用ctl+F5强制刷新的才可以清除缓存记录。如果不想让浏览器缓存input的值，有2种方法：方法一：在不想使用缓存的input中添加 autocomplete="off"; <input type="text" autocomplete="off" n
POJO和JavaBean的区别和联系 tjmljw POJO java beans
POJO 和JavaBean是我们常见的两个关键字，一般容易混淆，POJO全称是Plain Ordinary Java Object / Pure Old Java Object，中文可以翻译成：普通Java类，具有一部分getter/setter方法的那种类就可以称作POJO，但是JavaBean则比 POJO复杂很多， Java Bean 是可复用的组件，对 Java Bean 并没有严格的规
java中单例的五种写法 liuxiaoling java 单例
/** * 单例模式的五种写法： * 1、懒汉 * 2、恶汉 * 3、静态内部类 * 4、枚举 * 5、双重校验锁 */ /** * 五、双重校验锁，在当前的内存模型中无效 */ class LockSingleton { private volatile static LockSingleton singleton; pri