requests模块

requests模块

  1. 使用步骤:
    a) 导包:import requests
    b) 确定基础url:base_url=‘url地址’
    c) 发送请求,获取响应:response = requests.get/post(base_url)
    4) 处理响应内容

  2. requests.get()——get请求方法参数详解:
    a) requests.get(url,header,params,timeout)
        url=请求url,
        headers =请求头字典,
        params = 请求参数字典。
        timeout = 超时时长,
    b) response对象的属性:
        服务器响应包含:状态行(协议,状态码)、响应头,空行,响应正文
          1、 响应正文
            字符串格式:response.text
            bytes类型:response.content
          2、 状态码:response.status_code
          3、 响应头:response.headers(字典)
            response。headers[‘cookie’]
          4、 响应正文的编码:response.encoding
            response.text获取到的字符串类型的响应正文,其实是通过下面的步骤获取的:
              response.text = response.content.decode(‘response.encoding’)
          5、 乱码问题的解决办法:
            a) 产生的原因:编码和解码的格式不一致造成的。
              str.encode(‘编码’)——将字符串按指定编码解码成bytes类型。
              bytes.decode(‘编码’)——将bytes类型按指定编码编码成字符串。
            b) response.content.decode(‘页面正确的编码格式’)
            c) 找到正确的编码,设置到response.encoding中。
    c) get请求项目总结:
        1、 没有请求参数的情况下,只需要确定url和headers字典。
        2、 get请求石油请求参数的。
              在Chrome浏览器中,请求参数页码字段的变化,找到变化规律,用for循环就业以做到分页。

  3. post请求:
    a) requests.get(url,header,params,timeout)
        url=请求url,
        headers =请求头字典,
        params = 请求参数字典。
        timeout = 超时时长
        )——response对象
        post请求一般返回的是json数据。
    b) 解析json数据的方法:
        1、 response.json()——json字符串所对应的python的list或者dict。
        2、 json.dumps(josn_data)——json_str
        3、 post请求能否成功,关键看请求参数。
        4、 如何查找是哪个请求参数在影响数据获取?—>通过对比,找到变化的参数。
        5、 变化参数如何找到参数的生成方式,就是解决这个ajax请求数据获取的途径。
        6、 寻找的办法有以下几种:
            (1)写死在页面。
            (2)写在js中。
            (3)请求参数是在之前的一条ajax请求的数据里面提前获取好的。

  4. 代理使用方法:
    a) 代理基本原理:
        代理形象的说,就是网络信息中转站。实际上就是在本机和服务器之间架了一座桥。
    b) 代理的作用:
        1、 突破自身ip访问限制,可以访问一些平时访问不到的网站。
        2、 访问一些单位或者团体的资源。
        3、 提高访问速度。代理的服务器主要作用就是中转,所以一般代理服务器里面都是用内存来进行数据存储的。
        4、 隐藏ip。
    c) 代理的分类:
        1、 按照协议进行划分:
            FTP代理服务器——端口21,2121
            HTTP代理服务器——80,8080
            SSL/TLS代理:主要用于访问加密网站。端口:443
            telnet代理:主要用telnet远程控制,端口一般为23
        2、 按照匿名程度:
            高度匿名代理:数据包会原封不动转化,在服务段看来,就好像一个普通用户在访问,做到完全隐藏ip。
            普通匿名代理:数据包会做一些改动,服务器有可能找到原ip。
            透明代理:不但改动数据,还会告诉服务,是谁访问的。
            间谍代理:指组织或者个人用于记录用户传输数据,然后进行研究,监控等目的的代理。
    d) 在requests模块中如何设置代理?
    >    proxies = {
        ‘代理服务器的类型’:‘代理ip’
        }
        response = requests.get(proxies = proxies)
        代理服务器的类型:http,https,ftp
        代理ip:http://ip:port

你可能感兴趣的:(requests模块)