一只爬虫带你看世界【5】#批量下载图片

9.批量下载妹子图

使用模块化的思想进行代码搭建,主函数为 download_mm,其中包含了url_open(url)、 get_page(url)、find_imgs(url)、save_imgs(folder,img_addrs)四个模块,

模块一url_open(url):用于网址访问,多次调用,故抽象出一个模块,该模块返回html,但是不decode编码格式,由于不知返回的文字信息还是图片信息,所以不decode

模块二:get_page(url):返回图片信息的编号,获取编号信息是采用的 html 中 find 方法 进行指定字符的查询,(此出可以使用正则表达式,后续在使用),find 加 数字是指找到检索到word后的偏移量,例如本例中的 23.

模块三:find_imgs(url):根据上一模块得到的图片编号,组合成待下载的网址信息,将该网址信息中所有的.JGP的图片放入列表中

模块四:save_imgs(folder,img_addrs):获取存有图片的列表,存入指定的文件夹中。


demo 示例如下:

--------------------------------------------------------- 

import urllib.request

import os #当前目录创建文件夹用到的模块


def url_open(url):
    req = urllib.request.Request(url)
    req.add_header('user-agent','Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36')
    response = urllib.request.urlopen(url)
    html = response.read()


    return html
    
def get_page(url):
    html = url_open(url).decode('utf-8')
   
    a = html.find('current-comment-page') + 23
    b = html.find(']', a)
    
    return html[a:b]
  
def find_imgs(url):
    html = url_open(url).decode('utf-8')        
    img_addrs = []


    a = html.find('img src=')
    
    while a != -1:
        b = html.find('.jpg', a, a+255)
        if b != -1:
            c = "http:" + html[a+9:b+4]
            img_addrs.append(c)
        else:
            b = a + 9
            
        a = html.find('img src=', b)
        
    for each in img_addrs:
        print(each)
        
    return img_addrs


    
def save_imgs(folder,img_addrs):
    for each in img_addrs:
        filename = each.split('/')[-1]
        with open(filename,'wb') as f:
            img = url_open(each)
            f.write(img)


def download_mm(folder='OOXX',pages=2):
    os.mkdir(folder)
    os.chdir(folder)


    url = 'https://jandan.net/ooxx/'
    page_num = int(get_page(url))


    for i in range(pages):
        page_num -= i
        page_url = url + 'page-' + str(page_num)+ '#comments'
        img_addrs = find_imgs(page_url)
        save_imgs(folder,img_addrs)


if __name__ == '__main__':

    download_mm()

--------------------------------------------------------- 

if __name__ == '__main__': 该模块是模块测试使用,当模块被调用时,之后的代码不执行,当不模块调用即直接使用时,之后的代码会执行。


在python IDLE 中运行的效果图如下:

一只爬虫带你看世界【5】#批量下载图片_第1张图片


你可能感兴趣的:(crawler)