9.批量下载妹子图
使用模块化的思想进行代码搭建,主函数为 download_mm,其中包含了url_open(url)、 get_page(url)、find_imgs(url)、save_imgs(folder,img_addrs)四个模块,
模块一:url_open(url):用于网址访问,多次调用,故抽象出一个模块,该模块返回html,但是不decode编码格式,由于不知返回的文字信息还是图片信息,所以不decode
模块二:get_page(url):返回图片信息的编号,获取编号信息是采用的 html 中 find 方法 进行指定字符的查询,(此出可以使用正则表达式,后续在使用),find 加 数字是指找到检索到word后的偏移量,例如本例中的 23.
模块三:find_imgs(url):根据上一模块得到的图片编号,组合成待下载的网址信息,将该网址信息中所有的.JGP的图片放入列表中
模块四:save_imgs(folder,img_addrs):获取存有图片的列表,存入指定的文件夹中。
demo 示例如下:
---------------------------------------------------------
import urllib.request
import os #当前目录创建文件夹用到的模块
def url_open(url):
req = urllib.request.Request(url)
req.add_header('user-agent','Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36')
response = urllib.request.urlopen(url)
html = response.read()
return html
def get_page(url):
html = url_open(url).decode('utf-8')
a = html.find('current-comment-page') + 23
b = html.find(']', a)
return html[a:b]
def find_imgs(url):
html = url_open(url).decode('utf-8')
img_addrs = []
a = html.find('img src=')
while a != -1:
b = html.find('.jpg', a, a+255)
if b != -1:
c = "http:" + html[a+9:b+4]
img_addrs.append(c)
else:
b = a + 9
a = html.find('img src=', b)
for each in img_addrs:
print(each)
return img_addrs
def save_imgs(folder,img_addrs):
for each in img_addrs:
filename = each.split('/')[-1]
with open(filename,'wb') as f:
img = url_open(each)
f.write(img)
def download_mm(folder='OOXX',pages=2):
os.mkdir(folder)
os.chdir(folder)
url = 'https://jandan.net/ooxx/'
page_num = int(get_page(url))
for i in range(pages):
page_num -= i
page_url = url + 'page-' + str(page_num)+ '#comments'
img_addrs = find_imgs(page_url)
save_imgs(folder,img_addrs)
if __name__ == '__main__':
download_mm()
---------------------------------------------------------
if __name__ == '__main__': 该模块是模块测试使用,当模块被调用时,之后的代码不执行,当不模块调用即直接使用时,之后的代码会执行。
在python IDLE 中运行的效果图如下: