在使用Python对一些网站的数据进行采集时,经常会遇到需要登录的情况。这些情况下,使用FireFox等浏览器登录时,自带的调试器(快捷键F12)就可以看到登录的时候网页向服务器提交的信息,把这部分信息提取出来就可以利用Python 的 urllib2 库结合Cookie进行模拟登录然后采集数据,如以下代码:
#coding=utf-8 import urllib import urllib2 import httplib import cookielib url = 'http://www.xxx.net/' cookie = cookielib.CookieJar() cj=urllib2.HTTPCookieProcessor(cookie) #设置登录参数,使用浏览器的调试器等抓包工具得到 postdata=urllib.urlencode({'JSESSIONID':'1F616774D9548C1E8AF12A65B470B663', 'username':'admin','password':'admin'}) #生成请求 request=urllib2.Request(url, postdata) #设置代理 request.set_proxy('xx.xx.xx.xx:xx','http') #登录 opener=urllib2.build_opener(cj) urllib2.install_opener(opener) html=opener.open(request) print html.read() #打开数据页面开始采集数据 s = urllib2.urlopen('http://www.xx.net').read()
可以留意到,提交的数据包含了一个JSESSIONID参数,百度一下就知道,通常Tomcat服务器生成一个新的会话的时候就会产生这个ID,并且包含在登录页面的HEAD里面,如下图:
某些服务器使用固定一个JSESSIONID就可以重复登录,但某些就不行,应该是服务器可以设置的。对于固定JSESSIONID可以登录的,上面的代码就可以应付了,但动态改变的就需要先获取本次会话的JSESSIONID,然后再提交登录:
#获取Tomcat服务器产生的JSESSIONID request = urllib2.Request(url) set_cookie = urllib2.urlopen(request).info()['Set-Cookie'] json_id = set_cookie.split(';')[0]#JSESSIONID=3037DCDF69A6454FC525E38C41E6B611 json_id = json_id.split('=')[-1] print json_id