qq_25774971

简单梳理下python的一些常用代码

判断文件或者文件夹是否存在

    if(os.path.exists(rootdir) == False) 
  

创建文件夹

    os.mkdir(rootdir) 
  

调用系统命令

    os.system(cmd) 
  

字典循环

    for key,value in dict.items() 
  

打开文件并读取内容进行处理

     fd = open('xxxx.txt', encoding='utf-8') 
   
     for line in fd: 
   
          print line 
   
     fd.close()

创建文件并写入内容

     fd = open('xxxx.txt', 'a+', encoding='utf-8') 
   
     fd.write('aaaaa' + '\n') 
   
     fd.close()

使用xlrd读取EXCEL

     导入 
   
     import xlrd 
   
     打开excel 
   
     data = xlrd.open_workbook('demo.xls') #注意这里的workbook首字母是小写 
   
     查看文件中包含sheet的名称 
   
     data.sheet_names() 
   
     得到第一个工作表，或者通过索引顺序 或 工作表名称 
   
     table = data.sheets()[0] 
   
     table = data.sheet_by_index(0) 
   
     table = data.sheet_by_name(u'Sheet1') 
   
     获取行数和列数 
   
     nrows = table.nrows 
   
     ncols = table.ncols 
   
     获取整行和整列的值（数组） 
   
     table.row_values(i) 
   
     table.col_values(i) 
   
     循环行,得到索引的列表 
   
     for rownum in range(table.nrows): 
   
     print table.row_values(rownum) 
   
     单元格 
   
     cell_A1 = table.cell(0,0).value 
   
     cell_C4 = table.cell(2,3).value 
   
     分别使用行列索引 
   
     cell_A1 = table.row(0)[0].value 
   
     cell_A2 = table.col(1)[0].value 
   
     简单的写入 
   
     row = 0 
   
     col = 0 
   
     ctype = 1 # 类型 0 empty,1 string, 2 number, 3 date, 4 boolean, 5 error 
   
     value = 'lixiaoluo' 
   
     xf = 0 # 扩展的格式化 (默认是0) 
   
     table.put_cell(row, col, ctype, value, xf) 
   
     table.cell(0,0) # 文本:u'lixiaoluo' 
   
     table.cell(0,0).value # 'lixiaoluo'

使用xlwt写入EXCEL

     导入xlwt 
   
     import xlwt 
   
     新建一个excel文件 
   
     file = xlwt.Workbook() #注意这里的Workbook首字母是大写，无语吧 
   
     新建一个sheet 
   
     table = file.add_sheet('sheet name') 
   
     写入数据table.write(行,列,value) 
   
     table.write(0,0,'test') 
   
     如果对一个单元格重复操作，会引发 
   
     returns error: 
   
     # Exception: Attempt to overwrite cell: 
   
     # sheetname=u'sheet 1' rowx=0 colx=0 
   
     所以在打开时加cell_overwrite_ok=True解决 
   
     table = file.add_sheet('sheet name',cell_overwrite_ok=True) 
   
     保存文件 
   
     file.save('demo.xls') 
   
     另外，使用style 
   
     style = xlwt.XFStyle() #初始化样式 
   
     font = xlwt.Font() #为样式创建字体 
   
     font.name = 'Times New Roman' 
   
     font.bold = True 
   
     style.font = font #为样式设置字体 
   
     table.write(0, 0, 'some bold Times text', style) # 使用样式

命令行getopt

     try: 
   
          options,args = getopt.getopt(sys.argv[1:],"hp:i:",["help","ip=","port="]) 
   
     except getopt.GetoptError: 
   
          sys.exit() 
   
     for name,value in options: 
   
          if name in ("-h","--help"): 
   
               usage() 
   
          if name in ("-i","--ip"): 
   
               print(value) 
   
          if name in ("-p","--port"): 
   
               print(value)

简单爬虫

     import requests 
   
     AGENT = 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_3) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36' 
   
     HEADERS = { 
   
             'User-Agent': AGENT, 
   
             'Content-Type':'application/x-www-form-urlencoded; charset=UTF-8', 
   
             'X-Requested-With':'XMLHttpRequest', 
   
             'Accept':'*/*' 
   
     session = requests.session() 
   
     #模拟登录 
   
     postdata = { 
   
         'defaults':'xxx', 
   
         'fromLogin':'xxx', 
   
         'userName':'xxx', 
   
         'password':'xxxx' 
   
     } 
   
     url = 'xxxxxxxx' 
   
     login_info = session.post(url, headers = HEADERS, data = postdata,verify = False) 
   
     if(login_info.status_code == requests.codes.ok): 
   
         print('login success') 
   
         return True 
   
     else: 
   
         print('login err') 
   
         return False 
   
     } 
   
     #下载html页面 
   
     def downloadUrl(rootdir, url, orgid, page): 
   
         html = session.get(url, headers=global_config.HEADERS, verify=False) 
   
         if(html.text[1:7] == 'script'): 
   
             print(html.text) 
   
             return "err" 
   
         if(len(html.text) < 60): 
   
             return "err" 
   
         sample = open(rootdir + "/" + str(orgid) + '_' + str(page) + ".html", "w", encoding='utf-8') 
   
         sample.write(html.text) 
   
         sample.close() 
   
         return 'ok'

解析JOSN文件内容

     def scrapy_by_file(json_file_name): 
   
         #读取JSON文件的内容 
   
         text = open(json_file_name, encoding='utf-8').read() 
   
         #特殊处理,去除从WINDOWS系统带过来的BOM特殊字符 
   
         if text.startswith(u'\ufeff'): 
   
             text = text.encode('utf8')[3:].decode('utf8') 
   
         #将文本内容的JSON数据转换成自定义的JSON对象 
   
         try: 
   
             json_data = json.loads(text) 
   
         except: 
   
             print(json_file_name) 
   
             return 
   
         for row in json_data['rows']: 
   
     def scrapy_by_row(row): 
   
         try: 
   
             orgid = row['organization']['id'] 
   
             familyid = row['censusRegisterFamily']['id'] 
   
         except: 
   
             print('errrr') 
   
             return 
   
             scrapy_by_row(row)

遍历文件夹

     #遍历目录(rootdir) 遍历到的每个文件都执行dirFunc 
   
     def waklThroughDir(rootdir, dirFunc): 
   
         for parent, dirnames, filenames in os.walk(rootdir): 
   
             for filename in filenames: 
   
                 print(filename) 
   
                 #获取后缀为txt的文件 
   
                 if(filename.split('.')[-1] == 'html'): 
   
                     dirFunc(os.path.join(parent, filename))

采集温州房产网基本信息

     # -*- coding: utf-8 -*- 
   
     import re 
   
     import requests 
   
     import time 
   
     #-----------------------------用于解析的正则表达式常量------------------------------------------------------------------ 
   
     #解析页数 
   
     PAGE_NUM = '共找到 (.*?) 符合条件的记录' 
   
     #解析小区名称 
   
     NAME = 'texttext_title">
'

#解析小区价格

PRICE = 'class="hot_price">(.*?)'

#解析小区地址

ADDRESS = 'text_moreinfo">(.*?)

#文件生成路径

ROOTDIR = 'F:\\test\\'

#-----------------------------模拟请求的头部信息，否则将被识别出是程序抓包而被拦截--------------------------------------

HEADERS = {

'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8',

'Accept-Encoding': 'gzip, deflate, sdch',

'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.106 Safari/537.36',

'Host': 'www.0577home.net',

'Upgrade-Insecure-Requests': '1'

}

#-----------------------------抓取某一页的房产信息，pageNo为页号--------------------------------------------------------

def getHouseListByPageno(pageNo):

#建立一个连接用于后续发起请求

session = requests.session()

url = 'http://www.0577home.net/xiaoqu/list_0_0_0_0_0_0_0_' + str(pageNo) + '.html'

houseList = session.get(url, headers = HEADERS, verify = False)

#以写入模式打开文件

fh = open(ROOTDIR + "houseList_pageNo" + str(pageNo) + ".txt", 'w' ,encoding='utf-8')

#将movieList写入文件

fh.write(houseList.text)

#关闭文件

fh.close()

#-------------------------------获取需要抓取的页面总数------------------------------------------------------------------

def getPageNum():

#打开已经下载好的第一页房产内容

f = open(ROOTDIR + 'houseList_pageNo1.txt', encoding='utf-8')

#获取文件内容

rawContent = f.read()

#用正则表达式解析页面内容

pageNum = re.findall(PAGE_NUM, rawContent)

#返回页面号

return int(pageNum[0]) / 20 + 1

def parseHouseListToFile(srcFile, dstFile):

#打开待解析的文件

f = open(srcFile, encoding='utf-8')

#读取文件内容以备解析

rawContent = f.read()

p = re.compile('\s+')

content = re.sub(p, '', rawContent)

dnames = re.findall(NAME, content)

names = []

for dname in dnames:

idx = dname.rfind('>')

names.append(dname[idx + 1:])

prices = re.findall(PRICE, content)

daddress = re.findall(ADDRESS, content)

address = []

for daddr in daddress:

id = daddr.rfind('>')

address.append(daddr[id + 1:])

i = 0

for x in names:

#写入时用'$'做分割，结尾加上回车符

dstFile.write(names[i] + '$' + prices[i] + '$' + address[i] + '\n')

i = i + 1

#-------------------------------主函数，下载并解析房产信息--------------------------------------------------------------

if __name__ == '__main__':

#---------------------抓取页面-----------------------------

#抓取第一页房产信息

getHouseListByPageno(1)

#通过第一页房产信息获取总共要抓取的页面数量

pageNum = getPageNum()

#抓取剩余的页面

for i in range(2, int(pageNum) + 1):

getHouseListByPageno(str(i))

#---------------------解析页面-----------------------------

#获取当前年月日

localtime = time.strftime('%Y%m%d', time.localtime(time.time()))

#创建一个文件，文件名前面带上年月日

f = open(ROOTDIR + localtime + '_houseList.txt', 'a+', encoding='utf-8')

#解析所有的页面

#for k in range(1, int(pageNum) + 1):

for k in range(1, 115):

parseHouseListToFile(ROOTDIR + "houseList_pageNo" + str(k) + ".txt", f)

#关闭文件

f.close()

采集温州房产网详细信息

     # -*- coding: utf-8 -*- 
   
     import re 
   
     import requests 
   
     import time 
   
     import os 
   
     #-----------------------------用于解析的正则表达式常量------------------------------------------------------------------ 
   
     #解析页数 
   
     PAGE_NUM = '共找到 (.*?) 符合条件的记录' 
   
     #解析小区名称 
   
     NAME = 'texttext_title">
'

#解析小区价格

PRICE = 'class="hot_price">(.*?)'

#解析小区地址

ADDRESS = 'text_moreinfo">(.*?)

#解析小区编号

ID = 'class="picdiv_left">

#解析小区所属区域

LOCATION = '

所属区域：(.*?)

#解析小区占地面积

AREA = '

占地面积：(.*?)

#解析小区绿化率

GREENINGRATE = '

绿化率：(.*?)

#解析小区楼总数

LAYER = '

楼总数：(.*?)

#解析小区物业类型

TYPE = '

物业类型：(.*?)

#解析小区所属小学

PRIMARYSCHOOL = '

所属小学：(.*?)

#解析小区总建筑面积

BUILDINGAREA = '

总建筑面积：(.*?)

#解析小区容积率

PLOTRATIO = '

容积率：(.*?)

#解析小区开发商

DEVEPLOPER = '

开发商：(.*?)

#文件生成路径

ROOTDIR = 'F:\\test\\'

#-----------------------------模拟请求的头部信息，否则将被识别出是程序抓包而被拦截--------------------------------------

HEADERS = {

'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8',

'Accept-Encoding': 'gzip, deflate, sdch',

'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/51.0.2704.106 Safari/537.36',

'Host': 'www.0577home.net',

'Upgrade-Insecure-Requests': '1'

}

#-----------------------------抓取某一页的房产信息，pageNo为页号--------------------------------------------------------

def getHouseListByPageno(pageNo):

#建立一个连接用于后续发起请求

session = requests.session()

url = 'http://www.0577home.net/xiaoqu/list_0_0_0_0_0_0_0_' + str(pageNo) + '.html'

houseList = session.get(url, headers = HEADERS, verify = False)

#以写入模式打开文件

fh = open(ROOTDIR + "houseList_pageNo" + str(pageNo) + ".txt", 'w' ,encoding='utf-8')

#将movieList写入文件

fh.write(houseList.text)

#关闭文件

fh.close()

def getHouseInfoByPageno(pageNo, k):

if(os.path.exists(ROOTDIR + "houseInfo_pageNo" + str(pageNo) + ".html")):

return

print('downloading !, count %s, page %s' % (str(k), str(pageNo)))

#建立一个连接用于后续发起请求

session = requests.session()

url = 'http://www.0577home.net/xiaoqu/detail_' + str(pageNo) + '.html'

houseList = session.get(url, headers = HEADERS, verify = False)

#以写入模式打开文件

fh = open(ROOTDIR + "houseInfo_pageNo" + str(pageNo) + ".html", 'w' ,encoding='utf-8')

#将movieList写入文件

fh.write(houseList.text)

#关闭文件

fh.close()

#-------------------------------获取需要抓取的页面总数------------------------------------------------------------------

def getPageNum():

#打开已经下载好的第一页房产内容

f = open(ROOTDIR + 'houseList_pageNo1.txt', encoding='utf-8')

#获取文件内容

rawContent = f.read()

#用正则表达式解析页面内容

pageNum = re.findall(PAGE_NUM, rawContent)

#返回页面号

return int(pageNum[0]) / 20 + 1

def parseHouseInfo(srcFile):

#打开待解析的文件

f = open(srcFile, encoding='utf-8')

#读取文件内容以备解析

content = f.read()

# p = re.compile('\s+')

# content = re.sub(p, '', rawContent)

location = re.findall(LOCATION, content)[0]

location = location.split(' ')

category1 = location[0]

category2 = location[1]

area = re.findall(AREA, content)[0]

greeningrate = re.findall(GREENINGRATE, content)[0]

layer = re.findall(LAYER, content)[0]

type = re.findall(TYPE, content)[0]

primaryschool = re.findall(PRIMARYSCHOOL, content)[0]

buildingarea = re.findall(BUILDINGAREA, content)[0]

plotratio = re.findall(PLOTRATIO, content)[0]

developer = re.findall(DEVEPLOPER, content)[0]

f.close()

return (category1, category2, area, greeningrate, layer, type, primaryschool, buildingarea, plotratio, developer)

def parseHouseListToFile(srcFile, dstFile):

#打开待解析的文件

f = open(srcFile, encoding='utf-8')

#读取文件内容以备解析

rawContent = f.read()

p = re.compile('\s+')

content = re.sub(p, '', rawContent)

dnames = re.findall(NAME, content)

names = []

for dname in dnames:

idx = dname.rfind('>')

names.append(dname[idx + 1:])

prices = re.findall(PRICE, content)

daddress = re.findall(ADDRESS, content)

ids = re.findall(ID, content)

address = []

for daddr in daddress:

id = daddr.rfind('>')

address.append(daddr[id + 1:])

i = 0

f.close()

for x in names:

#写入时用'$'做分割，结尾加上回车符

dstFile.write(names[i] + '$' + prices[i] + '$' + address[i] + '$' + ids[i] + '\n')

i = i + 1

#-------------------------------主函数，下载并解析房产信息--------------------------------------------------------------

if __name__ == '__main__':

#---------------------抓取页面-----------------------------

#抓取第一页房产信息

# getHouseListByPageno(1)

# #通过第一页房产信息获取总共要抓取的页面数量

# pageNum = getPageNum()

# #抓取剩余的页面

# for i in range(2, int(pageNum) + 1):

# getHouseListByPageno(str(i))

#---------------------解析页面-----------------------------

#获取当前年月日

localtime = time.strftime('%Y%m%d', time.localtime(time.time()))

#创建一个文件，文件名前面带上年月日

f = open(ROOTDIR + localtime + '_houseList.txt', 'a+', encoding='utf-8')

#解析所有的页面

#for k in range(1, int(pageNum) + 1):

for k in range(1, 115):

parseHouseListToFile(ROOTDIR + "houseList_pageNo" + str(k) + ".txt", f)

#关闭文件

f.close()

f = open(ROOTDIR + localtime + '_houseList.txt', encoding='utf-8')

fd = open(ROOTDIR + localtime + '_houseInfo.txt', 'w', encoding='utf-8')

k = 0

for line in f:

data = line.strip('\n')

data = data.split('$')

idx = data[3]

getHouseInfoByPageno(idx, k)

houseInfo = parseHouseInfo(ROOTDIR + "houseInfo_pageNo" + str(idx) + ".html")

print(str(k) + "$".join(data) + '$' + "$".join(houseInfo))

fd.write("$".join(data) + '$' + "$".join(houseInfo) + '\n')

k += 1

f.close()

fd.close()

读取csv文件

     with open('job.csv', 'r') as f: 
   
         reader = csv.reader(f) 
   
         for row in reader: 
   
               print(row)

写入csv文件

     #创建CSV文件并写入第一行 
   
     def createCsv(file): 
   
         if not os.path.exists(file): 
   
             csvfile = open(file, 'a+', encoding='utf-8', newline='') 
   
             writer = csv.writer(csvfile) 
   
             writer.writerow(paramname) 
   
         else: 
   
             csvfile = open(file, 'a+', newline='') 
   
             writer = csv.writer(csvfile) 
   
         return writer

python调用JAVA

     import sys 
   
     import jpype 
   
     name = sys.argv[1] 
   
     jarpath = '/home/dsadm/why/python' 
   
     jpype.startJVM(jpype.getDefaultJVMPath(), "-Djava.ext.dirs=%s" % jarpath) 
   
     DECRYPT = jpype.JClass('why.fmrt.decrypt.DECRYPT') 
   
     upperName =DECRYPT.decrypt(name) 
   
     print(upperName) 
   
     jpype.shutdownJVM()

简单验证码破解

     from urllib.request import urlretrieve 
   
     from urllib.request import urlopen 
   
     from bs4 import BeautifulSoup 
   
     import subprocess 
   
     import requests 
   
     from PIL import Image 
   
     from PIL import ImageOps 
   
     def cleanImage(imagePath): 
   
         image = Image.open(imagePath) 
   
         image = image.point(lambda x: 0 if x<143 else 255) 
   
         borderImage = ImageOps.expand(image,border=20,fill='white') 
   
         borderImage.save(imagePath) 
   
     html = urlopen("http://www.pythonscraping.com/humans-only") 
   
     bsObj = BeautifulSoup(html, "html.parser") 
   
     #Gather prepopulated form values 
   
     imageLocation = bsObj.find("img", {"title": "Image CAPTCHA"})["src"] 
   
     formBuildId = bsObj.find("input", {"name":"form_build_id"})["value"] 
   
     captchaSid = bsObj.find("input", {"name":"captcha_sid"})["value"] 
   
     captchaToken = bsObj.find("input", {"name":"captcha_token"})["value"] 
   
     captchaUrl = "http://pythonscraping.com"+imageLocation 
   
     urlretrieve(captchaUrl, "captcha.jpg") 
   
     cleanImage("captcha.jpg") 
   
     p = subprocess.Popen(["tesseract", "captcha.jpg", "captcha"], stdout= 
   
         subprocess.PIPE,stderr=subprocess.PIPE) 
   
     p.wait() 
   
     f = open("captcha.txt", "r") 
   
     #Clean any whitespace characters 
   
     captchaResponse = f.read().replace(" ", "").replace("\n", "") 
   
     print("Captcha solution attempt: "+captchaResponse) 
   
     if len(captchaResponse) == 5: 
   
         params = {"captcha_token":captchaToken, "captcha_sid":captchaSid, 
   
                   "form_id":"comment_node_page_form", "form_build_id": formBuildId, 
   
                       "captcha_response":captchaResponse, "name":"Ryan Mitchell", 
   
                       "subject": "I come to seek the Grail", 
   
                       "comment_body[und][0][value]": 
   
                                               "...and I am definitely not a bot"} 
   
         r = requests.post("http://www.pythonscraping.com/comment/reply/10", 
   
                               data=params) 
   
         responseObj = BeautifulSoup(r.text) 
   
         if responseObj.find("div", {"class":"messages"}) is not None: 
   
             print(responseObj.find("div", {"class":"messages"}).get_text()) 
   
     else: 
   
         print("There was a problem reading the CAPTCHA correctly!")

滑块验证码破解

     from selenium import webdriver 
   
     from selenium.webdriver.support.ui import WebDriverWait 
   
     from selenium.webdriver.common.action_chains import ActionChains 
   
     import PIL.Image as image 
   
     import time,re, random 
   
     import requests 
   
     try: 
   
         from StringIO import StringIO 
   
     except ImportError: 
   
         from io import StringIO 
   
     #爬虫模拟的浏览器头部信息 
   
     agent = 'Mozilla/5.0 (Windows NT 5.1; rv:33.0) Gecko/20100101 Firefox/33.0' 
   
     headers = { 
   
             'User-Agent': agent 
   
             } 
   
     # 根据位置对图片进行合并还原 
   
     # filename:图片 
   
     # location_list:图片位置 
   
     #内部两个图片处理函数的介绍 
   
     #crop函数带的参数为(起始点的横坐标，起始点的纵坐标，宽度，高度） 
   
     #paste函数的参数为(需要修改的图片，粘贴的起始点的横坐标，粘贴的起始点的纵坐标） 
   
     def get_merge_image(filename,location_list): 
   
         #打开图片文件 
   
         im = image.open(filename) 
   
         #创建新的图片,大小为260*116 
   
         new_im = image.new('RGB', (260,116)) 
   
         im_list_upper=[] 
   
         im_list_down=[] 
   
         # 拷贝图片 
   
         for location in location_list: 
   
             #上面的图片 
   
             if location['y']==-58: 
   
                 im_list_upper.append(im.crop((abs(location['x']),58,abs(location['x'])+10,166))) 
   
             #下面的图片 
   
             if location['y']==0: 
   
                 im_list_down.append(im.crop((abs(location['x']),0,abs(location['x'])+10,58))) 
   
         new_im = image.new('RGB', (260,116)) 
   
         x_offset = 0 
   
         #黏贴图片 
   
         for im in im_list_upper: 
   
             new_im.paste(im, (x_offset,0)) 
   
             x_offset += im.size[0] 
   
         x_offset = 0 
   
         for im in im_list_down: 
   
             new_im.paste(im, (x_offset,58)) 
   
             x_offset += im.size[0] 
   
         return new_im 
   
     #下载并还原图片 
   
     # driver:webdriver 
   
     # div:图片的div 
   
     def get_image(driver,div): 
   
         #找到图片所在的div 
   
         background_images=driver.find_elements_by_xpath(div) 
   
         location_list=[] 
   
         imageurl='' 
   
         #图片是被CSS按照位移的方式打乱的,我们需要找出这些位移,为后续还原做好准备 
   
         for background_image in background_images: 
   
             location={} 
   
             #在html里面解析出小图片的url地址，还有长高的数值 
   
             location['x']=int(re.findall("background-image: url\(\"(.*)\"\); background-position: (.*)px (.*)px;",background_image.get_attribute('style'))[0][1]) 
   
             location['y']=int(re.findall("background-image: url\(\"(.*)\"\); background-position: (.*)px (.*)px;",background_image.get_attribute('style'))[0][2]) 
   
             imageurl=re.findall("background-image: url\(\"(.*)\"\); background-position: (.*)px (.*)px;",background_image.get_attribute('style'))[0][0] 
   
             location_list.append(location) 
   
         #替换图片的后缀,获得图片的URL 
   
         imageurl=imageurl.replace("webp","jpg") 
   
         #获得图片的名字 
   
         imageName = imageurl.split('/')[-1] 
   
         #获得图片 
   
         session = requests.session() 
   
         r = session.get(imageurl, headers = headers, verify = False) 
   
         #下载图片 
   
         with open(imageName, 'wb') as f: 
   
             f.write(r.content) 
   
             f.close() 
   
         #重新合并还原图片 
   
         image=get_merge_image(imageName, location_list) 
   
         return image 
   
     #对比RGB值 
   
     def is_similar(image1,image2,x,y): 
   
         pass 
   
         #获取指定位置的RGB值 
   
         pixel1=image1.getpixel((x,y)) 
   
         pixel2=image2.getpixel((x,y)) 
   
         for i in range(0,3): 
   
             # 如果相差超过50则就认为找到了缺口的位置 
   
             if abs(pixel1[i]-pixel2[i])>=50: 
   
                 return False 
   
         return True 
   
     #计算缺口的位置 
   
     def get_diff_location(image1,image2): 
   
         i=0 
   
         # 两张原始图的大小都是相同的260*116 
   
         # 那就通过两个for循环依次对比每个像素点的RGB值 
   
         # 如果相差超过50则就认为找到了缺口的位置 
   
         for i in range(0,260): 
   
             for j in range(0,116): 
   
                 if is_similar(image1,image2,i,j)==False: 
   
                     return  i 
   
     #根据缺口的位置模拟x轴移动的轨迹 
   
     def get_track(length): 
   
         pass 
   
         list=[] 
   
         #间隔通过随机范围函数来获得,每次移动一步或者两步 
   
         x=random.randint(1,3) 
   
         #生成轨迹并保存到list内 
   
         while length-x>=5: 
   
             list.append(x) 
   
             length=length-x 
   
             x=random.randint(1,3) 
   
         #最后五步都是一步步移动 
   
         for i in range(length): 
   
             list.append(1) 
   
         return list 
   
     #滑动验证码破解程序 
   
     def main(): 
   
         #打开火狐浏览器 
   
         driver = webdriver.Firefox() 
   
         #用火狐浏览器打开网页 
   
         driver.get("http://www.geetest.com/exp_embed") 
   
         #等待页面的上元素刷新出来 
   
         WebDriverWait(driver, 30).until(lambda the_driver: the_driver.find_element_by_xpath("//div[@class='gt_slider_knob gt_show']").is_displayed()) 
   
         WebDriverWait(driver, 30).until(lambda the_driver: the_driver.find_element_by_xpath("//div[@class='gt_cut_bg gt_show']").is_displayed()) 
   
         WebDriverWait(driver, 30).until(lambda the_driver: the_driver.find_element_by_xpath("//div[@class='gt_cut_fullbg gt_show']").is_displayed()) 
   
         #下载图片 
   
         image1=get_image(driver, "//div[@class='gt_cut_bg gt_show']/div") 
   
         image2=get_image(driver, "//div[@class='gt_cut_fullbg gt_show']/div") 
   
         #计算缺口位置 
   
         loc=get_diff_location(image1, image2) 
   
         #生成x的移动轨迹点 
   
         track_list=get_track(loc) 
   
         #找到滑动的圆球 
   
         element=driver.find_element_by_xpath("//div[@class='gt_slider_knob gt_show']") 
   
         location=element.location 
   
         #获得滑动圆球的高度 
   
         y=location['y'] 
   
         #鼠标点击元素并按住不放 
   
         print ("第一步,点击元素") 
   
         ActionChains(driver).click_and_hold(on_element=element).perform() 
   
         time.sleep(0.15) 
   
         print ("第二步，拖动元素") 
   
         track_string = "" 
   
         for track in track_list: 
   
             #不能移动太快,否则会被认为是程序执行 
   
             track_string = track_string + "{%d,%d}," % (track, y - 445) 
   
             #xoffset=track+22:这里的移动位置的值是相对于滑动圆球左上角的相对值，而轨迹变量里的是圆球的中心点，所以要加上圆球长度的一半。 
   
             #yoffset=y-445:这里也是一样的。不过要注意的是不同的浏览器渲染出来的结果是不一样的，要保证最终的计算后的值是22，也就是圆球高度的一半 
   
             ActionChains(driver).move_to_element_with_offset(to_element=element, xoffset=track+22, yoffset=y-445).perform() 
   
             #间隔时间也通过随机函数来获得,间隔不能太快,否则会被认为是程序执行 
   
             time.sleep(random.randint(10,50)/100) 
   
         print (track_string) 
   
         #xoffset=21，本质就是向后退一格。这里退了5格是因为圆球的位置和滑动条的左边缘有5格的距离 
   
         ActionChains(driver).move_to_element_with_offset(to_element=element, xoffset=21, yoffset=y-445).perform() 
   
         time.sleep(0.1) 
   
         ActionChains(driver).move_to_element_with_offset(to_element=element, xoffset=21, yoffset=y-445).perform() 
   
         time.sleep(0.1) 
   
         ActionChains(driver).move_to_element_with_offset(to_element=element, xoffset=21, yoffset=y-445).perform() 
   
         time.sleep(0.1) 
   
         ActionChains(driver).move_to_element_with_offset(to_element=element, xoffset=21, yoffset=y-445).perform() 
   
         time.sleep(0.1) 
   
         ActionChains(driver).move_to_element_with_offset(to_element=element, xoffset=21, yoffset=y-445).perform() 
   
         print ("第三步，释放鼠标") 
   
         #释放鼠标 
   
         ActionChains(driver).release(on_element=element).perform() 
   
         time.sleep(3) 
   
         #点击验证 
   
         # submit = driver.find_element_by_xpath("//div[@class='gt_ajax_tip success']") 
   
         # print(submit.location) 
   
         # time.sleep(5) 
   
         #关闭浏览器,为了演示方便,暂时注释掉. 
   
         #driver.quit() 
   
     #主函数入口 
   
     if __name__ == '__main__': 
   
         pass 
   
         main()

python构建web页面

     import os 
   
     import tornado.httpserver 
   
     import tornado.ioloop 
   
     import tornado.options 
   
     import tornado.web 
   
     from view import * 
   
     from tornado.options import define, options 
   
     define("port", default=8000, help="run on the given port", type=int) 
   
     class Application(tornado.web.Application): 
   
         def __init__(self): 
   
             handlers = [ 
   
                 (r"/", Indexhandler), 
   
             ] 
   
             settings = dict( 
   
                 template_path=os.path.join(os.path.dirname(__file__), 'templates'), 
   
                 autoescape=None, 
   
                 debug=False, 
   
             ) 
   
             tornado.web.Application.__init__(self, handlers, **settings) 
   
     if __name__ == "__main__": 
   
         tornado.options.parse_command_line() 
   
         http_server = tornado.httpserver.HTTPServer(Application(), xheaders=True) 
   
         http_server.listen(options.port) 
   
         tornado.ioloop.IOLoop.instance().start()

定时任务

     #! /usr/bin/env python 
   
     # coding=utf-8 
   
     import time, os, sched 
   
     # 第一个参数确定任务的时间，返回从某个特定的时间到现在经历的秒数 
   
     # 第二个参数以某种人为的方式衡量时间 
   
     schedule = sched.scheduler(time.time, time.sleep) 
   
     def perform_command(cmd, inc): 
   
         # 安排inc秒后再次运行自己，即周期运行 
   
         schedule.enter(inc, 0, perform_command, (cmd, inc)) 
   
         os.system(cmd) 
   
     def timming_exe(cmd, inc=60): 
   
         # enter用来安排某事件的发生时间，从现在起第n秒开始启动 
   
         schedule.enter(inc, 0, perform_command, (cmd, inc)) 
   
         # 持续运行，直到计划时间队列变成空为止 
   
         schedule.run() 
   
     #每隔一天调用getMovieList.py程序 
   
     timming_exe("getMovieList.py", 60 * 60 * 24)

通过百度地图API，标准化地址

     from urllib.request import urlopen 
   
     from urllib.parse import urlencode 
   
     from urllib.error import URLError 
   
     import json 
   
     class xBaiduMap: 
   
         def __init__(self, key='mgf2Gxr7EgnfPVQnpClZnsug'): 
   
             self.host = 'http://api.map.baidu.com' 
   
             self.path = '/geocoder?' 
   
             self.param = {'address': None, 'output': 'json', 'key': key, 'location': None, 'city': None} 
   
         def getLocation(self, address, city=None): 
   
             rlt = self.geocoding('address', address, city) 
   
             if rlt != None: 
   
                 l = rlt['result'] 
   
                 if isinstance(l, list): 
   
                     return None 
   
                 return l['location']['lat'], l['location']['lng'] 
   
         def getAddress(self, lat, lng): 
   
             rlt = self.geocoding('location', "{0},{1}".format(lat, lng)) 
   
             if rlt != None: 
   
                 l = rlt['result'] 
   
                 #return l['formatted_address'] 
   
                 # Here you can get more details about the location with 'addressComponent' key 
   
                 ld=rlt['result']['addressComponent'] 
   
                 return (ld['city']+';'+ld['district']+';'+ld['street']+";"+ld['street_number']) 
   
         def geocoding(self, key, value, city=None): 
   
             if key == 'location': 
   
                 if 'city' in self.param: 
   
                     del self.param['city'] 
   
                 if 'address' in self.param: 
   
                     del self.param['address'] 
   
             elif key == 'address': 
   
                 if 'location' in self.param: 
   
                     del self.param['location'] 
   
                 if city == None and 'city' in self.param: 
   
                     del self.param['city'] 
   
                 else: 
   
                     self.param['city'] = city 
   
             self.param[key] = value 
   
             try: 
   
                 r = urlopen(self.host + self.path + urlencode(self.param)).read() 
   
             except URLError: 
   
                 print ("URLError") 
   
                 return None 
   
             str_response = r.decode('utf-8') 
   
             rlt = json.loads(str_response) 
   
             if rlt['status'] == 'OK': 
   
                 return rlt 
   
             else: 
   
                 print ("Decoding Failed") 
   
                 return None

多进程

     import multiprocessing 
   
     for process_id in range(PROCESS_NUM): 
   
         p = multiprocessing.Process(target=worker, args=(process_id,)) 
   
         jobs.append(p) 
   
         p.start()

文件切割小程序

     def split_file(file_name, file_num): 
   
         #文件已经存在 
   
         if(os.path.exists("split_0.txt")): 
   
             return 
   
         #统计文件的总行数 
   
         count = -1 
   
         file = open(file_name, encoding='utf-8') 
   
         for count, line in enumerate(file): 
   
             pass 
   
         count += 1 
   
         file.close() 
   
         #每个文件的行数 
   
         count_per_file = count / file_num 
   
         #创建file_num个新文件 
   
         for i in range(file_num): 
   
             file = open("split_" + str(i) + ".txt", 'w', encoding='utf-8') 
   
             file.close() 
   
         #分割成file_num个新文件 
   
         file = open(file_name, encoding='utf-8') 
   
         count = -1 
   
         for count, line in enumerate(file): 
   
             file_index = (int)(count /count_per_file) 
   
             sub_file = open("split_" + str(file_index) + ".txt", "a+", encoding='utf-8') 
   
             if(sub_file != None): 
   
                 sub_file.write(line)

python操作DB2

     import ibm_db 
    
     con = ibm_db.connect("DATABASE=FMRT;HOSTNAME=XX.XX.XX.XX;PORT=60000;PORTOCOL=TCPIP;UID=db2inst1;PWD=db2inst1;", "", "") 
   
     sql = getSql(inputfile) 
   
     stmt = ibm_db.exec_immediate(con, sql) 
   
     result = ibm_db.fetch_both(stmt) 
   
     rowidx = 0 
   
     while (result): 
   
         #DO SOMETHING 
   
         result = ibm_db.fetch_both(stmt) 
   
     ibm_db.close(con)

jieba中文分词

     import jieba 
   
     seg_list = jieba.cut("我来到北京清华大学", cut_all=True) 
   
     for line in seg_list: 
   
         print(line) 
   
     print("Full Mode: " + "/ ".join(seg_list))  # 全模式 
   
     seg_list = jieba.cut("我来到北京清华大学", cut_all=False) 
   
     print("Default Mode: " + "/ ".join(seg_list))  # 精确模式 
   
     seg_list = jieba.cut("他来到了网易杭研大厦")  # 默认是精确模式 
   
     print(", ".join(seg_list)) 
   
     seg_list = jieba.cut_for_search("小明硕士毕业于中国科学院计算所，后在日本京都大学深造")  # 搜索引擎模式 
   
     print(", ".join(seg_list))

月末判断

     import calendar 
   
     import sys 
   
     def isMonthEnd(datetime): 
   
         year = int(datetime[0:4]) 
   
         month = int(datetime[4:6]) 
   
         day = int(datetime[6:8]) 
   
         wday, monthrange = calendar.monthrange(year, month) 
   
         if(day == monthrange): 
   
             return 1 
   
         else: 
   
             return 0 
   
     isMonthEnd(sys.argv[1])

移除中文分隔符

     cmd = "sed ':a;N;$ s/\\r\\n//g;ba' " + oldfile + " > " + newfile 
   
     os.system(cmd)

多线程

     # -*- coding: utf-8 -*- 
   
     """ 
   
         thread 
   
         ~~~~~~~~~~~~~~~~ 
   
       Thread framework 
   
         :copyright: (c) 2016 by why. 
   
         :license: MIT, see LICENSE for more details. 
   
     """ 
   
     import threading 
   
     class Threadconfig(): 
   
         def __init__(self, thread_size): 
   
             self.thread_size = thread_size 
   
         def topen(self): 
   
             self.thread_tasks = [] 
   
         def build(self, func, **kwargs): 
   
             self.thread_task = threading.Thread(target=func, kwargs=(kwargs)) 
   
             self.thread_tasks.append(self.thread_task) 
   
         def run(self): 
   
             for thread_task in self.thread_tasks: 
   
                 thread_task.setDaemon(True) 
   
                 thread_task.start() 
   
             while 1: 
   
                 alive = False 
   
                 for thread_num in range(0, self.thread_size): 
   
                     alive = alive or self.thread_tasks[thread_num].isAlive() 
   
                 if not alive: 
   
                     break 
   
         def __del__(self): 
   
             self.thread_tasks = []

你可能感兴趣的:(python)

系统学习Python——并发模型和异步编程：进程、线程和GIL
分类目录：《系统学习Python》总目录在文章《并发模型和异步编程：基础知识》我们简单介绍了Python中的进程、线程和协程。本文就着重介绍Python中的进程、线程和GIL的关系。Python解释器的每个实例都是一个进程。使用multiprocessing或concurrent.futures库可以启动额外的Python进程。Python的subprocess库用于启动运行外部程序（不管使用何种
Flask框架入门：快速搭建轻量级Python网页应用「已注销」 python-AI python基础网站网络 python flask 后端
转载：Flask框架入门：快速搭建轻量级Python网页应用1.Flask基础Flask是一个使用Python编写的轻量级Web应用框架。它的设计目标是让Web开发变得快速简单，同时保持应用的灵活性。Flask依赖于两个外部库：Werkzeug和Jinja2，Werkzeug作为WSGI工具包处理Web服务的底层细节，Jinja2作为模板引擎渲染模板。安装Flask非常简单，可以使用pip安装命令
Python Flask 框架入门：快速搭建 Web 应用的秘诀 Python编程之道 Python人工智能与大数据 Python编程之道 python flask 前端 ai
PythonFlask框架入门：快速搭建Web应用的秘诀关键词Flask、微框架、路由系统、Jinja2模板、请求处理、WSGI、Web开发摘要想快速用Python搭建一个灵活的Web应用？Flask作为“微框架”代表，凭借轻量、可扩展的特性，成为初学者和小型项目的首选。本文将从Flask的核心概念出发，结合生活化比喻、代码示例和实战案例，带你一步步掌握：如何用Flask搭建第一个Web应用？路由
python_虚拟环境阿_焦 python
第一、配置虚拟环境：virtualenv（1）pipvirtualenv>安装虚拟环境包（2）pipinstallvirtualenvwrapper-win>安装虚拟环境依赖包（3）c盘创建虚拟目录>C:\virtualenv>配置环境变量【了解一下】：（1）如何使用virtualenv创建虚拟环境a、cd到C:\virtualenv目录下：b、mkvirtualenvname>创建虚拟环境nam
Python爱心光波
系列文章序号直达链接Tkinter1Python李峋同款可写字版跳动的爱心2Python跳动的双爱心3Python蓝色跳动的爱心4Python动漫烟花5Python粒子烟花Turtle1Python满屏飘字2Python蓝色流星雨3Python金色流星雨4Python漂浮爱心5Python爱心光波①6Python爱心光波②7Python满天繁星8Python五彩气球9Python白色飘雪10Pyt
Python流星雨 Want595 python 开发语言
文章目录系列文章写在前面技术需求完整代码代码分析1.模块导入2.画布设置3.画笔设置4.颜色列表5.流星类(Star)6.流星对象创建7.主循环8.流星运动逻辑9.视觉效果10.总结写在后面系列文章序号直达链接表白系列1Python制作一个无法拒绝的表白界面2Python满屏飘字表白代码3Python无限弹窗满屏表白代码4Python李峋同款可写字版跳动的爱心5Python流星雨代码6Python
Python之七彩花朵代码实现 PlutoZuo Python python 开发语言
Python之七彩花朵代码实现文章目录Python之七彩花朵代码实现下面是一个简单的使用Python的七彩花朵。这个示例只是一个简单的版本，没有很多高级功能，但它可以作为一个起点，你可以在此基础上添加更多功能。importturtleastuimportrandomasraimportmathtu.setup(1.0,1.0)t=tu.Pen()t.ht()colors=['red','skybl
Python 脚本最佳实践2025版
前文可以直接把这篇文章喂给AI,可以放到AI角色设定里,也可以直接作为提示词.这样,你只管提需求,写脚本就让AI来.概述追求简洁和清晰：脚本应简单明了。使用函数(functions)、常量(constants)和适当的导入(import)实践来有逻辑地组织你的Python脚本。使用枚举(enumerations)和数据类(dataclasses)等数据结构高效管理脚本状态。通过命令行参数增强交互性
（Python基础篇）了解和使用分支结构 EternityArt 基础篇 python
目录一、引言二、Python分支结构的类型与语法（一）if语句（单分支）（二）if-else语句（双分支）（三）if-elif-else语句（多分支）三、分支结构的应用场景（一）提示用户输入用户名，然后再提示输入密码，如果用户名是“admin”并且密码是“88888”则提示正确，否则，如果用户名不是admin还提示用户用户名不存在,（二）提示用户输入用户名，然后再提示输入密码，如果用户名是“adm
（Python基础篇）循环结构 EternityArt 基础篇 python
一、什么是Python循环结构？循环结构是编程中重复执行代码块的机制。在Python中，循环允许你：1.迭代处理数据：遍历列表、字典、文件内容等。2.自动化重复任务：如批量处理数据、生成序列等。3.控制执行流程：根据条件决定是否继续或终止循环。二、为什么需要循环结构？假设你需要打印1到100的所有偶数：没有循环：需手动编写100行print()语句。print(0)print(2)print(4)
（Python基础篇）字典的操作 EternityArt 基础篇 python 开发语言
一、引言在Python编程中，字典（Dictionary）是一种极具灵活性的数据结构，它通过“键-值对”（key-valuepair）的形式存储数据，如同现实生活中的字典——通过“词语（键）”快速查找“释义（值）”。相较于列表和元组的有序索引访问，字典的优势在于基于键的快速查找，这使得它在处理需要频繁通过唯一标识获取数据的场景中极为高效。掌握字典的操作，能让我们更高效地组织和管理复杂数据，是Pyt
Python七彩花朵 Want595 python 开发语言
系列文章序号直达链接Tkinter1Python李峋同款可写字版跳动的爱心2Python跳动的双爱心3Python蓝色跳动的爱心4Python动漫烟花5Python粒子烟花Turtle1Python满屏飘字2Python蓝色流星雨3Python金色流星雨4Python漂浮爱心5Python爱心光波①6Python爱心光波②7Python满天繁星8Python五彩气球9Python白色飘雪10Pyt
用OpenCV标定相机内参应用示例（C++和Python）
下面是一个完整的使用OpenCV进行相机内参标定（CameraCalibration）的示例，包括C++和Python两个版本，基于棋盘格图案标定。一、目标：相机标定通过拍摄多张带有棋盘格图案的图像，估计相机的内参：相机矩阵（内参）K畸变系数distCoeffs可选外参（R,T）标定精度指标（如重投影误差）二、棋盘格参数设置（根据自己的棋盘格设置）：棋盘格角点数：9x6（内角点，9列×6行）；每个
Anaconda 详细下载与安装教程
Anaconda详细下载与安装教程1.简介Anaconda是一个用于科学计算的开源发行版，包含了Python和R的众多常用库。它还包括了conda包管理器，可以方便地安装、更新和管理各种软件包。2.下载Anaconda2.1访问官方网站首先，打开浏览器，访问Anaconda官方网站。2.2选择适合的版本在页面中，你会看到两个主要的下载选项：AnacondaIndividualEdition：适用于
python中 @注解及内置注解的使用方法总结以及完整示例慧一居士 Python python
在Python中，装饰器（Decorator）使用@符号实现，是一种修改函数/类行为的语法糖。它本质上是一个高阶函数，接受目标函数作为参数并返回包装后的函数。Python也提供了多个内置装饰器，如@property、@staticmethod、@classmethod等。一、核心概念装饰器本质：@decorator等价于func=decorator(func)执行时机：在函数/类定义时立即执行装饰
Python中的静态方法和类方法详解
在Python中，`@staticmethod`和`@classmethod`是两种装饰器，它们用于定义类中的方法，但是它们的行为和用途有所不同。###@staticmethod`@staticmethod`装饰器用于定义一个静态方法。静态方法不接收类或实例的引用作为第一个参数，因此它不能访问类的状态或实例的状态。静态方法可以看作是与类关联的普通函数，但它们可以通过类名直接调用。classMath
Python中类静态方法：@classmethod/@staticmethod详解和实战示例
在Python中，类方法(@classmethod)和静态方法(@staticmethod)是类作用域下的两种特殊方法。它们使用装饰器定义，并且与实例方法(deffunc(self))的行为有所不同。1.三种方法的对比概览方法类型是否访问实例(self)是否访问类(cls)典型用途实例方法✅是❌否访问对象属性类方法@classmethod❌否✅是创建类的替代构造器，访问类变量等静态方法@stati
Python多版本管理与pip升级全攻略：解决冲突与高效实践码界奇点 Python python pip 开发语言 python3.11 源代码管理虚拟现实依赖倒置原则
引言Python作为最流行的编程语言之一，其版本迭代速度与生态碎片化给开发者带来了巨大挑战。据统计，超过60%的Python开发者需要同时维护基于Python3.6+和Python2.7的项目。本文将系统解决以下核心痛点：如何安全地在同一台机器上管理多个Python版本pip依赖冲突的根治方案符合PEP标准的生产环境最佳实践第一部分：Python多版本管理核心方案1.1系统级多版本共存方案Wind
基于Python的健身数据分析工具的搭建流程day1 weixin_45677320 python 开发语言数据挖掘爬虫
基于Python的健身数据分析工具的搭建流程分数据挖掘、数据存储和数据分析三个步骤。本文主要介绍利用Python实现健身数据分析工具的数据挖掘部分。第一步：加载库加载本文需要的库，如下代码所示。若库未安装，请按照python如何安装各种库（保姆级教程）_python安装库-CSDN博客https://blog.csdn.net/aobulaien001/article/details/133298
seaborn又一个扩展heatmapz qq_21478261 #Python可视化 matplotlib
推荐阅读：Pythonmatplotlib保姆级教程嫌Matplotlib繁琐？试试Seaborn！
NGS测序基础梳理01-文库构建（Library Preparation） qq_21478261 #生物信息生物学
本文介绍Illumina测序平台文库构建（LibraryPreparation）步骤，文库结构。写作时间：2020.05。推荐阅读：10W字《Python可视化教程1.0》来了！一份由公众号「pythonic生物人」精心制作的PythonMatplotlib可视化系统教程，105页PDFhttps://mp.weixin.qq.com/s/QaSmucuVsS_DR-klfpE3-Q10W字《Rg
Python 常用内置函数详解（七）：dir()函数——获取当前本地作用域中的名称列表或对象的有效属性列表
目录一、功能二、语法和示例一、功能dir()函数获取当前本地作用域中的名称列表或对象的有效属性列表。二、语法和示例dir()函数有两种形式，如果没有实参，则返回当前本地作用域中的名称列表。如果有实参，它会尝试返回该对象的有效属性列表。如果对象有一个名为__dir__()的方法，那么该方法将被调用，并且必须返回一个属性列表。dir()函数的语法格式如下：C:\Users\amoxiang>ipyth
pythonjson中list操作_Python json.dumps 特殊数据类型的自定义序列化操作
场景描述：Python标准库中的json模块，集成了将数据序列化处理的功能；在使用json.dumps()方法序列化数据时候，如果目标数据中存在datetime数据类型，执行操作时，会抛出异常：TypeError:datetime.datetime(2016,12,10,11,04,21)isnotJSONserializable那么遇到json.dumps序列化不支持的数据类型，该怎么办！首先，
Python 日期格式转json.dumps的解决方法 douyaoxin python json 开发语言
classDateEncoder(json.JSONEncoder):defdefault(self,obj):ifisinstance(obj,datetime.datetime):returnobj.strftime('%Y-%m-%d%H:%M:%S')elifisinstance(obj,datetime.date):returnobj.strftime("%Y-%m-%d")json.d
Python 爬虫实战：视频平台播放量实时监控（含反爬对抗与数据趋势预测）西攻城狮北 python 爬虫音视频
一、引言在数字内容蓬勃发展的当下，视频平台的播放量数据已成为内容创作者、营销人员以及行业分析师手中极为关键的情报资源。它不仅能够实时反映内容的受欢迎程度，更能在竞争分析、营销策略制定以及内容优化等方面发挥不可估量的作用。然而，视频平台为了保护自身数据和用户隐私，往往会设置一系列反爬虫机制，对数据爬取行为进行限制。这就向我们发起了挑战：如何巧妙地突破这些限制，同时精准地捕捉并预测播放量的动态变化趋势
Python技能手册 - 模块module 金色牛神 Python python windows 开发语言
系列Python常用技能手册-基础语法Python常用技能手册-模块modulePython常用技能手册-包package目录module模块指什么typing数据类型int整数float浮点数str字符串bool布尔值TypeVar类型变量functools高阶函数工具functools.partial()函数偏置functools.lru_cache()函数缓存sorted排序列表排序元组排序
Ubuntu基础（Python虚拟环境和Vue） aaiier ubuntu python linux
Python虚拟环境sudoaptinstallpython3python3-venv进入项目目录cdXXX创建虚拟环境python3-mvenvvenv激活虚拟环境sourcevenv/bin/activate退出虚拟环境deactivateVue安装Node.js和npm#安装Node.js和npm（Ubuntu默认仓库可能版本较旧，适合入门）sudoaptinstallnodejsnpm#验
苦练Python第9天：if-else分支九剑 python后端前端人工智能
苦练Python第9天：if-else分支九剑前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我，微信公众号：倔强青铜三。欢迎点赞、收藏、关注，一键三连！！！欢迎来到100天Python挑战第9天！今天我们不练循环，改磨“分支剑法”——ifelse三式：单分支、双分支、多分支，以及嵌套和三元运算符，全部实战演练，让
苦练Python第8天：while 循环之妙用 python后端前端人工智能
苦练Python第8天：while循环之妙用原文链接：https://dev.to/therahul_gupta/day-9100-while-loops-with-real-world-examples-528f作者：RahulGupta译者：倔强青铜三前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我，微信公众
苦练Python第5天：字符串从入门到格式化 python后端人工智能前端
苦练Python第5天：字符串从入门到格式化原文链接：https://dev.to/therahul_gupta/day-5100-working-with-strings-basics-to-formatting-2kkn作者：RahulGupta译者：倔强青铜三前言大家好，我是倔强青铜三。是一名热情的软件工程师，我热衷于分享和传播IT技术，致力于通过我的知识和技能推动技术交流与创新，欢迎关注我
矩阵求逆（JAVA）利用伴随矩阵 qiuwanchi 利用伴随矩阵求逆矩阵
package gaodai.matrix; import gaodai.determinant.DeterminantCalculation; import java.util.ArrayList; import java.util.List; import java.util.Scanner; /** * 矩阵求逆(利用伴随矩阵) * @author 邱万迟
单例（Singleton）模式 aoyouzi 单例模式 Singleton
3.1 概述如果要保证系统里一个类最多只能存在一个实例时，我们就需要单例模式。这种情况在我们应用中经常碰到，例如缓存池，数据库连接池，线程池，一些应用服务实例等。在多线程环境中，为了保证实例的唯一性其实并不简单，这章将和读者一起探讨如何实现单例模式。 3.2
[开源与自主研发]就算可以轻易获得外部技术支持,自己也必须研发 comsci 开源
现在国内有大量的信息技术产品，都是通过盗版，免费下载，开源，附送等方式从国外的开发者那里获得的。。。。。。虽然这种情况带来了国内信息产业的短暂繁荣，也促进了电子商务和互联网产业的快速发展，但是实际上，我们应该清醒的看到，这些产业的核心力量是被国外的
页面有两个frame,怎样点击一个的链接改变另一个的内容 Array_06 UI XHTML
<a src="地址" targets="这里写你要操作的Frame的名字" />搜索然后你点击连接以后你的新页面就会显示在你设置的Frame名字的框那里 targerts="",就是你要填写目标的显示页面位置 ===================== 例如： <frame src=&
Struts2实现单个/多个文件上传和下载 oloz 文件上传 struts
struts2单文件上传：步骤01:jsp页面  　　<form action="fileUplo
推荐10个在线logo设计网站 362217990 logo
在线设计Logo网站。 1、http://flickr.nosv.org（这个太简单） 2、http://www.logomaker.com/?source=1.5770.1 3、http://www.simwebsol.com/ImageTool 4、http://www.logogenerator.com/logo.php?nal=1&tpl_catlist[]=2 5、ht
jsp上传文件香水浓 jsp fileupload
1. jsp上传 Notice： 1. form表单 method 属性必须设置为 POST 方法，不能使用 GET 方法 2. form表单 enctype 属性需要设置为 multipart/form-data 3. form表单 action 属性需要设置为提交到后台处理文件上传的jsp文件地址或者servlet地址。例如 uploadFile.jsp 程序文件用来处理上传的文
我的架构经验系列文章 - 前端架构 agevs JavaScript Web 框架 UI jQuer
框架层面：近几年前端发展很快，前端之所以叫前端因为前端是已经可以独立成为一种职业了，js也不再是十年前的玩具了，以前富客户端RIA的应用可能会用flash/flex或是silverlight，现在可以使用js来完成大部分的功能，因此js作为一门前端的支撑语言也不仅仅是进行的简单的编码，越来越多框架性的东西出现了。越来越多的开发模式转变为后端只是吐json的数据源，而前端做所有UI的事情。MVCMV
android ksoap2 中把XML(DataSet) 当做参数传递 aijuans android
我的android app中需要发送webservice ，于是我使用了 ksop2 进行发送，在测试过程中不是很顺利,不能正常工作.我的web service 请求格式如下 [html] view plain copy <Envelope xmlns="http://schemas.
使用Spring进行统一日志管理 + 统一异常管理 baalwolf spring
统一日志和异常管理配置好后，SSH项目中，代码以往散落的log.info() 和 try..catch..finally 再也不见踪影！统一日志异常实现类： [java] view plain copy package com.pilelot.web.util; impor
Android SDK 国内镜像 BigBird2012 android sdk
一、镜像地址： 1、东软信息学院的 Android SDK 镜像，比配置代理下载快多了。配置地址， http://mirrors.neusoft.edu.cn/configurations.we#android 2、北京化工大学的： IPV4:ubuntu.buct.edu.cn IPV4:ubuntu.buct.cn IPV6:ubuntu.buct6.edu.cn
HTML无害化和Sanitize模块 bijian1013 JavaScript AngularJS Linky Sanitize
一.ng-bind-html、ng-bind-html-unsafe AngularJS非常注重安全方面的问题，它会尽一切可能把大多数攻击手段最小化。其中一个攻击手段是向你的web页面里注入不安全的HTML，然后利用它触发跨站攻击或者注入攻击。考虑这样一个例子，假设我们有一个变量存
[Maven学习笔记二]Maven命令 bit1129 maven
mvn compile compile编译命令将src/main/java和src/main/resources中的代码和配置文件编译到target/classes中，不会对src/test/java中的测试类进行编译 MVN编译使用 maven-resources-plugin:2.6:resources maven-compiler-plugin:2.5.1:compile &nbs
【Java命令二】jhat bit1129 Java命令
jhat用于分析使用jmap dump的文件，，可以将堆中的对象以html的形式显示出来，包括对象的数量，大小等等，并支持对象查询语言。 jhat默认开启监听端口7000的HTTP服务，jhat是Java Heap Analysis Tool的缩写 1. 用法： [hadoop@hadoop bin]$ jhat -help Usage: jhat [-stack <bool&g
JBoss 5.1.0 GA:Error installing to Instantiated: name=AttachmentStore state=Desc ronin47
进到类似目录 server/default/conf/bootstrap，打开文件 profile.xml找到： Xml代码<bean name="AttachmentStore" class="org.jboss.system.server.profileservice.repository.AbstractAtta
写给初学者的6条网页设计安全配色指南 brotherlamp UI ui自学 ui视频 ui教程 ui资料
网页设计中最基本的原则之一是，不管你花多长时间创造一个华丽的设计，其最终的角色都是这场秀中真正的明星——内容的衬托我仍然清楚地记得我最早的一次美术课，那时我还是一个小小的、对凡事都充满渴望的孩子，我摆放出一大堆漂亮的彩色颜料。我仍然记得当我第一次看到原色与另一种颜色混合变成第二种颜色时的那种兴奋，并且我想，既然两种颜色能创造出一种全新的美丽色彩，那所有颜色
有一个数组，每次从中间随机取一个，然后放回去，当所有的元素都被取过，返回总共的取的次数。写一个函数实现。复杂度是什么。 bylijinnan java 算法面试
import java.util.Random; import java.util.Set; import java.util.TreeSet; /** * http://weibo.com/1915548291/z7HtOF4sx * #面试题#有一个数组，每次从中间随机取一个，然后放回去，当所有的元素都被取过，返回总共的取的次数。 * 写一个函数实现。复杂度是什么
struts2获得request、session、application方式 chiangfai application
1、与Servlet API解耦的访问方式。 a.Struts2对HttpServletRequest、HttpSession、ServletContext进行了封装，构造了三个Map对象来替代这三种对象要获取这三个Map对象，使用ActionContext类。 -----> package pro.action; import java.util.Map; imp
改变python的默认语言设置 chenchao051 python
import sys sys.getdefaultencoding() 可以测试出默认语言，要改变的话，需要在python lib的site-packages文件夹下新建： sitecustomize.py，这个文件比较特殊，会在python启动时来加载，所以就可以在里面写上： import sys sys.setdefaultencoding('utf-8') &n
mysql导入数据load data infile用法 daizj mysql 导入数据
我们常常导入数据！mysql有一个高效导入方法，那就是load data infile 下面来看案例说明基本语法： load data [low_priority] [local] infile 'file_name txt' [replace | ignore] into table tbl_name [fields [terminated by't'] [OPTI
phpexcel导入excel表到数据库简单入门示例 dcj3sjt126com PHP Excel
跟导出相对应的，同一个数据表，也是将phpexcel类放在class目录下，将Excel表格中的内容读取出来放到数据库中 <?php error_reporting(E_ALL); set_time_limit(0); ?> <html> <head> <meta http-equiv="Content-Type"
22岁到72岁的男人对女人的要求 dcj3sjt126com
22岁男人对女人的要求是：一，美丽，二，性感，三，有份具品味的职业，四，极有耐性，善解人意，五，该聪明的时候聪明，六，作小鸟依人状时尽量自然，七，怎样穿都好看，八，懂得适当地撒娇，九，虽作惊喜反应，但看起来自然，十，上了床就是个无条件荡妇。 32岁的男人对女人的要求，略作修定，是：一，入得厨房，进得睡房，二，不必服侍皇太后，三，不介意浪漫蜡烛配盒饭，四，听多过说，五，不再傻笑，六，懂得独
Spring和HIbernate对DDM设计的支持 e200702084 DAO 设计模式 spring Hibernate 领域模型
A：数据访问对象 DAO和资源库在领域驱动设计中都很重要。DAO是关系型数据库和应用之间的契约。它封装了Web应用中的数据库CRUD操作细节。另一方面，资源库是一个独立的抽象，它与DAO进行交互，并提供到领域模型的“业务接口”。资源库使用领域的通用语言，处理所有必要的DAO，并使用领域理解的语言提供对领域模型的数据访问服务。
NoSql 数据库的特性比较 geeksun NoSQL
Redis 是一个开源的使用ANSI C语言编写、支持网络、可基于内存亦可持久化的日志型、Key-Value数据库，并提供多种语言的API。目前由VMware主持开发工作。 1. 数据模型作为Key-value型数据库，Redis也提供了键（Key）和值（Value）的映射关系。除了常规的数值或字符串，Redis的键值还可以是以下形式之一： Lists （列表） Sets
使用 Nginx Upload Module 实现上传文件功能 hongtoushizi nginx
转载自： http://www.tuicool.com/wx/aUrAzm 普通网站在实现文件上传功能的时候，一般是使用Python，Java等后端程序实现，比较麻烦。Nginx有一个Upload模块，可以非常简单的实现文件上传功能。此模块的原理是先把用户上传的文件保存到临时文件，然后在交由后台页面处理，并且把文件的原名，上传后的名称，文件类型，文件大小set到页面。下
spring-boot-web-ui及thymeleaf基本使用 jishiweili spring thymeleaf
视图控制层代码demo如下： @Controller @RequestMapping("/") public class MessageController { private final MessageRepository messageRepository; @Autowired public MessageController(Mes
数据源架构模式之活动记录 home198979 PHP 架构活动记录数据映射
hello!架构一、概念活动记录（Active Record）：一个对象，它包装数据库表或视图中某一行，封装数据库访问，并在这些数据上增加了领域逻辑。对象既有数据又有行为。活动记录使用直截了当的方法，把数据访问逻辑置于领域对象中。二、实现简单活动记录活动记录在php许多框架中都有应用，如cakephp。 <?php /** * 行数据入口类 *
Linux Shell脚本之自动修改IP pda158 linux centos Debian 脚本
作为一名 Linux SA，日常运维中很多地方都会用到脚本，而服务器的ip一般采用静态ip或者MAC绑定，当然后者比较操作起来相对繁琐，而前者我们可以设置主机名、ip信息、网关等配置。修改成特定的主机名在维护和管理方面也比较方便。如下脚本用途为：修改ip和主机名等相关信息，可以根据实际需求修改，举一反三！ #!/bin/sh #auto Change ip netmask ga
开发环境搭建独浮云 eclipse jdk tomcat
最近在开发过程中，经常出现MyEclipse内存溢出等错误，需要重启的情况，好麻烦。对于一般的JAVA+TOMCAT项目开发，其实没有必要使用重量级的MyEclipse，使用eclipse就足够了。尤其是开发机器硬件配置一般的人。 &n