1.思路
在网上查找了半天,基本都是提取word中文字的,没有找到可以把word中的图片提取出来的方法。一个巧合的情况下,发现将word的后缀名改为zip,然后解压该zip,可以看到原来word是这样存储的:
图片就存放在固定的文件夹下:/word/media/;
那么我们就只需要批量的修改文件后缀名,并且解压之后将图片拷贝到需要存放的地方,然后将该文件夹清空留作下次的路径,并且将文件从zip改回docx即可。(注意:doc不支持这个方法,如果需要提取doc格式的图片,可以先转为docx,再提取即可)
2.具体实现
2.1导入相关库
''' =========================================== @author: renjiaxin @time: 2018/8/9 0009 10:00 =========================================== ''' import zipfile import os import shutil
2.2定义函数
为了方便和其他函数调用,直接写了个函数完成这个功能,在这里,我们需要以下四个参数:
- word文档的路径
- zip压缩文件的路径
- 临时解压的tmp路径
- 最后需要保存的store_path路径
def word2pic(path, zip_path, tmp_path, store_path): ''' :param path:源文件 :param zip_path:docx重命名为zip :param tmp_path:中转图片文件夹 :param store_path:最后保存结果的文件夹(需要手动创建) :return: '''
2.3重命名word文件,将后缀名docx改为zip
# 将docx文件重命名为zip文件 os.rename(path, zip_path) # 进行解压 f = zipfile.ZipFile(zip_path, 'r') # 将图片提取并保存 for file in f.namelist(): f.extract(file, tmp_path) # 释放该zip文件 f.close()
2.4zip还原为docx文件,并获得图片的列表
# 将docx文件从zip还原为docx os.rename(zip_path, path) # 得到缓存文件夹中图片列表 pic = os.listdir(os.path.join(tmp_path, 'word/media'))
2.5将图片复制到需要保存的文件夹中
并且我们将文件的名字命名为word所在的路径
# 将图片复制到最终的文件夹中 for i in pic: # 根据word的路径生成图片的名称 new_name = path.replace('\\', '_') new_name = new_name.replace(':', '') + '_' + i shutil.copy(os.path.join(tmp_path + '/word/media', i), os.path.join(store_path, new_name))
2.6删除tmp缓冲文件夹中的文件,用以存储下一次的文件
# 删除缓冲文件夹中的文件,用以存储下一次的文件 for i in os.listdir(tmp_path): # 如果是文件夹则删除 if os.path.isdir(os.path.join(tmp_path, i)): shutil.rmtree(os.path.join(tmp_path, i))
2.7运行程序
if __name__ == '__main__': # 源文件 path = r'E:\dogcat\提取图片\log.docx' # docx重命名为zip zip_path = r'E:\dogcat\提取图片\log.zip' # 中转图片文件夹 tmp_path = r'E:\dogcat\提取图片\tmp' # 最后保存结果的文件夹 store_path = r'E:\dogcat\提取图片\测试' m = word2pic(path, zip_path, tmp_path, store_path)
3效果预览
3.1源word
3.2提取的图片
4附:doc转docx
from win32com import client import traceback def doc2docx(doc_name, docx_name): ''' # doc转docx :param doc_name: doc文档路径 :param docx_name: docx文档路径 :return: ''' try: # 首先将doc转换成docx word = client.Dispatch("Word.Application") doc = word.Documents.Open(doc_name) # 使用参数16表示将doc转换成docx doc.SaveAs(docx_name, 16) doc.Close() word.Quit() except: traceback.print_exc()
到此这篇关于Python提取Word中图片的实现步骤的文章就介绍到这了,更多相关Python提取Word图片内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家!