[Python] 自动化办公 邮件/Excel/Word交互快速生成介绍信

转载请注明:陈熹 [email protected] (号:半为花间酒)
若公众号内转载请联系公众号:早起Python

这篇文章能学到的主要内容:

  1. imbox 读取邮件解析附件
  2. openpyxlpython-docx 对文件的交互操作

https://pan.baidu.com/s/1QKXBIPvOEGurpqbe4KiGTA 提取码:j2xp

一、需求描述

你在某三家医院的医务处工作,之前已经发通知让医生们申请外派 A 医院进修,表格 申请.xlsx 如下:

你需要根据他们的申请表开出相应的介绍信:

每个人会单独自己填写好的表格以 “进修申请 xxx” 的邮件标题发到你的邮箱。申请截止日期到了,你打开邮件发现有 300 多人申请,而你觉得从邮件中下载附件,打开 Excel 文件并把对应信息填写到 Word,再修改介绍信文件名为 “xxx 进修介绍信” 实在过于繁琐,你希望借助 Python 自动化高效完成上述任务

二、逻辑梳理

这次的真实需求实际上和之前的推文 批量生成多份合同:https://www.jianshu.com/p/3ee47f594d81 非常类似,不同之处在于需要配合邮件相关的工具完成整个需求。本需求同样绕不开一个问题:程序如何知道要将某个信息填到何处?为了解决这个问题,我们需要对模板 介绍信.docx 进行修改,即将需要填写的地方改成某种标识,让程序可以“看到标识就明白此处应该放什么信息”

采取的策略是:将需要填写的地方改成表中的列名,即:

这样程序通过文本识别就能够定位相应信息并完成替换

本需求完整的逻辑包括:

  1. 遍历所有邮件,将标题符合要求的邮件附件下载到指定文件夹中
  2. 遍历打开文件夹下的所有 Excel 文件
  3. 获取每个 Excel 表格中的信息,填写至 Word 模板中
  4. 保存文件到新文件夹中

三、代码实现

1. 解析邮件

首先完成第一部分的工作,读取全部邮件:

import keyring
from imbox import Imbox

利用 keyring 库,通过系统密钥环将密码(授权码)预先在本地存储好,后面在代码中调用 keyring 库的方法,通过账号把密码取出来作为变量,降低了密码(授权码)泄露的几率
通过 imbox 库获取附件:

password = keyring.get_password("yagmail","[email protected]")
with Imbox('imap.163.com', '[email protected]', password) as imbox:
    all_inbox_messages = imbox.messages()
    for uid,message in all_inbox_messages:
        print(message.attachments)

从需求中我们知道,特定的邮件是以 进修申请 四个字开头的,那么就可以以此为依据作为判断,获取特定邮件的附件:

password = keyring.get_password("yagmail","[email protected]")
with Imbox('imap.163.com', '[email protected]', password) as imbox:
    all_inbox_messages = imbox.messages()
    for uid, message in all_inbox_messages:
        if message.subject[:4] == '进修申请':
              pass

pass 代码就可以写附件存储了。需要把 Excel 文件存储到指定文件夹中,因此需要先利用 os 库建立文件夹。邮件部分的代码如下:

import keyring
from imbox import Imbox
import os

path = r'C:\xxx'
if not os.path.exists(path + r'\申请表文件夹'):
    os.mkdir(path + r'\申请表文件夹')

password = keyring.get_password("yagmail","[email protected]")
with Imbox('imap.163.com', '[email protected]', password) as imbox:
    all_inbox_messages = imbox.messages()
    for uid, message in all_inbox_messages:
        if message.subject[:4] == '进修申请':
              if message.attachments: # 判断是否存在附件
                  for attachment in message.attachments:
                      with open(path + f'\申请表文件夹\\{attachment["filename"]}', 'wb') as file:
                          file.write(attachment['content'].getvalue())

2. Excel 和 Word 文件交互

接下来的操作涉及 Excel 读取和 Word 文件的写入,需要导入相应的模块。同时建立新文件夹存放最终的介绍信:

from docx import Document
from openpyxl import load_workbook

if not os.path.exists(path + r'\介绍信文件夹'):
    os.mkdir(path + r'\介绍信文件夹')

现在 申请表文件夹 中存放 300 多个 Excel 文件,可以利用 glob 库进行遍历和读取:

import glob

for file in glob.glob(path + r'\申请表文件夹\*.xlsx'):
    workbook = load_workbook(file)
    sheet = workbook.active

有效信息在第二行,列名(文本替换的依据)在第一行。但考虑到有的申请表可能不按常规,填写了多个人的申请,因此用循环,不局限在第二行:

for file in glob.glob(path + r'\申请表文件夹\*.xlsx'):
    workbook = load_workbook(file)
    sheet = workbook.active
    for table_row in range(2, sheet.max_row + 1):  # 考虑到有的申请表可能不按常规,填写了多个人的申请,因此用循环
        # 每循环一行实例化一个新的word文件
        wordfile = Document(path + r'\新模板.docx')
        # 单元格需要逐个遍历,每一个都包含着有用的信息
        for table_col in range(1, sheet.max_column + 1):
            # 旧的文本也就是列名,已经在模板里填好了,用于文本替换,将row限定在第一行后就是列名
            old_text = '#' + str(sheet.cell(row=1, column=table_col).value) + '#'
            # 新的文本就是实际的信息,table_col循环到某个数值时,实际的单元格和列名就确定了
            new_text = str(sheet.cell(row=table_row, column=table_col).value)

获取到信息以后就可以进行 Word 模板文件的文本替换了,根据其 文档 Document - 段落 Paragraph - 文字块 Run的三级结构,在文字块层面完成替换:

# 文档Document - 段落Paragraph - 文字块Run
        all_paragraphs = wordfile.paragraphs
        for paragraph in all_paragraphs:
            for run in paragraph.runs:
                run.text = run.text.replace(old_text, new_text)

介绍信的落款日期是当天的日期,可以考虑借助 datetime 库获取,并在替换新旧文本时同时判断 #今天日期# 这个文本是否存在,存在就替换为真实日期:

                run.text = run.text.replace(old_text, new_text)
                run.text = run.text.replace('#今天日期#', datetime.date.today())

最后保存即可,文件名中的姓名即为当前循环行的第一个单元格,sheet.cell(row=table_row,column=1).value

完整代码如下:

import keyring
from imbox import Imbox
from docx import Document
from openpyxl import load_workbook
import os
import glob
import datetime

path = r'C:\xxx'
if not os.path.exists(path + r'\申请表文件夹'):
    os.mkdir(path + r'\申请表文件夹')

password = keyring.get_password("yagmail", "[email protected]")
with Imbox('imap.163.com', '[email protected]', password) as imbox:
    all_inbox_messages = imbox.messages()
    for uid, message in all_inbox_messages:
        if message.subject[:4] == '进修申请':
              if message.attachments:
                  for attachment in message.attachments:
                      with open(path + f'\申请表文件夹\\{attachment["filename"]}', 'wb') as file:
                          file.write(attachment['content'].getvalue())

if not os.path.exists(path + r'\介绍信文件夹'):
    os.mkdir(path + r'\介绍信文件夹')

for file in glob.glob(path + r'\申请表文件夹\*.xlsx'):
    workbook = load_workbook(file)
    sheet = workbook.active
    for table_row in range(2, sheet.max_row + 1):  # 考虑到有的申请表可能不按常规,填写了多个人的申请,因此用循环
        # 每循环一行实例化一个新的word文件
        wordfile = Document(path + '\新模板.docx')
        # 单元格需要逐个遍历,每一个都包含着有用的信息
        for table_col in range(1, sheet.max_column + 1):
            # 旧的文本也就是列名,已经在模板里填好了,用于文本替换,将row限定在第一行后就是列名
            old_text = '#' + str(sheet.cell(row=1, column=table_col).value) + '#'
            # 新的文本就是实际的信息,table_col循环到某个数值时,实际的单元格和列名就确定了
            new_text = str(sheet.cell(row=table_row, column=table_col).value)

            all_paragraphs = wordfile.paragraphs
            for paragraph in all_paragraphs:
                for run in paragraph.runs:
                    run.text = run.text.replace(old_text, new_text)
                    run.text = run.text.replace('#今天日期#', datetime.date.today())

        wordfile.save(path + f'\\介绍信文件夹\\{sheet.cell(row=table_row,column=1).value} 进修介绍信.docx')

整个复杂的需求就被瓦解成多个问题而成功解决!

你可能感兴趣的:([Python] 自动化办公 邮件/Excel/Word交互快速生成介绍信)